2026
2026
28 août
Nouveaux modèles
- Ajout de
hy4-preview: Hy4 Preview de Tencent Hunyuan, un modèle MoE de 770B de paramètres totaux et 49B de paramètres actifs, optimisé pour les workflows Agent, de code et de productivité. Il renforce la compréhension, la planification, l’utilisation d’outils et l’exécution soutenue sur des tâches complexes en plusieurs étapes, l’ingénierie logicielle, le traitement de documents, l’analyse d’informations, l’automatisation bureautique, la génération web et la collaboration entre outils. Il prend en charge une fenêtre de contexte de 1 M de tokens, jusqu’à 64K de sortie, le raisonnement, la recherche web, l’appel d’outils et de fonctions et les sorties structurées.
2026
27 août
Nouveaux modèles
- Ajout de
qwen3.8-flash: le modèle vision-langage natif phare d’Alibaba Cloud Qwen, pensé pour le code, les tâches bureautiques, le raisonnement sur long contexte et les workflows agentiques. Il prend en charge une fenêtre de contexte de 1 M de tokens, jusqu’à 128K de sortie, le thinking, l’accès web, l’appel d’outils et les sorties structurées. Par rapport à Qwen3.7-Plus, il renforce les capacités de code et de bureautique tout en améliorant l’efficacité d’entraînement et d’inférence.
- L’outil MCP de génération d’images exige désormais que l’appelant fournisse explicitement le modèle, ce qui évite l’utilisation silencieuse d’un modèle par défaut lorsqu’aucun modèle n’est indiqué.
openai/gpt-image-1est l’identifiant de modèle standard affiché et transmis vers l’extérieur. L’ancienne faute de frappe reste acceptée uniquement comme alias d’entrée compatible, puis elle est normalisée avant l’envoi de la requête.
2026
26 août
Nouveaux modèles
- Ajout de
glm-5.3-flash: le modèle multimodal haute efficacité de Z.AI, pensé pour les agents de code, le raisonnement complexe et les tâches d’ingénierie logicielle sur longue durée. Il prend en charge les entrées texte, image et vidéo, environ 1 million de tokens de contexte, jusqu’à 128K de sortie, le thinking, l’appel d’outils et les sorties structurées. Construit sur la pile technologique GLM avec un post-entraînement et une optimisation supplémentaires, il met l’accent sur l’efficacité d’inférence et la réactivité.
- Ajout de Broadcast, qui envoie automatiquement les traces des requêtes API AIHubMix vers LangWatch sans instrumentation supplémentaire dans l’application. Le mode de confidentialité, l’échantillonnage et les filtres de clés API sont pris en charge ; LangWatch affiche le modèle, les tokens, le coût réel facturé, la latence, la session et les données de Trace.
- L’ancien point d’entrée
/mcp/peut continuer à utiliser le mode d’authentification existant tout en étant routé vers les capacités MCP HTTP distantes unifiées. Les anciens clients n’ont pas besoin de migrer immédiatement et peuvent toujours consulter modèles et prix, rechercher dans la documentation, vérifier le solde et utiliser les outils de chat, d’image et de vidéo. - La console proposera un accès en lecture seule pour copier l’Access Key, et les clients MCP externes peuvent utiliser l’en-tête
X-Aihubmix-Access-Key. Le serveur ne fait pas tourner la clé et ne met pas cette réponse en cache.
- Les requêtes
gpt-image-2avec fond transparent privilégient désormais les canaux natifs OpenAI qui prennent en charge cette capacité, ce qui réduit les échecs répétés sur des canaux non compatibles. Les autres chemins de requête image ne changent pas.
- Les listes de modèles et guides destinés aux AI Agents et aux outils externes se rafraîchissent plus rapidement.
2026
25 août
Erreurs de migration plus claires pour les anciennes API média
- Pour les modèles média qui ne prennent plus en charge l’ancien protocole,
/v1/images/generations,/v1/images/edits,/v1/models/:organization/:model/predictionset/v1/videosrenvoient désormaisprotocol_not_supported, avec une orientation vers les API média asynchrones/ai/v1et la documentation associée. model=autoconserve le comportement actuel de sélection automatique du modèle. Si le modèle finalement choisi ne prend pas en charge l’ancien endpoint, l’appelant reçoit une erreur claire au lieu d’être redirigé silencieusement vers un autre modèle. Playground masque aussi les anciennes entrées pour ces modèles afin de réduire les usages involontaires.
2026
24 août
Nouveaux modèles
- Ajout de
wan3.0-video: le modèle vidéo All-in-One en préversion d’Alibaba Cloud Wan (Tongyi Wanxiang) unifie les workflows text-to-video, image-to-video par première/dernière image et vidéo de référence, prenant en charge jusqu’à 30 secondes à 30 fps en 480P/720P/1080P pour une génération et une édition intégrées. - Ajout de
wan3.0-video-prime: édition haute vitesse alignée en capacités pour les workflows intégrés de génération et d’édition vidéo, avec un traitement de bout en bout plus rapide.
gpt-5.6-solsynchronise la baisse officielle de 20 % et coûte désormais 4 par million de tokens de sortie. Les chemins d’appel existants ne changent pas, tandis que les charges de raisonnement complexe, de code et de long contexte coûtent moins cher.
- Lorsqu’un compte n’a pas activé les tâches asynchrones, les API de création média incluent désormais la page console correspondante dans l’erreur
async_not_enabled. Les utilisateurs aihubmix, inferera et shkq sont dirigés vers leur propre console, ce qui réduit les réponses 403 sans suite claire.
2026
21 août
Nouveaux modèles
- Ajout de
deepseek-v4-flash-0731-fast: une variante haute vitesse du modèle agentique de DeepSeek, conçu pour le code, l’utilisation d’outils et les charges d’Agent à fort volume. Il conserve les capacités de V4 Flash 0731 tout en offrant une inférence plus rapide ; comparé à V4 Pro, il privilégie une latence réduite et l’efficacité d’exécution. Il prend en charge une fenêtre de contexte de 1 M de tokens, jusqu’à 384K de sortie, le thinking, l’appel d’outils et les sorties structurées. - Ajout de
deepseek-v4-flash-vision-exp: modèle expérimental de compréhension visuelle multimodale de DeepSeek, avec entrée texte et image et sortie texte. Il convient à la description d’images, à l’OCR de captures d’écran, à l’analyse de graphiques et aux agents visuels ; ses capacités agentiques, de raisonnement et de connaissances générales en pur texte restent au niveau de DeepSeek V4 Flash officiel. - Ajout de
ox-alpha, un modèle de raisonnement furtif fourni par un tiers anonyme dont le véritable développeur et propriétaire n’ont pas été divulgués. Gratuit sur AIHubMix, il prend en charge l’entrée texte et image, la sortie texte et une fenêtre de contexte de 1 048 576 tokens pour le code, l’ingénierie logicielle sur longue durée, le travail agentique soutenu, le raisonnement complexe et les workflows combinant texte et visuel.
- Lorsqu’une requête de génération d’images rencontre une erreur de service temporaire, AIHubMix récupère plus régulièrement. Si l’erreur correspond clairement à une limite de capacité du modèle choisi, la requête s’arrête toujours avec une raison lisible. Cela réduit les échecs directs liés à des différences temporaires de service pour des modèles comme
gpt-image-2.
2026
20 août
Annonce de la plateforme
- Lancement des capacités d’intégration pour les AI Agents : instructions d’intégration
agents.md, documentation lisible par machinellms.txtpour le site et pour chaque modèle, Playground Skill (distribution via adresse fixe), liens profonds Playground (?models=ouvre jusqu’à 6 onglets de modèles avec un seul lien,?config=charge directement une configuration). Pour comparer les spécifications et les tarifs de deux modèles côte à côte, utilisez la page de comparaisonhttps://aihubmix.com/compare/{model_a}/{model_b}. La liste des points d’entrée est disponible sur Intégration Agent.
- Les requêtes de génération d’images gèrent plus régulièrement les paramètres de taille comme
resolutionetimageSize. Lorsqu’une requête dépasse les capacités du modèle choisi, l’API renvoie des erreurs plus claires pour corriger les paramètres plus vite.
- Les variantes liées, comme GLM 5.2, l’édition Coding et l’édition Free, peuvent être présentées comme un modèle principal avec plusieurs versions. La navigation, la comparaison des prix et le choix de version deviennent plus faciles à comprendre.
- Les tâches image asynchrones peuvent maintenant progresser avec une concurrence bornée selon la capacité disponible. En période chargée, les files devraient se résorber plus régulièrement et la livraison des statuts/résultats être plus stable.
2026
19 août
Nouveaux modèles
- Ajout de
gpt-5.6-sol-disc: la route de réduction à durée limitée d’AIHubMix pour GPT 5.6 Sol d’OpenAI, offrant jusqu’à 50 % de remise avec les mêmes capacités sous-jacentes que legpt-5.6-solstandard. Ce modèle de raisonnement de pointe est adapté au code complexe, au travail de connaissance professionnel, à la recherche approfondie et aux agents à longue exécution, avec entrée texte et image, environ 1,05 M tokens de contexte, jusqu’à 128K de sortie, thinking, outils et sorties structurées.
- L’heure de fin, l’expiration des résultats et l’archivage des artefacts sont plus cohérents pour les tâches image et vidéo. En déploiement progressif ou sous forte concurrence, les statuts, les résultats téléchargeables et les journaux côté utilisateur risquent moins d’être retardés ou traités deux fois.
- La capacité de production média a été augmentée, et les réponses média volumineuses disposent de plus de marge, ce qui améliore la disponibilité des tâches longues ou avec de gros artefacts.
2026
18 août
Les pages modèles sont plus complètes
- Les détails de modèle exposent maintenant
release_date, ce qui permet de mieux distinguer la date de sortie officielle de l’heure de mise en ligne AIHubMix sur les pages modèle et de comparaison.
- Les flux Gemini d’image et de Vertex multi-image conservent mieux
imageSizeet les paramètres image associés, ce qui réduit les écarts de taille ou de protocole. - Les téléversements de fichiers Gemini gardent le
Content-Typed’origine, donc les vidéos et autres médias sont moins souvent reconnus comme un mauvais type.
- Les erreurs côté utilisateur pour les schémas, les énumérations et les capacités affichent désormais des messages plus clairs, ce qui simplifie le diagnostic des paramètres.
2026
17 août
Nouveaux modèles
- Ajout de
glm-5.3, l’API de production de Z.AI pour son modèle de raisonnement phare uniquement texte, conçu pour l’ingénierie logicielle complexe, les tâches d’Agent à long horizon et l’analyse de vulnérabilités. Il prend en charge une fenêtre de contexte de 1 M de tokens, jusqu’à 128K en sortie et une concurrence illimitée sur AIHubMix, avec une remise à durée limitée de 10 %.
2026
15 août
Nouveau modèle
- Ajout de
mai-thinking-1: modèle de raisonnement de la série Microsoft MAI pour le raisonnement d’entreprise, les mathématiques, l’intelligence générale et les charges à haut débit. Il prend en charge une fenêtre de contexte de 256K tokens, Chat Completions et les sorties structurées, ce qui le rend adapté au raisonnement long contexte, aux formats de réponse stables et aux usages continus sensibles aux coûts.
2026
14 août
Nouveaux modèles
- Ajout de
gemini-3.7-flash: le modèle de raisonnement nativement multimodal de Google, conçu pour le codage, les agents, le développement web et le travail de connaissance. Il prend en charge les entrées texte, image, audio et vidéo, une fenêtre de contexte d’un million de tokens, des niveaux de thinking ajustables, l’appel d’outils, la recherche web et les sorties structurées, avec un codage, une utilisation d’outils, une planification multi-étapes et un suivi d’instructions renforcés par rapport à Gemini 3.6 Flash. - Ajout de
coding-glm-5.3: le modèle de raisonnement de Z.AI pour le codage et les workflows agentiques, conçu pour l’ingénierie logicielle complexe, les agents à longue durée d’exécution et l’analyse de vulnérabilités. Reposant sur le même modèle de base que GLM-5.2, un post-entraînement à plus grande échelle améliore le codage, l’exécution des tâches et l’efficacité des tokens. Cette route est une préversion en durée limitée, destinée uniquement aux tests et à l’évaluation ; la stabilité du service n’est pas garantie et une utilisation en production n’est pas recommandée.
- Les requêtes Gemini embedding natives conservent désormais l’origine de service du
fileUriretourné par Gemini Files API. AvecembedContentoubatchEmbedContentssur des fichiers téléversés, les erreurs 403 liées à une origine incohérente sont réduites ; les lots qui mélangent des fichiers de plusieurs origines renvoient un 400 explicite. - Lorsqu’OpenRouter renvoie une erreur structurée d’un fournisseur de modèles, l’erreur API privilégie maintenant les champs internes
message,paramettype, ce qui réduit les messages longs et difficiles à analyser. Une erreur d’un seul fournisseur de modèles risque aussi moins d’affecter tout le service OpenRouter. - Le polling, l’archivage terminal et le traitement des artefacts des tâches média asynchrones sont plus fiables. Les longues tâches image ou vidéo risquent moins d’être traitées deux fois, de perdre leur état terminal ou d’être livrées en retard en cas de forte concurrence, de redémarrage ou d’artefacts volumineux ; les champs publics, statuts et formules de facturation de l’API ne changent pas.
2026
13 août
Nouveaux modèles
- Ajout de
grok-4.6: le modèle multimodal de raisonnement phare de xAI, conçu pour le codage, les agents à long terme, le travail de connaissance et le développement d’applications interactives. Il prend en charge la compréhension d’images, une fenêtre de contexte de 500K, l’appel d’outils et les sorties structurées, avec une exécution multi-étapes, une auto-vérification, un codage et une génération de projets visuels renforcés par rapport à Grok 4.5. - Ajout de
deepseek-v4-pro-0813: le modèle de raisonnement et d’agent généraliste haute performance de DeepSeek, conçu pour le raisonnement complexe, le codage, l’analyse de documents longs et les workflows agentiques. Il prend en charge les modes thinking et non-thinking, une fenêtre de contexte d’un million de tokens, jusqu’à 384K en sortie, l’appel d’outils et l’API Responses.
2026
12 août
Nouveaux modèles
- Ajout de
agnes-2.5-flash,agnes-2.5-pro,agnes-2.5-pro-alphaetagnes-image-2.1-flash. Les modèles Agnes texte et image sont désormais accessibles via l’entrée unifiée AIHubMix.
- Les tâches Gemini Veo conservent plus fiablement la durée réelle de la vidéo lors de la création, du polling et de la lecture du résultat. Les utilisateurs qui génèrent des vidéos avec une durée personnalisée verront mieux alignés la durée de tâche, la durée du fichier téléchargé et les éléments de facturation ou d’affichage.
- Lors de l’utilisation d’outils namespace via Azure Responses, les descriptions vides ou absentes ne provoquent plus un rejet Azure 400 avant l’exécution du modèle. Les appels d’outils déjà acceptés par l’interface OpenAI officielle devraient se comporter plus régulièrement sur Azure.
/call/devsprend désormais en charge un champ de site web fournisseur, afin que les pages d’agrégation de modèles et de fournisseurs puissent afficher une entrée Official site une fois les données renseignées. Les pages/providers/<slug>conservent aussi leur comportement de cache en périphérie pour des réponses plus stables.
2026
11 août
Gemini interactions prend désormais en charge les tâches asynchrones
- Les requêtes Gemini interactions peuvent désormais utiliser explicitement
background: truepour créer des tâches asynchrones, puis utiliser l’ID de tâche retourné pour consulter l’état, annuler ou nettoyer la tâche. Les interactions multimodales/omni longues sont plus faciles à intégrer sans garder une connexion synchrone ouverte jusqu’à la fin. - Les tâches asynchrones sont facturées selon l’usage réel, avec les colonnes de tokens, le remboursement complet en cas d’annulation et les protections de grandes réponses complétés. Les journaux d’utilisation, la pré-déduction du solde et les frais finaux dans la console restent plus cohérents.
- Quand le protocole Messages appelle des fournisseurs de modèles compatibles OpenAI, le contenu thinking/reasoning retourné est conservé et peut être renvoyé dans les tours suivants. Les applications utilisant les SDK Claude, les outils multi-tours ou le mode thinking de DeepSeek devraient voir moins de réponses vides, d’erreurs 400 ou de pertes de contexte de raisonnement.
- Les blocs thinking non signés sont mieux pris en charge lorsque le trafic bascule vers des canaux Claude natifs, ce qui réduit les erreurs de format dans les flux de fallback multi-modèles ou de bridge.
- Lors de l’appel des modèles vidéo Doubao,
promptet les ressources de référence dansextra_body.contentpeuvent désormais fonctionner ensemble ; les requêtes ne contenant que des ressources conservent le prompt et l’ordre des ressources. - Les réponses de création reflètent désormais la taille et le prompt plus près du contenu réellement envoyé, tout en continuant à ignorer les champs natifs non pris en charge. Cela réduit les échecs de génération vidéo causés par des paramètres SDK supplémentaires.
2026
10 août
Usage cumulé plus complet pour la génération média
- Après le règlement d’une tâche de génération média, le quota cumulé utilisé au niveau du compte est mis à jour lui aussi. Dans la console, l’usage cumulé, la déduction de solde et les journaux d’utilisation reflètent plus complètement la consommation réelle de génération média.
- Lors de l’appel de modèles Azure dont le nom de deployment/model contient des points, le nom du modèle est conservé tel quel sur les chemins de conversion Chat, Responses et Messages, sans réécriture automatique. Le comportement des appels Azure existants reste inchangé.
2026
8 août
Nouveau modèle de génération vidéo
- Ajout de
doubao-seedance-2-5-260628: modèle unifié de génération audio-vidéo multimodale de nouvelle génération de ByteDance Seed. Il produit jusqu’à 30 secondes d’audio et de vidéo synchronisés en une seule passe, prend en charge les extensions multi-tours et améliore la narration, les transitions, la prise en charge des références, le réalisme et l’édition précise pour le cinéma, la publicité, l’éducation, la simulation et la création de contenu long.
2026
6 août
Nouveaux modèles
- Ajout de
wan3.0-video: modèle tout-en-un de génération et d’édition vidéo du Tongyi Lab d’Alibaba, actuellement en bêta publique. Il prend en charge des vidéos natives jusqu’à 30 secondes, une cohérence des personnages de niveau production, des visuels et un son réalistes, et des workflows unifiés de référence, d’édition, de réplication et de pilotage par mouvement pour la publicité, l’e-commerce, le cinéma, l’animation, le montage vidéo et la conversion de documents en vidéo. - Ajout de
qwen-image-3.0: modèle de génération et d’édition d’images de l’équipe Qwen d’Alibaba Cloud, prenant en charge la génération à partir de texte, la création à partir d’images de référence et l’édition d’images. Il équilibre qualité et vitesse pour les réseaux sociaux, l’e-commerce, le design créatif, la production de contenu quotidienne et la création à grande échelle en volume élevé. - Ajout de
qwen-image-3.0-pro: modèle phare de génération et d’édition d’images de Qwen (Alibaba Cloud) pour la publicité, l’identité de marque, l’UI, les présentations, l’imagerie produit et le design professionnel. Il excelle sur les mises en page complexes, le rendu précis du texte en chinois et en anglais, les matériaux réalistes, l’édition guidée par image de référence, le détail, la composition et une qualité visuelle de niveau commercial.
2026
4 août
Gemini embedding accepte les entrées multimodales et la facturation par modalité
gemini-embedding-2-previewpeut désormais traiter du texte, des images, de l’audio, de la vidéo et des documents via l’endpoint embeddings compatible OpenAI comme via le chemin Gemini natif. Les utilisateurs qui créent des workflows de recherche multimodale, de compréhension de contenu ou de base de connaissances peuvent utiliser davantage de types d’entrée avec le même modèle.- La facturation Gemini embedding s’appuie en priorité sur les tokens par modalité retournés par le fournisseur de modèles. Les images, l’audio, la vidéo et les documents ne sont plus ramenés à une estimation texte unique, ce qui rend la facture multimodale plus proche de l’usage réel.
- Une requête embedding à entrée unique peut appeler directement le nouveau chemin Gemini embedding. Les requêtes batch multi-entrées renvoient maintenant une réponse claire de capacité non prise en charge.
- Les références Seedance 2.0 pour images, audio et vidéo sont mieux mappées selon le type de média, avec des contraintes plus claires pour
adaptive, la 4K et les tailles. Les workflows de génération vidéo rencontrent moins d’échecs liés à un mauvais mapping de paramètres. - Les requêtes à durée adaptative sont prélevées sur une base de 15 secondes, puis régularisées selon la durée réelle à la fin de la tâche, ce qui aligne mieux pré-déduction du solde et facturation finale.
- En cas d’échec de génération média, les API renvoient des détails d’erreur expurgés, utiles pour diagnostiquer les problèmes de paramètres, de liens signés ou de limites du fournisseur de modèles sans exposer d’identifiants sensibles.
3 août
Nouveaux modèles- Ajout de
qwen3.8-max: modèle vision-langage natif phare d’Alibaba Cloud, bâti sur une architecture Mixture-of-Experts (MoE) de 2,4 billions de paramètres et prenant en charge des fenêtres de contexte jusqu’à 1 million de tokens. Adapté à la compréhension multimodale complexe, au raisonnement avancé, au développement logiciel, aux workflows agentiques et au traitement de contextes longs. À un prix proche de Qwen3.7-Max, Qwen3.8-Max apporte des améliorations notables en raisonnement, en codage et en capacités d’agent, avec des performances globales comparables aux meilleurs modèles actuels.
- Les details de modele placent maintenant en premier les fournisseurs les mieux adaptes aux requetes actuelles, tandis que les fournisseurs uniquement en secours ou temporairement indisponibles apparaissent plus bas. Lors du choix d’un fournisseur ou d’une verification de disponibilite, les utilisateurs et les equipes support voient plus vite quelles options sont les plus pertinentes et evitent les decisions fondees sur un ordre devenu obsolete.
2 aout
Facturation et journaux plus precis pour les petites requetes- Les petites requetes sur les modeles factures en by-bill ne disparaissent plus de la facturation ni des journaux d’utilisation lorsque le montant calcule etait arrondi a zero. Les requetes concernees sont desormais comptabilisees au quota minimal effectif, afin d’aligner factures, pre-deduction du solde et journaux; les equipes support et operations disposent de traces plus completes pour les trafics frequents de type embedding.
31 juil.
Nouveaux modèles- Ajout de
deepseek-v4-flash: modèle Mixture-of-Experts optimisé pour l’efficacité, avec 284 Md de paramètres au total, 13 Md de paramètres actifs et une fenêtre de contexte de 1 M tokens. Conçu pour l’inférence rapide et les charges à haut débit tout en conservant de solides performances en raisonnement et en codage, il convient aux assistants de code, aux systèmes de chat et aux workflows agentiques.
- Ajout de
minimax-h3: modele video multimodal generaliste de MiniMax. Il accepte les entrees texte, image, audio et video, et couvre la generation texte-vers-video, image-vers-video, premiere/derniere image, reference-based generation et edition video. Les utilisateurs qui construisent des workflows de creation video, creatives publicitaires, demos produit ou contenus multimodaux peuvent l’appeler via l’API unifiee AIHubMix.
glm-5.2beneficie d’une remise selon la plage horaire quotidienne, en UTC : 50 % de remise de 14:00 a 24:00 et 30 % de remise de 00:00 a 14:00 chaque jour. Offre a duree limitee.
gpt-5.6-lunaintegre la baisse officielle de 80 % et coute desormais 1.20 en sortie ;gpt-5.6-terraintegre la baisse officielle de 20 % et coute desormais 12.00 en sortie. Les utilisateurs avec un trafic regulier sur ces modeles peuvent reevaluer leur choix pour les charges sensibles au cout et les usages generaux.
30 juil.
Serveur MCP officiel AIHubMix disponible- Ajout du point d’entree MCP heberge officiel mcp.aihubmix.com/mcp ou mcp.inferera.com/mcp pour les clients compatibles MCP. Les developpeurs peuvent l’utiliser depuis Claude Code, Codex, Cursor et d’autres outils pour consulter les modeles et les prix, rechercher dans la documentation, verifier le solde et appeler des outils de chat, de generation d’images et de generation video.
- Les identifiants MCP sont transmis par le client a chaque requete et ne sont pas stockes par le serveur, ce qui convient aux developpeurs qui veulent acceder directement aux modeles et fonctions media AIHubMix depuis leurs IDE ou outils agentiques.
29 juil.
Nouveau modele- Ajout de
jina-reranker-v3.5: reranker de documents listwise multilingue 0,6B de Jina AI, compatible avec le schema dejina-reranker-v3. Il cible les workflows RAG, recherche et classement de donnees structurees, prend en charge le reclassement de candidats en contexte long et ameliore la robustesse par domaine, la recherche multilingue, le classement structure et l’efficacite d’inference.
28 juil.
Facturation du cache plus precise- Pour les requetes avec cache explicite ou implicite, AIHubMix identifie plus uniformement les lectures/ecritures de cache et privilegie le type de cache renvoye par le fournisseur amont. Les utilisateurs de modeles compatibles cache comme Qwen et Claude devraient voir des details de facturation plus proches de l’usage reel.
- La premiere liste de modeles de generation media a ete resserree sur les modeles verifies, et un cas pouvant renvoyer 404 pour certains appels de modeles image via l’entree media a ete corrige. Les telechargements de taches LLM dans la console couvrent aussi les archives texte, ce qui facilite la recuperation de grands resultats historiques.
- Le cache du site, des donnees modele, des donnees de blog et des sitemaps a ete ajuste pour que les publications prennent effet plus fiablement. Les pages modele et les entrees de documentation sont moins exposees aux anciennes donnees en cache apres une mise a jour.
27 juil.
APIs de generation media disponibles- Ajout de
/ai/v1/images/generationset/ai/v1/images/edits, avec des taches asynchrones unifiees, la consultation des resultats, le telechargement des fichiers generes et les callbacks webhook. Les workflows image et video peuvent s’integrer via le meme cycle de vie de tache, ce qui facilite le suivi des generations longues. - Les fichiers generes sont renvoyes via les resultats de tache AIHubMix et prennent en charge des telechargements limites ainsi que la recuperation par lot. Les equipes en contact avec les clients doivent surveiller les premiers retours sur l’etat des taches, la validite des liens de telechargement et les details de facturation.
25 juil.
Nouveaux modèles- Ajout de
claude-opus-5: modèle phare d’Anthropic pour le raisonnement exigeant, le codage et les tâches agentiques à long horizon. Il excelle dans les tâches logicielles de bout en bout, la revue de code et la détection de bugs, l’analyse de graphiques et de documents, les livrables bureautiques complexes et la coordination de sous-agents en parallèle, avec une fenêtre de contexte de 1M et jusqu’à 128K en sortie.
24 juil.
Nouveaux modèles- Ajout de
mai-image-2.5-pro: modèle phare de génération et d’édition d’images de Microsoft, offrant un réalisme haute fidélité, un rendu de texte précis dans l’image et une édition puissante pour le design commercial, la photographie produit et les workflows créatifs professionnels. - Ajout de
qwen-audio-3.0-tts-flash: modèle de synthèse vocale temps réel de Qwen, avec une prise en charge élargie des langues à faibles ressources et des dialectes chinois, un contrôle vocal expressif et une latence du premier paquet inférieure à 200 ms, adapté aux assistants vocaux, au dialogue en temps réel et au service client intelligent. - Ajout de
qwen-audio-3.0-tts-plus: modèle de synthèse vocale premium de Qwen, offrant un contrôle plus fin de l’émotion, du ton, du personnage, du débit, du volume et du style, conçu pour la création de contenu, les livres audio, le doublage, les voix de marque et les workflows vocaux haut de gamme.
- Les deux modeles Qwen TTS peuvent etre appeles via
/v1/audio/speech; les requetes non streaming renvoient une URL de resultat audio, tandis que les requetes streaming renvoient des evenements SSE de generation audio. Le tableau ci-dessous rapproche les champs compatibles AIHubMix et la documentation officielle Qwen-Audio-TTS d’Alibaba Cloud ;voicedoit etre choisi par modele, les voix systeme plus et flash ne sont pas interchangeables.
Meilleure compatibilite des reponses Messages
- Les reponses
/v1/messagesissues de modeles pontes et de services compatibles Claude, comme Bedrock, sont plus proches de l’ecosysteme Anthropic Messages, ce qui reduit les erreurs dans les SDK stricts ou validateurs de schema dues a des champs de reponse manquants.
- Lorsqu’un client se deconnecte d’une requete streaming AWS Bedrock, AIHubMix continue de collecter le signal de fin du fournisseur d’inference modele et l’usage final, reduisant les ecarts entre journaux de requete, details de facturation et usage du fournisseur d’inference modele dans ces scenarios.
23 juil.
Nouveaux modèles- Ajout de
qwen3-coder-480b-a35b-instruct: modèle de codage phare Qwen3-Coder pour la génération de code, les agents d’ingénierie logicielle et les workflows d’appel d’outils, adapté à la compréhension de code en long contexte et aux tâches de développement automatisé. - Ajout de
gemini-2.5-flash-lite: modèle Gemini 2.5 léger pour les charges texte, multimodales et batch fréquentes, avec faible latence et coût réduit. - Ajout de
Qwen/Qwen3-235B-A22B-Instruct-2507: version Qwen3 235B-A22B Instruct 2507 pour le chat général, le suivi d’instructions, le travail multilingue et les tâches à long contexte.
22 juil.
Nouveaux modèles- Ajout de
gemini-3.6-flash: le dernier modèle Flash de Google, adapté aux workflows complexes, à l’utilisation ordinateur, au raisonnement sur graphiques et aux tâches à long contexte. - Ajout de
gemini-3.5-flash-lite: un modèle Gemini 3.5 plus léger et moins coûteux, adapté aux traitements à haut débit, à l’automatisation courante et aux lots. - Ajout de
glm-5.2-fast-preview: modèle aperçu rapide Zhipu GLM-5.2, adapté au chat à faible latence, au raisonnement rapide et aux applications à haut débit.
- Les appels en streaming à
qwen3.8-max-previewvia/v1/responseset/v1/messagessont plus fiables. Des flux valides qui pouvaient auparavant apparaître commeempty_streamou 502 peuvent maintenant se terminer normalement.
21 juil.
Parametres d’image Gemini transmis- Via l’API Chat Completions compatible OpenAI, les modeles Gemini/Vertex de sortie image acceptent maintenant
aspectRatioetimageSizedansextra_body.generationConfig.imageConfig.
- Quand les reponses Gemini embedding contiennent un
usageMetadatareel, AIHubMix facture d’abord selon le nombre de tokens renvoye par le fournisseur de modeles, avec l’estimation locale precedente en secours si l’usage manque.
- Les requetes
/v1/responsespeuvent maintenant porter des function tools au niveau des messages system/developer, et ces declarations sont conservees lors du pont vers les modeles Chat. Les clients qui utilisent des workflows d’outils dynamiques avec Kimi K3 gagnent en fiabilite.
- Pour les appels
/v1/responsespontes vers des modeles Chat,stopest maintenant transmis au fournisseur de modeles. Un stop simple peut fonctionner normalement ; les nombres ou longueurs au-dela des limites du fournisseur de modeles renvoient des erreurs de borne coherentes avec Chat Completions.
- Les modeles DeepSeek V4 peuvent maintenant prendre en charge une facturation configuree par heures de pointe et heures creuses. La pre-deduction et la facturation finale utilisent le meme instant de soumission ; un streaming qui traverse une limite horaire reste facture selon cet instant. La protection de pre-deduction est limitee aux modeles configures en facturation horaire, sans changer le gel de solde des modeles ordinaires.
20 juil.
Compatibilite du thinking Claude Messages- Lorsque les requetes
/v1/messagessont routees vers des modeles OpenAI ou Azure Chat, les parametres Claudethinkingsont maintenant convertis en effort de raisonnement pris en charge par le fournisseur de modeles, ce qui reduit les erreurs 400. Les requetes Claude natives avec thinking, comme Opus 4.8, restent compatibles.
- La limite de streaming du gateway de production passe de 1 heure a 2 heures. Les taches de raisonnement ou de generation longues, comme Kimi K3, risquent moins d’etre coupees pendant l’execution.
19 juil.
Nouveaux modeles- Ajout de qwen3.8-max-preview :
Offre à durée limitée : Qwen3.8-Max-Preview est facturé à seulement 10 % du tarif standard, soit l’équivalent de 10× d’utilisation. Durée limitée, premier arrivé, premier servi.
Qwen3.8-Max-Preview est le modèle de fondation de dernière génération de la famille Qwen, avec 2,4 T de paramètres, et il continue d’évoluer. Par rapport au précédent modèle phare Qwen3.7-Max, il progresse nettement sur des capacités clés comme le Coding et le Cowork (bureautique professionnelle), et affiche des performances de premier plan mondial sur des tâches complexes de longue haleine : développement full-stack, analyse de données et workflows Office.
17 juil.
Nouveaux modeles- Ajout de
kimi-k3: Kimi K3 est le modele ouvert longue fenetre de contexte de classe 3T de Moonshot AI, avec 2,8T parametres, une fenetre de contexte de 1M tokens et une prise en charge native de l’entree visuelle. Il convient au codage longue duree, au travail de connaissance, au raisonnement complexe et a la comprehension multimodale. Voir le guide pratique Kimi K3 (exemples des trois API et matrice de prise en charge). - Ajout de
hy-3d-3.1: modele Tencent Hunyuan 3D Professional pour la generation texte-vers-3D, image-vers-3D et multi-vues. Il convient aux assets de jeu, aux presentations e-commerce, a l’impression 3D et aux workflows de design produit ; la version 3.1 ameliore la geometrie, les textures et prend en charge l’entree huit vues.
- Ajout de l’API asynchrone
/v1/3d/generations, connectee en premier a Tencent TokenHub Hunyuan 3D. Elle permet de soumettre une tache et d’en consulter le resultat, afin d’integrer plus facilement la generation d’assets 3D aux workflows automatises.
- Les outils charges dynamiquement au niveau message dans les requetes Kimi K3 sont maintenant conserves et transmis, evitant les erreurs 400 liees a la perte des declarations d’outils. Les clients utilisant les outils dynamiques Kimi gagnent en compatibilite.
- La compatibilite s’ameliore pour les custom tools Chat Completions, les blocs de texte Cohere et les requetes avec
assistant.content: null. Les requetes valides atteignent mieux les fournisseurs de modeles ; les entrees mal formees ou non prises en charge renvoient des erreurs structurees au lieu d’etre signalees comme des succes HTTP 200 vides.
- La generation d’images
doubao-seedream-5-0-proprend maintenant en charge la facturation par palier de pixels de sortie et par nombre d’images d’entree, afin que les requetes texte-vers-image et image-vers-image soient facturees plus pres de leurs caracteristiques reelles.
15 juil.
Compatibilite amelioree pour les appels d’outils Gemini- Lors d’un appel a Gemini ou Vertex via l’API compatible OpenAI, les requetes dont les definitions d’outils ou les schemas de sortie structuree contiennent une valeur d’enumeration vide ne sont plus rejetees avec une erreur 400 par la validation du fournisseur de modeles. Les workflows d’appels d’outils et de JSON Schema sont plus fiables.
14 juil.
Nouveaux modeles audio- Ajout de
gpt-audio-1.5, le premier modele audio OpenAI disponible de facon generale. Il accepte les entrees et sorties audio et peut etre utilise via l’API REST Chat Completions, pour les conversations vocales, la comprehension audio et la generation audio. - Ajout de
gpt-4o-transcribe-diarize, un modele ASR avec diarisation integree qui associe les segments audio aux differents intervenants d’une conversation. Ce modele est disponible uniquement dans l’API Transcription.
- La page de presentation LLM Router est desormais en ligne : elle presente les scores publics par dimension de routage et les modeles du pool. Deux endpoints ouverts sont egalement ajoutes : Perimetre de modeles de la strategie LLM Router renvoie les scores des modeles sur 5 categories et 23 sous-dimensions, les coefficients de prix, la latence du premier token et les modeles du pool ; Icones des fournisseurs de modeles renvoie les noms d’affichage et les icones des fournisseurs de modeles. Les dimensions de generation d’images et de videos ne sont pas encore incluses. Voir la documentation Routage automatique (LLM Router) pour l’utilisation.
13 juil.
Reponses d’erreur API plus coherentes- Quand
/v1/responsesest appele avec un modele inconnu, l’API renvoie maintenant HTTP 400, comme les autres points d’entree. Les clients peuvent donc traiter ce cas comme “aucun service disponible” au lieu de recevoir une 500.
- Si la conversion du corps de requete ou la validation des parametres echoue, l’API renvoie directement la 400/l’erreur correspondante au lieu de transmettre la requete originale au fournisseur de modeles, ce qui reduit les appels invalides et les echecs difficiles a comprendre.
- Les appels Claude Code vers Claude via Bedrock ont maintenant des hits de prompt cache plus stables dans une meme session, ce qui aide a reduire les couts d’ecriture de cache en double et la latence du premier token.
- Les requetes Gemini restent sur le meme service uniquement lorsque la reponse contient effectivement des signatures de pensee ou une activite de cache. Cela reduit les incoherences de signature ou d’etat de cache en multitouret, tandis que les taches sans etat comme la generation d’image ne sont plus fixees inutilement.
10 juillet
Nouveaux modèles- Ajout de
gpt-5.6-sol,gpt-5.6-terraetgpt-5.6-luna, les trois modèles de la série GPT-5.6 (publication officielle OpenAI du 2026-07-09). Les trois offrent une fenêtre de contexte de 1 050 000, une sortie maximale de 128K et une coupure des connaissances au 2026-02-16, acceptent le texte et l’image en entrée, et sont appelables via Chat Completions, Responses et l’interface Messages compatible Claude. Sol est le palier phare pour le travail professionnel complexe, présenté officiellement comme le meilleur modèle de codage actuel ; Terra offre des performances équivalentes à GPT-5.5 pour un prix réduit de moitié ; Luna cible les scénarios sensibles au coût.
- Nouvelle documentation Mise en cache des prompts GPT : à partir de la série GPT-5.6, l’écriture en cache est facturée à 1,25 fois le prix d’entrée, la lecture à 0,1 fois, et le cache est conservé au moins 30 minutes ; la page couvre les paramètres
prompt_cache_keyet points de rupture de cache explicites, la logique de facturation, des exemples d’interface et le dépannage des hits. Les formulations OpenAI de Mise en cache des prompts et Mise en cache des prompts Claude ont été mises à jour en conséquence.
- Les requêtes Claude Fable et Mythos avec
reasoning_effortutilisent désormais adaptive thinking, ce qui réduit les erreurs 400 du fournisseur de modèles pour ces familles de modèles sans changement côté client.
- Les paramètres
stopcompatibles OpenAI sont maintenant mappés vers les requêtes natives Claude et Gemini. Les stops purement vides invalides pour Claude sont filtrés, tandis que les limites OpenAI/Gemini sont appliquées par fournisseur.
gpt-chat-latestet les futurs alias latest GPT/ChatGPT conservent désormaismax_completion_tokenslorsque nécessaire, réduisant les erreurs 400 dues à l’ancien champmax_tokens.
- Lorsqu’une limite d’utilisation au niveau de la Key est épuisée, l’API renvoie désormais une indication plus claire pour ajuster et réactiver cette limite, au lieu d’un simple message quota de bas niveau.
- Les réponses chat non streaming qui contiennent
tool_callssans texte renvoient maintenant explicitementcontent: null, améliorant la compatibilité avec les SDK et parseurs de style OpenAI.
9 juillet
Réparation de sortie structurée : correction automatique des erreurs de format JSON- Ajout d’une capacité de réparation de sortie structurée au niveau de la clé, désactivée par défaut. Une fois activée, pour les requêtes non-streaming déclarant une sortie JSON structurée, lorsque le JSON renvoyé par le modèle présente des erreurs de format (troncature, virgule finale, encadrement par un bloc de code, etc.), la passerelle le répare automatiquement, avant le retour, en un JSON valide et analysable, en conservant les valeurs numériques telles quelles et sans aucune modification côté client. Compatible avec les quatre protocoles Chat Completions, Responses, Claude et Gemini ; lorsqu’une réparation a lieu, la réponse porte l’en-tête
X-JSON-Repaired: true.
- Mise à jour de la documentation Mise en cache des prompts Claude et Mise en cache des prompts avec les seuils minimaux de tokens pouvant être mis en cache par modèle (512 / 1 024 / 2 048 / 4 096), en ajoutant les modèles actuels comme Claude Opus 4.8, Opus 4.7 et Fable 5. Le seuil n’est pas proportionnel à la version du modèle ; un préfixe en dessous du seuil n’est pas mis en cache même avec
cache_control.
- L’agregation du tableau d’utilisation est maintenant plus proche des enregistrements de facturation issus des logs de requete, avec moins de pertes liees a la concurrence et un regroupement horaire unifie pour les relectures differees. Les donnees historiques du tableau peuvent encore presenter de legeres differences; les logs de requete restent la source de verite pour la reconciliation et la facturation.
- Ajout de
grok-4.5, un modele pour le code, les taches agentiques et le travail de connaissance, avec raisonnement configurable, appels d’outils et fenetre de contexte de 500K. Il convient a la correction de code, aux taches d’ingenierie complexes, aux questions-reponses de connaissance et aux workflows d’agents.
8 juillet
Les appels tools gpt-5.5+ basculent automatiquement vers Responses- Avec l’endpoint compatible OpenAI
/v1/chat/completions, les requetes vers gpt-5.5 et versions plus recentes qui incluent des tools etreasoning_effortutilisent maintenant automatiquement les capacites Responses. Cela reduit les erreurs 400 du fournisseur de modeles pour cette combinaison de parametres sans obliger les clients a migrer vers/v1/responses. Voir : Responses API
7 juillet
Compatibilite des sorties structurees entre protocolesresponse_formatcompatible OpenAI etoutput_config.formatnatif Claude sont maintenant adaptes sur les chemins concernes. Les clients qui passent entre protocoles de type OpenAI et Claude peuvent conserver plus fiablement les contraintes de sortie structuree. Voir : Structured Output.
/v1/messages plus stables sur Vertex AI
- Lors d’appels a Gemini et a d’autres modeles non-Claude via Vertex AI, les requetes
/v1/messagessont maintenant routees par famille de modele, ce qui reduit les erreurs not found ou 404 dues a des chemins specifiques a Claude.
6 juillet
Endpoints natifs Gemini completes- Lors de l’utilisation du SDK
@google/genaivia l’entree Gemini d’AIHubMix, les workflows natifs embeddings, interactions create et context caching sont maintenant pris en charge. Ces chemins pouvaient auparavant renvoyer des erreurs de route non enregistree ou des 404 ; ils peuvent maintenant servir a generer des embeddings, lancer des appels interactifs et creer/lire/mettre a jour/supprimer des caches. Voir : Integration SDK natif Gemini
- Les modeles long contexte comme
hy3-preview, ERNIE, Grok et Mimo prennent maintenant en charge la facturation par paliers selon la longueur du contexte. Le calcul des frais est plus precis.
- Les requetes streaming Vertex AI Gemini/Claude enregistrent maintenant des donnees plus exactes de premier token et de latence. Les logs et le monitoring sont plus fiables, sans changement du contenu des reponses.
- Ajout de
tencent-hy3, un modele de generation de texte (Tencent Hunyuan Hy3, version officielle). Architecture MoE avec 295B de parametres totaux / 21B de parametres actifs et une fenetre de contexte de 256K. Prend en charge les modes d’inference rapide et lente combines, adapte au raisonnement complexe, a la generation de code et aux workflows d’agents. Open-source sous licence Apache 2.0.
3 juillet
Jina Search/Reader prend désormais en charge POST et l’upload de fichiers- Jina Search et Reader prennent désormais en charge les requêtes POST. Reader peut recevoir des fichiers locaux via upload multipart, notamment PDF, Word, Excel, PPT, HTML et images. Les réponses par défaut se rapprochent de la sortie markdown native de Jina ; les clients qui ont besoin de JSON peuvent envoyer explicitement
Accept: application/json.
- Correction d’un problème où les appels
/v1/responsespontés vers des services de type Azure non GPT pouvaient échouer en 404 parce queapi-versionétait vide, réduisant les échecs directs de ce type de requêtes.
- Correction d’un cas où certains services d’inférence de modèles de type vLLM / Azure Foundry pouvaient tronquer aléatoirement les réponses en streaming. Les utilisateurs devraient recevoir plus fiablement les réponses complètes, les signaux de fin et les informations d’usage.
- Ajout de
command-a-plus-05-2026, un modele de generation de texte pour le chat, la creation de contenu et les workflows d’agents.
1 juillet
API de recherche Jina et de lecture de pages Web disponibles- Ajout des capacités Jina Search et Reader. Vous pouvez désormais utiliser votre clé API AIHubMix pour récupérer des résultats de recherche Jina et lire le contenu de pages Web, pour les scénarios de recherche Web externe, de lecture documentaire et d’outillage d’agents. Voir : Jina AI
- Veo 3.1 image-vers-vidéo prend désormais en charge les images de début, de fin et de référence, afin de contrôler plus précisément les plans de départ/arrivée, les références de personnages et les références de style dans les workflows avancés de génération vidéo. Voir : Génération vidéo
- Amélioration de la compatibilité des requêtes Gemini lors des reprises entre canaux, ce qui réduit certaines erreurs 400 en scénario de fallback et augmente le taux de succès des appels avec bascule multi-canaux. Voir : Guides Gemini
- Les réponses compatibles OpenAI, en mode non streaming comme streaming, conservent désormais les valeurs
nullpour des champs commelogprobs,refusaletfinish_reason, ce qui réduit les écarts pour les SDK, agents et analyseurs de logs qui attendent le format standard OpenAI.
- Amélioration de la compatibilité des requêtes lorsque Claude Code appelle des modèles Claude via AIHubMix, avec moins d’informations d’environnement client transmises dans les requêtes envoyées au fournisseur de modèles et une meilleure protection de la confidentialité pour les clients Agent tiers.
- Le système de compte natif couvre la connexion/inscription par code e-mail, la définition de mot de passe, la modification du profil, la liaison/dissociation de comptes tiers et la suppression de compte, avec une meilleure séparation des usages OTP et le blocage des comptes désactivés. Les callbacks de recharge Stripe sont aussi traités de façon plus fiable.
- claude-sonnet-5 pour le chat, le raisonnement et les workflows d’agents.
- gemma-4-31b et longcat-2.0 pour la génération de texte.
- gemini-3.1-flash-lite-image pour les workflows avec capacités d’image.
- mai-image-2.5 et mai-image-2.5-flash pour la génération d’images.
29 juin
Amélioration de la facturation et de la compatibilité des paramètres pour la génération d’images- La facturation de
gpt-image-2sur les endpoints Images est désormais uniformisée en mode token. La génération d’images GLM transmet les paramètres étendus commewatermark_enabledetquality, afin que les réglages de filigrane et de qualité puissent s’appliquer selon les capacités du fournisseur de modèles. Voir : Génération d’images
- Les échecs de l’upload de fichiers Gemini ne créent plus de journaux de requête ordinaires visibles par l’utilisateur, ce qui réduit le bruit des endpoints hors inférence dans la page de logs, tout en conservant les journaux internes de dépannage.
27 juin
Nouveaux modèles Deep Research- Ajout de o4-mini-deep-research et o3-deep-research, disponibles uniquement via le point de terminaison
/v1/responses. Les requêtes doivent inclureweb_search_previewoumcptools, pour les cas de recherche web approfondie et de réponses orientées research.
25 juin
Le protocole Responses prend en charge n’importe quel modèle- Le point de terminaison
/v1/responsesn’est plus limité à la série GPT : il peut désormais appeler n’importe quel modèle de la plateforme. Les outils basés sur le protocole Responses (comme Codex CLI) peuvent ainsi utiliser GLM, Gemini, DeepSeek, Kimi, Qwen et d’autres modèles via un catalogue de modèles local, sans se limiter aux modèles officiels d’OpenAI.
- Correction d’un problème où
step-3.7-flashpouvait renvoyer un contenu vide ou une réponse vide via/v1/responses; le contenu de raisonnement et les réponses finales sont désormais renvoyés correctement.
- Un nouveau tutoriel « Utiliser des modèles personnalisés dans Codex » a été ajouté à la documentation Codex CLI : déclarez n’importe quel modèle disponible sur AIHubMix (GLM, Gemini, DeepSeek, Kimi, Qwen, etc.) via un catalogue de modèles local (
model_catalog_json) et basculez librement depuis la liste/modelde Codex, sans être limité aux seuls modèles d’OpenAI. La documentation inclut un script permettant de générer en une commande un catalogue des 30 premiers modèles, ainsi que les pièges courants. Voir : Codex CLI · Utiliser des modèles personnalisés dans Codex
24 juin
Domaine de secours désormais pris en charge- Ajout d’un domaine de secours
https://api.inferera.com, dont les points de terminaison et les capacités sont identiques à ceux du domaine principalhttps://aihubmix.com. Lorsque le domaine principal est inaccessible (échecs de connexion ou délais d’attente, par exemple), remplacez l’URL de la requête par le domaine de secours ; la clé API, le modèle, le corps de la requête et les autres paramètres restent inchangés.
23 juin
Nouveaux modèles- Doubao doubao-seed-2-1-pro, doubao-seed-2-1-turbo.
- Série vidéo HappyHorse happyhorse-1.1-t2v (texte vers vidéo), happyhorse-1.1-r2v (génération par référence), happyhorse-1.1-i2v (image vers vidéo).
- Le paiement Stripe préremplit désormais l’e-mail du compte et réduit la collecte inutile du nom et de l’adresse de facturation, rendant les recharges via des moyens comme Alipay plus fluides.
- Lorsque le solde du compte est inférieur à -$1, les modèles gratuits ne peuvent plus être appelés tant que le compte n’est pas rechargé.
22 juin
Nouvelle documentation AIHubMix CLI- Nouvelle documentation AIHubMix CLI : un binaire unique sans dépendances (ni Python, ni Node, ni Go) pour consulter le solde du compte, gérer les clés API et voir les modèles disponibles directement depuis le terminal, avec une sortie adaptée aux scripts et aux agents IA (comme Claude Code).
- Définissez
modelsurautoet la passerelle analyse votre requête pour choisir le meilleur modèle parmi des centaines, avec des politiques coût / qualité / latence, facturé selon le modèle réellement utilisé, sans modifier le code client. Voir : LLM Router
- Correction d’un problème où le taux de réussite du cache de
deepseek-v4-proetdeepseek-v4-flashétait inférieur aux attentes.
- Une capacité d’extension locale pour les agents IA prenant en charge les Skills (Codex, Claude Code, Cursor, Cline, etc.) : réalisez en langage naturel l’intégration d’AIHubMix, l’interrogation des modèles, la sélection par capacité, la génération d’exemples et le dépannage des erreurs. Ce Skill lit à la demande les informations en temps réel (modèles, prix, contrats de protocole, etc.) depuis l’API officielle, évitant aux agents de s’appuyer sur une mémoire périmée. Voir : Skills
17 juin
Nouveaux modèles vidéo Kling (Keling)- Intégration de toutes les capacités de génération vidéo Kling : texte vers vidéo, image vers vidéo, référence multi-images et génération multimodale omni, appelées via le protocole natif selon le nom du modèle.
16 juin
Problème du plugin d’intégration OpenClaw corrigé- Le plugin d’intégration OpenClaw d’AIHubMix aihubmix-auth a corrigé ses problèmes d’intégration précédents et est désormais stable. Installez-le et saisissez une seule clé AIHubMix pour appeler simultanément les modèles OpenAI / Anthropic / Gemini dans OpenClaw.
- Zhipu glm-5.2.
15 juin
Nouvelle prise en charge de l’intégration d’Open Design- AIHubMix est désormais une passerelle BYOK prise en charge nativement par Open Design (une alternative à Claude Design, open source et local-first). Sélectionnez AIHubMix dans son mode API (BYOK), renseignez une seule clé, et pilotez simultanément la génération de chat / d’images / de vidéos / de voix, chaque modèle empruntant le protocole natif de son fournisseur selon son nom. Voir : Tutoriel d’intégration d’Open Design
- Le
glm-5.2du service natif Zhipu prend en charge le réglage de la profondeur de réflexion par niveaux viareasoning_effort; les anciens modèles sont automatiquement sélectionnés selon leur version, sans modification côté appelant.
- kimi-k2.7-code-highspeed (version code haute vitesse de Kimi).
13 juin
Nouveaux modèles- coding-glm-5.2 et sa version gratuite coding-glm-5.2-free.
12 juin
Mappage de modèles et fallback en cas d’erreur- Nouveau : Model Mapping et Fallback en cas d’erreur : Configurez le mappage des noms de modèle et le fallback en cas d’erreur par API Key dans la console : réécrivez l’alias de modèle du client vers le nom réel du modèle, basculez automatiquement vers un modèle de secours en cas d’échec du modèle principal et facturez selon le modèle qui répond finalement, sans modifier le code client. Voir : Model Mapping et Fallback
- kimi-k2.7-code.
11 juin
step-3.7-flash à -90 % pour une durée limitée- Offre limitée à -90 % sur step-3.7-flash : seulement 0,022 USD par million de tokens en entrée et 0,132 USD par million de tokens en sortie. À découvrir sans tarder.
claude-opus-4-20250514etclaude-sonnet-4-20250514seront officiellement retirés le 15 juin ; la plateforme routera alors automatiquement les modèles retirés vers la version 4-5 de la même série.
10 juin
Nouveaux modèles- claude-fable-5 [Retiré].
- Fable 5 applique des garde-fous de sécurité plus stricts, et certaines demandes légitimes peuvent aussi être bloquées : il ajoute des classifications sur la cybersécurité, la biologie / chimie, la distillation de modèles et l’extraction de raisonnement. Certaines recherches techniques, analyses de vulnérabilités ou questions biomédicales peuvent être refusées ou redirigées vers Opus 4.8.
- Mythos 5 est en accès restreint, ce n’est pas un modèle ouvert à tous : Mythos 5 et Fable 5 partagent la même base de capacités, mais Mythos 5 utilise moins de classificateurs de sécurité. Il est actuellement réservé à Project Glasswing / aux clients approuvés ; la plupart des utilisateurs utiliseront Fable 5 avec garde-fous.
- Coût API plus élevé : Fable 5 est tarifé 10 USD par million de tokens en entrée et 50 USD par million de tokens en sortie, soit environ deux fois le coût d’Opus 4.8.
- Confidentialité : Fable 5 / Mythos 5 sont classés comme Covered Models, exigent par défaut au moins 30 jours de conservation des données et ne prennent pas en charge Zero Data Retention.
- Comportement des refus API : lorsque Fable 5 refuse une requête, l’API renvoie HTTP 200, mais
stop_reasonvautrefusal.
08 juin
L’interface compatible Gemini prend en charge l’entrée audio- L’appel de Gemini via l’interface compatible OpenAI (
/v1/chat/completions) prend désormais en charge l’entrée audioinput_audio(auparavant silencieusement ignorée), et complète la mesure desaudio_tokensdans le champ usage renvoyé.
05 juin
Nouveaux modèles- grok-build-0.1, hy3-preview, et le modèle gratuit step-3.7-flash-free.
04 juin
Nouveaux modèles- Tongyi Qianwen qwen3.7-plus.
01 juin
Nouveaux modèles- MiniMax minimax-m3.
- Baidu musesteamer-air-image (génération d’images).
29 mars
Page Détail du journal- Latency : indique la rapidité de démarrage d’une requête (temps entre l’initiation de la requête et le premier jeton renvoyé)
- Throughput : fournit une mesure claire de la vitesse de sortie du modèle
- E2E Latency : durée totale entre la soumission de la requête et sa complétion, utilisée pour évaluer la performance globale de la requête
- Provider : identifie le fournisseur de modèle qui a traité la requête
- Status: Shows the execution result (e.g., success / failure) for quick detection of anomalies
- TID: A unique request identifier that can be shared with support for faster troubleshooting
Mar 23
- AIHubMix Global Acceleration Network is now live: Built on self-managed global edge nodes and an intelligent routing system, with continuous monitoring and dynamic optimization, achieving 75% lower latency, 60% improved stability, and 99.99% availability—delivering a faster, more reliable AI experience.
- Added 24/7 real-time health monitoring: Distributed probes scan the entire network every minute, tracking latency, success rate, and stability. Issues are detected and resolved before users even notice, ensuring consistent performance.
- Enhanced intelligent traffic routing: Node health is dynamically evaluated across multiple time windows, enabling millisecond-level switching to the optimal path, significantly reducing fluctuations and timeouts while improving overall request success rates.
Feb 08
- New Feature: Chat → Responses Compatibility
This release introduces Chat → Responses compatibility, allowing the Chat Completions API to invoke OpenAI models that support the Responses protocol only, including gpt-5.2-codex, gpt-5.1-codex-max, and gpt-5.2-pro. If you want to force the AIHubmix Chat API to route requests through the Responses protocol, add the following header to your request:X-Use-Responses-Enabled: trueWhen a model supports both Chat and Responses protocols, setting this header will force the request to use the Responses API.
Please note that the Responses protocol does not currently support audio input or output, so plan usage accordingly. - Model Deprecation Notice:
OpenAI will deprecatechatgpt-4o-lateston February 17, 2026. After the deprecation, we will automatically remapchatgpt-4o-latesttogpt-4o-2024-11-20.
2025
Dec 15
- New feature: Google API now supports Files API.
Sep 22
- Added support for Qwen series, Doubao Seedream 4, and Baidu image generation models
Aug 10
- Released the Aihubmix Image Generation MCP, making it easier for developers to integrate image generation services
Aug 1
- Use any large language model on the AiHubMix platform directly in Claude Code
Jul 29
- Added support for the AI SDK: access a massive number of models with a single API key
Jul 26
- Added support for the Flux image generation API, enabling high-quality images in seconds
Jul 23
- Added support for Qwen Code, leveraging all large language models available on the Aihubmix platform
Jul 4
- Added support for llms.txt: get standardized model navigation with one click so your LLM assistant can quickly understand the entire model ecosystem
Jun 29
- Added forwarding support for Gemini CLI, with multiple flexible usage modes
- Added code interpreter and Remote MCP invocation to the OpenAI Responses API
Jun 26
- Added a Unified Image Generation API, supporting major models including OpenAI, Ideogram, Stability, and Google Imagen
Jun 23
- Launched APP-Code, offering developers a 10% discount across all models
Jun 18
- Added HTTP Status Code documentation to help users better understand error messages
Jun 13
- Added support for Veo 3.0 video generation to expand creative formats
Jun 9
- Added support for OpenAI Reasoning Summaries in the Responses API
Jun 5
- Added implicit caching for Gemini, with automatic cache hits and hit feedback
Developers can useusage_metadatato determine cache hits
Cost savings are not guaranteed and depend on request structure and usage scenarios
May 31
Full Support for New Claude 4 Features- ⏳ New cache TTL: 1-hour cache support Beta
- 🎉 New text editing tools: Claude 4 now supports
text_editor_20250429andstr_replace_based_edit_tool - 🚫 New refusal stop reason for safety-based rejections
- 🧠 Extended Thinking: Claude 4 now returns full summaries of its reasoning process
- 🔄 Interleaved Thinking: Tool usage can now interleave with extended thinking for more natural conversations (Beta)
- ⚠️ Deprecated Features:
undo_editis no longer supportedtoken-efficient-tools-2025-02-19removed (Claude 3.7 only)output-128k-2025-02-19removed (Claude 3.7 only)
- 📚 Full migration guides and code examples have been updated to help users smoothly transition from Claude 3.7 to Claude 4
May 22
- Added support for the Dify plugin, enabling seamless integration of Aihubmix models into Dify
Extend and manage over 200 models with a single API key
May 17
- Added support for
codex-mini-latest, optimized for programming tasks, accessible via the Responses API or Codex CLI - Added support for Google Imagen 3.0 image generation and Veo 2.0 video generation
gemini-2.0-flash-expupgraded to the official preview versiongemini-2.0-flash-preview-image-generation
May 9
- Added the Ideogram AI V3 API — Ideogram’s most advanced image generation model
May 6
- Added Utility Management Scripts for managing API keys, viewing accounts, and listing available models via CLI
Apr 26
- The highly anticipated OpenAI image generation API
gpt-image-1is now live, supporting both text-to-image and image-to-image - Added native Gemini API support with precise reasoning budget control for Flash 2.5
Apr 24
- Integrated three core Jina AI APIs to help build powerful agents: Embeddings, Rerank, and DeepSearch
Apr 20
- Added support for the OpenAI Responses API endpoint with expanded tool capabilities
Apr 17
- Added OpenAI CodeX CLI support: program with natural language directly in the terminal
Apr 12
- By appending
:surfingto a model ID, any model can gain search capabilities (Beta)
Apr 9
- Added Claude prompt caching, saving up to 76% in cost for repeated high-frequency prompts
Apr 7
- Added Ideogram AI image generation support with strong text rendering, hybrid generation, local edits, and upscaling
Apr 5
- Brand-new documentation experience launched
Mar 30
- Added support for the Claude Text Edit Tool
Mar 24
- Launched the brand-new Trident logo
Mar 16
- Added native search support for OpenAI and Google Gemini models
- Third-party search integration will be added in future updates
Mar 15
- Added models:
gpt-4o-mini-search-previewandgpt-4o-search-preview
Mar 7
- Prices for o1 and o3-mini reduced by 10%, in line with official pricing
Mar 6
- Due to a 7× price increase from Microsoft, the price of
aihubmix-DeepSeek-R1also increased 7×
Recommended alternative: Volcano Engine’s DeepSeek-R1 (more stable and cost-effective)
Added models:qwen-qwq-32bandqwen2.5-vl-72b-instruct
Feb 28
- All Claude models received a 15% price reduction
- Added model
gpt-4.5-preview(extremely expensive — use with caution)
Feb 26
- Improved DeepSeek stability
- ByteDance versions of DeepSeek are currently the most stable
Recommended models:DeepSeek-R1andDeepSeek-V3
Feb 25
- Added model
claude-3-7-sonnet-20250219
Feb 24
- The gpt-4o model may occasionally respond very slowly due to model provider issues
It is recommended to temporarily switch togpt-4o-2024-11-20 - The Perplexity API is temporarily offline
Due to Perplexity’s complex billing model and higher costs than this platform’s pricing structure, the service will be relaunched after pricing adjustments - The temporary ByteDance official discount has ended and prices have returned to normal
The price ofDeepSeek-R1has been increased accordingly - Added a new model details page with full parameter information
Feb 23
- The temporary ByteDance official discount has ended and prices have returned to normal
The price ofDeepSeek-V3has been increased
ByteDance’s R1 model is also expected to return to normal pricing soon, and this platform will同步 adjust prices accordingly
Feb 18
- Added model:
kimi-latest
(Official billing is tiered by input length at 8k, 32k, and 128k.
This platform does not support tiered pricing and uses the mid-tier 32k as the pricing standard.
If you are price-sensitive, use with caution.) - Optimized overall website layout
- Merged the Changelog page into the Usage Statistics page
- Moved Announcements to the Model Marketplace page
- Moved Settings under the user avatar menu
- Reduced the price of
aihubmix-DeepSeek-R1by 50% - Added models:
gemini-2.0-pro-exp-02-05-search,gemini-2.0-flash-exp-search
(Integrated with Google’s official online search) - Added models:
gemini-2.0-flash,gemini-2.0-pro-exp-02-05,gemini-2.0-flash-lite-preview-02-05 - Added models:
o3-mini,o1
(These two models are billed about 10% higher than official pricing due to limited account resources)
Feb 4
- The
o1model does not support thestreamparameter in the official OpenAI API - The
o3-minimodel does not support thetemperatureparameter
A new parameterreasoning_effortis available with values:"low","medium","high"
Default is"medium"if not specified
Feb 1
Feature Update:- Added support for OpenAI audio model input and output
Theapi.aihubmix.compreview server is now available
After one week of stable operation, the main site will be updated
Backend billing is fully consistent with official pricing
Currently, usage logs only display text token usage
Audio token usage is not yet shown in logs but does not affect normal usage
o3-mini,o1
(Billed about 10% higher than official pricing due to limited account availability)aihubmix-DeepSeek-R1(recommended, highly stable)qwen-max-0125(Qwen2.5-Max),sonar-reasoningdeepseek-ai/DeepSeek-R1-Zero,deepseek-ai/DeepSeek-R1,deepseek-r1-distill-llama-70baihub-Phi-4Doubao-1.5-pro-256k,Doubao-1.5-pro-32k,Doubao-1.5-lite-32k,Doubao-1.5-vision-pro-32ksonar,sonar-pro(latest from Perplexity AI)gemini-2.0-flash-thinking-exp-01-21deepseek-reasoner(aka DeepSeek-R1)MiniMax-Text-01codestral-latest(Mistral’s new code model — Codestral 25.01)
Jan 23
New Models Added:aihub-Phi-4Doubao-1.5-pro-256k,Doubao-1.5-pro-32k,Doubao-1.5-lite-32k,Doubao-1.5-vision-pro-32ksonar,sonar-pro(latest from Perplexity AI)gemini-2.0-flash-thinking-exp-01-21deepseek-reasoner(aka DeepSeek-R1)
Jan 19
- Added Perplexity AI API models
Currently supported only on the preview serverapi.aihubmix.com
After stable testing, it will be rolled out to the main serveraihubmix.com api.aihubmix.comis the preview server
New features will be deployed there first and promoted to the main server after ~1 week of stability testing
MiniMax-Text-01codestral-latest(Mistral Codestral 25.01)
Jan 6
- Added
gemini-2.0-flash-exp-search, supporting native Google online search
The official Gemini 2.0 Flash model requires additional parameters for online search
Aihubmix has integrated this functionality — simply appendsearchto the model name - Added model:
deepseek-ai/DeepSeek-V3
Jan 1
- Launched the new Model Marketplace page to replace the old Model & Pricing page
2024
Dec 30
- Fixed the issue where
gemini-2.0-flash-thinking-exp-1219only returned reasoning without final answers - Fixed the issue of balance reminder emails not being delivered
Dec 22
- Added Usage Statistics page
- Added Recharge History page
- Added Doubao series models:
Doubao-lite-128k,Doubao-lite-32k,Doubao-lite-4k,Doubao-pro-128k,Doubao-pro-256k,Doubao-pro-32k,Doubao-pro-4k - Added model:
gemini-2.0-flash-thinking-exp-1219 - Added models:
gemini-2.0-flash-exp,aihubmix-Mistral-Large-2411,aihubmix-Llama-3-3-70B-Instruct,grok-2-1212,grok-2-vision-1212 - Added models:
gemini-exp-1206,llama-3.3-70b-versatile,learnlm-1.5-pro-experimental
Dec 14
- Added models:
gemini-2.0-flash-exp,aihubmix-Mistral-Large-2411,aihubmix-Llama-3-3-70B-Instruct
Dec 8
- Added models:
gemini-exp-1206,llama-3.3-70b-versatile,learnlm-1.5-pro-experimental - Added Usage Statistics page
Nov 21
- Recently added models:
gpt-4o-2024-11-20,step-2-16k,grok-vision-beta - Qwen 2.5 Turbo million-context model:
qwen-turbo-2024-11-01
Nov 7
- Added compatibility with the native Claude SDK
Thev1/messagesendpoint is now live - Native Claude prompt caching and computer use features are not yet supported
These will be completed within the next two weeks
Nov 5
- Added model:
claude-3-5-haiku-20241022 - Added Elon Musk’s xAI latest model:
grok-beta
Oct 23
- Added model:
claude-3-5-sonnet-20241022
Oct 10
- OpenAI’s latest caching feature is now live
Currently supported models:- GPT-4o
- GPT-4o-mini
- o1-preview
- o1-mini
- Note:
gpt-4o-2024-05-13is not included in the official supported list - Cache hit tokens will be visible in backend logs when a request hits the cache
- For full details and usage rules, refer to the OpenAI official documentation
Oct 3
- Backend billing for
gpt-4ohas been reduced to match official pricing - Added models:
aihubmix-Llama-3-2-90B-Vision,aihubmix-Llama-3-70B-Instruct - Added Cohere latest models:
aihubmix-command-r-08-2024,aihubmix-command-r-plus-08-2024
Sep 19
- Added models:
whisper-large-v3anddistil-whisper-large-v3-en - Note: Whisper model billing is based on input seconds
The current pricing display on the site is incorrect and will be fixed
Backend billing forwhisper-1fully matches OpenAI official pricing
Sep 13
- Added models:
o1-miniando1-preview
Note: These models require updated parameters
Some client shells may throw errors if defaults are not updated
o1 model does NOT support:
systemfield → 400 errortoolsfield → 400 error- Image input → 400 error
json_objectoutput → 500 errorstructuredoutput → 400 errorlogprobsoutput → 403 errorstreamoutput → 400 error
- o1 series: 20 RPM, 150,000,000 TPM — extremely low, frequent 429 errors possible
temperature,top_p, andnare fixed at 1presence_penaltyandfrequency_penaltyare fixed at 0
Sep 10
- Added model:
mattshumer/Reflection-Llama-3.1-70B
(Reported to be one of the strongest fine-tuned versions of LLaMA 3.1 70B) - Claude-3 model prices increased
To ensure stable supply, calls through this platform are currently ~10% more expensive than direct official usage - Increased concurrency capacity for OpenAI models
The system now theoretically supports near-unlimited concurrency
Aug 11
- Added models:
Phi3medium128k,ahm-Phi-3-medium-4k,ahm-Phi-3-small-128k - Improved stability for LLaMA-related models
- Further optimized compatibility for Claude models
Aug 7
- Added OpenAI’s newly released
gpt-4o-2024-08-06
See: https://platform.openai.com/docs/guides/structured-outputs - Added Google’s latest model:
gemini-1.5-pro-exp-0801
Aug 4
- Added direct online payment for account top-ups
- Fixed Claude multi-turn conversation format error:
messages: roles must alternate between "user" and "assistant", but found multiple "user" roles in a row - Optimized index handling when using function calling with Claude models
- The backup server
https://orisound.cnwill be fully decommissioned on Sep 7
Please migrate to the main serverhttps://aihubmix.comor backup serverhttps://api.aihubmix.com
Jul 27
- Added support for Mistral Large 2
Model name:Mistral-large-2407oraihubmix-Mistral-large-2407 - System optimizations
Jul 24
- Added latest LLaMA 3.1 models:
llama-3.1-405b-instruct,llama-3.1-70b-versatile,llama-3.1-8b-instant
Jul 20
- Fixed pricing calculation issues for the
gpt-4o-minimodel- Text input pricing: 1/33 of GPT-4o officially
- Image input pricing: equal to GPT-4o
- To align with official pricing, image token counts for
gpt-4o-miniare multiplied by 33 during billing - Refer to OpenAI official pricing for details
Jul 19
- Added support for the
gpt-4o-minimodel
Backend billing is fully aligned with official pricing
Jul 15
- Added support for the official
include_usageAPI parameter
This allows returning usage data in stream mode
See the official documentation for details
Jul 14
- The new version of NextWeb now supports calling non-OpenAI models through this platform
- Added backend billing support for Alibaba Qwen models
Calls through this platform cost ~10% more than direct Alibaba Cloud usage - Improved Azure OpenAI output compatibility with the standard OpenAI API
- Added tool calling support for Claude-3
- Added many new models (see Settings → Available Models)
Jul 3
- Overall backend UI optimization
- Each log entry now displays the model unit price at the time of the request
- Added the Model & Pricing page
Jun 20
- The latest
claude-3-5-sonnet-20240620is now supported
See the guide for calling non-OpenAI models on this platform
Jun 18
- Backend logs now support downloading historical request records
Jun 16
- The probability of randomly routing requests to Azure OpenAI has been significantly reduced
Jun 13
- Reduced backend costs for Claude-3 models
(Claude 3 Haiku,Claude 3 Sonnet,Claude 3 Opus)
Backend billing now matches official pricing
As a result, the effective retail API cost on this site is equivalent to ~86% of official pricing
Jun 10
- Optimized GPT-4o token billing
Tokenizer changed fromcl100k_basetoo200k_base
As a result, streaming token counts for Chinese, Korean, and Japanese are lower than before
Jun 8
- Added Alibaba’s latest open-source Qinwen 2 models:
alibaba/Qwen2-7B-Instructalibaba/Qwen2-57B-A14B-Instructalibaba/Qwen2-72B-Instruct
May 20
- Added model:
gemini-1.5-flash - Added model:
gpt-4o - Added models:
llama3-70b-8192,llama3-8b-8192,gemini-1.5-pro,command-r,command-r-plus - Claude-3 model supply has been restored
Endpoints are currently deployed across AWS and Google Cloud - To cover infrastructure and operational costs, Claude-3 backend billing is ~10% higher than official pricing
With increased usage, this will be gradually reduced to ~5% or lower - Concurrency limits are currently under testing and will be increased as demand grows
Dernière mise à jour : 2026-06-22