Skip to main content

2026

2026

28 août

Nouveaux modèles
  • Ajout de hy4-preview : Hy4 Preview de Tencent Hunyuan, un modèle MoE de 770B de paramètres totaux et 49B de paramètres actifs, optimisé pour les workflows Agent, de code et de productivité. Il renforce la compréhension, la planification, l’utilisation d’outils et l’exécution soutenue sur des tâches complexes en plusieurs étapes, l’ingénierie logicielle, le traitement de documents, l’analyse d’informations, l’automatisation bureautique, la génération web et la collaboration entre outils. Il prend en charge une fenêtre de contexte de 1 M de tokens, jusqu’à 64K de sortie, le raisonnement, la recherche web, l’appel d’outils et de fonctions et les sorties structurées.

2026

27 août

Nouveaux modèles
  • Ajout de qwen3.8-flash : le modèle vision-langage natif phare d’Alibaba Cloud Qwen, pensé pour le code, les tâches bureautiques, le raisonnement sur long contexte et les workflows agentiques. Il prend en charge une fenêtre de contexte de 1 M de tokens, jusqu’à 128K de sortie, le thinking, l’accès web, l’appel d’outils et les sorties structurées. Par rapport à Qwen3.7-Plus, il renforce les capacités de code et de bureautique tout en améliorant l’efficacité d’entraînement et d’inférence.
Les appels de l’outil image MCP sont plus explicites
  • L’outil MCP de génération d’images exige désormais que l’appelant fournisse explicitement le modèle, ce qui évite l’utilisation silencieuse d’un modèle par défaut lorsqu’aucun modèle n’est indiqué.
  • openai/gpt-image-1 est l’identifiant de modèle standard affiché et transmis vers l’extérieur. L’ancienne faute de frappe reste acceptée uniquement comme alias d’entrée compatible, puis elle est normalisée avant l’envoi de la requête.

2026

26 août

Nouveaux modèles
  • Ajout de glm-5.3-flash : le modèle multimodal haute efficacité de Z.AI, pensé pour les agents de code, le raisonnement complexe et les tâches d’ingénierie logicielle sur longue durée. Il prend en charge les entrées texte, image et vidéo, environ 1 million de tokens de contexte, jusqu’à 128K de sortie, le thinking, l’appel d’outils et les sorties structurées. Construit sur la pile technologique GLM avec un post-entraînement et une optimisation supplémentaires, il met l’accent sur l’efficacité d’inférence et la réactivité.
Nouvelle fonctionnalité
  • Ajout de Broadcast, qui envoie automatiquement les traces des requêtes API AIHubMix vers LangWatch sans instrumentation supplémentaire dans l’application. Le mode de confidentialité, l’échantillonnage et les filtres de clés API sont pris en charge ; LangWatch affiche le modèle, les tokens, le coût réel facturé, la latence, la session et les données de Trace.
Points d’entrée MCP et Access Key plus complets
  • L’ancien point d’entrée /mcp/ peut continuer à utiliser le mode d’authentification existant tout en étant routé vers les capacités MCP HTTP distantes unifiées. Les anciens clients n’ont pas besoin de migrer immédiatement et peuvent toujours consulter modèles et prix, rechercher dans la documentation, vérifier le solde et utiliser les outils de chat, d’image et de vidéo.
  • La console proposera un accès en lecture seule pour copier l’Access Key, et les clients MCP externes peuvent utiliser l’en-tête X-Aihubmix-Access-Key. Le serveur ne fait pas tourner la clé et ne met pas cette réponse en cache.
Demandes d’image avec fond transparent plus stables
  • Les requêtes gpt-image-2 avec fond transparent privilégient désormais les canaux natifs OpenAI qui prennent en charge cette capacité, ce qui réduit les échecs répétés sur des canaux non compatibles. Les autres chemins de requête image ne changent pas.
Fichiers pour Agents mis à jour plus vite
  • Les listes de modèles et guides destinés aux AI Agents et aux outils externes se rafraîchissent plus rapidement.

2026

25 août

Erreurs de migration plus claires pour les anciennes API média
  • Pour les modèles média qui ne prennent plus en charge l’ancien protocole, /v1/images/generations, /v1/images/edits, /v1/models/:organization/:model/predictions et /v1/videos renvoient désormais protocol_not_supported, avec une orientation vers les API média asynchrones /ai/v1 et la documentation associée.
  • model=auto conserve le comportement actuel de sélection automatique du modèle. Si le modèle finalement choisi ne prend pas en charge l’ancien endpoint, l’appelant reçoit une erreur claire au lieu d’être redirigé silencieusement vers un autre modèle. Playground masque aussi les anciennes entrées pour ces modèles afin de réduire les usages involontaires.

2026

24 août

Nouveaux modèles
  • Ajout de wan3.0-video : le modèle vidéo All-in-One en préversion d’Alibaba Cloud Wan (Tongyi Wanxiang) unifie les workflows text-to-video, image-to-video par première/dernière image et vidéo de référence, prenant en charge jusqu’à 30 secondes à 30 fps en 480P/720P/1080P pour une génération et une édition intégrées.
  • Ajout de wan3.0-video-prime : édition haute vitesse alignée en capacités pour les workflows intégrés de génération et d’édition vidéo, avec un traitement de bout en bout plus rapide.
Baisse de prix de GPT-5.6 Sol
  • gpt-5.6-sol synchronise la baisse officielle de 20 % et coûte désormais 4 parmilliondetokensdentreˊeet20par million de tokens d'entrée et 20 par million de tokens de sortie. Les chemins d’appel existants ne changent pas, tandis que les charges de raisonnement complexe, de code et de long contexte coûtent moins cher.
Activation des tâches média asynchrones plus claire
  • Lorsqu’un compte n’a pas activé les tâches asynchrones, les API de création média incluent désormais la page console correspondante dans l’erreur async_not_enabled. Les utilisateurs aihubmix, inferera et shkq sont dirigés vers leur propre console, ce qui réduit les réponses 403 sans suite claire.

2026

21 août

Nouveaux modèles
  • Ajout de deepseek-v4-flash-0731-fast : une variante haute vitesse du modèle agentique de DeepSeek, conçu pour le code, l’utilisation d’outils et les charges d’Agent à fort volume. Il conserve les capacités de V4 Flash 0731 tout en offrant une inférence plus rapide ; comparé à V4 Pro, il privilégie une latence réduite et l’efficacité d’exécution. Il prend en charge une fenêtre de contexte de 1 M de tokens, jusqu’à 384K de sortie, le thinking, l’appel d’outils et les sorties structurées.
  • Ajout de deepseek-v4-flash-vision-exp : modèle expérimental de compréhension visuelle multimodale de DeepSeek, avec entrée texte et image et sortie texte. Il convient à la description d’images, à l’OCR de captures d’écran, à l’analyse de graphiques et aux agents visuels ; ses capacités agentiques, de raisonnement et de connaissances générales en pur texte restent au niveau de DeepSeek V4 Flash officiel.
  • Ajout de ox-alpha, un modèle de raisonnement furtif fourni par un tiers anonyme dont le véritable développeur et propriétaire n’ont pas été divulgués. Gratuit sur AIHubMix, il prend en charge l’entrée texte et image, la sortie texte et une fenêtre de contexte de 1 048 576 tokens pour le code, l’ingénierie logicielle sur longue durée, le travail agentique soutenu, le raisonnement complexe et les workflows combinant texte et visuel.
La récupération après échec en génération d’images est plus stable
  • Lorsqu’une requête de génération d’images rencontre une erreur de service temporaire, AIHubMix récupère plus régulièrement. Si l’erreur correspond clairement à une limite de capacité du modèle choisi, la requête s’arrête toujours avec une raison lisible. Cela réduit les échecs directs liés à des différences temporaires de service pour des modèles comme gpt-image-2.

2026

20 août

Annonce de la plateforme
  • Lancement des capacités d’intégration pour les AI Agents : instructions d’intégration agents.md, documentation lisible par machine llms.txt pour le site et pour chaque modèle, Playground Skill (distribution via adresse fixe), liens profonds Playground (?models= ouvre jusqu’à 6 onglets de modèles avec un seul lien, ?config= charge directement une configuration). Pour comparer les spécifications et les tarifs de deux modèles côte à côte, utilisez la page de comparaison https://aihubmix.com/compare/{model_a}/{model_b}. La liste des points d’entrée est disponible sur Intégration Agent.
Les paramètres et erreurs de l’API image sont plus cohérents
  • Les requêtes de génération d’images gèrent plus régulièrement les paramètres de taille comme resolution et imageSize. Lorsqu’une requête dépasse les capacités du modèle choisi, l’API renvoie des erreurs plus claires pour corriger les paramètres plus vite.
Le hub de modèles prend en charge les modèles principaux avec versions
  • Les variantes liées, comme GLM 5.2, l’édition Coding et l’édition Free, peuvent être présentées comme un modèle principal avec plusieurs versions. La navigation, la comparaison des prix et le choix de version deviennent plus faciles à comprendre.
Les tâches image asynchrones avancent plus vite
  • Les tâches image asynchrones peuvent maintenant progresser avec une concurrence bornée selon la capacité disponible. En période chargée, les files devraient se résorber plus régulièrement et la livraison des statuts/résultats être plus stable.

2026

19 août

Nouveaux modèles
  • Ajout de gpt-5.6-sol-disc : la route de réduction à durée limitée d’AIHubMix pour GPT 5.6 Sol d’OpenAI, offrant jusqu’à 50 % de remise avec les mêmes capacités sous-jacentes que le gpt-5.6-sol standard. Ce modèle de raisonnement de pointe est adapté au code complexe, au travail de connaissance professionnel, à la recherche approfondie et aux agents à longue exécution, avec entrée texte et image, environ 1,05 M tokens de contexte, jusqu’à 128K de sortie, thinking, outils et sorties structurées.
Les tâches de génération média sont plus fiables
  • L’heure de fin, l’expiration des résultats et l’archivage des artefacts sont plus cohérents pour les tâches image et vidéo. En déploiement progressif ou sous forte concurrence, les statuts, les résultats téléchargeables et les journaux côté utilisateur risquent moins d’être retardés ou traités deux fois.
  • La capacité de production média a été augmentée, et les réponses média volumineuses disposent de plus de marge, ce qui améliore la disponibilité des tâches longues ou avec de gros artefacts.

2026

18 août

Les pages modèles sont plus complètes
  • Les détails de modèle exposent maintenant release_date, ce qui permet de mieux distinguer la date de sortie officielle de l’heure de mise en ligne AIHubMix sur les pages modèle et de comparaison.
La compatibilité Gemini pour les images et les envois est plus stable
  • Les flux Gemini d’image et de Vertex multi-image conservent mieux imageSize et les paramètres image associés, ce qui réduit les écarts de taille ou de protocole.
  • Les téléversements de fichiers Gemini gardent le Content-Type d’origine, donc les vidéos et autres médias sont moins souvent reconnus comme un mauvais type.
Les erreurs publiques sont plus lisibles
  • Les erreurs côté utilisateur pour les schémas, les énumérations et les capacités affichent désormais des messages plus clairs, ce qui simplifie le diagnostic des paramètres.

2026

17 août

Nouveaux modèles
  • Ajout de glm-5.3, l’API de production de Z.AI pour son modèle de raisonnement phare uniquement texte, conçu pour l’ingénierie logicielle complexe, les tâches d’Agent à long horizon et l’analyse de vulnérabilités. Il prend en charge une fenêtre de contexte de 1 M de tokens, jusqu’à 128K en sortie et une concurrence illimitée sur AIHubMix, avec une remise à durée limitée de 10 %.

2026

15 août

Nouveau modèle
  • Ajout de mai-thinking-1 : modèle de raisonnement de la série Microsoft MAI pour le raisonnement d’entreprise, les mathématiques, l’intelligence générale et les charges à haut débit. Il prend en charge une fenêtre de contexte de 256K tokens, Chat Completions et les sorties structurées, ce qui le rend adapté au raisonnement long contexte, aux formats de réponse stables et aux usages continus sensibles aux coûts.

2026

14 août

Nouveaux modèles
  • Ajout de gemini-3.7-flash : le modèle de raisonnement nativement multimodal de Google, conçu pour le codage, les agents, le développement web et le travail de connaissance. Il prend en charge les entrées texte, image, audio et vidéo, une fenêtre de contexte d’un million de tokens, des niveaux de thinking ajustables, l’appel d’outils, la recherche web et les sorties structurées, avec un codage, une utilisation d’outils, une planification multi-étapes et un suivi d’instructions renforcés par rapport à Gemini 3.6 Flash.
  • Ajout de coding-glm-5.3 : le modèle de raisonnement de Z.AI pour le codage et les workflows agentiques, conçu pour l’ingénierie logicielle complexe, les agents à longue durée d’exécution et l’analyse de vulnérabilités. Reposant sur le même modèle de base que GLM-5.2, un post-entraînement à plus grande échelle améliore le codage, l’exécution des tâches et l’efficacité des tokens. Cette route est une préversion en durée limitée, destinée uniquement aux tests et à l’évaluation ; la stabilité du service n’est pas garantie et une utilisation en production n’est pas recommandée.
Compatibilité API et fiabilité des tâches
  • Les requêtes Gemini embedding natives conservent désormais l’origine de service du fileUri retourné par Gemini Files API. Avec embedContent ou batchEmbedContents sur des fichiers téléversés, les erreurs 403 liées à une origine incohérente sont réduites ; les lots qui mélangent des fichiers de plusieurs origines renvoient un 400 explicite.
  • Lorsqu’OpenRouter renvoie une erreur structurée d’un fournisseur de modèles, l’erreur API privilégie maintenant les champs internes message, param et type, ce qui réduit les messages longs et difficiles à analyser. Une erreur d’un seul fournisseur de modèles risque aussi moins d’affecter tout le service OpenRouter.
  • Le polling, l’archivage terminal et le traitement des artefacts des tâches média asynchrones sont plus fiables. Les longues tâches image ou vidéo risquent moins d’être traitées deux fois, de perdre leur état terminal ou d’être livrées en retard en cas de forte concurrence, de redémarrage ou d’artefacts volumineux ; les champs publics, statuts et formules de facturation de l’API ne changent pas.

2026

13 août

Nouveaux modèles
  • Ajout de grok-4.6 : le modèle multimodal de raisonnement phare de xAI, conçu pour le codage, les agents à long terme, le travail de connaissance et le développement d’applications interactives. Il prend en charge la compréhension d’images, une fenêtre de contexte de 500K, l’appel d’outils et les sorties structurées, avec une exécution multi-étapes, une auto-vérification, un codage et une génération de projets visuels renforcés par rapport à Grok 4.5.
  • Ajout de deepseek-v4-pro-0813 : le modèle de raisonnement et d’agent généraliste haute performance de DeepSeek, conçu pour le raisonnement complexe, le codage, l’analyse de documents longs et les workflows agentiques. Il prend en charge les modes thinking et non-thinking, une fenêtre de contexte d’un million de tokens, jusqu’à 384K en sortie, l’appel d’outils et l’API Responses.

2026

12 août

Nouveaux modèles Durée vidéo Veo plus précise
  • Les tâches Gemini Veo conservent plus fiablement la durée réelle de la vidéo lors de la création, du polling et de la lecture du résultat. Les utilisateurs qui génèrent des vidéos avec une durée personnalisée verront mieux alignés la durée de tâche, la durée du fichier téléchargé et les éléments de facturation ou d’affichage.
Meilleure compatibilité des appels d’outils Azure Responses
  • Lors de l’utilisation d’outils namespace via Azure Responses, les descriptions vides ou absentes ne provoquent plus un rejet Azure 400 avant l’exécution du modèle. Les appels d’outils déjà acceptés par l’interface OpenAI officielle devraient se comporter plus régulièrement sur Azure.
Données plus complètes pour les pages modèles et fournisseurs
  • /call/devs prend désormais en charge un champ de site web fournisseur, afin que les pages d’agrégation de modèles et de fournisseurs puissent afficher une entrée Official site une fois les données renseignées. Les pages /providers/<slug> conservent aussi leur comportement de cache en périphérie pour des réponses plus stables.

2026

11 août

Gemini interactions prend désormais en charge les tâches asynchrones
  • Les requêtes Gemini interactions peuvent désormais utiliser explicitement background: true pour créer des tâches asynchrones, puis utiliser l’ID de tâche retourné pour consulter l’état, annuler ou nettoyer la tâche. Les interactions multimodales/omni longues sont plus faciles à intégrer sans garder une connexion synchrone ouverte jusqu’à la fin.
  • Les tâches asynchrones sont facturées selon l’usage réel, avec les colonnes de tokens, le remboursement complet en cas d’annulation et les protections de grandes réponses complétés. Les journaux d’utilisation, la pré-déduction du solde et les frais finaux dans la console restent plus cohérents.
Meilleure compatibilité thinking pour Claude Messages
  • Quand le protocole Messages appelle des fournisseurs de modèles compatibles OpenAI, le contenu thinking/reasoning retourné est conservé et peut être renvoyé dans les tours suivants. Les applications utilisant les SDK Claude, les outils multi-tours ou le mode thinking de DeepSeek devraient voir moins de réponses vides, d’erreurs 400 ou de pertes de contexte de raisonnement.
  • Les blocs thinking non signés sont mieux pris en charge lorsque le trafic bascule vers des canaux Claude natifs, ce qui réduit les erreurs de format dans les flux de fallback multi-modèles ou de bridge.
Meilleure compatibilité des prompts et références Doubao vidéo
  • Lors de l’appel des modèles vidéo Doubao, prompt et les ressources de référence dans extra_body.content peuvent désormais fonctionner ensemble ; les requêtes ne contenant que des ressources conservent le prompt et l’ordre des ressources.
  • Les réponses de création reflètent désormais la taille et le prompt plus près du contenu réellement envoyé, tout en continuant à ignorer les champs natifs non pris en charge. Cela réduit les échecs de génération vidéo causés par des paramètres SDK supplémentaires.

2026

10 août

Usage cumulé plus complet pour la génération média
  • Après le règlement d’une tâche de génération média, le quota cumulé utilisé au niveau du compte est mis à jour lui aussi. Dans la console, l’usage cumulé, la déduction de solde et les journaux d’utilisation reflètent plus complètement la consommation réelle de génération média.
Meilleure compatibilité des noms de modèle Azure
  • Lors de l’appel de modèles Azure dont le nom de deployment/model contient des points, le nom du modèle est conservé tel quel sur les chemins de conversion Chat, Responses et Messages, sans réécriture automatique. Le comportement des appels Azure existants reste inchangé.

2026

8 août

Nouveau modèle de génération vidéo
  • Ajout de doubao-seedance-2-5-260628 : modèle unifié de génération audio-vidéo multimodale de nouvelle génération de ByteDance Seed. Il produit jusqu’à 30 secondes d’audio et de vidéo synchronisés en une seule passe, prend en charge les extensions multi-tours et améliore la narration, les transitions, la prise en charge des références, le réalisme et l’édition précise pour le cinéma, la publicité, l’éducation, la simulation et la création de contenu long.

2026

6 août

Nouveaux modèles
  • Ajout de wan3.0-video : modèle tout-en-un de génération et d’édition vidéo du Tongyi Lab d’Alibaba, actuellement en bêta publique. Il prend en charge des vidéos natives jusqu’à 30 secondes, une cohérence des personnages de niveau production, des visuels et un son réalistes, et des workflows unifiés de référence, d’édition, de réplication et de pilotage par mouvement pour la publicité, l’e-commerce, le cinéma, l’animation, le montage vidéo et la conversion de documents en vidéo.
  • Ajout de qwen-image-3.0 : modèle de génération et d’édition d’images de l’équipe Qwen d’Alibaba Cloud, prenant en charge la génération à partir de texte, la création à partir d’images de référence et l’édition d’images. Il équilibre qualité et vitesse pour les réseaux sociaux, l’e-commerce, le design créatif, la production de contenu quotidienne et la création à grande échelle en volume élevé.
  • Ajout de qwen-image-3.0-pro : modèle phare de génération et d’édition d’images de Qwen (Alibaba Cloud) pour la publicité, l’identité de marque, l’UI, les présentations, l’imagerie produit et le design professionnel. Il excelle sur les mises en page complexes, le rendu précis du texte en chinois et en anglais, les matériaux réalistes, l’édition guidée par image de référence, le détail, la composition et une qualité visuelle de niveau commercial.

2026

4 août

Gemini embedding accepte les entrées multimodales et la facturation par modalité
  • gemini-embedding-2-preview peut désormais traiter du texte, des images, de l’audio, de la vidéo et des documents via l’endpoint embeddings compatible OpenAI comme via le chemin Gemini natif. Les utilisateurs qui créent des workflows de recherche multimodale, de compréhension de contenu ou de base de connaissances peuvent utiliser davantage de types d’entrée avec le même modèle.
  • La facturation Gemini embedding s’appuie en priorité sur les tokens par modalité retournés par le fournisseur de modèles. Les images, l’audio, la vidéo et les documents ne sont plus ramenés à une estimation texte unique, ce qui rend la facture multimodale plus proche de l’usage réel.
  • Une requête embedding à entrée unique peut appeler directement le nouveau chemin Gemini embedding. Les requêtes batch multi-entrées renvoient maintenant une réponse claire de capacité non prise en charge.
Appels de génération vidéo Seedance 2.0 plus fiables
  • Les références Seedance 2.0 pour images, audio et vidéo sont mieux mappées selon le type de média, avec des contraintes plus claires pour adaptive, la 4K et les tailles. Les workflows de génération vidéo rencontrent moins d’échecs liés à un mauvais mapping de paramètres.
  • Les requêtes à durée adaptative sont prélevées sur une base de 15 secondes, puis régularisées selon la durée réelle à la fin de la tâche, ce qui aligne mieux pré-déduction du solde et facturation finale.
  • En cas d’échec de génération média, les API renvoient des détails d’erreur expurgés, utiles pour diagnostiquer les problèmes de paramètres, de liens signés ou de limites du fournisseur de modèles sans exposer d’identifiants sensibles.

3 août

Nouveaux modèles
  • Ajout de qwen3.8-max : modèle vision-langage natif phare d’Alibaba Cloud, bâti sur une architecture Mixture-of-Experts (MoE) de 2,4 billions de paramètres et prenant en charge des fenêtres de contexte jusqu’à 1 million de tokens. Adapté à la compréhension multimodale complexe, au raisonnement avancé, au développement logiciel, aux workflows agentiques et au traitement de contextes longs. À un prix proche de Qwen3.7-Max, Qwen3.8-Max apporte des améliorations notables en raisonnement, en codage et en capacités d’agent, avec des performances globales comparables aux meilleurs modèles actuels.
Disponibilite des fournisseurs plus claire dans les details de modele
  • Les details de modele placent maintenant en premier les fournisseurs les mieux adaptes aux requetes actuelles, tandis que les fournisseurs uniquement en secours ou temporairement indisponibles apparaissent plus bas. Lors du choix d’un fournisseur ou d’une verification de disponibilite, les utilisateurs et les equipes support voient plus vite quelles options sont les plus pertinentes et evitent les decisions fondees sur un ordre devenu obsolete.

2 aout

Facturation et journaux plus precis pour les petites requetes
  • Les petites requetes sur les modeles factures en by-bill ne disparaissent plus de la facturation ni des journaux d’utilisation lorsque le montant calcule etait arrondi a zero. Les requetes concernees sont desormais comptabilisees au quota minimal effectif, afin d’aligner factures, pre-deduction du solde et journaux; les equipes support et operations disposent de traces plus completes pour les trafics frequents de type embedding.

31 juil.

Nouveaux modèles
  • Ajout de deepseek-v4-flash : modèle Mixture-of-Experts optimisé pour l’efficacité, avec 284 Md de paramètres au total, 13 Md de paramètres actifs et une fenêtre de contexte de 1 M tokens. Conçu pour l’inférence rapide et les charges à haut débit tout en conservant de solides performances en raisonnement et en codage, il convient aux assistants de code, aux systèmes de chat et aux workflows agentiques.
Nouveau modele de generation video
  • Ajout de minimax-h3 : modele video multimodal generaliste de MiniMax. Il accepte les entrees texte, image, audio et video, et couvre la generation texte-vers-video, image-vers-video, premiere/derniere image, reference-based generation et edition video. Les utilisateurs qui construisent des workflows de creation video, creatives publicitaires, demos produit ou contenus multimodaux peuvent l’appeler via l’API unifiee AIHubMix.
Offre a duree limitee GLM-5.2 par plage horaire
  • glm-5.2 beneficie d’une remise selon la plage horaire quotidienne, en UTC : 50 % de remise de 14:00 a 24:00 et 30 % de remise de 00:00 a 14:00 chaque jour. Offre a duree limitee.
Baisses de prix GPT-5.6 Luna/Terra
  • gpt-5.6-luna integre la baisse officielle de 80 % et coute desormais 0.20enentreeet0.20 en entree et 1.20 en sortie ; gpt-5.6-terra integre la baisse officielle de 20 % et coute desormais 2.00enentreeet2.00 en entree et 12.00 en sortie. Les utilisateurs avec un trafic regulier sur ces modeles peuvent reevaluer leur choix pour les charges sensibles au cout et les usages generaux.

30 juil.

Serveur MCP officiel AIHubMix disponible
  • Ajout du point d’entree MCP heberge officiel mcp.aihubmix.com/mcp ou mcp.inferera.com/mcp pour les clients compatibles MCP. Les developpeurs peuvent l’utiliser depuis Claude Code, Codex, Cursor et d’autres outils pour consulter les modeles et les prix, rechercher dans la documentation, verifier le solde et appeler des outils de chat, de generation d’images et de generation video.
  • Les identifiants MCP sont transmis par le client a chaque requete et ne sont pas stockes par le serveur, ce qui convient aux developpeurs qui veulent acceder directement aux modeles et fonctions media AIHubMix depuis leurs IDE ou outils agentiques.

29 juil.

Nouveau modele
  • Ajout de jina-reranker-v3.5 : reranker de documents listwise multilingue 0,6B de Jina AI, compatible avec le schema de jina-reranker-v3. Il cible les workflows RAG, recherche et classement de donnees structurees, prend en charge le reclassement de candidats en contexte long et ameliore la robustesse par domaine, la recherche multilingue, le classement structure et l’efficacite d’inference.

28 juil.

Facturation du cache plus precise
  • Pour les requetes avec cache explicite ou implicite, AIHubMix identifie plus uniformement les lectures/ecritures de cache et privilegie le type de cache renvoye par le fournisseur amont. Les utilisateurs de modeles compatibles cache comme Qwen et Claude devraient voir des details de facturation plus proches de l’usage reel.
Generation media et resultats de taches plus fiables
  • La premiere liste de modeles de generation media a ete resserree sur les modeles verifies, et un cas pouvant renvoyer 404 pour certains appels de modeles image via l’entree media a ete corrige. Les telechargements de taches LLM dans la console couvrent aussi les archives texte, ce qui facilite la recuperation de grands resultats historiques.
Site et donnees modele mieux rafraichis
  • Le cache du site, des donnees modele, des donnees de blog et des sitemaps a ete ajuste pour que les publications prennent effet plus fiablement. Les pages modele et les entrees de documentation sont moins exposees aux anciennes donnees en cache apres une mise a jour.

27 juil.

APIs de generation media disponibles
  • Ajout de /ai/v1/images/generations et /ai/v1/images/edits, avec des taches asynchrones unifiees, la consultation des resultats, le telechargement des fichiers generes et les callbacks webhook. Les workflows image et video peuvent s’integrer via le meme cycle de vie de tache, ce qui facilite le suivi des generations longues.
  • Les fichiers generes sont renvoyes via les resultats de tache AIHubMix et prennent en charge des telechargements limites ainsi que la recuperation par lot. Les equipes en contact avec les clients doivent surveiller les premiers retours sur l’etat des taches, la validite des liens de telechargement et les details de facturation.

25 juil.

Nouveaux modèles
  • Ajout de claude-opus-5 : modèle phare d’Anthropic pour le raisonnement exigeant, le codage et les tâches agentiques à long horizon. Il excelle dans les tâches logicielles de bout en bout, la revue de code et la détection de bugs, l’analyse de graphiques et de documents, les livrables bureautiques complexes et la coordination de sous-agents en parallèle, avec une fenêtre de contexte de 1M et jusqu’à 128K en sortie.

24 juil.

Nouveaux modèles
  • Ajout de mai-image-2.5-pro : modèle phare de génération et d’édition d’images de Microsoft, offrant un réalisme haute fidélité, un rendu de texte précis dans l’image et une édition puissante pour le design commercial, la photographie produit et les workflows créatifs professionnels.
  • Ajout de qwen-audio-3.0-tts-flash : modèle de synthèse vocale temps réel de Qwen, avec une prise en charge élargie des langues à faibles ressources et des dialectes chinois, un contrôle vocal expressif et une latence du premier paquet inférieure à 200 ms, adapté aux assistants vocaux, au dialogue en temps réel et au service client intelligent.
  • Ajout de qwen-audio-3.0-tts-plus : modèle de synthèse vocale premium de Qwen, offrant un contrôle plus fin de l’émotion, du ton, du personnage, du débit, du volume et du style, conçu pour la création de contenu, les livres audio, le doublage, les voix de marque et les workflows vocaux haut de gamme.
Capacites de generation audio Qwen TTS
  • Les deux modeles Qwen TTS peuvent etre appeles via /v1/audio/speech ; les requetes non streaming renvoient une URL de resultat audio, tandis que les requetes streaming renvoient des evenements SSE de generation audio. Le tableau ci-dessous rapproche les champs compatibles AIHubMix et la documentation officielle Qwen-Audio-TTS d’Alibaba Cloud ; voice doit etre choisi par modele, les voix systeme plus et flash ne sont pas interchangeables.
Meilleure compatibilite des reponses Messages
  • Les reponses /v1/messages issues de modeles pontes et de services compatibles Claude, comme Bedrock, sont plus proches de l’ecosysteme Anthropic Messages, ce qui reduit les erreurs dans les SDK stricts ou validateurs de schema dues a des champs de reponse manquants.
Usage plus complet apres deconnexion des streams AWS Bedrock
  • Lorsqu’un client se deconnecte d’une requete streaming AWS Bedrock, AIHubMix continue de collecter le signal de fin du fournisseur d’inference modele et l’usage final, reduisant les ecarts entre journaux de requete, details de facturation et usage du fournisseur d’inference modele dans ces scenarios.

23 juil.

Nouveaux modèles
  • Ajout de qwen3-coder-480b-a35b-instruct : modèle de codage phare Qwen3-Coder pour la génération de code, les agents d’ingénierie logicielle et les workflows d’appel d’outils, adapté à la compréhension de code en long contexte et aux tâches de développement automatisé.
  • Ajout de gemini-2.5-flash-lite : modèle Gemini 2.5 léger pour les charges texte, multimodales et batch fréquentes, avec faible latence et coût réduit.
  • Ajout de Qwen/Qwen3-235B-A22B-Instruct-2507 : version Qwen3 235B-A22B Instruct 2507 pour le chat général, le suivi d’instructions, le travail multilingue et les tâches à long contexte.

22 juil.

Nouveaux modèles
  • Ajout de gemini-3.6-flash : le dernier modèle Flash de Google, adapté aux workflows complexes, à l’utilisation ordinateur, au raisonnement sur graphiques et aux tâches à long contexte.
  • Ajout de gemini-3.5-flash-lite : un modèle Gemini 3.5 plus léger et moins coûteux, adapté aux traitements à haut débit, à l’automatisation courante et aux lots.
  • Ajout de glm-5.2-fast-preview : modèle aperçu rapide Zhipu GLM-5.2, adapté au chat à faible latence, au raisonnement rapide et aux applications à haut débit.
Streaming Qwen 3.8 plus fiable
  • Les appels en streaming à qwen3.8-max-preview via /v1/responses et /v1/messages sont plus fiables. Des flux valides qui pouvaient auparavant apparaître comme empty_stream ou 502 peuvent maintenant se terminer normalement.

21 juil.

Parametres d’image Gemini transmis
  • Via l’API Chat Completions compatible OpenAI, les modeles Gemini/Vertex de sortie image acceptent maintenant aspectRatio et imageSize dans extra_body.generationConfig.imageConfig.
Facturation Gemini embedding plus proche de l’usage reel
  • Quand les reponses Gemini embedding contiennent un usageMetadata reel, AIHubMix facture d’abord selon le nombre de tokens renvoye par le fournisseur de modeles, avec l’estimation locale precedente en secours si l’usage manque.
Meilleure compatibilite des outils dynamiques Responses
  • Les requetes /v1/responses peuvent maintenant porter des function tools au niveau des messages system/developer, et ces declarations sont conservees lors du pont vers les modeles Chat. Les clients qui utilisent des workflows d’outils dynamiques avec Kimi K3 gagnent en fiabilite.
Parametre stop corrige dans Responses
  • Pour les appels /v1/responses pontes vers des modeles Chat, stop est maintenant transmis au fournisseur de modeles. Un stop simple peut fonctionner normalement ; les nombres ou longueurs au-dela des limites du fournisseur de modeles renvoient des erreurs de borne coherentes avec Chat Completions.
Prise en charge de la facturation horaire DeepSeek V4
  • Les modeles DeepSeek V4 peuvent maintenant prendre en charge une facturation configuree par heures de pointe et heures creuses. La pre-deduction et la facturation finale utilisent le meme instant de soumission ; un streaming qui traverse une limite horaire reste facture selon cet instant. La protection de pre-deduction est limitee aux modeles configures en facturation horaire, sans changer le gel de solde des modeles ordinaires.

20 juil.

Compatibilite du thinking Claude Messages
  • Lorsque les requetes /v1/messages sont routees vers des modeles OpenAI ou Azure Chat, les parametres Claude thinking sont maintenant convertis en effort de raisonnement pris en charge par le fournisseur de modeles, ce qui reduit les erreurs 400. Les requetes Claude natives avec thinking, comme Opus 4.8, restent compatibles.
Requetes longues en streaming plus stables
  • La limite de streaming du gateway de production passe de 1 heure a 2 heures. Les taches de raisonnement ou de generation longues, comme Kimi K3, risquent moins d’etre coupees pendant l’execution.

19 juil.

Nouveaux modeles
  • Ajout de qwen3.8-max-preview :
    Offre à durée limitée : Qwen3.8-Max-Preview est facturé à seulement 10 % du tarif standard, soit l’équivalent de 10× d’utilisation. Durée limitée, premier arrivé, premier servi.
    Qwen3.8-Max-Preview est le modèle de fondation de dernière génération de la famille Qwen, avec 2,4 T de paramètres, et il continue d’évoluer. Par rapport au précédent modèle phare Qwen3.7-Max, il progresse nettement sur des capacités clés comme le Coding et le Cowork (bureautique professionnelle), et affiche des performances de premier plan mondial sur des tâches complexes de longue haleine : développement full-stack, analyse de données et workflows Office.

17 juil.

Nouveaux modeles
  • Ajout de kimi-k3 : Kimi K3 est le modele ouvert longue fenetre de contexte de classe 3T de Moonshot AI, avec 2,8T parametres, une fenetre de contexte de 1M tokens et une prise en charge native de l’entree visuelle. Il convient au codage longue duree, au travail de connaissance, au raisonnement complexe et a la comprehension multimodale. Voir le guide pratique Kimi K3 (exemples des trois API et matrice de prise en charge).
  • Ajout de hy-3d-3.1 : modele Tencent Hunyuan 3D Professional pour la generation texte-vers-3D, image-vers-3D et multi-vues. Il convient aux assets de jeu, aux presentations e-commerce, a l’impression 3D et aux workflows de design produit ; la version 3.1 ameliore la geometrie, les textures et prend en charge l’entree huit vues.
API de generation 3D disponible
  • Ajout de l’API asynchrone /v1/3d/generations, connectee en premier a Tencent TokenHub Hunyuan 3D. Elle permet de soumettre une tache et d’en consulter le resultat, afin d’integrer plus facilement la generation d’assets 3D aux workflows automatises.
Compatibilite des outils dynamiques Kimi K3
  • Les outils charges dynamiquement au niveau message dans les requetes Kimi K3 sont maintenant conserves et transmis, evitant les erreurs 400 liees a la perte des declarations d’outils. Les clients utilisant les outils dynamiques Kimi gagnent en compatibilite.
Erreurs de conversion de requetes plus claires
  • La compatibilite s’ameliore pour les custom tools Chat Completions, les blocs de texte Cohere et les requetes avec assistant.content: null. Les requetes valides atteignent mieux les fournisseurs de modeles ; les entrees mal formees ou non prises en charge renvoient des erreurs structurees au lieu d’etre signalees comme des succes HTTP 200 vides.
Facturation Seedream mise a jour
  • La generation d’images doubao-seedream-5-0-pro prend maintenant en charge la facturation par palier de pixels de sortie et par nombre d’images d’entree, afin que les requetes texte-vers-image et image-vers-image soient facturees plus pres de leurs caracteristiques reelles.

15 juil.

Compatibilite amelioree pour les appels d’outils Gemini
  • Lors d’un appel a Gemini ou Vertex via l’API compatible OpenAI, les requetes dont les definitions d’outils ou les schemas de sortie structuree contiennent une valeur d’enumeration vide ne sont plus rejetees avec une erreur 400 par la validation du fournisseur de modeles. Les workflows d’appels d’outils et de JSON Schema sont plus fiables.

14 juil.

Nouveaux modeles audio
  • Ajout de gpt-audio-1.5, le premier modele audio OpenAI disponible de facon generale. Il accepte les entrees et sorties audio et peut etre utilise via l’API REST Chat Completions, pour les conversations vocales, la comprehension audio et la generation audio.
  • Ajout de gpt-4o-transcribe-diarize, un modele ASR avec diarisation integree qui associe les segments audio aux differents intervenants d’une conversation. Ce modele est disponible uniquement dans l’API Transcription.
Page de presentation LLM Router en ligne

13 juil.

Reponses d’erreur API plus coherentes
  • Quand /v1/responses est appele avec un modele inconnu, l’API renvoie maintenant HTTP 400, comme les autres points d’entree. Les clients peuvent donc traiter ce cas comme “aucun service disponible” au lieu de recevoir une 500.
Les erreurs de validation reviennent plus tot
  • Si la conversion du corps de requete ou la validation des parametres echoue, l’API renvoie directement la 400/l’erreur correspondante au lieu de transmettre la requete originale au fournisseur de modeles, ce qui reduit les appels invalides et les echecs difficiles a comprendre.
Cache plus stable pour Claude Code
  • Les appels Claude Code vers Claude via Bedrock ont maintenant des hits de prompt cache plus stables dans une meme session, ce qui aide a reduire les couts d’ecriture de cache en double et la latence du premier token.
Gemini multitouret cache plus precis
  • Les requetes Gemini restent sur le meme service uniquement lorsque la reponse contient effectivement des signatures de pensee ou une activite de cache. Cela reduit les incoherences de signature ou d’etat de cache en multitouret, tandis que les taches sans etat comme la generation d’image ne sont plus fixees inutilement.

10 juillet

Nouveaux modèles
  • Ajout de gpt-5.6-sol, gpt-5.6-terra et gpt-5.6-luna, les trois modèles de la série GPT-5.6 (publication officielle OpenAI du 2026-07-09). Les trois offrent une fenêtre de contexte de 1 050 000, une sortie maximale de 128K et une coupure des connaissances au 2026-02-16, acceptent le texte et l’image en entrée, et sont appelables via Chat Completions, Responses et l’interface Messages compatible Claude. Sol est le palier phare pour le travail professionnel complexe, présenté officiellement comme le meilleur modèle de codage actuel ; Terra offre des performances équivalentes à GPT-5.5 pour un prix réduit de moitié ; Luna cible les scénarios sensibles au coût.
Documentation de la mise en cache des prompts GPT
  • Nouvelle documentation Mise en cache des prompts GPT : à partir de la série GPT-5.6, l’écriture en cache est facturée à 1,25 fois le prix d’entrée, la lecture à 0,1 fois, et le cache est conservé au moins 30 minutes ; la page couvre les paramètres prompt_cache_key et points de rupture de cache explicites, la logique de facturation, des exemples d’interface et le dépannage des hits. Les formulations OpenAI de Mise en cache des prompts et Mise en cache des prompts Claude ont été mises à jour en conséquence.
Compatibilité thinking pour Claude Fable/Mythos
  • Les requêtes Claude Fable et Mythos avec reasoning_effort utilisent désormais adaptive thinking, ce qui réduit les erreurs 400 du fournisseur de modèles pour ces familles de modèles sans changement côté client.
Prise en charge des stop sequences pour Claude et Gemini
  • Les paramètres stop compatibles OpenAI sont maintenant mappés vers les requêtes natives Claude et Gemini. Les stops purement vides invalides pour Claude sont filtrés, tandis que les limites OpenAI/Gemini sont appliquées par fournisseur.
Compatibilité de limite de tokens pour gpt-chat-latest
  • gpt-chat-latest et les futurs alias latest GPT/ChatGPT conservent désormais max_completion_tokens lorsque nécessaire, réduisant les erreurs 400 dues à l’ancien champ max_tokens.
Message plus clair quand une Key atteint sa limite
  • Lorsqu’une limite d’utilisation au niveau de la Key est épuisée, l’API renvoie désormais une indication plus claire pour ajuster et réactiver cette limite, au lieu d’un simple message quota de bas niveau.
Format des réponses tool calls aligné sur OpenAI
  • Les réponses chat non streaming qui contiennent tool_calls sans texte renvoient maintenant explicitement content: null, améliorant la compatibilité avec les SDK et parseurs de style OpenAI.

9 juillet

Réparation de sortie structurée : correction automatique des erreurs de format JSON
  • Ajout d’une capacité de réparation de sortie structurée au niveau de la clé, désactivée par défaut. Une fois activée, pour les requêtes non-streaming déclarant une sortie JSON structurée, lorsque le JSON renvoyé par le modèle présente des erreurs de format (troncature, virgule finale, encadrement par un bloc de code, etc.), la passerelle le répare automatiquement, avant le retour, en un JSON valide et analysable, en conservant les valeurs numériques telles quelles et sans aucune modification côté client. Compatible avec les quatre protocoles Chat Completions, Responses, Claude et Gemini ; lorsqu’une réparation a lieu, la réponse porte l’en-tête X-JSON-Repaired: true.
Documentation du cache de prompts Claude : seuils minimaux de tokens par modèle complétés
  • Mise à jour de la documentation Mise en cache des prompts Claude et Mise en cache des prompts avec les seuils minimaux de tokens pouvant être mis en cache par modèle (512 / 1 024 / 2 048 / 4 096), en ajoutant les modèles actuels comme Claude Opus 4.8, Opus 4.7 et Fable 5. Le seuil n’est pas proportionnel à la version du modèle ; un préfixe en dessous du seuil n’est pas mis en cache même avec cache_control.
Alignement du tableau d’utilisation et des donnees de facturation
  • L’agregation du tableau d’utilisation est maintenant plus proche des enregistrements de facturation issus des logs de requete, avec moins de pertes liees a la concurrence et un regroupement horaire unifie pour les relectures differees. Les donnees historiques du tableau peuvent encore presenter de legeres differences; les logs de requete restent la source de verite pour la reconciliation et la facturation.
Nouveau modele
  • Ajout de grok-4.5, un modele pour le code, les taches agentiques et le travail de connaissance, avec raisonnement configurable, appels d’outils et fenetre de contexte de 500K. Il convient a la correction de code, aux taches d’ingenierie complexes, aux questions-reponses de connaissance et aux workflows d’agents.

8 juillet

Les appels tools gpt-5.5+ basculent automatiquement vers Responses
  • Avec l’endpoint compatible OpenAI /v1/chat/completions, les requetes vers gpt-5.5 et versions plus recentes qui incluent des tools et reasoning_effort utilisent maintenant automatiquement les capacites Responses. Cela reduit les erreurs 400 du fournisseur de modeles pour cette combinaison de parametres sans obliger les clients a migrer vers /v1/responses. Voir : Responses API

7 juillet

Compatibilite des sorties structurees entre protocoles
  • response_format compatible OpenAI et output_config.format natif Claude sont maintenant adaptes sur les chemins concernes. Les clients qui passent entre protocoles de type OpenAI et Claude peuvent conserver plus fiablement les contraintes de sortie structuree. Voir : Structured Output.
Appels /v1/messages plus stables sur Vertex AI
  • Lors d’appels a Gemini et a d’autres modeles non-Claude via Vertex AI, les requetes /v1/messages sont maintenant routees par famille de modele, ce qui reduit les erreurs not found ou 404 dues a des chemins specifiques a Claude.

6 juillet

Endpoints natifs Gemini completes
  • Lors de l’utilisation du SDK @google/genai via l’entree Gemini d’AIHubMix, les workflows natifs embeddings, interactions create et context caching sont maintenant pris en charge. Ces chemins pouvaient auparavant renvoyer des erreurs de route non enregistree ou des 404 ; ils peuvent maintenant servir a generer des embeddings, lancer des appels interactifs et creer/lire/mettre a jour/supprimer des caches. Voir : Integration SDK natif Gemini
Extension de la couverture de facturation par paliers pour les modeles long contexte
  • Les modeles long contexte comme hy3-preview, ERNIE, Grok et Mimo prennent maintenant en charge la facturation par paliers selon la longueur du contexte. Le calcul des frais est plus precis.
Metriques de streaming Vertex AI corrigees
  • Les requetes streaming Vertex AI Gemini/Claude enregistrent maintenant des donnees plus exactes de premier token et de latence. Les logs et le monitoring sont plus fiables, sans changement du contenu des reponses.
Nouveau modele
  • Ajout de tencent-hy3, un modele de generation de texte (Tencent Hunyuan Hy3, version officielle). Architecture MoE avec 295B de parametres totaux / 21B de parametres actifs et une fenetre de contexte de 256K. Prend en charge les modes d’inference rapide et lente combines, adapte au raisonnement complexe, a la generation de code et aux workflows d’agents. Open-source sous licence Apache 2.0.

3 juillet

Jina Search/Reader prend désormais en charge POST et l’upload de fichiers
  • Jina Search et Reader prennent désormais en charge les requêtes POST. Reader peut recevoir des fichiers locaux via upload multipart, notamment PDF, Word, Excel, PPT, HTML et images. Les réponses par défaut se rapprochent de la sortie markdown native de Jina ; les clients qui ont besoin de JSON peuvent envoyer explicitement Accept: application/json.
Appels plus stables aux services de type Azure via Responses
  • Correction d’un problème où les appels /v1/responses pontés vers des services de type Azure non GPT pouvaient échouer en 404 parce que api-version était vide, réduisant les échecs directs de ce type de requêtes.
Troncature du streaming corrigée
  • Correction d’un cas où certains services d’inférence de modèles de type vLLM / Azure Foundry pouvaient tronquer aléatoirement les réponses en streaming. Les utilisateurs devraient recevoir plus fiablement les réponses complètes, les signaux de fin et les informations d’usage.
Nouveau modele : Command A Plus 05-2026
  • Ajout de command-a-plus-05-2026, un modele de generation de texte pour le chat, la creation de contenu et les workflows d’agents.

1 juillet

API de recherche Jina et de lecture de pages Web disponibles
  • Ajout des capacités Jina Search et Reader. Vous pouvez désormais utiliser votre clé API AIHubMix pour récupérer des résultats de recherche Jina et lire le contenu de pages Web, pour les scénarios de recherche Web externe, de lecture documentaire et d’outillage d’agents. Voir : Jina AI
Veo 3.1 image-vers-vidéo prend en charge les images de début/fin et les images de référence
  • Veo 3.1 image-vers-vidéo prend désormais en charge les images de début, de fin et de référence, afin de contrôler plus précisément les plans de départ/arrivée, les références de personnages et les références de style dans les workflows avancés de génération vidéo. Voir : Génération vidéo
Stabilité améliorée des reprises multi-canaux Gemini
  • Amélioration de la compatibilité des requêtes Gemini lors des reprises entre canaux, ce qui réduit certaines erreurs 400 en scénario de fallback et augmente le taux de succès des appels avec bascule multi-canaux. Voir : Guides Gemini
Champs de réponse compatibles OpenAI alignés
  • Les réponses compatibles OpenAI, en mode non streaming comme streaming, conservent désormais les valeurs null pour des champs comme logprobs, refusal et finish_reason, ce qui réduit les écarts pour les SDK, agents et analyseurs de logs qui attendent le format standard OpenAI.
Confidentialité et compatibilité améliorées pour Claude Code
  • Amélioration de la compatibilité des requêtes lorsque Claude Code appelle des modèles Claude via AIHubMix, avec moins d’informations d’environnement client transmises dans les requêtes envoyées au fournisseur de modèles et une meilleure protection de la confidentialité pour les clients Agent tiers.
Connexion, inscription et profil améliorés
  • Le système de compte natif couvre la connexion/inscription par code e-mail, la définition de mot de passe, la modification du profil, la liaison/dissociation de comptes tiers et la suppression de compte, avec une meilleure séparation des usages OTP et le blocage des comptes désactivés. Les callbacks de recharge Stripe sont aussi traités de façon plus fiable.
Nouveaux modèles
  • claude-sonnet-5 pour le chat, le raisonnement et les workflows d’agents.
  • gemma-4-31b et longcat-2.0 pour la génération de texte.
  • gemini-3.1-flash-lite-image pour les workflows avec capacités d’image.
  • mai-image-2.5 et mai-image-2.5-flash pour la génération d’images.

29 juin

Amélioration de la facturation et de la compatibilité des paramètres pour la génération d’images
  • La facturation de gpt-image-2 sur les endpoints Images est désormais uniformisée en mode token. La génération d’images GLM transmet les paramètres étendus comme watermark_enabled et quality, afin que les réglages de filigrane et de qualité puissent s’appliquer selon les capacités du fournisseur de modèles. Voir : Génération d’images
Journaux Gemini File Upload plus propres
  • Les échecs de l’upload de fichiers Gemini ne créent plus de journaux de requête ordinaires visibles par l’utilisateur, ce qui réduit le bruit des endpoints hors inférence dans la page de logs, tout en conservant les journaux internes de dépannage.

27 juin

Nouveaux modèles Deep Research
  • Ajout de o4-mini-deep-research et o3-deep-research, disponibles uniquement via le point de terminaison /v1/responses. Les requêtes doivent inclure web_search_preview ou mcp tools, pour les cas de recherche web approfondie et de réponses orientées research.

25 juin

Le protocole Responses prend en charge n’importe quel modèle
  • Le point de terminaison /v1/responses n’est plus limité à la série GPT : il peut désormais appeler n’importe quel modèle de la plateforme. Les outils basés sur le protocole Responses (comme Codex CLI) peuvent ainsi utiliser GLM, Gemini, DeepSeek, Kimi, Qwen et d’autres modèles via un catalogue de modèles local, sans se limiter aux modèles officiels d’OpenAI.
Correction de la sortie Responses pour Step 3.7 Flash
  • Correction d’un problème où step-3.7-flash pouvait renvoyer un contenu vide ou une réponse vide via /v1/responses ; le contenu de raisonnement et les réponses finales sont désormais renvoyés correctement.
Prise en charge des modèles personnalisés dans Codex CLI
  • Un nouveau tutoriel « Utiliser des modèles personnalisés dans Codex » a été ajouté à la documentation Codex CLI : déclarez n’importe quel modèle disponible sur AIHubMix (GLM, Gemini, DeepSeek, Kimi, Qwen, etc.) via un catalogue de modèles local (model_catalog_json) et basculez librement depuis la liste /model de Codex, sans être limité aux seuls modèles d’OpenAI. La documentation inclut un script permettant de générer en une commande un catalogue des 30 premiers modèles, ainsi que les pièges courants. Voir : Codex CLI · Utiliser des modèles personnalisés dans Codex

24 juin

Domaine de secours désormais pris en charge
  • Ajout d’un domaine de secours https://api.inferera.com, dont les points de terminaison et les capacités sont identiques à ceux du domaine principal https://aihubmix.com. Lorsque le domaine principal est inaccessible (échecs de connexion ou délais d’attente, par exemple), remplacez l’URL de la requête par le domaine de secours ; la clé API, le modèle, le corps de la requête et les autres paramètres restent inchangés.

23 juin

Nouveaux modèles
  • Doubao doubao-seed-2-1-pro, doubao-seed-2-1-turbo.
  • Série vidéo HappyHorse happyhorse-1.1-t2v (texte vers vidéo), happyhorse-1.1-r2v (génération par référence), happyhorse-1.1-i2v (image vers vidéo).
Expérience de paiement Stripe améliorée
  • Le paiement Stripe préremplit désormais l’e-mail du compte et réduit la collecte inutile du nom et de l’adresse de facturation, rendant les recharges via des moyens comme Alipay plus fluides.
Limite pour les comptes à solde négatif
  • Lorsque le solde du compte est inférieur à -$1, les modèles gratuits ne peuvent plus être appelés tant que le compte n’est pas rechargé.

22 juin

Nouvelle documentation AIHubMix CLI
  • Nouvelle documentation AIHubMix CLI : un binaire unique sans dépendances (ni Python, ni Node, ni Go) pour consulter le solde du compte, gérer les clés API et voir les modèles disponibles directement depuis le terminal, avec une sortie adaptée aux scripts et aux agents IA (comme Claude Code).
LLM Router (routage automatique de modèle)
  • Définissez model sur auto et la passerelle analyse votre requête pour choisir le meilleur modèle parmi des centaines, avec des politiques coût / qualité / latence, facturé selon le modèle réellement utilisé, sans modifier le code client. Voir : LLM Router
Correction du taux de réussite du cache DeepSeek
  • Correction d’un problème où le taux de réussite du cache de deepseek-v4-pro et deepseek-v4-flash était inférieur aux attentes.
AIHubMix Skill (extension pour assistants de programmation IA)
  • Une capacité d’extension locale pour les agents IA prenant en charge les Skills (Codex, Claude Code, Cursor, Cline, etc.) : réalisez en langage naturel l’intégration d’AIHubMix, l’interrogation des modèles, la sélection par capacité, la génération d’exemples et le dépannage des erreurs. Ce Skill lit à la demande les informations en temps réel (modèles, prix, contrats de protocole, etc.) depuis l’API officielle, évitant aux agents de s’appuyer sur une mémoire périmée. Voir : Skills

17 juin

Nouveaux modèles vidéo Kling (Keling)
  • Intégration de toutes les capacités de génération vidéo Kling : texte vers vidéo, image vers vidéo, référence multi-images et génération multimodale omni, appelées via le protocole natif selon le nom du modèle.

16 juin

Problème du plugin d’intégration OpenClaw corrigé
  • Le plugin d’intégration OpenClaw d’AIHubMix aihubmix-auth a corrigé ses problèmes d’intégration précédents et est désormais stable. Installez-le et saisissez une seule clé AIHubMix pour appeler simultanément les modèles OpenAI / Anthropic / Gemini dans OpenClaw.
Nouveaux modèles
  • Zhipu glm-5.2.

15 juin

Nouvelle prise en charge de l’intégration d’Open Design
  • AIHubMix est désormais une passerelle BYOK prise en charge nativement par Open Design (une alternative à Claude Design, open source et local-first). Sélectionnez AIHubMix dans son mode API (BYOK), renseignez une seule clé, et pilotez simultanément la génération de chat / d’images / de vidéos / de voix, chaque modèle empruntant le protocole natif de son fournisseur selon son nom. Voir : Tutoriel d’intégration d’Open Design
Zhipu GLM 5.2 prend en charge les niveaux d’intensité de raisonnement
  • Le glm-5.2 du service natif Zhipu prend en charge le réglage de la profondeur de réflexion par niveaux via reasoning_effort ; les anciens modèles sont automatiquement sélectionnés selon leur version, sans modification côté appelant.
Nouveaux modèles
  • kimi-k2.7-code-highspeed (version code haute vitesse de Kimi).

13 juin

Nouveaux modèles
  • coding-glm-5.2 et sa version gratuite coding-glm-5.2-free.

12 juin

Mappage de modèles et fallback en cas d’erreur
  • Nouveau : Model Mapping et Fallback en cas d’erreur : Configurez le mappage des noms de modèle et le fallback en cas d’erreur par API Key dans la console : réécrivez l’alias de modèle du client vers le nom réel du modèle, basculez automatiquement vers un modèle de secours en cas d’échec du modèle principal et facturez selon le modèle qui répond finalement, sans modifier le code client. Voir : Model Mapping et Fallback
Nouveaux modèles
  • kimi-k2.7-code.

11 juin

step-3.7-flash à -90 % pour une durée limitée
  • Offre limitée à -90 % sur step-3.7-flash : seulement 0,022 USD par million de tokens en entrée et 0,132 USD par million de tokens en sortie. À découvrir sans tarder.
Retrait de modèles et routage automatique
  • claude-opus-4-20250514 et claude-sonnet-4-20250514 seront officiellement retirés le 15 juin ; la plateforme routera alors automatiquement les modèles retirés vers la version 4-5 de la même série.

10 juin

Nouveaux modèles
  • claude-fable-5 [Retiré].
Notes sur les nouveaux modèles Claude Fable 5 / Mythos 5
  • Fable 5 applique des garde-fous de sécurité plus stricts, et certaines demandes légitimes peuvent aussi être bloquées : il ajoute des classifications sur la cybersécurité, la biologie / chimie, la distillation de modèles et l’extraction de raisonnement. Certaines recherches techniques, analyses de vulnérabilités ou questions biomédicales peuvent être refusées ou redirigées vers Opus 4.8.
  • Mythos 5 est en accès restreint, ce n’est pas un modèle ouvert à tous : Mythos 5 et Fable 5 partagent la même base de capacités, mais Mythos 5 utilise moins de classificateurs de sécurité. Il est actuellement réservé à Project Glasswing / aux clients approuvés ; la plupart des utilisateurs utiliseront Fable 5 avec garde-fous.
  • Coût API plus élevé : Fable 5 est tarifé 10 USD par million de tokens en entrée et 50 USD par million de tokens en sortie, soit environ deux fois le coût d’Opus 4.8.
  • Confidentialité : Fable 5 / Mythos 5 sont classés comme Covered Models, exigent par défaut au moins 30 jours de conservation des données et ne prennent pas en charge Zero Data Retention.
  • Comportement des refus API : lorsque Fable 5 refuse une requête, l’API renvoie HTTP 200, mais stop_reason vaut refusal.

08 juin

L’interface compatible Gemini prend en charge l’entrée audio
  • L’appel de Gemini via l’interface compatible OpenAI (/v1/chat/completions) prend désormais en charge l’entrée audio input_audio (auparavant silencieusement ignorée), et complète la mesure des audio_tokens dans le champ usage renvoyé.

05 juin

Nouveaux modèles
  • grok-build-0.1, hy3-preview, et le modèle gratuit step-3.7-flash-free.

04 juin

Nouveaux modèles
  • Tongyi Qianwen qwen3.7-plus.

01 juin

Nouveaux modèles
  • MiniMax minimax-m3.
  • Baidu musesteamer-air-image (génération d’images).

29 mars

Page Détail du journal
  • Latency : indique la rapidité de démarrage d’une requête (temps entre l’initiation de la requête et le premier jeton renvoyé)
  • Throughput : fournit une mesure claire de la vitesse de sortie du modèle
  • E2E Latency : durée totale entre la soumission de la requête et sa complétion, utilisée pour évaluer la performance globale de la requête
  • Provider : identifie le fournisseur de modèle qui a traité la requête
  • Status: Shows the execution result (e.g., success / failure) for quick detection of anomalies
  • TID: A unique request identifier that can be shared with support for faster troubleshooting

Mar 23

  • AIHubMix Global Acceleration Network is now live: Built on self-managed global edge nodes and an intelligent routing system, with continuous monitoring and dynamic optimization, achieving 75% lower latency, 60% improved stability, and 99.99% availability—delivering a faster, more reliable AI experience.
  • Added 24/7 real-time health monitoring: Distributed probes scan the entire network every minute, tracking latency, success rate, and stability. Issues are detected and resolved before users even notice, ensuring consistent performance.
  • Enhanced intelligent traffic routing: Node health is dynamically evaluated across multiple time windows, enabling millisecond-level switching to the optimal path, significantly reducing fluctuations and timeouts while improving overall request success rates.

Feb 08

  • New Feature: Chat → Responses Compatibility
    This release introduces Chat → Responses compatibility, allowing the Chat Completions API to invoke OpenAI models that support the Responses protocol only, including gpt-5.2-codex, gpt-5.1-codex-max, and gpt-5.2-pro. If you want to force the AIHubmix Chat API to route requests through the Responses protocol, add the following header to your request:
    X-Use-Responses-Enabled: true When a model supports both Chat and Responses protocols, setting this header will force the request to use the Responses API.
    Please note that the Responses protocol does not currently support audio input or output, so plan usage accordingly.
  • Model Deprecation Notice:
    OpenAI will deprecate chatgpt-4o-latest on February 17, 2026. After the deprecation, we will automatically remap chatgpt-4o-latest to gpt-4o-2024-11-20.

2025

Dec 15

  • New feature: Google API now supports Files API.

Sep 22

Aug 10

Aug 1

Jul 29

  • Added support for the AI SDK: access a massive number of models with a single API key

Jul 26

Jul 23

  • Added support for Qwen Code, leveraging all large language models available on the Aihubmix platform

Jul 4

  • Added support for llms.txt: get standardized model navigation with one click so your LLM assistant can quickly understand the entire model ecosystem

Jun 29

  • Added forwarding support for Gemini CLI, with multiple flexible usage modes
  • Added code interpreter and Remote MCP invocation to the OpenAI Responses API

Jun 26

Jun 23

  • Launched APP-Code, offering developers a 10% discount across all models

Jun 18

  • Added HTTP Status Code documentation to help users better understand error messages

Jun 13

  • Added support for Veo 3.0 video generation to expand creative formats

Jun 9

  • Added support for OpenAI Reasoning Summaries in the Responses API

Jun 5

  • Added implicit caching for Gemini, with automatic cache hits and hit feedback
    Developers can use usage_metadata to determine cache hits
    Cost savings are not guaranteed and depend on request structure and usage scenarios

May 31

Full Support for New Claude 4 Features
  • New cache TTL: 1-hour cache support Beta
  • 🎉 New text editing tools: Claude 4 now supports text_editor_20250429 and str_replace_based_edit_tool
  • 🚫 New refusal stop reason for safety-based rejections
  • 🧠 Extended Thinking: Claude 4 now returns full summaries of its reasoning process
  • 🔄 Interleaved Thinking: Tool usage can now interleave with extended thinking for more natural conversations (Beta)
  • ⚠️ Deprecated Features:
    • undo_edit is no longer supported
    • token-efficient-tools-2025-02-19 removed (Claude 3.7 only)
    • output-128k-2025-02-19 removed (Claude 3.7 only)
  • 📚 Full migration guides and code examples have been updated to help users smoothly transition from Claude 3.7 to Claude 4

May 22

  • Added support for the Dify plugin, enabling seamless integration of Aihubmix models into Dify
    Extend and manage over 200 models with a single API key

May 17

  • Added support for codex-mini-latest, optimized for programming tasks, accessible via the Responses API or Codex CLI
  • Added support for Google Imagen 3.0 image generation and Veo 2.0 video generation
  • gemini-2.0-flash-exp upgraded to the official preview version gemini-2.0-flash-preview-image-generation

May 9

  • Added the Ideogram AI V3 API — Ideogram’s most advanced image generation model

May 6

Apr 26

  1. The highly anticipated OpenAI image generation API gpt-image-1 is now live, supporting both text-to-image and image-to-image
  2. Added native Gemini API support with precise reasoning budget control for Flash 2.5

Apr 24

  • Integrated three core Jina AI APIs to help build powerful agents: Embeddings, Rerank, and DeepSearch

Apr 20

  • Added support for the OpenAI Responses API endpoint with expanded tool capabilities

Apr 17

  • Added OpenAI CodeX CLI support: program with natural language directly in the terminal

Apr 12

Apr 9

  • Added Claude prompt caching, saving up to 76% in cost for repeated high-frequency prompts

Apr 7

  • Added Ideogram AI image generation support with strong text rendering, hybrid generation, local edits, and upscaling

Apr 5

  • Brand-new documentation experience launched

Mar 30

  • Added support for the Claude Text Edit Tool

Mar 24

  • Launched the brand-new Trident logo

Mar 16

  • Added native search support for OpenAI and Google Gemini models
  • Third-party search integration will be added in future updates

Mar 15

  • Added models: gpt-4o-mini-search-preview and gpt-4o-search-preview

Mar 7

  • Prices for o1 and o3-mini reduced by 10%, in line with official pricing

Mar 6

  • Due to a 7× price increase from Microsoft, the price of aihubmix-DeepSeek-R1 also increased 7×
    Recommended alternative: Volcano Engine’s DeepSeek-R1 (more stable and cost-effective)
    Added models: qwen-qwq-32b and qwen2.5-vl-72b-instruct

Feb 28

  • All Claude models received a 15% price reduction
  • Added model gpt-4.5-preview (extremely expensive — use with caution)

Feb 26

  • Improved DeepSeek stability
  • ByteDance versions of DeepSeek are currently the most stable
    Recommended models: DeepSeek-R1 and DeepSeek-V3

Feb 25

  • Added model claude-3-7-sonnet-20250219

Feb 24

  • The gpt-4o model may occasionally respond very slowly due to model provider issues
    It is recommended to temporarily switch to gpt-4o-2024-11-20
  • The Perplexity API is temporarily offline
    Due to Perplexity’s complex billing model and higher costs than this platform’s pricing structure, the service will be relaunched after pricing adjustments
  • The temporary ByteDance official discount has ended and prices have returned to normal
    The price of DeepSeek-R1 has been increased accordingly
  • Added a new model details page with full parameter information

Feb 23

  • The temporary ByteDance official discount has ended and prices have returned to normal
    The price of DeepSeek-V3 has been increased
    ByteDance’s R1 model is also expected to return to normal pricing soon, and this platform will同步 adjust prices accordingly

Feb 18

  • Added model: kimi-latest
    (Official billing is tiered by input length at 8k, 32k, and 128k.
    This platform does not support tiered pricing and uses the mid-tier 32k as the pricing standard.
    If you are price-sensitive, use with caution.)
  • Optimized overall website layout
  • Merged the Changelog page into the Usage Statistics page
  • Moved Announcements to the Model Marketplace page
  • Moved Settings under the user avatar menu
  • Reduced the price of aihubmix-DeepSeek-R1 by 50%
  • Added models:
    gemini-2.0-pro-exp-02-05-search, gemini-2.0-flash-exp-search
    (Integrated with Google’s official online search)
  • Added models:
    gemini-2.0-flash, gemini-2.0-pro-exp-02-05, gemini-2.0-flash-lite-preview-02-05
  • Added models:
    o3-mini, o1
    (These two models are billed about 10% higher than official pricing due to limited account resources)

Feb 4

  • The o1 model does not support the stream parameter in the official OpenAI API
  • The o3-mini model does not support the temperature parameter
    A new parameter reasoning_effort is available with values: "low", "medium", "high"
    Default is "medium" if not specified

Feb 1

Feature Update:
  • Added support for OpenAI audio model input and output
    The api.aihubmix.com preview server is now available
    After one week of stable operation, the main site will be updated
    Backend billing is fully consistent with official pricing
    Currently, usage logs only display text token usage
    Audio token usage is not yet shown in logs but does not affect normal usage
New Models Added:
  • o3-mini, o1
    (Billed about 10% higher than official pricing due to limited account availability)
  • aihubmix-DeepSeek-R1 (recommended, highly stable)
  • qwen-max-0125 (Qwen2.5-Max), sonar-reasoning
  • deepseek-ai/DeepSeek-R1-Zero, deepseek-ai/DeepSeek-R1, deepseek-r1-distill-llama-70b
  • aihub-Phi-4
  • Doubao-1.5-pro-256k, Doubao-1.5-pro-32k,
    Doubao-1.5-lite-32k, Doubao-1.5-vision-pro-32k
  • sonar, sonar-pro (latest from Perplexity AI)
  • gemini-2.0-flash-thinking-exp-01-21
  • deepseek-reasoner (aka DeepSeek-R1)
  • MiniMax-Text-01
  • codestral-latest (Mistral’s new code model — Codestral 25.01)

Jan 23

New Models Added:
  • aihub-Phi-4
  • Doubao-1.5-pro-256k, Doubao-1.5-pro-32k,
    Doubao-1.5-lite-32k, Doubao-1.5-vision-pro-32k
  • sonar, sonar-pro (latest from Perplexity AI)
  • gemini-2.0-flash-thinking-exp-01-21
  • deepseek-reasoner (aka DeepSeek-R1)

Jan 19

  • Added Perplexity AI API models
    Currently supported only on the preview server api.aihubmix.com
    After stable testing, it will be rolled out to the main server aihubmix.com
  • api.aihubmix.com is the preview server
    New features will be deployed there first and promoted to the main server after ~1 week of stability testing
New Models Added:
  • MiniMax-Text-01
  • codestral-latest (Mistral Codestral 25.01)

Jan 6

  • Added gemini-2.0-flash-exp-search, supporting native Google online search
    The official Gemini 2.0 Flash model requires additional parameters for online search
    Aihubmix has integrated this functionality — simply append search to the model name
  • Added model: deepseek-ai/DeepSeek-V3

Jan 1

  • Launched the new Model Marketplace page to replace the old Model & Pricing page

2024

Dec 30

  • Fixed the issue where gemini-2.0-flash-thinking-exp-1219 only returned reasoning without final answers
  • Fixed the issue of balance reminder emails not being delivered

Dec 22

  • Added Usage Statistics page
  • Added Recharge History page
  • Added Doubao series models:
    Doubao-lite-128k, Doubao-lite-32k, Doubao-lite-4k,
    Doubao-pro-128k, Doubao-pro-256k, Doubao-pro-32k, Doubao-pro-4k
  • Added model: gemini-2.0-flash-thinking-exp-1219
  • Added models:
    gemini-2.0-flash-exp, aihubmix-Mistral-Large-2411,
    aihubmix-Llama-3-3-70B-Instruct, grok-2-1212, grok-2-vision-1212
  • Added models:
    gemini-exp-1206, llama-3.3-70b-versatile, learnlm-1.5-pro-experimental

Dec 14

  • Added models:
    gemini-2.0-flash-exp, aihubmix-Mistral-Large-2411,
    aihubmix-Llama-3-3-70B-Instruct

Dec 8

  • Added models:
    gemini-exp-1206, llama-3.3-70b-versatile, learnlm-1.5-pro-experimental
  • Added Usage Statistics page

Nov 21

  • Recently added models:
    gpt-4o-2024-11-20, step-2-16k, grok-vision-beta
  • Qwen 2.5 Turbo million-context model:
    qwen-turbo-2024-11-01

Nov 7

  • Added compatibility with the native Claude SDK
    The v1/messages endpoint is now live
  • Native Claude prompt caching and computer use features are not yet supported
    These will be completed within the next two weeks

Nov 5

  • Added model: claude-3-5-haiku-20241022
  • Added Elon Musk’s xAI latest model: grok-beta

Oct 23

  • Added model: claude-3-5-sonnet-20241022

Oct 10

  • OpenAI’s latest caching feature is now live
    Currently supported models:
    • GPT-4o
    • GPT-4o-mini
    • o1-preview
    • o1-mini
  • Note: gpt-4o-2024-05-13 is not included in the official supported list
  • Cache hit tokens will be visible in backend logs when a request hits the cache
  • For full details and usage rules, refer to the OpenAI official documentation

Oct 3

  • Backend billing for gpt-4o has been reduced to match official pricing
  • Added models:
    aihubmix-Llama-3-2-90B-Vision, aihubmix-Llama-3-70B-Instruct
  • Added Cohere latest models:
    aihubmix-command-r-08-2024, aihubmix-command-r-plus-08-2024

Sep 19

  • Added models: whisper-large-v3 and distil-whisper-large-v3-en
  • Note: Whisper model billing is based on input seconds
    The current pricing display on the site is incorrect and will be fixed
    Backend billing for whisper-1 fully matches OpenAI official pricing

Sep 13

  • Added models: o1-mini and o1-preview
    Note: These models require updated parameters
    Some client shells may throw errors if defaults are not updated
Test results show that the o1 model does NOT support:
  • system field → 400 error
  • tools field → 400 error
  • Image input → 400 error
  • json_object output → 500 error
  • structured output → 400 error
  • logprobs output → 403 error
  • stream output → 400 error
Rate limits and fixed parameters:
  • o1 series: 20 RPM, 150,000,000 TPM — extremely low, frequent 429 errors possible
  • temperature, top_p, and n are fixed at 1
  • presence_penalty and frequency_penalty are fixed at 0

Sep 10

  • Added model: mattshumer/Reflection-Llama-3.1-70B
    (Reported to be one of the strongest fine-tuned versions of LLaMA 3.1 70B)
  • Claude-3 model prices increased
    To ensure stable supply, calls through this platform are currently ~10% more expensive than direct official usage
  • Increased concurrency capacity for OpenAI models
    The system now theoretically supports near-unlimited concurrency

Aug 11

  • Added models:
    Phi3medium128k, ahm-Phi-3-medium-4k, ahm-Phi-3-small-128k
  • Improved stability for LLaMA-related models
  • Further optimized compatibility for Claude models

Aug 7

Aug 4

  • Added direct online payment for account top-ups
  • Fixed Claude multi-turn conversation format error:
    messages: roles must alternate between "user" and "assistant", but found multiple "user" roles in a row
  • Optimized index handling when using function calling with Claude models
  • The backup server https://orisound.cn will be fully decommissioned on Sep 7
    Please migrate to the main server https://aihubmix.com or backup server https://api.aihubmix.com

Jul 27

  • Added support for Mistral Large 2
    Model name: Mistral-large-2407 or aihubmix-Mistral-large-2407
  • System optimizations

Jul 24

  • Added latest LLaMA 3.1 models:
    llama-3.1-405b-instruct, llama-3.1-70b-versatile, llama-3.1-8b-instant

Jul 20

  • Fixed pricing calculation issues for the gpt-4o-mini model
    • Text input pricing: 1/33 of GPT-4o officially
    • Image input pricing: equal to GPT-4o
  • To align with official pricing, image token counts for gpt-4o-mini are multiplied by 33 during billing
  • Refer to OpenAI official pricing for details

Jul 19

  • Added support for the gpt-4o-mini model
    Backend billing is fully aligned with official pricing

Jul 15

  • Added support for the official include_usage API parameter
    This allows returning usage data in stream mode
    See the official documentation for details

Jul 14

  • The new version of NextWeb now supports calling non-OpenAI models through this platform
  • Added backend billing support for Alibaba Qwen models
    Calls through this platform cost ~10% more than direct Alibaba Cloud usage
  • Improved Azure OpenAI output compatibility with the standard OpenAI API
  • Added tool calling support for Claude-3
  • Added many new models (see Settings → Available Models)

Jul 3

  • Overall backend UI optimization
  • Each log entry now displays the model unit price at the time of the request
  • Added the Model & Pricing page

Jun 20

  • The latest claude-3-5-sonnet-20240620 is now supported
    See the guide for calling non-OpenAI models on this platform

Jun 18

  • Backend logs now support downloading historical request records

Jun 16

  • The probability of randomly routing requests to Azure OpenAI has been significantly reduced

Jun 13

  • Reduced backend costs for Claude-3 models
    (Claude 3 Haiku, Claude 3 Sonnet, Claude 3 Opus)
    Backend billing now matches official pricing
    As a result, the effective retail API cost on this site is equivalent to ~86% of official pricing

Jun 10

  • Optimized GPT-4o token billing
    Tokenizer changed from cl100k_base to o200k_base
    As a result, streaming token counts for Chinese, Korean, and Japanese are lower than before

Jun 8

  • Added Alibaba’s latest open-source Qinwen 2 models:
    • alibaba/Qwen2-7B-Instruct
    • alibaba/Qwen2-57B-A14B-Instruct
    • alibaba/Qwen2-72B-Instruct

May 20

  • Added model: gemini-1.5-flash
  • Added model: gpt-4o
  • Added models:
    llama3-70b-8192, llama3-8b-8192,
    gemini-1.5-pro, command-r, command-r-plus
  • Claude-3 model supply has been restored
    Endpoints are currently deployed across AWS and Google Cloud
  • To cover infrastructure and operational costs, Claude-3 backend billing is ~10% higher than official pricing
    With increased usage, this will be gradually reduced to ~5% or lower
  • Concurrency limits are currently under testing and will be increased as demand grows

Dernière mise à jour : 2026-06-22