2026
2026
28. August
Neue Modelle
hy4-previewhinzugefügt: Hy4 Preview von Tencent Hunyuan, ein MoE-Modell mit 770B Gesamtparametern und 49B aktiven Parametern, optimiert für Agent-, Coding- und Produktivitäts-Workflows. Es stärkt Aufgabenverständnis, Planung, Tool-Nutzung und die anhaltende Ausführung bei komplexen mehrstufigen Aufgaben, Software-Engineering, Dokumentenverarbeitung, Informationsanalyse, Büroautomation, Web-Generierung und tool-übergreifender Zusammenarbeit. Es unterstützt ein Kontextfenster von 1 Million Tokens, bis zu 64K Ausgabe, Reasoning, Websuche, Tool-/Function-Calling und strukturierte Ausgaben.
2026
27. August
Neue Modelle
qwen3.8-flashhinzugefügt: das Flaggschiff-Vision-Language-Modell von Alibaba Cloud Qwen, ausgelegt auf Coding, Office-Aufgaben, Long-Context-Reasoning und Agent-Workflows. Es unterstützt ein Kontextfenster von 1 Million Tokens, bis zu 128K Ausgabe, Thinking, Webzugriff, Tool-Aufrufe und strukturierte Ausgaben. Im Vergleich zu Qwen3.7-Plus stärkt es Coding- und Office-Fähigkeiten und verbessert zugleich die Trainings- und Inferenzeffizienz.
- Das MCP-Tool fuer Bildgenerierung verlangt nun, dass Aufrufer das Modell explizit angeben. So wird vermieden, dass ohne Modellangabe still ein Standardmodell genutzt wird.
openai/gpt-image-1ist die nach aussen angezeigte und weitergeleitete Standard-Modell-ID. Der historische Tippfehler bleibt als reine Eingabe-Kompatibilitaet akzeptiert und wird vor dem Senden normalisiert.
2026
26. August
Neue Modelle
glm-5.3-flashhinzugefügt: das hocheffiziente multimodale Modell von Z.AI für Coding Agents, komplexes Reasoning und langfristige Software-Engineering-Aufgaben. Es unterstützt Text-, Bild- und Videoeingaben, rund 1 Million Tokens Kontext, bis zu 128K Ausgabe, Thinking, Tool-Aufrufe und strukturierte Ausgaben. Aufbauend auf dem GLM-Technologiestack mit weiterem Post-Training und Optimierungen legt es besonderen Wert auf Inferenzeffizienz und Reaktionsschnelligkeit.
- Broadcast hinzugefügt: Traces aus AIHubMix API-Anfragen werden ohne zusätzliche Instrumentierung der Anwendung automatisch an LangWatch gesendet. Unterstützt werden Datenschutzmodus, Sampling und API-Key-Filter; Modell, Token-Nutzung, tatsächlich berechnete Kosten, Latenz, Sitzung und Trace-Daten sind in LangWatch verfügbar.
- Der alte Einstieg
/mcp/kann weiter mit der bestehenden Authentifizierung genutzt werden und wird auf die einheitlichen Remote-HTTP-MCP-Funktionen geroutet. Aeltere Clients muessen nicht sofort migrieren und koennen weiterhin Modelle und Preise abfragen, Dokumente suchen, Guthaben pruefen sowie Chat-, Bild- und Video-Tools nutzen. - Die Konsole stellt einen schreibgeschuetzten Weg zum Kopieren des Access Key bereit, und externe MCP-Clients koennen den Header
X-Aihubmix-Access-Keyverwenden. Der Server rotiert den Key nicht und cached diese Antwort nicht.
gpt-image-2-Anfragen mit transparentem Hintergrund bevorzugen nun OpenAI-native Kanaele, die diese Faehigkeit unterstuetzen, und vermeiden wiederholte Fehler auf nicht kompatiblen Kanaelen. Andere Bildanfragepfade bleiben unveraendert.
- Modelllisten und Guides fuer AI Agents und externe Tools werden schneller aktualisiert.
2026
25. August
Klarere Migrationsfehler fuer alte Medien-APIs
- Fuer Medienmodelle, die den alten Protokollzugriff nicht mehr unterstuetzen, geben
/v1/images/generations,/v1/images/edits,/v1/models/:organization/:model/predictionsund/v1/videosnunprotocol_not_supportedzurueck, mit Hinweis auf die asynchronen Medien-APIs unter/ai/v1und die zugehoerige Dokumentation. model=autobehaelt das bestehende automatische Auswahlverhalten bei. Wenn das final gewaehlte Modell den alten Endpoint nicht unterstuetzt, erhalten Aufrufer einen klaren Fehler statt einer stillen Umschaltung auf ein anderes Modell. Playground blendet die alten Eintraege fuer diese Modelle ebenfalls aus, um versehentliche Nutzung zu reduzieren.
2026
24. August
Neue Modelle
wan3.0-videohinzugefügt: das Preview-All-in-One-Videomodell von Alibaba Cloud Wan (Tongyi Wanxiang) vereint Text-to-Video-, Image-to-Video-Workflows mit erster/letzter Frame sowie Reference-Video-Workflows und unterstützt bis zu 30 Sekunden bei 30 fps in 480P/720P/1080P für integrierte Generierung und Bearbeitung.wan3.0-video-primehinzugefügt: eine leistungsangepasste Hochgeschwindigkeitsedition für integrierte Videogenerierungs- und Bearbeitungs-Workflows mit schnellerem End-to-End-Durchlauf.
gpt-5.6-solübernimmt die offizielle Preissenkung um 20 % und kostet nun 4 pro Million Ausgabetokens. Bestehende Aufrufwege bleiben unverändert, während komplexes Reasoning, Coding und Long-Context-Workloads günstiger werden.
- Wenn ein Konto asynchrone Aufgaben noch nicht aktiviert hat, enthalten Medienerstellungs-APIs im Fehler
async_not_enabledjetzt die passende Konsolen-Seite zur Aktivierung. Nutzer von aihubmix, inferera und shkq werden zu ihrer jeweiligen Konsole geführt, wodurch 403-Antworten ohne klaren nächsten Schritt seltener werden.
2026
21. August
Neue Modelle
deepseek-v4-flash-0731-fasthinzugefügt: eine Hochgeschwindigkeitsvariante des agentischen Modells von DeepSeek, für Coding, Tool-Nutzung und Agent-Workloads mit hohem Volumen. Es behält die Fähigkeiten von V4 Flash 0731 bei und liefert dabei eine schnellere Inferenz; im Vergleich zu V4 Pro priorisiert es niedrigere Latenz und Ausführungseffizienz. Es unterstützt ein Kontextfenster von 1 Mio. Token, bis zu 384K Ausgabe, Thinking, Tool Calling und strukturierte Ausgaben.deepseek-v4-flash-vision-exphinzugefügt: DeepSeeks experimentelles multimodales Modell für visuelles Verständnis mit Text- und Bildeingabe sowie Textausgabe. Es eignet sich für Bildbeschreibungen, Screenshot-OCR, Diagrammanalyse und visuell verankerte Agents; seine reinen Textfähigkeiten für Agents, Reasoning und Weltwissen liegen auf dem Niveau der offiziellen DeepSeek V4 Flash-Version.ox-alphahinzugefügt: ein Stealth-Reasoning-Modell eines anonymen Drittanbieters, dessen tatsächlicher Entwickler und Eigentümer nicht offengelegt wurden. Auf AIHubMix kostenlos verfügbar, unterstützt es Text- und Bildeingabe, Textausgabe und ein Kontextfenster von 1.048.576 Token für Coding, langfristige Softwareentwicklung, dauerhafte agentische Arbeit, komplexes Reasoning und Workflows mit Text und Bild.
- Wenn eine Bildgenerierungsanfrage auf einen temporären Servicefehler trifft, stellt AIHubMix die Anfrage nun konsistenter wieder her. Wenn der Fehler eindeutig eine Fähigkeitsgrenze des gewählten Modells beschreibt, wird weiterhin nicht weiter versucht und ein klarer Grund zurückgegeben. Dadurch sollten direkte Ausfälle durch temporäre Serviceunterschiede bei Modellen wie
gpt-image-2seltener werden.
2026
20. August
Plattform-Ankündigung
- Neue Integrationsfunktionen für AI Agents sind verfügbar: die
agents.md-Integrationsanleitung, maschinenlesbarellms.txt-Dokumente für die Website und für jedes Modell, der Playground Skill (Verteilung über eine feste Adresse) sowie Playground-Deep-Links (?models=öffnet mit einem Link bis zu 6 Modell-Tabs,?config=lädt eine Konfiguration direkt). Um Spezifikationen und Preise zweier Modelle nebeneinander zu sehen, nutzen Sie die Vergleichsseitehttps://aihubmix.com/compare/{model_a}/{model_b}. Die Übersicht aller Einstiegspunkte finden Sie unter Agent-Integration.
- Bildgenerierungsanfragen behandeln Größenparameter wie
resolutionundimageSizekonsistenter. Liegt eine Anfrage außerhalb der aktuellen Modellfähigkeit, gibt die API klarere Fehler zurück, damit Aufrufer Parameter schneller korrigieren können.
- Verwandte Varianten wie GLM 5.2, die Coding-Edition und die Free-Edition können als ein Hauptmodell mit mehreren Versionen dargestellt werden. Browsing, Preisvergleich und Versionsauswahl werden dadurch leichter verständlich.
- Asynchrone Bildaufgaben können jetzt mit begrenzter Parallelität entsprechend verfügbarer Kapazität verarbeitet werden. In Spitzenzeiten sollten Warteschlangen gleichmäßiger abgebaut und Status sowie Ergebnislieferung stabiler werden.
2026
19. August
Neue Modelle
gpt-5.6-sol-dischinzugefügt: die zeitlich begrenzte Rabattroute von AIHubMix für OpenAIs GPT 5.6 Sol mit bis zu 50 % Rabatt und denselben zugrundeliegenden Fähigkeiten wie das Standardmodellgpt-5.6-sol. Dieses Frontier-Reasoning-Modell eignet sich für komplexes Coding, professionelle Wissensarbeit, Deep Research und langlaufende Agenten und unterstützt Text- und Bildeingabe, einen Kontext von rund 1,05 Mio. Token, bis zu 128K Ausgabe sowie Thinking, Tools und strukturierte Ausgaben.
- Abschlusszeit, Ergebnisablauf und Artefaktarchivierung sind für Bild- und Videoaufgaben konsistenter. Bei Rolling Releases oder hoher Parallelität treten Verzögerungen, doppelte Verarbeitung und abweichende nutzerseitige Status seltener auf.
- Die Produktionskapazität für Medien wurde erhöht, und größere Medienantworten haben mehr Spielraum. Lang laufende Aufgaben oder große Artefakte sind dadurch besser verfügbar.
2026
18. August
Die Modelldetails sind vollständiger
- Die Modelldetails zeigen jetzt
release_datean, sodass sich das offizielle Veröffentlichungsdatum leichter von der AIHubMix-Bereitstellungszeit unterscheiden lässt.
- Gemini-Bildgenerierung/-bearbeitung und Vertex-Multi-Image-Flows behalten
imageSizeund zugehörige Bildparameter konsistenter bei, wodurch Größen- oder Protokollabweichungen seltener werden. - Gemini-Dateiuploads behalten den ursprünglichen
Content-Type, sodass Videos und andere Medien seltener fälschlich klassifiziert werden.
- Nutzerseitige Fehler zu Schema, Enumerationen und Fähigkeiten geben jetzt klarere Meldungen aus, wodurch sich Parameterprobleme leichter eingrenzen lassen.
2026
17. August
Neue Modelle
glm-5.3hinzugefügt: die Produktions-API von Z.AI für das reine Text-Reasoning-Flaggschiffmodell, ausgelegt auf komplexe Softwareentwicklung, langlaufende Agent-Aufgaben und Schwachstellenanalyse. Unterstützt werden ein Kontextfenster von 1 Mio. Token, bis zu 128K Ausgabe und uneingeschränkte Parallelität auf AIHubMix, mit einem zeitlich begrenzten Rabatt von 10 %.
2026
15. August
Neues Modell
mai-thinking-1hinzugefügt: ein Reasoning-Modell der Microsoft-MAI-Serie für Enterprise-Reasoning, Mathematik, allgemeine Intelligenz und Workloads mit hohem Durchsatz. Es unterstützt ein 256K-Token-Kontextfenster, Chat Completions und strukturierte Ausgaben und eignet sich damit für Long-Context-Reasoning, stabile Antwortformate und kostenbewusste Dauerlast.
2026
14. August
Neue Modelle
gemini-3.7-flashhinzugefügt: das nativ multimodale Reasoning-Modell von Google für Coding, Agenten, Webentwicklung und Wissensarbeit. Es unterstützt Text-, Bild-, Audio- und Videoeingaben, ein Kontextfenster von 1 Mio. Token, einstellbare Thinking-Stufen, Tool Calls, Websuche und strukturierte Ausgaben und bietet gegenüber Gemini 3.6 Flash ein stärkeres Coding, Tool-Nutzung, mehrstufige Planung und Instruction Following.coding-glm-5.3hinzugefügt: das Reasoning-Modell von Z.AI für Coding und agentische Workflows, ausgelegt auf komplexe Softwareentwicklung, langlaufende Agenten und Schwachstellenanalyse. Es basiert auf demselben Basismodell wie GLM-5.2 und verbessert durch skaliertes Post-Training Coding, Aufgabenausführung und Token-Effizienz. Diese Route ist eine zeitlich begrenzte Vorschau und ausschließlich für Tests und Evaluierung gedacht; die Dienststabilität wird nicht garantiert und der produktive Einsatz wird nicht empfohlen.
- Native Gemini-Embedding-Anfragen behalten nun den Kanal bei, dem der von der Gemini Files API zurückgegebene
fileUrigehört. BeiembedContentoderbatchEmbedContentsmit hochgeladenen Dateien werden 403-Fehler durch Kanalinkonsistenzen reduziert; Batch-Anfragen mit Dateien aus mehreren Kanälen geben nun einen klaren 400 zurück. - Wenn OpenRouter einen strukturierten Fehler eines Modellanbieters zurückgibt, priorisiert der API-Fehler nun die inneren Felder
message,paramundtypeund reduziert lange, schwer auswertbare Meldungen. Fehler einzelner Modellanbieter wirken sich außerdem seltener auf den gesamten OpenRouter-Dienst aus. - Polling, terminale Archivierung und Artefaktverarbeitung für asynchrone Medienaufgaben sind zuverlässiger. Langlaufende Bild- und Videoaufgaben werden bei hoher Parallelität, Neustarts oder großen Artefakten seltener doppelt verarbeitet, verlieren seltener den Endstatus und werden seltener verspätet ausgeliefert; öffentliche API-Felder, Statusbegriffe und Abrechnungsformeln bleiben unverändert.
2026
13. August
Neue Modelle
grok-4.6hinzugefügt: das multimodale Flaggschiff-Reasoning-Modell von xAI für Coding, langlaufende Agenten, Wissensarbeit und interaktive Anwendungsentwicklung. Es unterstützt Bildverständnis, ein 500K-Kontextfenster, Tool Calls und strukturierte Ausgaben und bietet gegenüber Grok 4.5 eine stärkere mehrstufige Ausführung, Selbstverifikation, Coding und visuelle Projekterstellung.deepseek-v4-pro-0813hinzugefügt: das leistungsstarke Allzweck-Reasoning- und Agenten-Modell von DeepSeek für komplexes Reasoning, Coding, Analyse langer Dokumente und agentische Workflows. Es unterstützt Thinking- und Non-Thinking-Modi, ein Kontextfenster von 1 Mio. Token, bis zu 384K Ausgabe, Tool Calls und die Responses API.
2026
12. August
Neue Modelle
agnes-2.5-flash,agnes-2.5-pro,agnes-2.5-pro-alphaundagnes-image-2.1-flashhinzugefügt. Text- und Bildmodelle der Agnes-Reihe sind nun über den einheitlichen AIHubMix-Einstieg verfügbar.
- Gemini-Veo-Aufgaben behalten die reale Videodauer bei Erstellung, Polling und Ergebnisabruf zuverlässiger bei. Nutzer, die Videos mit eigener Sekundenzahl erzeugen, sollten eine konsistentere Dauer in Aufgabe, heruntergeladener Datei sowie späterer Abrechnung oder Anzeige sehen.
- Bei namespace-Tools über Azure Responses führen leere oder fehlende descriptions nicht mehr dazu, dass Azure die Anfrage vor der Modellausführung mit 400 ablehnt. Tool Calls, die über den offiziellen OpenAI-Kanal bereits funktionieren, sollten sich auf Azure-Kanälen konsistenter verhalten.
/call/devsunterstützt jetzt ein Website-Feld für Anbieter, sodass Modellaggregations- und Anbieterseiten nach Datenbefüllung einen Official-site-Eintrag anzeigen können./providers/<slug>-Seiten behalten außerdem das Edge-Cache-Verhalten für stabilere Seitenantworten bei.
2026
11. August
Gemini interactions unterstützt jetzt asynchrone Aufgaben
- Gemini-interactions-Anfragen können jetzt explizit
background: truefür asynchrone Aufgaben verwenden und anschließend mit der zurückgegebenen Aufgaben-ID den Status abfragen, abbrechen oder die Aufgabe bereinigen. Länger laufende multimodale/omni-Interaktionen lassen sich einfacher integrieren, ohne eine synchrone Verbindung bis zum Abschluss offen zu halten. - Asynchrone Aufgaben werden nach realer Nutzung abgerechnet; Token-Spalten, vollständige Freigabe bei Abbruch und Schutz für große Antworten sind ergänzt. Nutzungsprotokolle, Vorab-Abzug und finale Gebühren in der Konsole bleiben konsistenter.
- Wenn das Messages-Protokoll OpenAI-kompatible Modellanbieter aufruft, bleiben zurückgegebene thinking/reasoning-Inhalte erhalten und können in späteren Runden wieder mitgesendet werden. Anwendungen mit Claude SDKs, mehrstufigen Tool-Flows oder DeepSeek thinking mode sollten seltener leere Antworten, 400-Fehler oder verlorenen Reasoning-Kontext sehen.
- Unsigned thinking-Blöcke werden beim Wechsel auf native Claude-Kanäle kompatibler behandelt, wodurch Formatfehler in Multi-Modell-Fallbacks oder Bridge-Flows reduziert werden.
- Beim Aufruf von Doubao-Videomodellen können
promptund Referenzmedien inextra_body.contentjetzt gemeinsam wirken; Anfragen mit nur Medieninhalt behalten sowohl den Prompt als auch die Reihenfolge der Medien. - Erstellungsantworten spiegeln Größe und Prompt nun näher an den tatsächlich gesendeten Inhalten wider und ignorieren weiterhin nicht unterstützte native Felder. Dadurch gibt es weniger Videogenerierungsfehler durch zusätzliche SDK-Parameter.
2026
10. August
Vollständigere kumulierte Nutzung für Mediengenerierung
- Nach der Abrechnung einer Mediengenerierungsaufgabe wird auch die kumulierte Nutzung auf Kontoebene aktualisiert. In der Konsole bilden kumulierte Nutzung, Saldoabzug und Verbrauchsprotokolle den realen Medienverbrauch vollständiger ab.
- Beim Aufruf von Azure-Modellen mit Punkten im deployment/model-Namen bleibt der Modellname auf den Konvertierungspfaden Chat, Responses und Messages unverändert erhalten und wird nicht mehr automatisch umgeschrieben. Das Verhalten bestehender Azure-Aufrufe bleibt unverändert.
2026
8. August
Neues Modell zur Videogenerierung
doubao-seedance-2-5-260628hinzugefügt: ByteDance Seeds vereintes multimodales Audio-Video-Generierungsmodell der nächsten Generation. Es erzeugt in einem Durchgang bis zu 30 Sekunden synchronisierten Audio- und Videoinhalt, unterstützt mehrrundige Verlängerungen und verbessert Storytelling, Übergänge, Referenzunterstützung, Realismus und präzise Bearbeitung für Filmproduktion, Werbung, Bildung, Simulation und langformatige Inhalte.
2026
6. August
Neue Modelle
wan3.0-videohinzugefügt: All-in-One-Modell für Videogenerierung und -bearbeitung von Alibabas Tongyi Lab, derzeit in der öffentlichen Beta. Es unterstützt native Videos von bis zu 30 Sekunden, produktionsreife Charakter-Konsistenz, realistische Bild- und Tonqualität sowie vereinheitlichte Workflows für Referenz, Bearbeitung, Replikation und Motion-Driving. Geeignet für Werbung, E-Commerce, Filmproduktion, Animation, Videoschnitt und Dokument-zu-Video.qwen-image-3.0hinzugefügt: Modell für Bildgenerierung und -bearbeitung vom Qwen-Team von Alibaba Cloud, mit Unterstützung für Text-zu-Bild, referenzbildbasierte Erstellung und Bildbearbeitung. Es hält Bildqualität und Geschwindigkeit im Gleichgewicht und eignet sich für Social Media, E-Commerce, Kreativdesign, alltägliche Content-Produktion und häufige Erstellung in großem Umfang.qwen-image-3.0-prohinzugefügt: Alibaba Clouds Qwen-Flaggschiff für Bildgenerierung und -bearbeitung, ausgelegt für Werbung, Brand-Visuals, UI, Präsentationen, Produktbilder und professionelles Design. Es überzeugt bei komplexen Layouts, präziser chinesischer und englischer Text-Darstellung, realistischen Materialien, referenzbasierter Bearbeitung, Detailtiefe, Komposition und einer visuellen Qualität auf Commercial-Grade-Niveau.
2026
4. August
Gemini embedding unterstützt multimodale Eingaben und Abrechnung nach Modalität
gemini-embedding-2-previewkann jetzt Text-, Bild-, Audio-, Video- und Dokumenteingaben sowohl über den OpenAI-kompatiblen Embeddings-Endpunkt als auch über den nativen Gemini-Pfad verarbeiten. Nutzer mit multimodaler Suche, Content-Verständnis oder Knowledge-Base-Workflows können mehr Eingabetypen mit demselben Modell nutzen.- Die Gemini-embedding-Abrechnung priorisiert nun die vom Modellanbieter zurückgegebenen Token-Werte je Modalität. Bilder, Audio, Video und Dokumente werden nicht mehr als einheitliche Textschätzung behandelt, sodass multimodale embedding-Rechnungen näher am tatsächlichen Verbrauch liegen.
- Embedding-Anfragen mit einer einzelnen Eingabe können den neueren Gemini-embedding-Pfad direkt verwenden. Batch-Anfragen mit mehreren Inputs erhalten nun eine klare Meldung zur nicht passenden Fähigkeit.
- Seedance 2.0 Referenzen für Bilder, Audio und Video werden genauer nach Medientyp zugeordnet; die Vorgaben für
adaptive, 4K und Größenoptionen sind klarer. Video-Workflows sehen weniger Fehler durch falsche Parameterzuordnung. - Anfragen mit adaptiver Dauer werden zunächst mit 15 Sekunden vorbelastet und nach Abschluss der Aufgabe anhand der realen Dauer abgerechnet. Vorabzug und finale Rechnung bleiben dadurch konsistenter.
- Bei Fehlern in der Mediengenerierung geben die APIs bereinigte Fehlerdetails zurück, damit Nutzer und Support Parameter-, signierte-URL- oder Modellanbieter-Limit-Probleme diagnostizieren können, ohne sensible Zugangsdaten offenzulegen.
3. August
Neue Modelleqwen3.8-maxhinzugefügt: Alibaba Clouds natives Flaggschiff-Vision-Language-Modell, basierend auf einer Mixture-of-Experts (MoE)-Architektur mit 2,4 Billionen Parametern und Kontextfenstern von bis zu 1 Million Tokens. Es eignet sich für komplexes multimodales Verständnis, fortgeschrittenes Reasoning, Softwareentwicklung, Agent-Workflows und Long-Context-Verarbeitung. Zu einem ähnlichen Preis wie Qwen3.7-Max liefert Qwen3.8-Max deutliche Verbesserungen bei Reasoning, Coding und Agent-Fähigkeiten, mit einer Gesamtleistung auf dem Niveau der aktuell führenden Modelle.
- Modelldetails zeigen Anbieter, die fuer aktuelle Anfragen besser geeignet sind, weiter oben. Anbieter, die nur als Reserve dienen oder voruebergehend nicht verfuegbar sind, erscheinen weiter hinten. Nutzer und Support-Teams sehen bei der Auswahl eines Anbieters oder bei Verfuegbarkeitspruefungen schneller, welche Anbieter aktuell die bessere Wahl sind, und vermeiden Entscheidungen auf Basis veralteter Reihenfolgen.
2. August
Genauere Abrechnung und Nutzungslogs fuer kleine Anfragen- Kleine Anfragen bei by-bill-Modellen verschwinden nicht mehr aus Abrechnung und Nutzungslogs, wenn der berechnete Betrag zuvor auf null abgerundet wurde. Betroffene Anfragen werden nun mit dem minimal wirksamen Quota erfasst, sodass Rechnung, Guthaben-Vorabpruefung und Nutzungsprotokolle konsistent bleiben; Support und Operations sehen vollstaendigere Daten fuer hochfrequente Embedding-aehnliche Nutzung.
31. Juli
Neue Modelledeepseek-v4-flashhinzugefügt: ein auf Effizienz optimiertes Mixture-of-Experts-Modell mit insgesamt 284B Parametern, 13B aktiven Parametern und einem Kontextfenster von 1 Mio. Tokens. Es ist auf schnelle Inferenz und Workloads mit hohem Durchsatz ausgelegt und behält dabei starke Reasoning- und Coding-Leistung, was es für Coding-Assistenten, Chat-Systeme und Agent-Workflows geeignet macht.
minimax-h3hinzugefuegt: MiniMax’ allgemeines multimodales Videomodell. Es akzeptiert Text-, Bild-, Audio- und Videoeingaben und unterstuetzt Text-zu-Video, Bild-zu-Video, First/Last-Frame-Generierung, referenzbasierte Generierung und Videobearbeitung. Nutzer mit Workflows fuer Videocreation, Werbemittel, Produktdemos oder multimodale Inhalte koennen es ueber die einheitliche AIHubMix API aufrufen.
glm-5.2wird nach taeglichem Zeitfenster rabattiert, in UTC: 50 % Rabatt von 14:00 bis 24:00 Uhr und 30 % Rabatt von 00:00 bis 14:00 Uhr taeglich. Zeitlich begrenztes Angebot.
gpt-5.6-lunauebernimmt die offizielle Preissenkung um 80 % und kostet jetzt 1.20 Ausgabe;gpt-5.6-terrauebernimmt die offizielle Preissenkung um 20 % und kostet jetzt 12.00 Ausgabe. Nutzer mit stabilem Traffic auf diesen Modellen koennen ihre Modellauswahl fuer kostenkritische und allgemeine Workloads neu bewerten.
30. Juli
Offizieller AIHubMix MCP Server verfuegbar- Der offizielle gehostete MCP-Endpunkt mcp.aihubmix.com/mcp oder mcp.inferera.com/mcp ist fuer MCP-faehige Clients verfuegbar. Entwickler koennen damit aus Tools wie Claude Code, Codex und Cursor Modelle und Preise abfragen, Dokumentation durchsuchen, Guthaben pruefen und Chat-, Bildgenerierungs- sowie Videogenerierungs-Tools aufrufen.
- MCP-Zugangsdaten werden pro Anfrage vom Client uebergeben und nicht serverseitig gespeichert. Das ist fuer Entwickler gedacht, die AIHubMix-Modelle und Medienfunktionen direkt in IDEs oder Agent-Tools nutzen moechten.
29. Juli
Neues Modelljina-reranker-v3.5hinzugefuegt: Jina AIs multilingualer listwise Dokument-Reranker mit 0,6B Parametern und gleichem Schema als Upgrade vonjina-reranker-v3. Er eignet sich fuer RAG, Suche und Ranking strukturierter Daten, unterstuetzt Long-Context-Kandidatenranking und verbessert Domain-Robustheit, multilinguale Suche, strukturiertes Ranking und Inferenz-Effizienz.
28. Juli
Genauere Cache-Abrechnung- Fuer explizite und implizite Cache-Anfragen erkennt AIHubMix Cache-Lese- und Schreibnutzung jetzt konsistenter und priorisiert den vom Upstream-Anbieter zurueckgegebenen Cache-Typ. Nutzer von cachefaehigen Modellen wie Qwen und Claude sollten Abrechnungsdetails sehen, die naeher an der tatsaechlichen Nutzung liegen.
- Die erste Modellliste fuer Mediengenerierung wurde auf verifizierte Modelle eingegrenzt, und ein Problem mit moeglichen 404-Antworten bei einigen Bildmodell-Aufrufen ueber den Medien-Endpunkt wurde behoben. Console-Downloads fuer LLM-Tasks decken nun auch Textarchive ab, sodass grosse historische Ergebnisse leichter abrufbar sind.
- Das Cache-Verhalten fuer Website, Modelldaten, Blogdaten und Sitemaps wurde angepasst, damit Releases verlaesslicher wirksam werden. Modellseiten und Dokumentationseinstiege werden nach Updates seltener durch alte Cache-Daten beeinflusst.
27. Juli
Mediengenerierungs-APIs sind verfuegbar/ai/v1/images/generationsund/ai/v1/images/editswurden mit einheitlichen asynchronen Tasks, Ergebnisabfragen, Artefakt-Downloads und Webhook-Callbacks ergaenzt. Bild- und Video-Workflows koennen nun ueber denselben Task-Lifecycle integriert werden, wodurch langlaufende Generierungsergebnisse leichter nachverfolgbar sind.- Generierte Artefakte werden ueber AIHubMix-Task-Ergebnisse zurueckgegeben und unterstuetzen begrenzte Downloads sowie Bulk-Abrufe. Kundenteams sollten fruehes Feedback zu Task-Status, Download-Link-Gueltigkeit und Abrechnungsdetails beobachten.
25. Juli
Neue Modelleclaude-opus-5hinzugefügt: Anthropics Flaggschiff-Modell für anspruchsvolles Reasoning, Coding und langlaufende Agent-Aufgaben. Es überzeugt bei End-to-End-Softwareaufgaben, Code Review und Bugsuche, Diagramm- und Dokumentenanalyse, komplexen Office-Deliverables sowie der Koordination paralleler Sub-Agents, mit 1M Context Window und bis zu 128K Output.
24. Juli
Neue Modellemai-image-2.5-prohinzugefügt: Microsofts Flaggschiff-Modell für Bildgenerierung und -bearbeitung, mit hochauflösendem Realismus, präzisem Text-Rendering im Bild und leistungsstarker Bearbeitung für Commercial Design, Produktfotografie und professionelle Kreativ-Workflows.qwen-audio-3.0-tts-flashhinzugefügt: Qwens Echtzeit-Sprachsynthesemodell mit erweiterter Unterstützung für ressourcenarme Sprachen und chinesische Dialekte, ausdrucksstarker Stimmsteuerung und First-Packet-Latenz unter 200 ms, geeignet für Sprachassistenten, Echtzeit-Dialoge und intelligenten Kundenservice.qwen-audio-3.0-tts-plushinzugefügt: Qwens Premium-Sprachsynthesemodell mit feinerer Kontrolle über Emotion, Tonfall, Charakter, Sprechtempo, Lautstärke und Stil, ausgelegt für Content-Erstellung, Hörbücher, Film-/TV-Synchronisation, Brand-Voices und weitere hochwertige Sprach-Workflows.
- Beide Qwen TTS Modelle koennen ueber
/v1/audio/speechaufgerufen werden; nicht-streamende Anfragen liefern eine Audio-Ergebnis-URL, streamende Anfragen liefern SSE-Ereignisse zur Audiogenerierung. Die folgende Tabelle kombiniert AIHubMix-kompatible Felder mit der offiziellen Qwen-Audio-TTS-Dokumentation von Alibaba Cloud;voicemuss pro Modell gewaehlt werden, plus- und flash-Systemstimmen sind nicht austauschbar.
Bessere Messages-Antwortkompatibilitaet
/v1/messages-Antworten von gebridgten Modellen und Claude-kompatiblen Diensten wie Bedrock entsprechen dem Anthropic-Messages-Oekosystem jetzt genauer, wodurch strikte SDKs oder Schema-Validatoren seltener wegen fehlender Antwortfelder fehlschlagen.
- Wenn ein Client eine AWS-Bedrock-Streaming-Anfrage abbricht, sammelt AIHubMix weiterhin das Endsignal des Modellanbieters und die finale Usage ein. Dadurch gibt es in Abbruchfaellen weniger Abweichungen zwischen Request-Logs, Abrechnungsdetails und Nutzung des Modellanbieters.
23. Juli
Neue Modelleqwen3-coder-480b-a35b-instructhinzugefuegt: Qwen3-Coder-Flaggschiffmodell fuer Codegenerierung, Software-Engineering-Agents und Tool-Calling-Workflows, geeignet fuer Long-Context-Codeverstaendnis und automatisierte Entwicklungsaufgaben.gemini-2.5-flash-litehinzugefuegt: leichtes Gemini-2.5-Modell fuer latenzarme, guenstigere Text-, Multimodal- und Batch-Workloads mit hoher Frequenz.Qwen/Qwen3-235B-A22B-Instruct-2507hinzugefuegt: Qwen3 235B-A22B Instruct 2507 fuer allgemeinen Chat, Befolgung von Anweisungen, mehrsprachige Arbeit und Long-Context-Aufgaben.
22. Juli
Neue Modellegemini-3.6-flashhinzugefuegt: Googles neuestes Flash-Modell fuer komplexe Workflows, Computer Use, Chart Reasoning und Long-Context-Aufgaben.gemini-3.5-flash-litehinzugefuegt: ein leichteres und guenstigeres Gemini-3.5-Modell fuer hohen Durchsatz, Alltagsautomatisierung und Batch-Verarbeitung.glm-5.2-fast-previewhinzugefügt: schnelles Preview-Modell der Zhipu-GLM-5.2-Serie für latenzarme Chats, schnelles Reasoning und Anwendungen mit hohem Durchsatz.
- Streaming-Aufrufe an
qwen3.8-max-previewueber/v1/responsesund/v1/messagessind zuverlaessiger. Gueltige Streams, die zuvor alsempty_streamoder 502 erscheinen konnten, koennen jetzt normal abgeschlossen werden.
21. Juli
Gemini-Bildparameter werden durchgereicht- Bei Aufrufen von Gemini- oder Vertex-Bildausgabemodellen ueber die OpenAI-kompatible Chat-Completions-API koennen Clients jetzt
aspectRatioundimageSizeinextra_body.generationConfig.imageConfiguebergeben.
- Wenn Gemini-Embedding-Antworten echte
usageMetadataenthalten, rechnet AIHubMix zuerst nach dem vom Modellanbieter gelieferten Tokenverbrauch ab; fehlt diese Angabe, bleibt die bisherige lokale Schaetzung als Fallback erhalten.
/v1/responses-Anfragen koennen jetzt message-local function tools in system/developer-Nachrichten enthalten; diese Tool-Deklarationen bleiben beim Bridging zu Chat-Modellen erhalten. Clients mit dynamischen Tool-Workflows, etwa fuer Kimi K3, erhalten stabilere Tool-Aufrufe.
- Fuer
/v1/responses-Aufrufe, die zu Chat-Modellen gebridgt werden, wirdstopjetzt an den Modellanbieter weitergegeben. Eine einzelne Stop-Sequenz wirkt normal; mehr oder laengere Stops, als der Modellanbieter zulaesst, liefern Grenzfehler, die mit Chat Completions konsistent sind.
- DeepSeek-V4-Modelle koennen jetzt konfigurierte Peak/Off-Peak-Abrechnung unterstuetzen. Pre-Deduction und finale Abrechnung verwenden denselben Zeitpunkt der Request-Einreichung, sodass Streaming-Requests ueber Zeitgrenzen hinweg nach dem Startzeitpunkt berechnet werden. Der Pre-Deduction-Schutz greift nur fuer Modelle mit zeitbasierter Abrechnung und veraendert das eingefrorene Guthaben normaler Modelle nicht.
20. Juli
Claude-Messages-thinking-Kompatibilitaet- Wenn
/v1/messages-Anfragen an OpenAI- oder Azure-Chat-Modelle ueberbrueckt werden, werden Claude-thinking-Einstellungen nun in ein vom Modellanbieter unterstuetztes Reasoning Effort umgesetzt. Das reduziert 400-Fehler bei Requests mit thinking. Native Claude-thinking-Anfragen wie Opus 4.8 bleiben kompatibel.
- Das Stream-Limit des Produktions-Gateways wurde von 1 Stunde auf 2 Stunden erhoeht. Lang laufende Reasoning- und Generierungsaufgaben wie Kimi K3 werden waehrend des Denkens oder Generierens seltener vorzeitig getrennt.
19. Juli
Neue Modelle- Neu: qwen3.8-max-preview:
Zeitlich begrenztes Angebot: Qwen3.8-Max-Preview wird mit nur 10 % des Standardpreises abgerechnet – das entspricht der 10-fachen Nutzung. Nur für begrenzte Zeit, wer zuerst kommt, profitiert zuerst.
Qwen3.8-Max-Preview ist das Foundation-Modell der neuesten Generation der Qwen-Familie mit 2,4 Billionen (2.4T) Parametern – und es entwickelt sich stetig weiter. Im Vergleich zum bisherigen Flaggschiff Qwen3.7-Max bietet es deutliche Fortschritte bei Kernfähigkeiten wie Coding und Cowork (professionelle Büroarbeit) und zeigt weltweit führende Gesamtleistung bei komplexen Langzeitaufgaben wie Full-Stack-Entwicklung, Datenanalyse und Office-Workflows.
17. Juli
Neue Modelle- Neu hinzugefuegt:
kimi-k3. Kimi K3 ist Moonshot AIs offenes Long-Context-Modell der 3T-Klasse mit 2,8T Parametern, einem Kontextfenster von 1M Tokens und nativer Unterstuetzung fuer visuelle Eingaben. Es eignet sich fuer langlaufendes Coding, Wissensarbeit, komplexes Reasoning und multimodales Verstehen. Siehe Kimi K3 Praxis-Guide (Beispiele für die drei APIs und Support-Matrix). - Neu hinzugefuegt:
hy-3d-3.1. Tencent Hunyuan 3D Professional unterstuetzt Text-zu-3D, Bild-zu-3D und Multi-View-3D-Generierung. Es eignet sich fuer Game Assets, E-Commerce-Praesentationen, 3D-Druck und Produktdesign; Version 3.1 verbessert Geometrie- und Texturqualitaet und unterstuetzt Acht-Ansichten-Eingaben.
- Die asynchrone API
/v1/3d/generationsist verfuegbar und startet mit Tencent TokenHub Hunyuan 3D. Sie unterstuetzt das Einreichen von Generierungsaufgaben und das Abfragen von Ergebnissen, um 3D-Asset-Erstellung einfacher in automatisierte Workflows einzubinden.
- Dynamisch geladene Tools auf Message-Ebene in Kimi-K3-Anfragen bleiben erhalten und werden weitergeleitet. Dadurch werden 400-Fehler des Modellanbieters durch verlorene Tool-Deklarationen vermieden, und Clients mit Kimi Dynamic Tool Loading sind kompatibler.
- Die Kompatibilitaet fuer Chat-Completions-Custom-Tools, Cohere-Textblöcke und Anfragen mit
assistant.content: nullwurde verbessert. Gueltige Anfragen erreichen den Modellanbieter stabiler; fehlerhafte oder nicht unterstuetzte Eingaben liefern strukturierte Fehler statt leerer HTTP-200-Erfolge.
- Die Bildgenerierung mit
doubao-seedream-5-0-prounterstuetzt nun Abrechnung nach Ausgabepixel-Stufe und Anzahl der Eingabebilder, sodass Text-zu-Bild- und Bild-zu-Bild-Anfragen naeher an den tatsaechlichen Generierungsspezifikationen berechnet werden.
15. Juli
Verbesserte Kompatibilitaet fuer Gemini-Tool-Aufrufe- Bei Gemini- oder Vertex-Aufrufen ueber die OpenAI-kompatible API fuehren leere String-Werte in Enum-Definitionen von Tools oder strukturierten Ausgabeschemas nicht mehr zu einem 400-Fehler bei der Pruefung durch den Modellanbieter. Tool-Aufrufe und JSON-Schema-Workflows sind dadurch zuverlaessiger.
14. Juli
Neue Audiomodelle- Neu:
gpt-audio-1.5, OpenAIs erstes allgemein verfuegbares Audiomodell. Es akzeptiert Audioeingaben und -ausgaben und kann ueber die Chat Completions REST API genutzt werden, etwa fuer Sprachdialoge, Audioverstaendnis und Audiogenerierung. - Neu:
gpt-4o-transcribe-diarize, ein ASR-Modell mit integrierter Sprecherdiarisierung, das Audiosegmente den verschiedenen Sprechern einer Unterhaltung zuordnet. Dieses Modell ist nur in der Transcription API verfuegbar.
- Die Einfuehrungsseite fuer intelligentes Routing ist jetzt online und zeigt die oeffentlichen Bewertungen je Routing-Dimension sowie die aktuell routbaren Modelle. Gleichzeitig gibt es zwei neue offene Endpunkte: Modellumfang der LLM-Router-Strategie liefert Modellbewertungen ueber 5 Kategorien und 23 Unterdimensionen, Preiskoeffizienten, First-Token-Latenz und die Modelle im Pool; Modellanbieter-Icons liefert Anzeigenamen und Icons der Modellanbieter. Dimensionen fuer Bild- und Videogenerierung sind noch nicht enthalten. Details zur Nutzung finden Sie in der Dokumentation LLM Router (intelligentes Modell-Routing).
13. Juli
Konsistentere API-Fehlerantworten- Wenn
/v1/responsesmit einem unbekannten Modell aufgerufen wird, gibt die API jetzt HTTP 400 zurueck, passend zu anderen API-Einstiegen. Clients koennen den Fall damit als „kein verfuegbarer Service“ behandeln statt als 500.
- Schlaegt die Umwandlung des Request-Bodys oder die Parameterpruefung fehl, gibt die API direkt die passende 400/Fehlerantwort zurueck, anstatt den Originalrequest an den Modellanbieter weiterzuleiten. Das reduziert ungueltige Aufrufe und schwer verstaendliche Fehler.
- Claude-Code-Aufrufe von Claude ueber Bedrock haben jetzt stabilere Prompt-Cache-Hits innerhalb derselben Sitzung. Das kann doppelte Cache-Write-Kosten sowie First-Token-Latenz senken.
- Gemini-Anfragen bleiben nur dann beim selben Service, wenn die Antwort tatsaechlich Thinking-Signaturen oder Cache-Aktivitaet enthaelt. Das reduziert Signatur- oder Cache-State-Abweichungen in Mehrfachrunden, waehrend zustandslose Bildgenerierungsjobs nicht unnoetig festgelegt werden.
10. Juli
Neue Modellegpt-5.6-sol,gpt-5.6-terraundgpt-5.6-lunaaus der GPT-5.6-Serie wurden hinzugefügt (offiziell von OpenAI am 09.07.2026 veröffentlicht). Alle drei Stufen bieten ein Kontextfenster von 1.050.000 Token, maximal 128K Output und Wissensstand 2026-02-16, unterstützen Text- und Bildeingaben und sind über Chat Completions, Responses sowie die Claude-kompatible Messages-Schnittstelle aufrufbar. Sol ist das Flaggschiff für komplexe professionelle Arbeit und laut OpenAI das derzeit beste Coding-Modell; Terra erreicht die Leistung von GPT-5.5 zum halben Preis; Luna ist für kostensensible Szenarien ausgelegt.
- Neue Dokumentation GPT Prompt Caching: Ab der GPT-5.6-Serie werden Cache-Writes mit dem 1,25-Fachen des Inputpreises abgerechnet, Cache-Reads mit dem 0,1-Fachen, und der Cache bleibt mindestens 30 Minuten erhalten. Die Seite behandelt die Parameter
prompt_cache_keyund explizite Cache-Breakpoints, die Abrechnungslogik, API-Beispiele und die Fehlersuche bei Cache-Misses. Die OpenAI-Caching-Angaben in Prompt Caching und Claude Prompt Caching wurden entsprechend aktualisiert.
- Anfragen an Claude Fable und Mythos mit
reasoning_effortverwenden jetzt adaptive thinking. Das reduziert 400-Fehler des Modellanbieters fuer diese Modellfamilien, ohne dass Clients Parameter aendern muessen.
- OpenAI-kompatible
stop-Einstellungen werden nun auf native Claude- und Gemini-Anfragen abgebildet. Fuer Claude ungueltige leere Stop-Sequenzen werden gefiltert, waehrend OpenAI- und Gemini-Limits pro Anbieter behandelt werden.
gpt-chat-latestund kuenftige GPT/ChatGPT-latest-Aliasse behaltenmax_completion_tokensbei, wenn erforderlich. Dadurch sinken 400-Fehler durch das aeltere Feldmax_tokens.
- Wenn ein Nutzungslimit auf Key-Ebene erschoepft ist, gibt die API jetzt eine klarere Anleitung zum Anpassen und Reaktivieren des Key-Limits zurueck statt nur eines technischen Quota-Fehlers.
- Nicht-streamende Chat-Antworten mit
tool_callsund ohne Text liefern nun explizitcontent: null, was die Kompatibilitaet mit OpenAI-aehnlichen SDKs und Parsern verbessert.
9. Juli
Reparatur strukturierter Ausgaben: automatische Reparatur fehlerhafter JSON-Formate- Neue Fähigkeit Reparatur strukturierter Ausgaben auf Key-Ebene, standardmäßig deaktiviert. Ist sie aktiviert, repariert das Gateway bei nicht-streamenden Anfragen, die eine strukturierte JSON-Ausgabe deklarieren, ein vom Modell zurückgegebenes JSON mit Formatfehlern wie Abschneidung, nachgestelltem Komma oder Codeblock-Umschließung vor der Rückgabe automatisch zu parsbarem, gültigem JSON; die Zahlenwerte bleiben unverändert und der Client muss nicht angepasst werden. Unterstützt die vier Protokolle Chat Completions, Responses, Claude und Gemini; bei einer Reparatur enthält die Antwort den Response-Header X-JSON-Repaired: true.
- Die Dokumentation Claude Prompt Caching und Prompt Caching wurde um die modellabhängigen Mindestschwellen für cachebare Token (512 / 1.024 / 2.048 / 4.096) ergänzt, inklusive aktueller Modelle wie Claude Opus 4.8, Opus 4.7 und Fable 5. Die Schwelle ist nicht proportional zur Modellversion; ein Präfix unterhalb der Schwelle wird auch mit
cache_controlnicht zwischengespeichert.
- Die Aggregation im Nutzungsdashboard liegt nun naeher an den Request-Log-Abrechnungsdaten, da gleichzeitige Aggregationsverluste reduziert und Stunden-Buckets fuer verzoegerte Replays vereinheitlicht wurden. Historische Dashboard-Werte koennen weiterhin leicht abweichen; fuer Abrechnung und Abgleich bleiben Request-Logs die Quelle der Wahrheit.
grok-4.5wurde hinzugefuegt, ein Modell fuer Coding, agentische Aufgaben und Wissensarbeit, mit konfigurierbarem Reasoning, Tool Calling und 500K-Kontextfenster. Geeignet fuer Code-Reparatur, komplexe Engineering-Aufgaben, Wissens-QA und Agent-Workflows.
8. Juli
gpt-5.5+-Tool-Aufrufe werden automatisch zu Responses gebrueckt- Bei Nutzung des OpenAI-kompatiblen Endpunkts
/v1/chat/completionsmit gpt-5.5 oder neueren Modellen verwenden Anfragen mit Tools undreasoning_effortnun automatisch Responses-Faehigkeiten. Das reduziert 400-Fehler des Modellanbieters fuer diese Parameterkombination, ohne dass Clients auf/v1/responsesmigrieren muessen. Siehe: Responses API
7. Juli
Strukturierte Ausgaben protokolluebergreifend kompatibler- OpenAI-kompatibles
response_formatund Claude-nativesoutput_config.formatwerden nun auf den relevanten Pfaden angepasst. Clients koennen beim Wechsel zwischen OpenAI- und Claude-aehnlichen Protokollen strukturierte Ausgabevorgaben verlaesslicher beibehalten. Siehe: Structured Output.
/v1/messages-Aufrufe ueber Vertex AI
- Bei Gemini und anderen Nicht-Claude-Modellen ueber Vertex AI werden
/v1/messages-Anfragen jetzt nach Modellfamilie geroutet. Dadurch sinken not-found- oder 404-Fehler durch versehentlich Claude-spezifische Pfade.
6. Juli
Native Gemini-Endpunkte vervollstaendigt- Bei Nutzung des
@google/genaiSDK ueber den Gemini-Einstieg von AIHubMix werden jetzt native Embeddings, interactions create und Context-Caching-Workflows unterstuetzt. Diese Pfade konnten bisher unregistrierte Routenfehler oder 404 liefern; jetzt sind Embedding-Erzeugung, interaktive Aufrufe sowie Cache-Erstellung, -Abfrage, -Aktualisierung und -Loeschung moeglich. Siehe: Gemini Native SDK-Anbindung
- Long-Context-Modelle wie
hy3-preview, ERNIE, Grok und Mimo unterstuetzen jetzt gestaffelte Abrechnung nach Kontextlaenge. Die Preisberechnung ist genauer.
- Streaming-Anfragen fuer Vertex AI Gemini/Claude erfassen jetzt genauere Time-to-first-token- und Latenzdaten. Logs und Monitoring sind dadurch verlaesslicher; Modellantworten aendern sich nicht.
tencent-hy3wurde hinzugefuegt, ein Textgenerierungsmodell (Tencent Hunyuan Hy3, offizielle Version). MoE-Architektur mit 295B Gesamtparametern / 21B aktiven Parametern und 256K Kontextfenster. Unterstuetzt kombinierte schnelle und langsame Denk-Inferenzmodi, geeignet fuer komplexes Reasoning, Code-Generierung und Agent-Workflows. Open-Source unter der Apache-2.0-Lizenz.
3. Juli
Jina Search/Reader unterstützt jetzt POST und Dateiuploads- Jina Search und Reader unterstützen jetzt POST-Anfragen. Reader kann lokale Dateien per Multipart-Upload annehmen, darunter PDF, Word, Excel, PPT, HTML und Bilder. Standardantworten entsprechen stärker Jinas nativer Markdown-Ausgabe; Clients, die JSON benötigen, können explizit
Accept: application/jsonsenden.
- Ein Problem wurde behoben, bei dem über
/v1/responsesgebridgte Aufrufe an Azure-artige Nicht-GPT-Dienste mit 404 fehlschlagen konnten, weilapi-versionleer war. Dadurch sinkt das Risiko direkter Fehler bei solchen Anfragen.
- Ein Fall wurde behoben, in dem einige Modell-Inferenzdienste wie vLLM / Azure Foundry Streaming-Antworten zufällig abschneiden konnten. Nutzer sollten vollständige Antworten, Abschlusssignale und Nutzungsdaten zuverlässiger erhalten.
command-a-plus-05-2026wurde als Textgenerierungsmodell fuer Chat, Inhaltserstellung und Agent-Workflows hinzugefuegt.
1. Juli
Jina-Suche und Webpage-Reader-APIs verfügbar- Neue Jina Search- und Reader-Funktionen: Mit Ihrem AIHubMix API Key können Sie jetzt Jina-Suchergebnisse abrufen und Webseiteninhalte lesen – geeignet für externe Web-Recherche, Dokumentenlesen und Agent-Tool-Workflows. Siehe: Jina AI
- Veo 3.1 Image-to-Video unterstützt jetzt Eingaben für Startframe, Endframe und Referenzbilder. Dadurch lassen sich Anfangs-/Endszene, Charakterreferenzen und Stilreferenzen in anspruchsvolleren Videogenerierungs-Workflows präziser steuern. Siehe: Videogenerierung
- Verbesserte Kompatibilität für Gemini-Anfragen bei Cross-Channel-Retries; reduziert bestimmte 400-Fehler in Fallback-Szenarien und erhöht die Erfolgsrate bei Multi-Channel-Failover-Aufrufen. Siehe: Gemini Guides
- OpenAI-kompatible Antworten mit und ohne Streaming behalten jetzt
null-Werte für Felder wielogprobs,refusalundfinish_reasonbei. Dadurch gibt es weniger Abweichungen für SDKs, Agents und Log-Parser, die das Standardformat von OpenAI erwarten.
- Die Anfragekompatibilität wurde verbessert, wenn Claude Code über AIHubMix Claude-Modelle aufruft. Dabei gelangen weniger Client-Umgebungsinformationen in die Anfragen an den Modellanbieter, was den Datenschutz für Drittanbieter-Agent-Clients verbessert.
- Das eigene Kontosystem deckt jetzt E-Mail-Code-Login/Registrierung, Passwortsetzung, Profilbearbeitung, Verknüpfen/Trennen von Drittanbieter-Konten und Kontolöschung ab, mit stärkerer OTP-Zwecktrennung und Prüfung deaktivierter Konten. Stripe-Auflade-Callbacks werden ebenfalls zuverlässiger verarbeitet.
- claude-sonnet-5 für Chat-, Reasoning- und Agent-Workflows.
- gemma-4-31b und longcat-2.0 für Textgenerierung.
- gemini-3.1-flash-lite-image für Workflows mit Bildfunktionen.
- mai-image-2.5 und mai-image-2.5-flash für Bildgenerierung.
29. Juni
Verbesserte Bildgenerierungs-Abrechnung und Parameterkompatibilität- Die Abrechnung von
gpt-image-2auf Images-Endpunkten ist jetzt einheitlich tokenbasiert. GLM-Bildgenerierung leitet erweiterte Parameter wiewatermark_enabledundqualityweiter, sodass Wasserzeichen- und Qualitätseinstellungen greifen können, wenn der Modellanbieter sie unterstützt. Siehe: Bildgenerierung
- Fehlgeschlagene Gemini-Dateiuploads erzeugen keine nutzersichtbaren normalen Request-Logs mehr. Dadurch entsteht weniger Rauschen von Nicht-Inferenz-Endpunkten auf der Logseite, während interne Diagnose-Logs erhalten bleiben.
27. Juni
Neue Deep-Research-Modelle- o4-mini-deep-research und o3-deep-research wurden hinzugefügt. Sie sind nur über den Endpunkt
/v1/responsesverfügbar; Anfragen müssenweb_search_previewodermcptools enthalten und eignen sich für gründliche Web-Recherche und research-orientierte Antworten.
25. Juni
Responses-Protokoll unterstützt beliebige Modelle- Der Endpunkt
/v1/responsesist nicht mehr auf die GPT-Serie beschränkt und kann nun beliebige Modelle der Plattform aufrufen. Tools auf Basis des Responses-Protokolls (z. B. die Codex CLI) können dadurch über einen lokalen Modellkatalog Modelle wie GLM, Gemini, DeepSeek, Kimi und Qwen nutzen – nicht mehr nur die offiziellen OpenAI-Modelle.
- Ein Problem wurde behoben, durch das
step-3.7-flashüber/v1/responsesleere Inhalte oder eine leere Antwort zurückgeben konnte; Reasoning-Inhalte und finale Antworten werden jetzt korrekt zurückgegeben.
- Die Codex CLI-Doku hat ein neues Tutorial „Benutzerdefinierte Modelle in Codex verwenden”: Über einen lokalen Modellkatalog (
model_catalog_json) lassen sich beliebige AIHubMix-Modelle (GLM, Gemini, DeepSeek, Kimi, Qwen usw.) deklarieren und in Codex’/model-Liste frei wechseln – nicht mehr auf die offiziellen OpenAI-Modelle beschränkt. Enthält ein Ein-Befehl-Skript zum Erzeugen eines Top-30-Katalogs sowie häufige Stolperfallen. Mehr dazu: Codex CLI · Benutzerdefinierte Modelle in Codex verwenden
24. Juni
Ersatzdomain jetzt unterstützt- Neue Ersatzdomain
https://api.inferera.commit Endpunkten und Funktionen identisch zur primären Domainhttps://aihubmix.com. Wenn die primäre Domain nicht erreichbar ist (z. B. Verbindungsfehler oder Timeouts), ersetzen Sie die Anfrage-URL durch die Ersatzdomain; API Key, Modell, Request-Body und weitere Parameter bleiben unverändert.
23. Juni
Neue Modelle- Doubao doubao-seed-2-1-pro, doubao-seed-2-1-turbo.
- HappyHorse-Videoserie happyhorse-1.1-t2v (Text-to-Video), happyhorse-1.1-r2v (Referenzgenerierung), happyhorse-1.1-i2v (Image-to-Video).
- Der Stripe-Checkout füllt jetzt die Konto-E-Mail automatisch aus und reduziert unnötige Abfragen von Name und Rechnungsadresse, sodass Aufladungen mit Zahlungsmethoden wie Alipay einfacher werden.
- Wenn das Kontoguthaben unter -$1 liegt, können kostenlose Modelle erst nach einer Aufladung wieder aufgerufen werden.
22. Juni
Neu: AIHubMix-CLI-Dokumentation- Neue AIHubMix CLI-Dokumentation: eine einzelne Binärdatei ohne Abhängigkeiten (kein Python / Node / Go erforderlich), mit der Sie den Kontostand abfragen, API-Keys verwalten und verfügbare Modelle direkt im Terminal anzeigen können – mit skript- und AI-Agent-freundlicher Ausgabe (z. B. Claude Code).
- Setzen Sie
modelaufautound das Gateway analysiert Ihre Anfrage, um aus Hunderten Modellen das beste auszuwählen – mit Kosten- / Qualitäts- / Latenz-Strategien, abgerechnet nach dem tatsächlich genutzten Modell, ohne Änderung am Client-Code. Siehe: LLM Router (intelligentes Modell-Routing)
- Ein Problem wurde behoben, durch das die Cache-Trefferquote für
deepseek-v4-prounddeepseek-v4-flashniedriger als erwartet war.
- Bietet lokale Erweiterungsfunktionen für KI-Agents mit Skill-Unterstützung wie Codex, Claude Code, Cursor und Cline: Erledigen Sie die AIHubMix-Anbindung, Modellabfragen, fähigkeitsbasierte Modellauswahl, Beispielerzeugung und Fehlerbehebung in natürlicher Sprache. Der Skill liest bei Bedarf Echtzeitinformationen wie Modelle, Preise und Protokollverträge aus der offiziellen Schnittstelle aus, damit der Agent sich nicht auf veraltetes Wissen verlässt. Mehr dazu: Skills
17. Juni
Neu: Kling-Videomodelle- Anbindung der gesamten Kling-Videogenerierung: Text-to-Video, Image-to-Video, Mehrbild-Referenz und Omni-Multimodal-Generierung – je nach Modellname über das native Protokoll aufgerufen.
16. Juni
Problem mit dem OpenClaw-Integrationsplugin behoben- Das OpenClaw-Integrationsplugin aihubmix-auth von AIHubMix hat seine vorherigen Integrationsprobleme behoben und ist nun stabil nutzbar. Installieren Sie es einfach und geben Sie einen AIHubMix-Key ein, um in OpenClaw gleichzeitig OpenAI / Anthropic / Gemini-Modelle aufzurufen.
- Zhipu glm-5.2.
15. Juni
Neu: Open-Design-Anbindung unterstützt- AIHubMix ist jetzt ein in Open Design (der quelloffenen, lokal-orientierten Claude-Design-Alternative) integriertes BYOK-Gateway. Wählen Sie im API-(BYOK-)Modus AIHubMix, tragen Sie einen Key ein, und treiben Sie damit zugleich Chat-, Bild-, Video- und Sprachgenerierung an – je nach Modellname über das jeweilige native Protokoll der Anbieter. Mehr dazu: Open-Design-Anbindungsanleitung
- Das
glm-5.2im nativen Zhipu-Kanal unterstütztreasoning_effortzur abgestuften Steuerung der Denktiefe; ältere Modellversionen werden je nach Version automatisch geroutet, ohne dass aufrufseitig Änderungen nötig sind.
- kimi-k2.7-code-highspeed (Kimi Code Highspeed-Version).
13. Juni
Neue Modelle- coding-glm-5.2 sowie die kostenlose Variante coding-glm-5.2-free.
12. Juni
Modell-Mapping und Fehler-Fallback- Neu: Model Mapping und Fehler-Fallback: Konfigurieren Sie pro API Key das Modellnamen-Mapping und den Fehler-Fallback in der Konsole: Schreiben Sie den Modell-Alias des Clients auf den tatsächlichen Modellnamen um, wechseln Sie bei einem Fehler des Hauptmodells automatisch zu einem Backup-Modell und rechnen Sie nach dem final antwortenden Modell ab, ganz ohne Änderungen am Client-Code. Siehe: Model Mapping und Fallback
- kimi-k2.7-code.
11. Juni
step-3.7-flash zeitlich begrenzt mit 90 % Rabatt- step-3.7-flash mit zeitlich begrenztem Rabatt von 90 %: nur 0,022 USD pro Million Eingabe-Token und nur 0,132 USD pro Million Ausgabe-Token – probieren Sie es gern aus.
claude-opus-4-20250514undclaude-sonnet-4-20250514werden offiziell am 15. Juni abgeschaltet. Die Plattform routet die abgeschalteten Modelle dann automatisch auf die 4-5-Versionen derselben Serie.
10. Juni
Neue Modelle- claude-fable-5 [Eingestellt].
- Fable 5 hat stärkere Sicherheits-Gatekeeper, sodass auch manche normale Anfragen blockiert werden können: Zusätzliche Klassifizierungen gelten unter anderem für Cybersicherheit, Biologie / Chemie, Modell-Destillation und Reasoning-Extraktion. Manche technische Forschung, Schwachstellenanalyse oder biomedizinische Fragen können abgelehnt oder an Opus 4.8 weitergeleitet werden.
- Mythos 5 ist eingeschränkt verfügbar und kein allgemein offenes Modell: Mythos 5 und Fable 5 stammen aus derselben Fähigkeitsbasis, aber Mythos 5 nutzt weniger Sicherheitsklassifizierer. Es ist derzeit nur für Project Glasswing / freigegebene Kunden verfügbar; die meisten Nutzer verwenden Fable 5 mit Guardrails.
- Höhere API-Kosten: Fable 5 kostet 10 USD pro Million Eingabe-Token und 50 USD pro Million Ausgabe-Token, etwa doppelt so viel wie Opus 4.8.
- Datenschutz: Fable 5 / Mythos 5 gelten als Covered Models, erfordern standardmäßig mindestens 30 Tage Datenaufbewahrung und unterstützen keine Zero Data Retention.
- API-Ablehnungsverhalten: Wenn Fable 5 eine Anfrage ablehnt, gibt die API HTTP 200 zurück, aber
stop_reasonistrefusal.
08. Juni
Gemini-kompatible Schnittstelle unterstützt Audio-Eingabe- Beim Aufruf von Gemini über die OpenAI-kompatible Schnittstelle (
/v1/chat/completions) wird nun die Audio-Eingabe viainput_audiounterstützt (zuvor wurde sie stillschweigend verworfen); zudem wird in der zurückgegebenen Usage die Zählung der audio_tokens ergänzt.
05. Juni
Neue Modelle- grok-build-0.1, hy3-preview sowie das kostenlose Modell step-3.7-flash-free.
04. Juni
Neue Modelle- Tongyi Qianwen qwen3.7-plus.
01. Juni
Neue Modelle- MiniMax minimax-m3.
- Baidu musesteamer-air-image (Bildgenerierung).
29. März
Detailseite zu Logs- Latenz: Gibt an, wie schnell eine Anfrage startet (Zeit von der Anfrage bis zum ersten zurückgegebenen Token)
- Durchsatz: Klare Messgröße für die Ausgabegeschwindigkeit des Modells
- E2E-Latenz: Gesamtzeit von Anfrage bis Abschluss; zur Bewertung der Gesamtleistung der Anfrage
- Provider: Identifiziert den Modellanbieter, der die Anfrage verarbeitet hat
- Status: Zeigt das Ergebnis (z. B. Erfolg / Fehlschlag) zur schnellen Erkennung von Anomalien
- TID: Eindeutige Anfragen-ID, die mit dem Support geteilt werden kann, um Probleme schneller zu beheben
23. März
- Das AIHubMix Global Acceleration Network ist live: aufgebaut auf eigenen globalen Edge-Knoten und intelligentem Routing, mit kontinuierlichem Monitoring und dynamischer Optimierung – 75 % geringere Latenz, 60 % höhere Stabilität und 99,99 % Verfügbarkeit. Schnelleres, zuverlässigeres KI-Erlebnis.
- 24/7-Echtzeit-Health-Monitoring hinzugefügt: Verteilte Sonden scannen das gesamte Netzwerk minütlich, verfolgen Latenz, Erfolgsrate und Stabilität. Probleme werden erkannt und behoben, bevor Nutzer sie bemerken – für gleichbleibende Performance.
- Verbessertes intelligentes Traffic-Routing: Knotengesundheit wird dynamisch über mehrere Zeitfenster bewertet, mit Millisekunden-Switching zur optimalen Route – deutlich weniger Schwankungen und Timeouts bei höherer Erfolgsrate.
8. Februar
- Neue Funktion: Chat → Responses-Kompatibilität
Dieses Release führt die Chat → Responses-Kompatibilität ein, sodass die Chat-Completions-API OpenAI-Modelle aufrufen kann, die nur das Responses-Protokoll unterstützen – darunter gpt-5.2-codex, gpt-5.1-codex-max und gpt-5.2-pro. Wenn Sie die AIHubmix-Chat-API zwingen möchten, Anfragen über das Responses-Protokoll zu routen, fügen Sie folgenden Header hinzu:X-Use-Responses-Enabled: trueWenn ein Modell sowohl Chat als auch Responses unterstützt, erzwingt dieser Header die Verwendung der Responses-API.
Beachten Sie: Das Responses-Protokoll unterstützt derzeit weder Audioeingabe noch -ausgabe; planen Sie die Nutzung entsprechend. - Hinweis zur Modell-Abkündigung:
OpenAI wirdchatgpt-4o-latestam 17. Februar 2026 abkündigen. Danach mappen wirchatgpt-4o-latestautomatisch aufgpt-4o-2024-11-20.
2025
15. Dezember
- Neue Funktion: Die Google-API unterstützt jetzt die Files API.
22. September
- Unterstützung für Qwen-Serie, Doubao Seedream 4 und Baidu-Bildgenerierungsmodelle hinzugefügt
10. August
- Aihubmix Image Generation MCP veröffentlicht – erleichtert Entwicklern die Integration von Bildgenerierungsdiensten
1. August
- Nutzen Sie beliebige LLMs auf der AiHubMix-Plattform direkt in Claude Code
29. Juli
- Unterstützung für AI SDK hinzugefügt: Zugriff auf eine Vielzahl von Modellen mit einem einzigen API-Schlüssel
26. Juli
- Unterstützung für die Flux-Bildgenerierungs-API hinzugefügt – hochwertige Bilder in Sekunden
23. Juli
- Unterstützung für Qwen Code hinzugefügt; nutzt alle auf der Aihubmix-Plattform verfügbaren LLMs
4. Juli
- Unterstützung für llms.txt hinzugefügt: Mit einem Klick standardisierte Modellnavigation erhalten, damit Ihr LLM-Assistent das gesamte Modellökosystem schnell versteht
29. Juni
- Forwarding-Unterstützung für Gemini CLI mit mehreren flexiblen Nutzungsmodi
- Code Interpreter und Remote-MCP-Aufrufe zur OpenAI Responses API hinzugefügt
26. Juni
- Vereinheitlichte Image-Generation-API hinzugefügt – unterstützt wichtige Modelle wie OpenAI, Ideogram, Stability und Google Imagen
23. Juni
- APP-Code gestartet – 10 % Rabatt für Entwickler auf alle Modelle
18. Juni
- HTTP-Statuscode-Dokumentation hinzugefügt, um Fehler besser zu verstehen
13. Juni
- Unterstützung für Veo-3.0-Videogenerierung hinzugefügt, um kreative Formate zu erweitern
9. Juni
- Unterstützung für OpenAI Reasoning Summaries in der Responses API hinzugefügt
5. Juni
- Implizites Caching für Gemini hinzugefügt, mit automatischen Cache-Hits und Hit-Rückmeldung
Entwickler könnenusage_metadatanutzen, um Cache-Hits zu erkennen
Kosteneinsparungen sind nicht garantiert und hängen von Anfragestruktur und Nutzungsszenario ab
31. Mai
Vollständige Unterstützung neuer Claude-4-Funktionen- ⏳ Neuer Cache-TTL: 1-Stunden-Cache-Unterstützung Beta
- 🎉 Neue Texteditor-Tools: Claude 4 unterstützt jetzt
text_editor_20250429undstr_replace_based_edit_tool - 🚫 Neuer Refusal-Stop-Reason für sicherheitsbedingte Ablehnungen
- 🧠 Extended Thinking: Claude 4 gibt nun vollständige Zusammenfassungen seines Denkprozesses zurück
- 🔄 Interleaved Thinking: Tool-Nutzung kann jetzt mit Extended Thinking verschränkt werden für natürlichere Konversationen (Beta)
- ⚠️ Veraltete Funktionen:
undo_editwird nicht mehr unterstützttoken-efficient-tools-2025-02-19entfernt (nur Claude 3.7)output-128k-2025-02-19entfernt (nur Claude 3.7)
- 📚 Vollständige Migrationsanleitungen und Codebeispiele wurden aktualisiert, um den Wechsel von Claude 3.7 auf Claude 4 zu erleichtern
22. Mai
- Unterstützung für das Dify-Plugin hinzugefügt, das die nahtlose Integration der Aihubmix-Modelle in Dify ermöglicht
Mehr als 200 Modelle mit einem einzigen API-Schlüssel verwalten
17. Mai
- Unterstützung für
codex-mini-latesthinzugefügt – optimiert für Programmieraufgaben, verfügbar über Responses API oder Codex CLI - Unterstützung für Google Imagen 3.0 Bildgenerierung und Veo 2.0 Videogenerierung hinzugefügt
gemini-2.0-flash-expaktualisiert auf die offizielle Preview-Versiongemini-2.0-flash-preview-image-generation
9. Mai
- Ideogram AI V3-API hinzugefügt – Ideograms fortschrittlichstes Bildgenerierungsmodell
6. Mai
- Utility Management Scripts hinzugefügt: API-Schlüssel verwalten, Konten ansehen und verfügbare Modelle per CLI auflisten
26. April
- Die mit Spannung erwartete OpenAI-Bildgenerierungs-API
gpt-image-1ist live – Text-zu-Bild und Bild-zu-Bild - Native Gemini-API-Unterstützung mit präziser Reasoning-Budget-Steuerung für Flash 2.5 hinzugefügt
24. April
- Drei zentrale Jina-AI-APIs integriert, um leistungsfähige Agents zu bauen: Embeddings, Rerank und DeepSearch
20. April
- Unterstützung für den OpenAI-Responses-API-Endpoint mit erweiterten Tool-Funktionen hinzugefügt
17. April
- OpenAI CodeX CLI-Unterstützung: Programmieren mit natürlicher Sprache direkt im Terminal
12. April
- Durch Anhängen von
:surfingan eine Modell-ID erhält jedes Modell Suchfähigkeiten (Beta)
9. April
- Claude-Prompt-Caching hinzugefügt – bis zu 76 % Kosteneinsparung bei wiederkehrenden Prompts
7. April
- Ideogram-AI-Bildgenerierung hinzugefügt: starkes Text-Rendering, Hybrid-Generierung, lokale Bearbeitung und Upscaling
5. April
- Komplett neues Dokumentationserlebnis veröffentlicht
30. März
- Unterstützung für das Claude-Texteditor-Tool hinzugefügt
24. März
- Brandneues Trident-Logo eingeführt
16. März
- Native Suchunterstützung für OpenAI- und Google-Gemini-Modelle hinzugefügt
- Drittanbieter-Suchintegration folgt in zukünftigen Updates
15. März
- Modelle hinzugefügt:
gpt-4o-mini-search-previewundgpt-4o-search-preview
7. März
- Preise für o1 und o3-mini um 10 % gesenkt – im Einklang mit offiziellen Preisen
6. März
- Aufgrund einer 7-fachen Preiserhöhung von Microsoft stieg auch der Preis von
aihubmix-DeepSeek-R1um das 7-Fache
Empfohlene Alternative: DeepSeek-R1 von Volcano Engine (stabiler und kostengünstiger)
Modelle hinzugefügt:qwen-qwq-32bundqwen2.5-vl-72b-instruct
28. Februar
- 15 % Preisreduzierung bei allen Claude-Modellen
- Modell
gpt-4.5-previewhinzugefügt (extrem teuer – mit Vorsicht verwenden)
26. Februar
- DeepSeek-Stabilität verbessert
- ByteDance-Versionen von DeepSeek sind derzeit am stabilsten
Empfohlene Modelle:DeepSeek-R1undDeepSeek-V3
25. Februar
- Modell
claude-3-7-sonnet-20250219hinzugefügt
24. Februar
- Das gpt-4o-Modell kann aufgrund von Problemen beim Modellanbieter gelegentlich sehr langsam antworten
Empfohlen wird temporär aufgpt-4o-2024-11-20umzustellen - Die Perplexity-API ist temporär offline
Aufgrund von Perplexitys komplexem Abrechnungsmodell und höheren Kosten als die Preisstruktur dieser Plattform wird der Dienst nach Preisanpassungen erneut gestartet - Der temporäre offizielle ByteDance-Rabatt ist beendet, die Preise sind wieder normal
Der Preis vonDeepSeek-R1wurde entsprechend erhöht - Neue Modell-Detailseite mit vollständigen Parameterinformationen hinzugefügt
23. Februar
- Der temporäre offizielle ByteDance-Rabatt ist beendet, die Preise sind wieder normal
Der Preis vonDeepSeek-V3wurde erhöht
Auch das R1-Modell von ByteDance wird voraussichtlich bald wieder normale Preise haben; die Plattform wird die Preise entsprechend anpassen
18. Februar
- Modell hinzugefügt:
kimi-latest
(Offiziell nach Eingabelänge gestaffelt zu 8k, 32k und 128k abgerechnet.
Diese Plattform unterstützt keine gestaffelte Abrechnung und verwendet die mittlere Stufe 32k als Standardpreis.
Wenn Sie preissensibel sind, mit Vorsicht verwenden.) - Layout der Website insgesamt optimiert
- Changelog-Seite in die Nutzungsstatistik-Seite zusammengeführt
- Ankündigungen in die Modell-Marktplatz-Seite verschoben
- Einstellungen in das Benutzeravatar-Menü verschoben
- Preis von
aihubmix-DeepSeek-R1um 50 % gesenkt - Modelle hinzugefügt:
gemini-2.0-pro-exp-02-05-search,gemini-2.0-flash-exp-search
(mit offizieller Online-Suche von Google integriert) - Modelle hinzugefügt:
gemini-2.0-flash,gemini-2.0-pro-exp-02-05,gemini-2.0-flash-lite-preview-02-05 - Modelle hinzugefügt:
o3-mini,o1
(Diese beiden Modelle werden aufgrund begrenzter Account-Ressourcen ca. 10 % teurer als offiziell abgerechnet)
4. Februar
- Das
o1-Modell unterstützt in der offiziellen OpenAI-API denstream-Parameter nicht - Das
o3-mini-Modell unterstützt dentemperature-Parameter nicht
Ein neuer Parameterreasoning_effortist verfügbar mit Werten:"low","medium","high"
Standard ist"medium", wenn nicht angegeben
1. Februar
Funktions-Update:- Unterstützung für OpenAI-Audio-Modell-Eingabe und -Ausgabe hinzugefügt
Der Preview-Serverapi.aihubmix.comist nun verfügbar
Nach einer Woche stabiler Laufzeit wird die Hauptseite aktualisiert
Backend-Abrechnung entspricht vollständig den offiziellen Preisen
Aktuell zeigen Nutzungs-Logs nur Text-Token-Nutzung
Audio-Token-Nutzung wird noch nicht in den Logs angezeigt, beeinträchtigt aber die Nutzung nicht
o3-mini,o1
(ca. 10 % teurer als offiziell, da Account-Verfügbarkeit begrenzt ist)aihubmix-DeepSeek-R1(empfohlen, sehr stabil)qwen-max-0125(Qwen2.5-Max),sonar-reasoningdeepseek-ai/DeepSeek-R1-Zero,deepseek-ai/DeepSeek-R1,deepseek-r1-distill-llama-70baihub-Phi-4Doubao-1.5-pro-256k,Doubao-1.5-pro-32k,Doubao-1.5-lite-32k,Doubao-1.5-vision-pro-32ksonar,sonar-pro(neueste von Perplexity AI)gemini-2.0-flash-thinking-exp-01-21deepseek-reasoner(alias DeepSeek-R1)MiniMax-Text-01codestral-latest(Mistrals neues Code-Modell – Codestral 25.01)
23. Januar
Neue Modelle:aihub-Phi-4Doubao-1.5-pro-256k,Doubao-1.5-pro-32k,Doubao-1.5-lite-32k,Doubao-1.5-vision-pro-32ksonar,sonar-pro(neueste von Perplexity AI)gemini-2.0-flash-thinking-exp-01-21deepseek-reasoner(alias DeepSeek-R1)
19. Januar
- Perplexity-AI-API-Modelle hinzugefügt
Derzeit nur auf dem Preview-Serverapi.aihubmix.comunterstützt
Nach stabilem Test erfolgt das Rollout auf den Hauptserveraihubmix.com api.aihubmix.comist der Preview-Server
Neue Features werden zuerst dort deployed und nach ca. 1 Woche Stabilitätstest auf den Hauptserver übertragen
MiniMax-Text-01codestral-latest(Mistral Codestral 25.01)
6. Januar
gemini-2.0-flash-exp-searchhinzugefügt – unterstützt native Google-Online-Suche
Das offizielle Gemini-2.0-Flash-Modell benötigt zusätzliche Parameter für Online-Suche
Aihubmix hat diese Funktion integriert – hängen Sie einfachsearchan den Modellnamen an- Modell hinzugefügt:
deepseek-ai/DeepSeek-V3
1. Januar
- Neue Modell-Marktplatz-Seite veröffentlicht, ersetzt die alte „Model & Pricing”-Seite
2024
30. Dezember
- Problem behoben, bei dem
gemini-2.0-flash-thinking-exp-1219nur Reasoning, aber keine endgültige Antwort zurückgab - Problem behoben, dass Balance-Erinnerungsmails nicht zugestellt wurden
22. Dezember
- Nutzungsstatistik-Seite hinzugefügt
- Aufladungs-Verlauf-Seite hinzugefügt
- Doubao-Modellserie hinzugefügt:
Doubao-lite-128k,Doubao-lite-32k,Doubao-lite-4k,Doubao-pro-128k,Doubao-pro-256k,Doubao-pro-32k,Doubao-pro-4k - Modell hinzugefügt:
gemini-2.0-flash-thinking-exp-1219 - Modelle hinzugefügt:
gemini-2.0-flash-exp,aihubmix-Mistral-Large-2411,aihubmix-Llama-3-3-70B-Instruct,grok-2-1212,grok-2-vision-1212 - Modelle hinzugefügt:
gemini-exp-1206,llama-3.3-70b-versatile,learnlm-1.5-pro-experimental
14. Dezember
- Modelle hinzugefügt:
gemini-2.0-flash-exp,aihubmix-Mistral-Large-2411,aihubmix-Llama-3-3-70B-Instruct
8. Dezember
- Modelle hinzugefügt:
gemini-exp-1206,llama-3.3-70b-versatile,learnlm-1.5-pro-experimental - Nutzungsstatistik-Seite hinzugefügt
21. November
- Kürzlich hinzugefügte Modelle:
gpt-4o-2024-11-20,step-2-16k,grok-vision-beta - Qwen-2.5-Turbo-Modell mit Millionen-Kontext:
qwen-turbo-2024-11-01
7. November
- Kompatibilität mit dem nativen Claude-SDK ergänzt
Der Endpointv1/messagesist nun verfügbar - Native Claude-Prompt-Caching- und Computer-Use-Funktionen werden noch nicht unterstützt
Diese werden in den nächsten zwei Wochen fertiggestellt
5. November
- Modell hinzugefügt:
claude-3-5-haiku-20241022 - Elon Musks xAI-Neuestes-Modell hinzugefügt:
grok-beta
23. Oktober
- Modell hinzugefügt:
claude-3-5-sonnet-20241022
10. Oktober
- OpenAIs neuestes Caching-Feature ist live
Aktuell unterstützte Modelle:- GPT-4o
- GPT-4o-mini
- o1-preview
- o1-mini
- Hinweis:
gpt-4o-2024-05-13steht nicht auf der offiziell unterstützten Liste - Cache-Hit-Token werden in den Backend-Logs sichtbar, wenn ein Request den Cache trifft
- Vollständige Details und Nutzungsregeln finden Sie in der offiziellen OpenAI-Dokumentation
3. Oktober
- Backend-Abrechnung für
gpt-4owurde an die offiziellen Preise angeglichen - Modelle hinzugefügt:
aihubmix-Llama-3-2-90B-Vision,aihubmix-Llama-3-70B-Instruct - Cohere-neuste Modelle hinzugefügt:
aihubmix-command-r-08-2024,aihubmix-command-r-plus-08-2024
19. September
- Modelle hinzugefügt:
whisper-large-v3unddistil-whisper-large-v3-en - Hinweis: Whisper-Modell-Abrechnung erfolgt nach Eingabe-Sekunden
Die aktuelle Preisanzeige auf der Seite ist falsch und wird korrigiert
Backend-Abrechnung fürwhisper-1entspricht vollständig den offiziellen OpenAI-Preisen
13. September
- Modelle hinzugefügt:
o1-miniundo1-preview
Hinweis: Diese Modelle erfordern aktualisierte Parameter
Manche Client-Oberflächen können Fehler werfen, wenn Standardwerte nicht aktualisiert sind
o1-Modell Folgendes NICHT unterstützt:
system-Feld → 400-Fehlertools-Feld → 400-Fehler- Bildeingabe → 400-Fehler
json_object-Ausgabe → 500-Fehlerstructured-Ausgabe → 400-Fehlerlogprobs-Ausgabe → 403-Fehlerstream-Ausgabe → 400-Fehler
- o1-Serie: 20 RPM, 150.000.000 TPM – extrem niedrig, häufige 429-Fehler möglich
temperature,top_pundnsind auf 1 festgelegtpresence_penaltyundfrequency_penaltysind auf 0 festgelegt
10. September
- Modell hinzugefügt:
mattshumer/Reflection-Llama-3.1-70B
(Berichten zufolge eine der stärksten Feintuning-Varianten von LLaMA 3.1 70B) - Preise der Claude-3-Modelle erhöht
Zur Sicherstellung der stabilen Versorgung sind Aufrufe über diese Plattform aktuell ca. 10 % teurer als die direkte offizielle Nutzung - Erhöhte Concurrency-Kapazität für OpenAI-Modelle
Das System unterstützt theoretisch nahezu unbegrenzte Parallelität
11. August
- Modelle hinzugefügt:
Phi3medium128k,ahm-Phi-3-medium-4k,ahm-Phi-3-small-128k - Stabilität für LLaMA-Modelle verbessert
- Kompatibilität für Claude-Modelle weiter optimiert
7. August
- OpenAIs neu veröffentlichtes
gpt-4o-2024-08-06hinzugefügt
Siehe: https://platform.openai.com/docs/guides/structured-outputs - Googles neuestes Modell hinzugefügt:
gemini-1.5-pro-exp-0801
4. August
- Direkte Online-Zahlung für Aufladungen hinzugefügt
- Claude-Mehrfach-Konversationsformat-Fehler behoben:
messages: roles must alternate between "user" and "assistant", but found multiple "user" roles in a row - Index-Handling bei Function-Calling mit Claude-Modellen optimiert
- Der Backup-Server
https://orisound.cnwird am 7. September vollständig stillgelegt
Bitte migrieren Sie zum Hauptserverhttps://aihubmix.comoder Backup-Serverhttps://api.aihubmix.com
27. Juli
- Unterstützung für Mistral Large 2 hinzugefügt
Modellname:Mistral-large-2407oderaihubmix-Mistral-large-2407 - Systemoptimierungen
24. Juli
- Neueste LLaMA-3.1-Modelle hinzugefügt:
llama-3.1-405b-instruct,llama-3.1-70b-versatile,llama-3.1-8b-instant
20. Juli
- Probleme bei der Preisberechnung für
gpt-4o-minibehoben- Texteingabe-Preis: 1/33 von GPT-4o offiziell
- Bildeingabe-Preis: gleich GPT-4o
- Um mit offiziellen Preisen übereinzustimmen, werden Image-Token-Counts von
gpt-4o-minibei der Abrechnung mit 33 multipliziert - Details siehe offizielle OpenAI-Preise
19. Juli
- Unterstützung für das
gpt-4o-mini-Modell hinzugefügt
Backend-Abrechnung entspricht vollständig den offiziellen Preisen
15. Juli
- Unterstützung für den offiziellen API-Parameter
include_usagehinzugefügt
Damit können Usage-Daten im Stream-Modus zurückgegeben werden
Details siehe offizielle Dokumentation
14. Juli
- Die neue Version von NextWeb unterstützt jetzt das Aufrufen von Nicht-OpenAI-Modellen über diese Plattform
- Backend-Abrechnungsunterstützung für Alibaba-Qwen-Modelle hinzugefügt
Aufrufe über diese Plattform kosten ca. 10 % mehr als direkte Nutzung über Alibaba Cloud - Azure-OpenAI-Ausgabe-Kompatibilität mit der Standard-OpenAI-API verbessert
- Tool-Calling-Unterstützung für Claude-3 hinzugefügt
- Viele neue Modelle hinzugefügt (siehe Einstellungen → Verfügbare Modelle)
3. Juli
- Backend-UI insgesamt optimiert
- Jeder Log-Eintrag zeigt jetzt den Modell-Einheitspreis zum Zeitpunkt der Anfrage
- „Modell & Preis”-Seite hinzugefügt
20. Juni
- Das neueste
claude-3-5-sonnet-20240620wird jetzt unterstützt
Siehe Anleitung für den Aufruf von Nicht-OpenAI-Modellen auf dieser Plattform
18. Juni
- Backend-Logs unterstützen jetzt den Download historischer Request-Datensätze
16. Juni
- Die Wahrscheinlichkeit, Requests zufällig an Azure OpenAI zu routen, wurde deutlich reduziert
13. Juni
- Backend-Kosten für Claude-3-Modelle gesenkt
(Claude 3 Haiku,Claude 3 Sonnet,Claude 3 Opus)
Die Backend-Abrechnung entspricht jetzt den offiziellen Preisen
In Folge entspricht der effektive Retail-API-Preis dieser Seite ca. 86 % der offiziellen Preise
10. Juni
- GPT-4o-Token-Abrechnung optimiert
Tokenizer voncl100k_baseaufo200k_basegeändert
In Folge sind Streaming-Token-Counts für Chinesisch, Koreanisch und Japanisch niedriger als zuvor
8. Juni
- Alibabas neueste Open-Source-Qwen-2-Modelle hinzugefügt:
alibaba/Qwen2-7B-Instructalibaba/Qwen2-57B-A14B-Instructalibaba/Qwen2-72B-Instruct
20. Mai
- Modell hinzugefügt:
gemini-1.5-flash - Modell hinzugefügt:
gpt-4o - Modelle hinzugefügt:
llama3-70b-8192,llama3-8b-8192,gemini-1.5-pro,command-r,command-r-plus - Claude-3-Modell-Versorgung wiederhergestellt
Endpoints sind derzeit über AWS und Google Cloud deployed - Zur Deckung von Infrastruktur- und Betriebskosten ist die Claude-3-Backend-Abrechnung ca. 10 % höher als die offiziellen Preise
Mit steigender Nutzung wird dies schrittweise auf ca. 5 % oder darunter gesenkt - Concurrency-Limits werden derzeit getestet und werden mit steigender Nachfrage erhöht
Zuletzt aktualisiert: 2026-06-22