Skip to main content

2026

2026

28. August

Neue Modelle
  • hy4-preview hinzugefügt: Hy4 Preview von Tencent Hunyuan, ein MoE-Modell mit 770B Gesamtparametern und 49B aktiven Parametern, optimiert für Agent-, Coding- und Produktivitäts-Workflows. Es stärkt Aufgabenverständnis, Planung, Tool-Nutzung und die anhaltende Ausführung bei komplexen mehrstufigen Aufgaben, Software-Engineering, Dokumentenverarbeitung, Informationsanalyse, Büroautomation, Web-Generierung und tool-übergreifender Zusammenarbeit. Es unterstützt ein Kontextfenster von 1 Million Tokens, bis zu 64K Ausgabe, Reasoning, Websuche, Tool-/Function-Calling und strukturierte Ausgaben.

2026

27. August

Neue Modelle
  • qwen3.8-flash hinzugefügt: das Flaggschiff-Vision-Language-Modell von Alibaba Cloud Qwen, ausgelegt auf Coding, Office-Aufgaben, Long-Context-Reasoning und Agent-Workflows. Es unterstützt ein Kontextfenster von 1 Million Tokens, bis zu 128K Ausgabe, Thinking, Webzugriff, Tool-Aufrufe und strukturierte Ausgaben. Im Vergleich zu Qwen3.7-Plus stärkt es Coding- und Office-Fähigkeiten und verbessert zugleich die Trainings- und Inferenzeffizienz.
MCP-Bildtool-Aufrufe sind klarer
  • Das MCP-Tool fuer Bildgenerierung verlangt nun, dass Aufrufer das Modell explizit angeben. So wird vermieden, dass ohne Modellangabe still ein Standardmodell genutzt wird.
  • openai/gpt-image-1 ist die nach aussen angezeigte und weitergeleitete Standard-Modell-ID. Der historische Tippfehler bleibt als reine Eingabe-Kompatibilitaet akzeptiert und wird vor dem Senden normalisiert.

2026

26. August

Neue Modelle
  • glm-5.3-flash hinzugefügt: das hocheffiziente multimodale Modell von Z.AI für Coding Agents, komplexes Reasoning und langfristige Software-Engineering-Aufgaben. Es unterstützt Text-, Bild- und Videoeingaben, rund 1 Million Tokens Kontext, bis zu 128K Ausgabe, Thinking, Tool-Aufrufe und strukturierte Ausgaben. Aufbauend auf dem GLM-Technologiestack mit weiterem Post-Training und Optimierungen legt es besonderen Wert auf Inferenzeffizienz und Reaktionsschnelligkeit.
Neue Funktion
  • Broadcast hinzugefügt: Traces aus AIHubMix API-Anfragen werden ohne zusätzliche Instrumentierung der Anwendung automatisch an LangWatch gesendet. Unterstützt werden Datenschutzmodus, Sampling und API-Key-Filter; Modell, Token-Nutzung, tatsächlich berechnete Kosten, Latenz, Sitzung und Trace-Daten sind in LangWatch verfügbar.
MCP- und Access-Key-Einstiege sind vollstaendiger
  • Der alte Einstieg /mcp/ kann weiter mit der bestehenden Authentifizierung genutzt werden und wird auf die einheitlichen Remote-HTTP-MCP-Funktionen geroutet. Aeltere Clients muessen nicht sofort migrieren und koennen weiterhin Modelle und Preise abfragen, Dokumente suchen, Guthaben pruefen sowie Chat-, Bild- und Video-Tools nutzen.
  • Die Konsole stellt einen schreibgeschuetzten Weg zum Kopieren des Access Key bereit, und externe MCP-Clients koennen den Header X-Aihubmix-Access-Key verwenden. Der Server rotiert den Key nicht und cached diese Antwort nicht.
Bildanfragen mit transparentem Hintergrund sind stabiler
  • gpt-image-2-Anfragen mit transparentem Hintergrund bevorzugen nun OpenAI-native Kanaele, die diese Faehigkeit unterstuetzen, und vermeiden wiederholte Fehler auf nicht kompatiblen Kanaelen. Andere Bildanfragepfade bleiben unveraendert.
Agent-Dateien aktualisieren schneller
  • Modelllisten und Guides fuer AI Agents und externe Tools werden schneller aktualisiert.

2026

25. August

Klarere Migrationsfehler fuer alte Medien-APIs
  • Fuer Medienmodelle, die den alten Protokollzugriff nicht mehr unterstuetzen, geben /v1/images/generations, /v1/images/edits, /v1/models/:organization/:model/predictions und /v1/videos nun protocol_not_supported zurueck, mit Hinweis auf die asynchronen Medien-APIs unter /ai/v1 und die zugehoerige Dokumentation.
  • model=auto behaelt das bestehende automatische Auswahlverhalten bei. Wenn das final gewaehlte Modell den alten Endpoint nicht unterstuetzt, erhalten Aufrufer einen klaren Fehler statt einer stillen Umschaltung auf ein anderes Modell. Playground blendet die alten Eintraege fuer diese Modelle ebenfalls aus, um versehentliche Nutzung zu reduzieren.

2026

24. August

Neue Modelle
  • wan3.0-video hinzugefügt: das Preview-All-in-One-Videomodell von Alibaba Cloud Wan (Tongyi Wanxiang) vereint Text-to-Video-, Image-to-Video-Workflows mit erster/letzter Frame sowie Reference-Video-Workflows und unterstützt bis zu 30 Sekunden bei 30 fps in 480P/720P/1080P für integrierte Generierung und Bearbeitung.
  • wan3.0-video-prime hinzugefügt: eine leistungsangepasste Hochgeschwindigkeitsedition für integrierte Videogenerierungs- und Bearbeitungs-Workflows mit schnellerem End-to-End-Durchlauf.
GPT-5.6 Sol mit Preissenkung
  • gpt-5.6-sol übernimmt die offizielle Preissenkung um 20 % und kostet nun 4 proMillionEingabetokensund20pro Million Eingabetokens und 20 pro Million Ausgabetokens. Bestehende Aufrufwege bleiben unverändert, während komplexes Reasoning, Coding und Long-Context-Workloads günstiger werden.
Aktivierung asynchroner Medienaufgaben ist klarer
  • Wenn ein Konto asynchrone Aufgaben noch nicht aktiviert hat, enthalten Medienerstellungs-APIs im Fehler async_not_enabled jetzt die passende Konsolen-Seite zur Aktivierung. Nutzer von aihubmix, inferera und shkq werden zu ihrer jeweiligen Konsole geführt, wodurch 403-Antworten ohne klaren nächsten Schritt seltener werden.

2026

21. August

Neue Modelle
  • deepseek-v4-flash-0731-fast hinzugefügt: eine Hochgeschwindigkeitsvariante des agentischen Modells von DeepSeek, für Coding, Tool-Nutzung und Agent-Workloads mit hohem Volumen. Es behält die Fähigkeiten von V4 Flash 0731 bei und liefert dabei eine schnellere Inferenz; im Vergleich zu V4 Pro priorisiert es niedrigere Latenz und Ausführungseffizienz. Es unterstützt ein Kontextfenster von 1 Mio. Token, bis zu 384K Ausgabe, Thinking, Tool Calling und strukturierte Ausgaben.
  • deepseek-v4-flash-vision-exp hinzugefügt: DeepSeeks experimentelles multimodales Modell für visuelles Verständnis mit Text- und Bildeingabe sowie Textausgabe. Es eignet sich für Bildbeschreibungen, Screenshot-OCR, Diagrammanalyse und visuell verankerte Agents; seine reinen Textfähigkeiten für Agents, Reasoning und Weltwissen liegen auf dem Niveau der offiziellen DeepSeek V4 Flash-Version.
  • ox-alpha hinzugefügt: ein Stealth-Reasoning-Modell eines anonymen Drittanbieters, dessen tatsächlicher Entwickler und Eigentümer nicht offengelegt wurden. Auf AIHubMix kostenlos verfügbar, unterstützt es Text- und Bildeingabe, Textausgabe und ein Kontextfenster von 1.048.576 Token für Coding, langfristige Softwareentwicklung, dauerhafte agentische Arbeit, komplexes Reasoning und Workflows mit Text und Bild.
Fehlerbehebung bei Bildgenerierung ist stabiler
  • Wenn eine Bildgenerierungsanfrage auf einen temporären Servicefehler trifft, stellt AIHubMix die Anfrage nun konsistenter wieder her. Wenn der Fehler eindeutig eine Fähigkeitsgrenze des gewählten Modells beschreibt, wird weiterhin nicht weiter versucht und ein klarer Grund zurückgegeben. Dadurch sollten direkte Ausfälle durch temporäre Serviceunterschiede bei Modellen wie gpt-image-2 seltener werden.

2026

20. August

Plattform-Ankündigung
  • Neue Integrationsfunktionen für AI Agents sind verfügbar: die agents.md-Integrationsanleitung, maschinenlesbare llms.txt-Dokumente für die Website und für jedes Modell, der Playground Skill (Verteilung über eine feste Adresse) sowie Playground-Deep-Links (?models= öffnet mit einem Link bis zu 6 Modell-Tabs, ?config= lädt eine Konfiguration direkt). Um Spezifikationen und Preise zweier Modelle nebeneinander zu sehen, nutzen Sie die Vergleichsseite https://aihubmix.com/compare/{model_a}/{model_b}. Die Übersicht aller Einstiegspunkte finden Sie unter Agent-Integration.
Parameter und Fehler der Bildgenerierungs-API sind konsistenter
  • Bildgenerierungsanfragen behandeln Größenparameter wie resolution und imageSize konsistenter. Liegt eine Anfrage außerhalb der aktuellen Modellfähigkeit, gibt die API klarere Fehler zurück, damit Aufrufer Parameter schneller korrigieren können.
Der Model Hub unterstützt Hauptmodelle mit Versionen
  • Verwandte Varianten wie GLM 5.2, die Coding-Edition und die Free-Edition können als ein Hauptmodell mit mehreren Versionen dargestellt werden. Browsing, Preisvergleich und Versionsauswahl werden dadurch leichter verständlich.
Asynchrone Bildaufgaben können schneller vorankommen
  • Asynchrone Bildaufgaben können jetzt mit begrenzter Parallelität entsprechend verfügbarer Kapazität verarbeitet werden. In Spitzenzeiten sollten Warteschlangen gleichmäßiger abgebaut und Status sowie Ergebnislieferung stabiler werden.

2026

19. August

Neue Modelle
  • gpt-5.6-sol-disc hinzugefügt: die zeitlich begrenzte Rabattroute von AIHubMix für OpenAIs GPT 5.6 Sol mit bis zu 50 % Rabatt und denselben zugrundeliegenden Fähigkeiten wie das Standardmodell gpt-5.6-sol. Dieses Frontier-Reasoning-Modell eignet sich für komplexes Coding, professionelle Wissensarbeit, Deep Research und langlaufende Agenten und unterstützt Text- und Bildeingabe, einen Kontext von rund 1,05 Mio. Token, bis zu 128K Ausgabe sowie Thinking, Tools und strukturierte Ausgaben.
Mediengenerierungsaufgaben sind zuverlässiger
  • Abschlusszeit, Ergebnisablauf und Artefaktarchivierung sind für Bild- und Videoaufgaben konsistenter. Bei Rolling Releases oder hoher Parallelität treten Verzögerungen, doppelte Verarbeitung und abweichende nutzerseitige Status seltener auf.
  • Die Produktionskapazität für Medien wurde erhöht, und größere Medienantworten haben mehr Spielraum. Lang laufende Aufgaben oder große Artefakte sind dadurch besser verfügbar.

2026

18. August

Die Modelldetails sind vollständiger
  • Die Modelldetails zeigen jetzt release_date an, sodass sich das offizielle Veröffentlichungsdatum leichter von der AIHubMix-Bereitstellungszeit unterscheiden lässt.
Die Gemini-Kompatibilität für Bilder und Uploads ist stabiler
  • Gemini-Bildgenerierung/-bearbeitung und Vertex-Multi-Image-Flows behalten imageSize und zugehörige Bildparameter konsistenter bei, wodurch Größen- oder Protokollabweichungen seltener werden.
  • Gemini-Dateiuploads behalten den ursprünglichen Content-Type, sodass Videos und andere Medien seltener fälschlich klassifiziert werden.
Öffentliche Fehlermeldungen sind verständlicher
  • Nutzerseitige Fehler zu Schema, Enumerationen und Fähigkeiten geben jetzt klarere Meldungen aus, wodurch sich Parameterprobleme leichter eingrenzen lassen.

2026

17. August

Neue Modelle
  • glm-5.3 hinzugefügt: die Produktions-API von Z.AI für das reine Text-Reasoning-Flaggschiffmodell, ausgelegt auf komplexe Softwareentwicklung, langlaufende Agent-Aufgaben und Schwachstellenanalyse. Unterstützt werden ein Kontextfenster von 1 Mio. Token, bis zu 128K Ausgabe und uneingeschränkte Parallelität auf AIHubMix, mit einem zeitlich begrenzten Rabatt von 10 %.

2026

15. August

Neues Modell
  • mai-thinking-1 hinzugefügt: ein Reasoning-Modell der Microsoft-MAI-Serie für Enterprise-Reasoning, Mathematik, allgemeine Intelligenz und Workloads mit hohem Durchsatz. Es unterstützt ein 256K-Token-Kontextfenster, Chat Completions und strukturierte Ausgaben und eignet sich damit für Long-Context-Reasoning, stabile Antwortformate und kostenbewusste Dauerlast.

2026

14. August

Neue Modelle
  • gemini-3.7-flash hinzugefügt: das nativ multimodale Reasoning-Modell von Google für Coding, Agenten, Webentwicklung und Wissensarbeit. Es unterstützt Text-, Bild-, Audio- und Videoeingaben, ein Kontextfenster von 1 Mio. Token, einstellbare Thinking-Stufen, Tool Calls, Websuche und strukturierte Ausgaben und bietet gegenüber Gemini 3.6 Flash ein stärkeres Coding, Tool-Nutzung, mehrstufige Planung und Instruction Following.
  • coding-glm-5.3 hinzugefügt: das Reasoning-Modell von Z.AI für Coding und agentische Workflows, ausgelegt auf komplexe Softwareentwicklung, langlaufende Agenten und Schwachstellenanalyse. Es basiert auf demselben Basismodell wie GLM-5.2 und verbessert durch skaliertes Post-Training Coding, Aufgabenausführung und Token-Effizienz. Diese Route ist eine zeitlich begrenzte Vorschau und ausschließlich für Tests und Evaluierung gedacht; die Dienststabilität wird nicht garantiert und der produktive Einsatz wird nicht empfohlen.
API-Kompatibilität und Task-Zuverlässigkeit
  • Native Gemini-Embedding-Anfragen behalten nun den Kanal bei, dem der von der Gemini Files API zurückgegebene fileUri gehört. Bei embedContent oder batchEmbedContents mit hochgeladenen Dateien werden 403-Fehler durch Kanalinkonsistenzen reduziert; Batch-Anfragen mit Dateien aus mehreren Kanälen geben nun einen klaren 400 zurück.
  • Wenn OpenRouter einen strukturierten Fehler eines Modellanbieters zurückgibt, priorisiert der API-Fehler nun die inneren Felder message, param und type und reduziert lange, schwer auswertbare Meldungen. Fehler einzelner Modellanbieter wirken sich außerdem seltener auf den gesamten OpenRouter-Dienst aus.
  • Polling, terminale Archivierung und Artefaktverarbeitung für asynchrone Medienaufgaben sind zuverlässiger. Langlaufende Bild- und Videoaufgaben werden bei hoher Parallelität, Neustarts oder großen Artefakten seltener doppelt verarbeitet, verlieren seltener den Endstatus und werden seltener verspätet ausgeliefert; öffentliche API-Felder, Statusbegriffe und Abrechnungsformeln bleiben unverändert.

2026

13. August

Neue Modelle
  • grok-4.6 hinzugefügt: das multimodale Flaggschiff-Reasoning-Modell von xAI für Coding, langlaufende Agenten, Wissensarbeit und interaktive Anwendungsentwicklung. Es unterstützt Bildverständnis, ein 500K-Kontextfenster, Tool Calls und strukturierte Ausgaben und bietet gegenüber Grok 4.5 eine stärkere mehrstufige Ausführung, Selbstverifikation, Coding und visuelle Projekterstellung.
  • deepseek-v4-pro-0813 hinzugefügt: das leistungsstarke Allzweck-Reasoning- und Agenten-Modell von DeepSeek für komplexes Reasoning, Coding, Analyse langer Dokumente und agentische Workflows. Es unterstützt Thinking- und Non-Thinking-Modi, ein Kontextfenster von 1 Mio. Token, bis zu 384K Ausgabe, Tool Calls und die Responses API.

2026

12. August

Neue Modelle Genauere Veo-Videodauer
  • Gemini-Veo-Aufgaben behalten die reale Videodauer bei Erstellung, Polling und Ergebnisabruf zuverlässiger bei. Nutzer, die Videos mit eigener Sekundenzahl erzeugen, sollten eine konsistentere Dauer in Aufgabe, heruntergeladener Datei sowie späterer Abrechnung oder Anzeige sehen.
Bessere Kompatibilität für Azure Responses Tool Calls
  • Bei namespace-Tools über Azure Responses führen leere oder fehlende descriptions nicht mehr dazu, dass Azure die Anfrage vor der Modellausführung mit 400 ablehnt. Tool Calls, die über den offiziellen OpenAI-Kanal bereits funktionieren, sollten sich auf Azure-Kanälen konsistenter verhalten.
Vollständigere Daten für Modell- und Anbieterseiten
  • /call/devs unterstützt jetzt ein Website-Feld für Anbieter, sodass Modellaggregations- und Anbieterseiten nach Datenbefüllung einen Official-site-Eintrag anzeigen können. /providers/<slug>-Seiten behalten außerdem das Edge-Cache-Verhalten für stabilere Seitenantworten bei.

2026

11. August

Gemini interactions unterstützt jetzt asynchrone Aufgaben
  • Gemini-interactions-Anfragen können jetzt explizit background: true für asynchrone Aufgaben verwenden und anschließend mit der zurückgegebenen Aufgaben-ID den Status abfragen, abbrechen oder die Aufgabe bereinigen. Länger laufende multimodale/omni-Interaktionen lassen sich einfacher integrieren, ohne eine synchrone Verbindung bis zum Abschluss offen zu halten.
  • Asynchrone Aufgaben werden nach realer Nutzung abgerechnet; Token-Spalten, vollständige Freigabe bei Abbruch und Schutz für große Antworten sind ergänzt. Nutzungsprotokolle, Vorab-Abzug und finale Gebühren in der Konsole bleiben konsistenter.
Bessere Claude-Messages-Kompatibilität für thinking
  • Wenn das Messages-Protokoll OpenAI-kompatible Modellanbieter aufruft, bleiben zurückgegebene thinking/reasoning-Inhalte erhalten und können in späteren Runden wieder mitgesendet werden. Anwendungen mit Claude SDKs, mehrstufigen Tool-Flows oder DeepSeek thinking mode sollten seltener leere Antworten, 400-Fehler oder verlorenen Reasoning-Kontext sehen.
  • Unsigned thinking-Blöcke werden beim Wechsel auf native Claude-Kanäle kompatibler behandelt, wodurch Formatfehler in Multi-Modell-Fallbacks oder Bridge-Flows reduziert werden.
Bessere Kompatibilität für Doubao-Video-Prompts und Referenzen
  • Beim Aufruf von Doubao-Videomodellen können prompt und Referenzmedien in extra_body.content jetzt gemeinsam wirken; Anfragen mit nur Medieninhalt behalten sowohl den Prompt als auch die Reihenfolge der Medien.
  • Erstellungsantworten spiegeln Größe und Prompt nun näher an den tatsächlich gesendeten Inhalten wider und ignorieren weiterhin nicht unterstützte native Felder. Dadurch gibt es weniger Videogenerierungsfehler durch zusätzliche SDK-Parameter.

2026

10. August

Vollständigere kumulierte Nutzung für Mediengenerierung
  • Nach der Abrechnung einer Mediengenerierungsaufgabe wird auch die kumulierte Nutzung auf Kontoebene aktualisiert. In der Konsole bilden kumulierte Nutzung, Saldoabzug und Verbrauchsprotokolle den realen Medienverbrauch vollständiger ab.
Bessere Kompatibilität für Azure-Modellnamen
  • Beim Aufruf von Azure-Modellen mit Punkten im deployment/model-Namen bleibt der Modellname auf den Konvertierungspfaden Chat, Responses und Messages unverändert erhalten und wird nicht mehr automatisch umgeschrieben. Das Verhalten bestehender Azure-Aufrufe bleibt unverändert.

2026

8. August

Neues Modell zur Videogenerierung
  • doubao-seedance-2-5-260628 hinzugefügt: ByteDance Seeds vereintes multimodales Audio-Video-Generierungsmodell der nächsten Generation. Es erzeugt in einem Durchgang bis zu 30 Sekunden synchronisierten Audio- und Videoinhalt, unterstützt mehrrundige Verlängerungen und verbessert Storytelling, Übergänge, Referenzunterstützung, Realismus und präzise Bearbeitung für Filmproduktion, Werbung, Bildung, Simulation und langformatige Inhalte.

2026

6. August

Neue Modelle
  • wan3.0-video hinzugefügt: All-in-One-Modell für Videogenerierung und -bearbeitung von Alibabas Tongyi Lab, derzeit in der öffentlichen Beta. Es unterstützt native Videos von bis zu 30 Sekunden, produktionsreife Charakter-Konsistenz, realistische Bild- und Tonqualität sowie vereinheitlichte Workflows für Referenz, Bearbeitung, Replikation und Motion-Driving. Geeignet für Werbung, E-Commerce, Filmproduktion, Animation, Videoschnitt und Dokument-zu-Video.
  • qwen-image-3.0 hinzugefügt: Modell für Bildgenerierung und -bearbeitung vom Qwen-Team von Alibaba Cloud, mit Unterstützung für Text-zu-Bild, referenzbildbasierte Erstellung und Bildbearbeitung. Es hält Bildqualität und Geschwindigkeit im Gleichgewicht und eignet sich für Social Media, E-Commerce, Kreativdesign, alltägliche Content-Produktion und häufige Erstellung in großem Umfang.
  • qwen-image-3.0-pro hinzugefügt: Alibaba Clouds Qwen-Flaggschiff für Bildgenerierung und -bearbeitung, ausgelegt für Werbung, Brand-Visuals, UI, Präsentationen, Produktbilder und professionelles Design. Es überzeugt bei komplexen Layouts, präziser chinesischer und englischer Text-Darstellung, realistischen Materialien, referenzbasierter Bearbeitung, Detailtiefe, Komposition und einer visuellen Qualität auf Commercial-Grade-Niveau.

2026

4. August

Gemini embedding unterstützt multimodale Eingaben und Abrechnung nach Modalität
  • gemini-embedding-2-preview kann jetzt Text-, Bild-, Audio-, Video- und Dokumenteingaben sowohl über den OpenAI-kompatiblen Embeddings-Endpunkt als auch über den nativen Gemini-Pfad verarbeiten. Nutzer mit multimodaler Suche, Content-Verständnis oder Knowledge-Base-Workflows können mehr Eingabetypen mit demselben Modell nutzen.
  • Die Gemini-embedding-Abrechnung priorisiert nun die vom Modellanbieter zurückgegebenen Token-Werte je Modalität. Bilder, Audio, Video und Dokumente werden nicht mehr als einheitliche Textschätzung behandelt, sodass multimodale embedding-Rechnungen näher am tatsächlichen Verbrauch liegen.
  • Embedding-Anfragen mit einer einzelnen Eingabe können den neueren Gemini-embedding-Pfad direkt verwenden. Batch-Anfragen mit mehreren Inputs erhalten nun eine klare Meldung zur nicht passenden Fähigkeit.
Zuverlässigere Seedance 2.0 Video-Generierungsaufrufe
  • Seedance 2.0 Referenzen für Bilder, Audio und Video werden genauer nach Medientyp zugeordnet; die Vorgaben für adaptive, 4K und Größenoptionen sind klarer. Video-Workflows sehen weniger Fehler durch falsche Parameterzuordnung.
  • Anfragen mit adaptiver Dauer werden zunächst mit 15 Sekunden vorbelastet und nach Abschluss der Aufgabe anhand der realen Dauer abgerechnet. Vorabzug und finale Rechnung bleiben dadurch konsistenter.
  • Bei Fehlern in der Mediengenerierung geben die APIs bereinigte Fehlerdetails zurück, damit Nutzer und Support Parameter-, signierte-URL- oder Modellanbieter-Limit-Probleme diagnostizieren können, ohne sensible Zugangsdaten offenzulegen.

3. August

Neue Modelle
  • qwen3.8-max hinzugefügt: Alibaba Clouds natives Flaggschiff-Vision-Language-Modell, basierend auf einer Mixture-of-Experts (MoE)-Architektur mit 2,4 Billionen Parametern und Kontextfenstern von bis zu 1 Million Tokens. Es eignet sich für komplexes multimodales Verständnis, fortgeschrittenes Reasoning, Softwareentwicklung, Agent-Workflows und Long-Context-Verarbeitung. Zu einem ähnlichen Preis wie Qwen3.7-Max liefert Qwen3.8-Max deutliche Verbesserungen bei Reasoning, Coding und Agent-Fähigkeiten, mit einer Gesamtleistung auf dem Niveau der aktuell führenden Modelle.
Klarere Anbieter-Verfuegbarkeit in Modelldetails
  • Modelldetails zeigen Anbieter, die fuer aktuelle Anfragen besser geeignet sind, weiter oben. Anbieter, die nur als Reserve dienen oder voruebergehend nicht verfuegbar sind, erscheinen weiter hinten. Nutzer und Support-Teams sehen bei der Auswahl eines Anbieters oder bei Verfuegbarkeitspruefungen schneller, welche Anbieter aktuell die bessere Wahl sind, und vermeiden Entscheidungen auf Basis veralteter Reihenfolgen.

2. August

Genauere Abrechnung und Nutzungslogs fuer kleine Anfragen
  • Kleine Anfragen bei by-bill-Modellen verschwinden nicht mehr aus Abrechnung und Nutzungslogs, wenn der berechnete Betrag zuvor auf null abgerundet wurde. Betroffene Anfragen werden nun mit dem minimal wirksamen Quota erfasst, sodass Rechnung, Guthaben-Vorabpruefung und Nutzungsprotokolle konsistent bleiben; Support und Operations sehen vollstaendigere Daten fuer hochfrequente Embedding-aehnliche Nutzung.

31. Juli

Neue Modelle
  • deepseek-v4-flash hinzugefügt: ein auf Effizienz optimiertes Mixture-of-Experts-Modell mit insgesamt 284B Parametern, 13B aktiven Parametern und einem Kontextfenster von 1 Mio. Tokens. Es ist auf schnelle Inferenz und Workloads mit hohem Durchsatz ausgelegt und behält dabei starke Reasoning- und Coding-Leistung, was es für Coding-Assistenten, Chat-Systeme und Agent-Workflows geeignet macht.
Neues Videogenerierungsmodell
  • minimax-h3 hinzugefuegt: MiniMax’ allgemeines multimodales Videomodell. Es akzeptiert Text-, Bild-, Audio- und Videoeingaben und unterstuetzt Text-zu-Video, Bild-zu-Video, First/Last-Frame-Generierung, referenzbasierte Generierung und Videobearbeitung. Nutzer mit Workflows fuer Videocreation, Werbemittel, Produktdemos oder multimodale Inhalte koennen es ueber die einheitliche AIHubMix API aufrufen.
Zeitlich begrenztes GLM-5.2 Angebot nach Tageszeit
  • glm-5.2 wird nach taeglichem Zeitfenster rabattiert, in UTC: 50 % Rabatt von 14:00 bis 24:00 Uhr und 30 % Rabatt von 00:00 bis 14:00 Uhr taeglich. Zeitlich begrenztes Angebot.
GPT-5.6 Luna/Terra Preisreduzierungen
  • gpt-5.6-luna uebernimmt die offizielle Preissenkung um 80 % und kostet jetzt 0.20Eingabeund0.20 Eingabe und 1.20 Ausgabe; gpt-5.6-terra uebernimmt die offizielle Preissenkung um 20 % und kostet jetzt 2.00Eingabeund2.00 Eingabe und 12.00 Ausgabe. Nutzer mit stabilem Traffic auf diesen Modellen koennen ihre Modellauswahl fuer kostenkritische und allgemeine Workloads neu bewerten.

30. Juli

Offizieller AIHubMix MCP Server verfuegbar
  • Der offizielle gehostete MCP-Endpunkt mcp.aihubmix.com/mcp oder mcp.inferera.com/mcp ist fuer MCP-faehige Clients verfuegbar. Entwickler koennen damit aus Tools wie Claude Code, Codex und Cursor Modelle und Preise abfragen, Dokumentation durchsuchen, Guthaben pruefen und Chat-, Bildgenerierungs- sowie Videogenerierungs-Tools aufrufen.
  • MCP-Zugangsdaten werden pro Anfrage vom Client uebergeben und nicht serverseitig gespeichert. Das ist fuer Entwickler gedacht, die AIHubMix-Modelle und Medienfunktionen direkt in IDEs oder Agent-Tools nutzen moechten.

29. Juli

Neues Modell
  • jina-reranker-v3.5 hinzugefuegt: Jina AIs multilingualer listwise Dokument-Reranker mit 0,6B Parametern und gleichem Schema als Upgrade von jina-reranker-v3. Er eignet sich fuer RAG, Suche und Ranking strukturierter Daten, unterstuetzt Long-Context-Kandidatenranking und verbessert Domain-Robustheit, multilinguale Suche, strukturiertes Ranking und Inferenz-Effizienz.

28. Juli

Genauere Cache-Abrechnung
  • Fuer explizite und implizite Cache-Anfragen erkennt AIHubMix Cache-Lese- und Schreibnutzung jetzt konsistenter und priorisiert den vom Upstream-Anbieter zurueckgegebenen Cache-Typ. Nutzer von cachefaehigen Modellen wie Qwen und Claude sollten Abrechnungsdetails sehen, die naeher an der tatsaechlichen Nutzung liegen.
Zuverlaessigere Mediengenerierung und Task-Ergebnisse
  • Die erste Modellliste fuer Mediengenerierung wurde auf verifizierte Modelle eingegrenzt, und ein Problem mit moeglichen 404-Antworten bei einigen Bildmodell-Aufrufen ueber den Medien-Endpunkt wurde behoben. Console-Downloads fuer LLM-Tasks decken nun auch Textarchive ab, sodass grosse historische Ergebnisse leichter abrufbar sind.
Aktuellere Website- und Modelldaten
  • Das Cache-Verhalten fuer Website, Modelldaten, Blogdaten und Sitemaps wurde angepasst, damit Releases verlaesslicher wirksam werden. Modellseiten und Dokumentationseinstiege werden nach Updates seltener durch alte Cache-Daten beeinflusst.

27. Juli

Mediengenerierungs-APIs sind verfuegbar
  • /ai/v1/images/generations und /ai/v1/images/edits wurden mit einheitlichen asynchronen Tasks, Ergebnisabfragen, Artefakt-Downloads und Webhook-Callbacks ergaenzt. Bild- und Video-Workflows koennen nun ueber denselben Task-Lifecycle integriert werden, wodurch langlaufende Generierungsergebnisse leichter nachverfolgbar sind.
  • Generierte Artefakte werden ueber AIHubMix-Task-Ergebnisse zurueckgegeben und unterstuetzen begrenzte Downloads sowie Bulk-Abrufe. Kundenteams sollten fruehes Feedback zu Task-Status, Download-Link-Gueltigkeit und Abrechnungsdetails beobachten.

25. Juli

Neue Modelle
  • claude-opus-5 hinzugefügt: Anthropics Flaggschiff-Modell für anspruchsvolles Reasoning, Coding und langlaufende Agent-Aufgaben. Es überzeugt bei End-to-End-Softwareaufgaben, Code Review und Bugsuche, Diagramm- und Dokumentenanalyse, komplexen Office-Deliverables sowie der Koordination paralleler Sub-Agents, mit 1M Context Window und bis zu 128K Output.

24. Juli

Neue Modelle
  • mai-image-2.5-pro hinzugefügt: Microsofts Flaggschiff-Modell für Bildgenerierung und -bearbeitung, mit hochauflösendem Realismus, präzisem Text-Rendering im Bild und leistungsstarker Bearbeitung für Commercial Design, Produktfotografie und professionelle Kreativ-Workflows.
  • qwen-audio-3.0-tts-flash hinzugefügt: Qwens Echtzeit-Sprachsynthesemodell mit erweiterter Unterstützung für ressourcenarme Sprachen und chinesische Dialekte, ausdrucksstarker Stimmsteuerung und First-Packet-Latenz unter 200 ms, geeignet für Sprachassistenten, Echtzeit-Dialoge und intelligenten Kundenservice.
  • qwen-audio-3.0-tts-plus hinzugefügt: Qwens Premium-Sprachsynthesemodell mit feinerer Kontrolle über Emotion, Tonfall, Charakter, Sprechtempo, Lautstärke und Stil, ausgelegt für Content-Erstellung, Hörbücher, Film-/TV-Synchronisation, Brand-Voices und weitere hochwertige Sprach-Workflows.
Qwen TTS-Audiogenerierungsfunktionen
  • Beide Qwen TTS Modelle koennen ueber /v1/audio/speech aufgerufen werden; nicht-streamende Anfragen liefern eine Audio-Ergebnis-URL, streamende Anfragen liefern SSE-Ereignisse zur Audiogenerierung. Die folgende Tabelle kombiniert AIHubMix-kompatible Felder mit der offiziellen Qwen-Audio-TTS-Dokumentation von Alibaba Cloud; voice muss pro Modell gewaehlt werden, plus- und flash-Systemstimmen sind nicht austauschbar.
Bessere Messages-Antwortkompatibilitaet
  • /v1/messages-Antworten von gebridgten Modellen und Claude-kompatiblen Diensten wie Bedrock entsprechen dem Anthropic-Messages-Oekosystem jetzt genauer, wodurch strikte SDKs oder Schema-Validatoren seltener wegen fehlender Antwortfelder fehlschlagen.
Vollstaendigere Nutzungserfassung nach AWS-Bedrock-Stream-Abbruechen
  • Wenn ein Client eine AWS-Bedrock-Streaming-Anfrage abbricht, sammelt AIHubMix weiterhin das Endsignal des Modellanbieters und die finale Usage ein. Dadurch gibt es in Abbruchfaellen weniger Abweichungen zwischen Request-Logs, Abrechnungsdetails und Nutzung des Modellanbieters.

23. Juli

Neue Modelle
  • qwen3-coder-480b-a35b-instruct hinzugefuegt: Qwen3-Coder-Flaggschiffmodell fuer Codegenerierung, Software-Engineering-Agents und Tool-Calling-Workflows, geeignet fuer Long-Context-Codeverstaendnis und automatisierte Entwicklungsaufgaben.
  • gemini-2.5-flash-lite hinzugefuegt: leichtes Gemini-2.5-Modell fuer latenzarme, guenstigere Text-, Multimodal- und Batch-Workloads mit hoher Frequenz.
  • Qwen/Qwen3-235B-A22B-Instruct-2507 hinzugefuegt: Qwen3 235B-A22B Instruct 2507 fuer allgemeinen Chat, Befolgung von Anweisungen, mehrsprachige Arbeit und Long-Context-Aufgaben.

22. Juli

Neue Modelle
  • gemini-3.6-flash hinzugefuegt: Googles neuestes Flash-Modell fuer komplexe Workflows, Computer Use, Chart Reasoning und Long-Context-Aufgaben.
  • gemini-3.5-flash-lite hinzugefuegt: ein leichteres und guenstigeres Gemini-3.5-Modell fuer hohen Durchsatz, Alltagsautomatisierung und Batch-Verarbeitung.
  • glm-5.2-fast-preview hinzugefügt: schnelles Preview-Modell der Zhipu-GLM-5.2-Serie für latenzarme Chats, schnelles Reasoning und Anwendungen mit hohem Durchsatz.
Zuverlaessigeres Qwen-3.8-Streaming
  • Streaming-Aufrufe an qwen3.8-max-preview ueber /v1/responses und /v1/messages sind zuverlaessiger. Gueltige Streams, die zuvor als empty_stream oder 502 erscheinen konnten, koennen jetzt normal abgeschlossen werden.

21. Juli

Gemini-Bildparameter werden durchgereicht
  • Bei Aufrufen von Gemini- oder Vertex-Bildausgabemodellen ueber die OpenAI-kompatible Chat-Completions-API koennen Clients jetzt aspectRatio und imageSize in extra_body.generationConfig.imageConfig uebergeben.
Genauere Abrechnung fuer Gemini Embeddings
  • Wenn Gemini-Embedding-Antworten echte usageMetadata enthalten, rechnet AIHubMix zuerst nach dem vom Modellanbieter gelieferten Tokenverbrauch ab; fehlt diese Angabe, bleibt die bisherige lokale Schaetzung als Fallback erhalten.
Bessere Responses-Kompatibilitaet fuer dynamische Tools
  • /v1/responses-Anfragen koennen jetzt message-local function tools in system/developer-Nachrichten enthalten; diese Tool-Deklarationen bleiben beim Bridging zu Chat-Modellen erhalten. Clients mit dynamischen Tool-Workflows, etwa fuer Kimi K3, erhalten stabilere Tool-Aufrufe.
Responses-stop-Parameter korrigiert
  • Fuer /v1/responses-Aufrufe, die zu Chat-Modellen gebridgt werden, wird stop jetzt an den Modellanbieter weitergegeben. Eine einzelne Stop-Sequenz wirkt normal; mehr oder laengere Stops, als der Modellanbieter zulaesst, liefern Grenzfehler, die mit Chat Completions konsistent sind.
DeepSeek V4 unterstuetzt zeitbasierte Abrechnung
  • DeepSeek-V4-Modelle koennen jetzt konfigurierte Peak/Off-Peak-Abrechnung unterstuetzen. Pre-Deduction und finale Abrechnung verwenden denselben Zeitpunkt der Request-Einreichung, sodass Streaming-Requests ueber Zeitgrenzen hinweg nach dem Startzeitpunkt berechnet werden. Der Pre-Deduction-Schutz greift nur fuer Modelle mit zeitbasierter Abrechnung und veraendert das eingefrorene Guthaben normaler Modelle nicht.

20. Juli

Claude-Messages-thinking-Kompatibilitaet
  • Wenn /v1/messages-Anfragen an OpenAI- oder Azure-Chat-Modelle ueberbrueckt werden, werden Claude-thinking-Einstellungen nun in ein vom Modellanbieter unterstuetztes Reasoning Effort umgesetzt. Das reduziert 400-Fehler bei Requests mit thinking. Native Claude-thinking-Anfragen wie Opus 4.8 bleiben kompatibel.
Stabilere lange Streaming-Anfragen
  • Das Stream-Limit des Produktions-Gateways wurde von 1 Stunde auf 2 Stunden erhoeht. Lang laufende Reasoning- und Generierungsaufgaben wie Kimi K3 werden waehrend des Denkens oder Generierens seltener vorzeitig getrennt.

19. Juli

Neue Modelle
  • Neu: qwen3.8-max-preview:
    Zeitlich begrenztes Angebot: Qwen3.8-Max-Preview wird mit nur 10 % des Standardpreises abgerechnet – das entspricht der 10-fachen Nutzung. Nur für begrenzte Zeit, wer zuerst kommt, profitiert zuerst.
    Qwen3.8-Max-Preview ist das Foundation-Modell der neuesten Generation der Qwen-Familie mit 2,4 Billionen (2.4T) Parametern – und es entwickelt sich stetig weiter. Im Vergleich zum bisherigen Flaggschiff Qwen3.7-Max bietet es deutliche Fortschritte bei Kernfähigkeiten wie Coding und Cowork (professionelle Büroarbeit) und zeigt weltweit führende Gesamtleistung bei komplexen Langzeitaufgaben wie Full-Stack-Entwicklung, Datenanalyse und Office-Workflows.

17. Juli

Neue Modelle
  • Neu hinzugefuegt: kimi-k3. Kimi K3 ist Moonshot AIs offenes Long-Context-Modell der 3T-Klasse mit 2,8T Parametern, einem Kontextfenster von 1M Tokens und nativer Unterstuetzung fuer visuelle Eingaben. Es eignet sich fuer langlaufendes Coding, Wissensarbeit, komplexes Reasoning und multimodales Verstehen. Siehe Kimi K3 Praxis-Guide (Beispiele für die drei APIs und Support-Matrix).
  • Neu hinzugefuegt: hy-3d-3.1. Tencent Hunyuan 3D Professional unterstuetzt Text-zu-3D, Bild-zu-3D und Multi-View-3D-Generierung. Es eignet sich fuer Game Assets, E-Commerce-Praesentationen, 3D-Druck und Produktdesign; Version 3.1 verbessert Geometrie- und Texturqualitaet und unterstuetzt Acht-Ansichten-Eingaben.
3D-Generierungs-API verfuegbar
  • Die asynchrone API /v1/3d/generations ist verfuegbar und startet mit Tencent TokenHub Hunyuan 3D. Sie unterstuetzt das Einreichen von Generierungsaufgaben und das Abfragen von Ergebnissen, um 3D-Asset-Erstellung einfacher in automatisierte Workflows einzubinden.
Kimi-K3-Kompatibilitaet fuer dynamische Tools
  • Dynamisch geladene Tools auf Message-Ebene in Kimi-K3-Anfragen bleiben erhalten und werden weitergeleitet. Dadurch werden 400-Fehler des Modellanbieters durch verlorene Tool-Deklarationen vermieden, und Clients mit Kimi Dynamic Tool Loading sind kompatibler.
Klarere Request-Konvertierungsfehler
  • Die Kompatibilitaet fuer Chat-Completions-Custom-Tools, Cohere-Textblöcke und Anfragen mit assistant.content: null wurde verbessert. Gueltige Anfragen erreichen den Modellanbieter stabiler; fehlerhafte oder nicht unterstuetzte Eingaben liefern strukturierte Fehler statt leerer HTTP-200-Erfolge.
Aktualisierte Seedream-Bildabrechnung
  • Die Bildgenerierung mit doubao-seedream-5-0-pro unterstuetzt nun Abrechnung nach Ausgabepixel-Stufe und Anzahl der Eingabebilder, sodass Text-zu-Bild- und Bild-zu-Bild-Anfragen naeher an den tatsaechlichen Generierungsspezifikationen berechnet werden.

15. Juli

Verbesserte Kompatibilitaet fuer Gemini-Tool-Aufrufe
  • Bei Gemini- oder Vertex-Aufrufen ueber die OpenAI-kompatible API fuehren leere String-Werte in Enum-Definitionen von Tools oder strukturierten Ausgabeschemas nicht mehr zu einem 400-Fehler bei der Pruefung durch den Modellanbieter. Tool-Aufrufe und JSON-Schema-Workflows sind dadurch zuverlaessiger.

14. Juli

Neue Audiomodelle
  • Neu: gpt-audio-1.5, OpenAIs erstes allgemein verfuegbares Audiomodell. Es akzeptiert Audioeingaben und -ausgaben und kann ueber die Chat Completions REST API genutzt werden, etwa fuer Sprachdialoge, Audioverstaendnis und Audiogenerierung.
  • Neu: gpt-4o-transcribe-diarize, ein ASR-Modell mit integrierter Sprecherdiarisierung, das Audiosegmente den verschiedenen Sprechern einer Unterhaltung zuordnet. Dieses Modell ist nur in der Transcription API verfuegbar.
LLM-Router-Einfuehrungsseite ist online

13. Juli

Konsistentere API-Fehlerantworten
  • Wenn /v1/responses mit einem unbekannten Modell aufgerufen wird, gibt die API jetzt HTTP 400 zurueck, passend zu anderen API-Einstiegen. Clients koennen den Fall damit als „kein verfuegbarer Service“ behandeln statt als 500.
Validierungsfehler werden frueher zurueckgegeben
  • Schlaegt die Umwandlung des Request-Bodys oder die Parameterpruefung fehl, gibt die API direkt die passende 400/Fehlerantwort zurueck, anstatt den Originalrequest an den Modellanbieter weiterzuleiten. Das reduziert ungueltige Aufrufe und schwer verstaendliche Fehler.
Stabilere Cache-Hits fuer Claude Code
  • Claude-Code-Aufrufe von Claude ueber Bedrock haben jetzt stabilere Prompt-Cache-Hits innerhalb derselben Sitzung. Das kann doppelte Cache-Write-Kosten sowie First-Token-Latenz senken.
Praezisere Gemini-Mehrfachrunden und Cache-Bindung
  • Gemini-Anfragen bleiben nur dann beim selben Service, wenn die Antwort tatsaechlich Thinking-Signaturen oder Cache-Aktivitaet enthaelt. Das reduziert Signatur- oder Cache-State-Abweichungen in Mehrfachrunden, waehrend zustandslose Bildgenerierungsjobs nicht unnoetig festgelegt werden.

10. Juli

Neue Modelle
  • gpt-5.6-sol, gpt-5.6-terra und gpt-5.6-luna aus der GPT-5.6-Serie wurden hinzugefügt (offiziell von OpenAI am 09.07.2026 veröffentlicht). Alle drei Stufen bieten ein Kontextfenster von 1.050.000 Token, maximal 128K Output und Wissensstand 2026-02-16, unterstützen Text- und Bildeingaben und sind über Chat Completions, Responses sowie die Claude-kompatible Messages-Schnittstelle aufrufbar. Sol ist das Flaggschiff für komplexe professionelle Arbeit und laut OpenAI das derzeit beste Coding-Modell; Terra erreicht die Leistung von GPT-5.5 zum halben Preis; Luna ist für kostensensible Szenarien ausgelegt.
GPT-Prompt-Caching-Dokumentation verfügbar
  • Neue Dokumentation GPT Prompt Caching: Ab der GPT-5.6-Serie werden Cache-Writes mit dem 1,25-Fachen des Inputpreises abgerechnet, Cache-Reads mit dem 0,1-Fachen, und der Cache bleibt mindestens 30 Minuten erhalten. Die Seite behandelt die Parameter prompt_cache_key und explizite Cache-Breakpoints, die Abrechnungslogik, API-Beispiele und die Fehlersuche bei Cache-Misses. Die OpenAI-Caching-Angaben in Prompt Caching und Claude Prompt Caching wurden entsprechend aktualisiert.
Claude Fable/Mythos Thinking-Kompatibilitaet
  • Anfragen an Claude Fable und Mythos mit reasoning_effort verwenden jetzt adaptive thinking. Das reduziert 400-Fehler des Modellanbieters fuer diese Modellfamilien, ohne dass Clients Parameter aendern muessen.
Stop-Sequences fuer Claude und Gemini
  • OpenAI-kompatible stop-Einstellungen werden nun auf native Claude- und Gemini-Anfragen abgebildet. Fuer Claude ungueltige leere Stop-Sequenzen werden gefiltert, waehrend OpenAI- und Gemini-Limits pro Anbieter behandelt werden.
Token-Limit-Kompatibilitaet fuer gpt-chat-latest
  • gpt-chat-latest und kuenftige GPT/ChatGPT-latest-Aliasse behalten max_completion_tokens bei, wenn erforderlich. Dadurch sinken 400-Fehler durch das aeltere Feld max_tokens.
Klarere Meldung bei erschoepftem Key-Limit
  • Wenn ein Nutzungslimit auf Key-Ebene erschoepft ist, gibt die API jetzt eine klarere Anleitung zum Anpassen und Reaktivieren des Key-Limits zurueck statt nur eines technischen Quota-Fehlers.
Tool-Call-Antwortformat an OpenAI angeglichen
  • Nicht-streamende Chat-Antworten mit tool_calls und ohne Text liefern nun explizit content: null, was die Kompatibilitaet mit OpenAI-aehnlichen SDKs und Parsern verbessert.

9. Juli

Reparatur strukturierter Ausgaben: automatische Reparatur fehlerhafter JSON-Formate
  • Neue Fähigkeit Reparatur strukturierter Ausgaben auf Key-Ebene, standardmäßig deaktiviert. Ist sie aktiviert, repariert das Gateway bei nicht-streamenden Anfragen, die eine strukturierte JSON-Ausgabe deklarieren, ein vom Modell zurückgegebenes JSON mit Formatfehlern wie Abschneidung, nachgestelltem Komma oder Codeblock-Umschließung vor der Rückgabe automatisch zu parsbarem, gültigem JSON; die Zahlenwerte bleiben unverändert und der Client muss nicht angepasst werden. Unterstützt die vier Protokolle Chat Completions, Responses, Claude und Gemini; bei einer Reparatur enthält die Antwort den Response-Header X-JSON-Repaired: true.
Claude-Prompt-Caching-Dokumentation: Mindest-Token-Schwellen je Modell ergänzt
  • Die Dokumentation Claude Prompt Caching und Prompt Caching wurde um die modellabhängigen Mindestschwellen für cachebare Token (512 / 1.024 / 2.048 / 4.096) ergänzt, inklusive aktueller Modelle wie Claude Opus 4.8, Opus 4.7 und Fable 5. Die Schwelle ist nicht proportional zur Modellversion; ein Präfix unterhalb der Schwelle wird auch mit cache_control nicht zwischengespeichert.
Nutzungsdashboard und Abrechnungsdetails besser abgeglichen
  • Die Aggregation im Nutzungsdashboard liegt nun naeher an den Request-Log-Abrechnungsdaten, da gleichzeitige Aggregationsverluste reduziert und Stunden-Buckets fuer verzoegerte Replays vereinheitlicht wurden. Historische Dashboard-Werte koennen weiterhin leicht abweichen; fuer Abrechnung und Abgleich bleiben Request-Logs die Quelle der Wahrheit.
Neues Modell
  • grok-4.5 wurde hinzugefuegt, ein Modell fuer Coding, agentische Aufgaben und Wissensarbeit, mit konfigurierbarem Reasoning, Tool Calling und 500K-Kontextfenster. Geeignet fuer Code-Reparatur, komplexe Engineering-Aufgaben, Wissens-QA und Agent-Workflows.

8. Juli

gpt-5.5+-Tool-Aufrufe werden automatisch zu Responses gebrueckt
  • Bei Nutzung des OpenAI-kompatiblen Endpunkts /v1/chat/completions mit gpt-5.5 oder neueren Modellen verwenden Anfragen mit Tools und reasoning_effort nun automatisch Responses-Faehigkeiten. Das reduziert 400-Fehler des Modellanbieters fuer diese Parameterkombination, ohne dass Clients auf /v1/responses migrieren muessen. Siehe: Responses API

7. Juli

Strukturierte Ausgaben protokolluebergreifend kompatibler
  • OpenAI-kompatibles response_format und Claude-natives output_config.format werden nun auf den relevanten Pfaden angepasst. Clients koennen beim Wechsel zwischen OpenAI- und Claude-aehnlichen Protokollen strukturierte Ausgabevorgaben verlaesslicher beibehalten. Siehe: Structured Output.
Stabilere /v1/messages-Aufrufe ueber Vertex AI
  • Bei Gemini und anderen Nicht-Claude-Modellen ueber Vertex AI werden /v1/messages-Anfragen jetzt nach Modellfamilie geroutet. Dadurch sinken not-found- oder 404-Fehler durch versehentlich Claude-spezifische Pfade.

6. Juli

Native Gemini-Endpunkte vervollstaendigt
  • Bei Nutzung des @google/genai SDK ueber den Gemini-Einstieg von AIHubMix werden jetzt native Embeddings, interactions create und Context-Caching-Workflows unterstuetzt. Diese Pfade konnten bisher unregistrierte Routenfehler oder 404 liefern; jetzt sind Embedding-Erzeugung, interaktive Aufrufe sowie Cache-Erstellung, -Abfrage, -Aktualisierung und -Loeschung moeglich. Siehe: Gemini Native SDK-Anbindung
Erweiterte gestaffelte Abrechnung fuer Long-Context-Modelle
  • Long-Context-Modelle wie hy3-preview, ERNIE, Grok und Mimo unterstuetzen jetzt gestaffelte Abrechnung nach Kontextlaenge. Die Preisberechnung ist genauer.
Vertex-AI-Streaming-Metriken korrigiert
  • Streaming-Anfragen fuer Vertex AI Gemini/Claude erfassen jetzt genauere Time-to-first-token- und Latenzdaten. Logs und Monitoring sind dadurch verlaesslicher; Modellantworten aendern sich nicht.
Neues Modell
  • tencent-hy3 wurde hinzugefuegt, ein Textgenerierungsmodell (Tencent Hunyuan Hy3, offizielle Version). MoE-Architektur mit 295B Gesamtparametern / 21B aktiven Parametern und 256K Kontextfenster. Unterstuetzt kombinierte schnelle und langsame Denk-Inferenzmodi, geeignet fuer komplexes Reasoning, Code-Generierung und Agent-Workflows. Open-Source unter der Apache-2.0-Lizenz.

3. Juli

Jina Search/Reader unterstützt jetzt POST und Dateiuploads
  • Jina Search und Reader unterstützen jetzt POST-Anfragen. Reader kann lokale Dateien per Multipart-Upload annehmen, darunter PDF, Word, Excel, PPT, HTML und Bilder. Standardantworten entsprechen stärker Jinas nativer Markdown-Ausgabe; Clients, die JSON benötigen, können explizit Accept: application/json senden.
Stabilere Azure-artige Dienste über Responses
  • Ein Problem wurde behoben, bei dem über /v1/responses gebridgte Aufrufe an Azure-artige Nicht-GPT-Dienste mit 404 fehlschlagen konnten, weil api-version leer war. Dadurch sinkt das Risiko direkter Fehler bei solchen Anfragen.
Streaming-Abbrüche behoben
  • Ein Fall wurde behoben, in dem einige Modell-Inferenzdienste wie vLLM / Azure Foundry Streaming-Antworten zufällig abschneiden konnten. Nutzer sollten vollständige Antworten, Abschlusssignale und Nutzungsdaten zuverlässiger erhalten.
Neues Modell: Command A Plus 05-2026
  • command-a-plus-05-2026 wurde als Textgenerierungsmodell fuer Chat, Inhaltserstellung und Agent-Workflows hinzugefuegt.

1. Juli

Jina-Suche und Webpage-Reader-APIs verfügbar
  • Neue Jina Search- und Reader-Funktionen: Mit Ihrem AIHubMix API Key können Sie jetzt Jina-Suchergebnisse abrufen und Webseiteninhalte lesen – geeignet für externe Web-Recherche, Dokumentenlesen und Agent-Tool-Workflows. Siehe: Jina AI
Veo 3.1 Image-to-Video unterstützt Start-/Endframes und Referenzbilder
  • Veo 3.1 Image-to-Video unterstützt jetzt Eingaben für Startframe, Endframe und Referenzbilder. Dadurch lassen sich Anfangs-/Endszene, Charakterreferenzen und Stilreferenzen in anspruchsvolleren Videogenerierungs-Workflows präziser steuern. Siehe: Videogenerierung
Stabilere Gemini-Multi-Channel-Retries
  • Verbesserte Kompatibilität für Gemini-Anfragen bei Cross-Channel-Retries; reduziert bestimmte 400-Fehler in Fallback-Szenarien und erhöht die Erfolgsrate bei Multi-Channel-Failover-Aufrufen. Siehe: Gemini Guides
OpenAI-kompatible Antwortfelder angeglichen
  • OpenAI-kompatible Antworten mit und ohne Streaming behalten jetzt null-Werte für Felder wie logprobs, refusal und finish_reason bei. Dadurch gibt es weniger Abweichungen für SDKs, Agents und Log-Parser, die das Standardformat von OpenAI erwarten.
Verbesserte Privatsphäre und Kompatibilität für Claude Code
  • Die Anfragekompatibilität wurde verbessert, wenn Claude Code über AIHubMix Claude-Modelle aufruft. Dabei gelangen weniger Client-Umgebungsinformationen in die Anfragen an den Modellanbieter, was den Datenschutz für Drittanbieter-Agent-Clients verbessert.
Login, Registrierung und Profil verbessert
  • Das eigene Kontosystem deckt jetzt E-Mail-Code-Login/Registrierung, Passwortsetzung, Profilbearbeitung, Verknüpfen/Trennen von Drittanbieter-Konten und Kontolöschung ab, mit stärkerer OTP-Zwecktrennung und Prüfung deaktivierter Konten. Stripe-Auflade-Callbacks werden ebenfalls zuverlässiger verarbeitet.
Neue Modelle
  • claude-sonnet-5 für Chat-, Reasoning- und Agent-Workflows.
  • gemma-4-31b und longcat-2.0 für Textgenerierung.
  • gemini-3.1-flash-lite-image für Workflows mit Bildfunktionen.
  • mai-image-2.5 und mai-image-2.5-flash für Bildgenerierung.

29. Juni

Verbesserte Bildgenerierungs-Abrechnung und Parameterkompatibilität
  • Die Abrechnung von gpt-image-2 auf Images-Endpunkten ist jetzt einheitlich tokenbasiert. GLM-Bildgenerierung leitet erweiterte Parameter wie watermark_enabled und quality weiter, sodass Wasserzeichen- und Qualitätseinstellungen greifen können, wenn der Modellanbieter sie unterstützt. Siehe: Bildgenerierung
Sauberere Gemini-Dateiupload-Logs
  • Fehlgeschlagene Gemini-Dateiuploads erzeugen keine nutzersichtbaren normalen Request-Logs mehr. Dadurch entsteht weniger Rauschen von Nicht-Inferenz-Endpunkten auf der Logseite, während interne Diagnose-Logs erhalten bleiben.

27. Juni

Neue Deep-Research-Modelle
  • o4-mini-deep-research und o3-deep-research wurden hinzugefügt. Sie sind nur über den Endpunkt /v1/responses verfügbar; Anfragen müssen web_search_preview oder mcp tools enthalten und eignen sich für gründliche Web-Recherche und research-orientierte Antworten.

25. Juni

Responses-Protokoll unterstützt beliebige Modelle
  • Der Endpunkt /v1/responses ist nicht mehr auf die GPT-Serie beschränkt und kann nun beliebige Modelle der Plattform aufrufen. Tools auf Basis des Responses-Protokolls (z. B. die Codex CLI) können dadurch über einen lokalen Modellkatalog Modelle wie GLM, Gemini, DeepSeek, Kimi und Qwen nutzen – nicht mehr nur die offiziellen OpenAI-Modelle.
Responses-Ausgabe für Step 3.7 Flash korrigiert
  • Ein Problem wurde behoben, durch das step-3.7-flash über /v1/responses leere Inhalte oder eine leere Antwort zurückgeben konnte; Reasoning-Inhalte und finale Antworten werden jetzt korrekt zurückgegeben.
Codex CLI: Unterstützung für benutzerdefinierte Modelle
  • Die Codex CLI-Doku hat ein neues Tutorial „Benutzerdefinierte Modelle in Codex verwenden”: Über einen lokalen Modellkatalog (model_catalog_json) lassen sich beliebige AIHubMix-Modelle (GLM, Gemini, DeepSeek, Kimi, Qwen usw.) deklarieren und in Codex’ /model-Liste frei wechseln – nicht mehr auf die offiziellen OpenAI-Modelle beschränkt. Enthält ein Ein-Befehl-Skript zum Erzeugen eines Top-30-Katalogs sowie häufige Stolperfallen. Mehr dazu: Codex CLI · Benutzerdefinierte Modelle in Codex verwenden

24. Juni

Ersatzdomain jetzt unterstützt
  • Neue Ersatzdomain https://api.inferera.com mit Endpunkten und Funktionen identisch zur primären Domain https://aihubmix.com. Wenn die primäre Domain nicht erreichbar ist (z. B. Verbindungsfehler oder Timeouts), ersetzen Sie die Anfrage-URL durch die Ersatzdomain; API Key, Modell, Request-Body und weitere Parameter bleiben unverändert.

23. Juni

Neue Modelle
  • Doubao doubao-seed-2-1-pro, doubao-seed-2-1-turbo.
  • HappyHorse-Videoserie happyhorse-1.1-t2v (Text-to-Video), happyhorse-1.1-r2v (Referenzgenerierung), happyhorse-1.1-i2v (Image-to-Video).
Verbesserte Stripe-Checkout-Erfahrung
  • Der Stripe-Checkout füllt jetzt die Konto-E-Mail automatisch aus und reduziert unnötige Abfragen von Name und Rechnungsadresse, sodass Aufladungen mit Zahlungsmethoden wie Alipay einfacher werden.
Limit für Konten mit negativem Guthaben
  • Wenn das Kontoguthaben unter -$1 liegt, können kostenlose Modelle erst nach einer Aufladung wieder aufgerufen werden.

22. Juni

Neu: AIHubMix-CLI-Dokumentation
  • Neue AIHubMix CLI-Dokumentation: eine einzelne Binärdatei ohne Abhängigkeiten (kein Python / Node / Go erforderlich), mit der Sie den Kontostand abfragen, API-Keys verwalten und verfügbare Modelle direkt im Terminal anzeigen können – mit skript- und AI-Agent-freundlicher Ausgabe (z. B. Claude Code).
LLM Router (intelligentes Modell-Routing)
  • Setzen Sie model auf auto und das Gateway analysiert Ihre Anfrage, um aus Hunderten Modellen das beste auszuwählen – mit Kosten- / Qualitäts- / Latenz-Strategien, abgerechnet nach dem tatsächlich genutzten Modell, ohne Änderung am Client-Code. Siehe: LLM Router (intelligentes Modell-Routing)
DeepSeek-Cache-Trefferquote korrigiert
  • Ein Problem wurde behoben, durch das die Cache-Trefferquote für deepseek-v4-pro und deepseek-v4-flash niedriger als erwartet war.
Neu: AIHubMix Skill (Erweiterung für KI-Programmierassistenten)
  • Bietet lokale Erweiterungsfunktionen für KI-Agents mit Skill-Unterstützung wie Codex, Claude Code, Cursor und Cline: Erledigen Sie die AIHubMix-Anbindung, Modellabfragen, fähigkeitsbasierte Modellauswahl, Beispielerzeugung und Fehlerbehebung in natürlicher Sprache. Der Skill liest bei Bedarf Echtzeitinformationen wie Modelle, Preise und Protokollverträge aus der offiziellen Schnittstelle aus, damit der Agent sich nicht auf veraltetes Wissen verlässt. Mehr dazu: Skills

17. Juni

Neu: Kling-Videomodelle
  • Anbindung der gesamten Kling-Videogenerierung: Text-to-Video, Image-to-Video, Mehrbild-Referenz und Omni-Multimodal-Generierung – je nach Modellname über das native Protokoll aufgerufen.

16. Juni

Problem mit dem OpenClaw-Integrationsplugin behoben
  • Das OpenClaw-Integrationsplugin aihubmix-auth von AIHubMix hat seine vorherigen Integrationsprobleme behoben und ist nun stabil nutzbar. Installieren Sie es einfach und geben Sie einen AIHubMix-Key ein, um in OpenClaw gleichzeitig OpenAI / Anthropic / Gemini-Modelle aufzurufen.
Neue Modelle
  • Zhipu glm-5.2.

15. Juni

Neu: Open-Design-Anbindung unterstützt
  • AIHubMix ist jetzt ein in Open Design (der quelloffenen, lokal-orientierten Claude-Design-Alternative) integriertes BYOK-Gateway. Wählen Sie im API-(BYOK-)Modus AIHubMix, tragen Sie einen Key ein, und treiben Sie damit zugleich Chat-, Bild-, Video- und Sprachgenerierung an – je nach Modellname über das jeweilige native Protokoll der Anbieter. Mehr dazu: Open-Design-Anbindungsanleitung
Zhipu GLM 5.2 unterstützt abgestufte Reasoning-Intensität
  • Das glm-5.2 im nativen Zhipu-Kanal unterstützt reasoning_effort zur abgestuften Steuerung der Denktiefe; ältere Modellversionen werden je nach Version automatisch geroutet, ohne dass aufrufseitig Änderungen nötig sind.
Neue Modelle
  • kimi-k2.7-code-highspeed (Kimi Code Highspeed-Version).

13. Juni

Neue Modelle
  • coding-glm-5.2 sowie die kostenlose Variante coding-glm-5.2-free.

12. Juni

Modell-Mapping und Fehler-Fallback
  • Neu: Model Mapping und Fehler-Fallback: Konfigurieren Sie pro API Key das Modellnamen-Mapping und den Fehler-Fallback in der Konsole: Schreiben Sie den Modell-Alias des Clients auf den tatsächlichen Modellnamen um, wechseln Sie bei einem Fehler des Hauptmodells automatisch zu einem Backup-Modell und rechnen Sie nach dem final antwortenden Modell ab, ganz ohne Änderungen am Client-Code. Siehe: Model Mapping und Fallback
Neue Modelle
  • kimi-k2.7-code.

11. Juni

step-3.7-flash zeitlich begrenzt mit 90 % Rabatt
  • step-3.7-flash mit zeitlich begrenztem Rabatt von 90 %: nur 0,022 USD pro Million Eingabe-Token und nur 0,132 USD pro Million Ausgabe-Token – probieren Sie es gern aus.
Modellabschaltung und Auto-Routing
  • claude-opus-4-20250514 und claude-sonnet-4-20250514 werden offiziell am 15. Juni abgeschaltet. Die Plattform routet die abgeschalteten Modelle dann automatisch auf die 4-5-Versionen derselben Serie.

10. Juni

Neue Modelle
  • claude-fable-5 [Eingestellt].
Hinweise zu den neuen Claude-Modellen Fable 5 / Mythos 5
  • Fable 5 hat stärkere Sicherheits-Gatekeeper, sodass auch manche normale Anfragen blockiert werden können: Zusätzliche Klassifizierungen gelten unter anderem für Cybersicherheit, Biologie / Chemie, Modell-Destillation und Reasoning-Extraktion. Manche technische Forschung, Schwachstellenanalyse oder biomedizinische Fragen können abgelehnt oder an Opus 4.8 weitergeleitet werden.
  • Mythos 5 ist eingeschränkt verfügbar und kein allgemein offenes Modell: Mythos 5 und Fable 5 stammen aus derselben Fähigkeitsbasis, aber Mythos 5 nutzt weniger Sicherheitsklassifizierer. Es ist derzeit nur für Project Glasswing / freigegebene Kunden verfügbar; die meisten Nutzer verwenden Fable 5 mit Guardrails.
  • Höhere API-Kosten: Fable 5 kostet 10 USD pro Million Eingabe-Token und 50 USD pro Million Ausgabe-Token, etwa doppelt so viel wie Opus 4.8.
  • Datenschutz: Fable 5 / Mythos 5 gelten als Covered Models, erfordern standardmäßig mindestens 30 Tage Datenaufbewahrung und unterstützen keine Zero Data Retention.
  • API-Ablehnungsverhalten: Wenn Fable 5 eine Anfrage ablehnt, gibt die API HTTP 200 zurück, aber stop_reason ist refusal.

08. Juni

Gemini-kompatible Schnittstelle unterstützt Audio-Eingabe
  • Beim Aufruf von Gemini über die OpenAI-kompatible Schnittstelle (/v1/chat/completions) wird nun die Audio-Eingabe via input_audio unterstützt (zuvor wurde sie stillschweigend verworfen); zudem wird in der zurückgegebenen Usage die Zählung der audio_tokens ergänzt.

05. Juni

Neue Modelle
  • grok-build-0.1, hy3-preview sowie das kostenlose Modell step-3.7-flash-free.

04. Juni

Neue Modelle
  • Tongyi Qianwen qwen3.7-plus.

01. Juni

Neue Modelle
  • MiniMax minimax-m3.
  • Baidu musesteamer-air-image (Bildgenerierung).

29. März

Detailseite zu Logs
  • Latenz: Gibt an, wie schnell eine Anfrage startet (Zeit von der Anfrage bis zum ersten zurückgegebenen Token)
  • Durchsatz: Klare Messgröße für die Ausgabegeschwindigkeit des Modells
  • E2E-Latenz: Gesamtzeit von Anfrage bis Abschluss; zur Bewertung der Gesamtleistung der Anfrage
  • Provider: Identifiziert den Modellanbieter, der die Anfrage verarbeitet hat
  • Status: Zeigt das Ergebnis (z. B. Erfolg / Fehlschlag) zur schnellen Erkennung von Anomalien
  • TID: Eindeutige Anfragen-ID, die mit dem Support geteilt werden kann, um Probleme schneller zu beheben

23. März

  • Das AIHubMix Global Acceleration Network ist live: aufgebaut auf eigenen globalen Edge-Knoten und intelligentem Routing, mit kontinuierlichem Monitoring und dynamischer Optimierung – 75 % geringere Latenz, 60 % höhere Stabilität und 99,99 % Verfügbarkeit. Schnelleres, zuverlässigeres KI-Erlebnis.
  • 24/7-Echtzeit-Health-Monitoring hinzugefügt: Verteilte Sonden scannen das gesamte Netzwerk minütlich, verfolgen Latenz, Erfolgsrate und Stabilität. Probleme werden erkannt und behoben, bevor Nutzer sie bemerken – für gleichbleibende Performance.
  • Verbessertes intelligentes Traffic-Routing: Knotengesundheit wird dynamisch über mehrere Zeitfenster bewertet, mit Millisekunden-Switching zur optimalen Route – deutlich weniger Schwankungen und Timeouts bei höherer Erfolgsrate.

8. Februar

  • Neue Funktion: Chat → Responses-Kompatibilität
    Dieses Release führt die Chat → Responses-Kompatibilität ein, sodass die Chat-Completions-API OpenAI-Modelle aufrufen kann, die nur das Responses-Protokoll unterstützen – darunter gpt-5.2-codex, gpt-5.1-codex-max und gpt-5.2-pro. Wenn Sie die AIHubmix-Chat-API zwingen möchten, Anfragen über das Responses-Protokoll zu routen, fügen Sie folgenden Header hinzu:
    X-Use-Responses-Enabled: true Wenn ein Modell sowohl Chat als auch Responses unterstützt, erzwingt dieser Header die Verwendung der Responses-API.
    Beachten Sie: Das Responses-Protokoll unterstützt derzeit weder Audioeingabe noch -ausgabe; planen Sie die Nutzung entsprechend.
  • Hinweis zur Modell-Abkündigung:
    OpenAI wird chatgpt-4o-latest am 17. Februar 2026 abkündigen. Danach mappen wir chatgpt-4o-latest automatisch auf gpt-4o-2024-11-20.

2025

15. Dezember

  • Neue Funktion: Die Google-API unterstützt jetzt die Files API.

22. September

10. August

1. August

29. Juli

  • Unterstützung für AI SDK hinzugefügt: Zugriff auf eine Vielzahl von Modellen mit einem einzigen API-Schlüssel

26. Juli

23. Juli

  • Unterstützung für Qwen Code hinzugefügt; nutzt alle auf der Aihubmix-Plattform verfügbaren LLMs

4. Juli

  • Unterstützung für llms.txt hinzugefügt: Mit einem Klick standardisierte Modellnavigation erhalten, damit Ihr LLM-Assistent das gesamte Modellökosystem schnell versteht

29. Juni

  • Forwarding-Unterstützung für Gemini CLI mit mehreren flexiblen Nutzungsmodi
  • Code Interpreter und Remote-MCP-Aufrufe zur OpenAI Responses API hinzugefügt

26. Juni

23. Juni

  • APP-Code gestartet – 10 % Rabatt für Entwickler auf alle Modelle

18. Juni

  • HTTP-Statuscode-Dokumentation hinzugefügt, um Fehler besser zu verstehen

13. Juni

  • Unterstützung für Veo-3.0-Videogenerierung hinzugefügt, um kreative Formate zu erweitern

9. Juni

  • Unterstützung für OpenAI Reasoning Summaries in der Responses API hinzugefügt

5. Juni

  • Implizites Caching für Gemini hinzugefügt, mit automatischen Cache-Hits und Hit-Rückmeldung
    Entwickler können usage_metadata nutzen, um Cache-Hits zu erkennen
    Kosteneinsparungen sind nicht garantiert und hängen von Anfragestruktur und Nutzungsszenario ab

31. Mai

Vollständige Unterstützung neuer Claude-4-Funktionen
  • Neuer Cache-TTL: 1-Stunden-Cache-Unterstützung Beta
  • 🎉 Neue Texteditor-Tools: Claude 4 unterstützt jetzt text_editor_20250429 und str_replace_based_edit_tool
  • 🚫 Neuer Refusal-Stop-Reason für sicherheitsbedingte Ablehnungen
  • 🧠 Extended Thinking: Claude 4 gibt nun vollständige Zusammenfassungen seines Denkprozesses zurück
  • 🔄 Interleaved Thinking: Tool-Nutzung kann jetzt mit Extended Thinking verschränkt werden für natürlichere Konversationen (Beta)
  • ⚠️ Veraltete Funktionen:
    • undo_edit wird nicht mehr unterstützt
    • token-efficient-tools-2025-02-19 entfernt (nur Claude 3.7)
    • output-128k-2025-02-19 entfernt (nur Claude 3.7)
  • 📚 Vollständige Migrationsanleitungen und Codebeispiele wurden aktualisiert, um den Wechsel von Claude 3.7 auf Claude 4 zu erleichtern

22. Mai

  • Unterstützung für das Dify-Plugin hinzugefügt, das die nahtlose Integration der Aihubmix-Modelle in Dify ermöglicht
    Mehr als 200 Modelle mit einem einzigen API-Schlüssel verwalten

17. Mai

  • Unterstützung für codex-mini-latest hinzugefügt – optimiert für Programmieraufgaben, verfügbar über Responses API oder Codex CLI
  • Unterstützung für Google Imagen 3.0 Bildgenerierung und Veo 2.0 Videogenerierung hinzugefügt
  • gemini-2.0-flash-exp aktualisiert auf die offizielle Preview-Version gemini-2.0-flash-preview-image-generation

9. Mai

  • Ideogram AI V3-API hinzugefügt – Ideograms fortschrittlichstes Bildgenerierungsmodell

6. Mai

26. April

  1. Die mit Spannung erwartete OpenAI-Bildgenerierungs-API gpt-image-1 ist live – Text-zu-Bild und Bild-zu-Bild
  2. Native Gemini-API-Unterstützung mit präziser Reasoning-Budget-Steuerung für Flash 2.5 hinzugefügt

24. April

  • Drei zentrale Jina-AI-APIs integriert, um leistungsfähige Agents zu bauen: Embeddings, Rerank und DeepSearch

20. April

  • Unterstützung für den OpenAI-Responses-API-Endpoint mit erweiterten Tool-Funktionen hinzugefügt

17. April

12. April

9. April

  • Claude-Prompt-Caching hinzugefügt – bis zu 76 % Kosteneinsparung bei wiederkehrenden Prompts

7. April

  • Ideogram-AI-Bildgenerierung hinzugefügt: starkes Text-Rendering, Hybrid-Generierung, lokale Bearbeitung und Upscaling

5. April

  • Komplett neues Dokumentationserlebnis veröffentlicht

30. März

  • Unterstützung für das Claude-Texteditor-Tool hinzugefügt

24. März

  • Brandneues Trident-Logo eingeführt

16. März

  • Native Suchunterstützung für OpenAI- und Google-Gemini-Modelle hinzugefügt
  • Drittanbieter-Suchintegration folgt in zukünftigen Updates

15. März

  • Modelle hinzugefügt: gpt-4o-mini-search-preview und gpt-4o-search-preview

7. März

  • Preise für o1 und o3-mini um 10 % gesenkt – im Einklang mit offiziellen Preisen

6. März

  • Aufgrund einer 7-fachen Preiserhöhung von Microsoft stieg auch der Preis von aihubmix-DeepSeek-R1 um das 7-Fache
    Empfohlene Alternative: DeepSeek-R1 von Volcano Engine (stabiler und kostengünstiger)
    Modelle hinzugefügt: qwen-qwq-32b und qwen2.5-vl-72b-instruct

28. Februar

  • 15 % Preisreduzierung bei allen Claude-Modellen
  • Modell gpt-4.5-preview hinzugefügt (extrem teuer – mit Vorsicht verwenden)

26. Februar

  • DeepSeek-Stabilität verbessert
  • ByteDance-Versionen von DeepSeek sind derzeit am stabilsten
    Empfohlene Modelle: DeepSeek-R1 und DeepSeek-V3

25. Februar

  • Modell claude-3-7-sonnet-20250219 hinzugefügt

24. Februar

  • Das gpt-4o-Modell kann aufgrund von Problemen beim Modellanbieter gelegentlich sehr langsam antworten
    Empfohlen wird temporär auf gpt-4o-2024-11-20 umzustellen
  • Die Perplexity-API ist temporär offline
    Aufgrund von Perplexitys komplexem Abrechnungsmodell und höheren Kosten als die Preisstruktur dieser Plattform wird der Dienst nach Preisanpassungen erneut gestartet
  • Der temporäre offizielle ByteDance-Rabatt ist beendet, die Preise sind wieder normal
    Der Preis von DeepSeek-R1 wurde entsprechend erhöht
  • Neue Modell-Detailseite mit vollständigen Parameterinformationen hinzugefügt

23. Februar

  • Der temporäre offizielle ByteDance-Rabatt ist beendet, die Preise sind wieder normal
    Der Preis von DeepSeek-V3 wurde erhöht
    Auch das R1-Modell von ByteDance wird voraussichtlich bald wieder normale Preise haben; die Plattform wird die Preise entsprechend anpassen

18. Februar

  • Modell hinzugefügt: kimi-latest
    (Offiziell nach Eingabelänge gestaffelt zu 8k, 32k und 128k abgerechnet.
    Diese Plattform unterstützt keine gestaffelte Abrechnung und verwendet die mittlere Stufe 32k als Standardpreis.
    Wenn Sie preissensibel sind, mit Vorsicht verwenden.)
  • Layout der Website insgesamt optimiert
  • Changelog-Seite in die Nutzungsstatistik-Seite zusammengeführt
  • Ankündigungen in die Modell-Marktplatz-Seite verschoben
  • Einstellungen in das Benutzeravatar-Menü verschoben
  • Preis von aihubmix-DeepSeek-R1 um 50 % gesenkt
  • Modelle hinzugefügt:
    gemini-2.0-pro-exp-02-05-search, gemini-2.0-flash-exp-search
    (mit offizieller Online-Suche von Google integriert)
  • Modelle hinzugefügt:
    gemini-2.0-flash, gemini-2.0-pro-exp-02-05, gemini-2.0-flash-lite-preview-02-05
  • Modelle hinzugefügt:
    o3-mini, o1
    (Diese beiden Modelle werden aufgrund begrenzter Account-Ressourcen ca. 10 % teurer als offiziell abgerechnet)

4. Februar

  • Das o1-Modell unterstützt in der offiziellen OpenAI-API den stream-Parameter nicht
  • Das o3-mini-Modell unterstützt den temperature-Parameter nicht
    Ein neuer Parameter reasoning_effort ist verfügbar mit Werten: "low", "medium", "high"
    Standard ist "medium", wenn nicht angegeben

1. Februar

Funktions-Update:
  • Unterstützung für OpenAI-Audio-Modell-Eingabe und -Ausgabe hinzugefügt
    Der Preview-Server api.aihubmix.com ist nun verfügbar
    Nach einer Woche stabiler Laufzeit wird die Hauptseite aktualisiert
    Backend-Abrechnung entspricht vollständig den offiziellen Preisen
    Aktuell zeigen Nutzungs-Logs nur Text-Token-Nutzung
    Audio-Token-Nutzung wird noch nicht in den Logs angezeigt, beeinträchtigt aber die Nutzung nicht
Neue Modelle:
  • o3-mini, o1
    (ca. 10 % teurer als offiziell, da Account-Verfügbarkeit begrenzt ist)
  • aihubmix-DeepSeek-R1 (empfohlen, sehr stabil)
  • qwen-max-0125 (Qwen2.5-Max), sonar-reasoning
  • deepseek-ai/DeepSeek-R1-Zero, deepseek-ai/DeepSeek-R1, deepseek-r1-distill-llama-70b
  • aihub-Phi-4
  • Doubao-1.5-pro-256k, Doubao-1.5-pro-32k,
    Doubao-1.5-lite-32k, Doubao-1.5-vision-pro-32k
  • sonar, sonar-pro (neueste von Perplexity AI)
  • gemini-2.0-flash-thinking-exp-01-21
  • deepseek-reasoner (alias DeepSeek-R1)
  • MiniMax-Text-01
  • codestral-latest (Mistrals neues Code-Modell – Codestral 25.01)

23. Januar

Neue Modelle:
  • aihub-Phi-4
  • Doubao-1.5-pro-256k, Doubao-1.5-pro-32k,
    Doubao-1.5-lite-32k, Doubao-1.5-vision-pro-32k
  • sonar, sonar-pro (neueste von Perplexity AI)
  • gemini-2.0-flash-thinking-exp-01-21
  • deepseek-reasoner (alias DeepSeek-R1)

19. Januar

  • Perplexity-AI-API-Modelle hinzugefügt
    Derzeit nur auf dem Preview-Server api.aihubmix.com unterstützt
    Nach stabilem Test erfolgt das Rollout auf den Hauptserver aihubmix.com
  • api.aihubmix.com ist der Preview-Server
    Neue Features werden zuerst dort deployed und nach ca. 1 Woche Stabilitätstest auf den Hauptserver übertragen
Neue Modelle:
  • MiniMax-Text-01
  • codestral-latest (Mistral Codestral 25.01)

6. Januar

  • gemini-2.0-flash-exp-search hinzugefügt – unterstützt native Google-Online-Suche
    Das offizielle Gemini-2.0-Flash-Modell benötigt zusätzliche Parameter für Online-Suche
    Aihubmix hat diese Funktion integriert – hängen Sie einfach search an den Modellnamen an
  • Modell hinzugefügt: deepseek-ai/DeepSeek-V3

1. Januar

  • Neue Modell-Marktplatz-Seite veröffentlicht, ersetzt die alte „Model & Pricing”-Seite

2024

30. Dezember

  • Problem behoben, bei dem gemini-2.0-flash-thinking-exp-1219 nur Reasoning, aber keine endgültige Antwort zurückgab
  • Problem behoben, dass Balance-Erinnerungsmails nicht zugestellt wurden

22. Dezember

  • Nutzungsstatistik-Seite hinzugefügt
  • Aufladungs-Verlauf-Seite hinzugefügt
  • Doubao-Modellserie hinzugefügt:
    Doubao-lite-128k, Doubao-lite-32k, Doubao-lite-4k,
    Doubao-pro-128k, Doubao-pro-256k, Doubao-pro-32k, Doubao-pro-4k
  • Modell hinzugefügt: gemini-2.0-flash-thinking-exp-1219
  • Modelle hinzugefügt:
    gemini-2.0-flash-exp, aihubmix-Mistral-Large-2411,
    aihubmix-Llama-3-3-70B-Instruct, grok-2-1212, grok-2-vision-1212
  • Modelle hinzugefügt:
    gemini-exp-1206, llama-3.3-70b-versatile, learnlm-1.5-pro-experimental

14. Dezember

  • Modelle hinzugefügt:
    gemini-2.0-flash-exp, aihubmix-Mistral-Large-2411,
    aihubmix-Llama-3-3-70B-Instruct

8. Dezember

  • Modelle hinzugefügt:
    gemini-exp-1206, llama-3.3-70b-versatile, learnlm-1.5-pro-experimental
  • Nutzungsstatistik-Seite hinzugefügt

21. November

  • Kürzlich hinzugefügte Modelle:
    gpt-4o-2024-11-20, step-2-16k, grok-vision-beta
  • Qwen-2.5-Turbo-Modell mit Millionen-Kontext:
    qwen-turbo-2024-11-01

7. November

  • Kompatibilität mit dem nativen Claude-SDK ergänzt
    Der Endpoint v1/messages ist nun verfügbar
  • Native Claude-Prompt-Caching- und Computer-Use-Funktionen werden noch nicht unterstützt
    Diese werden in den nächsten zwei Wochen fertiggestellt

5. November

  • Modell hinzugefügt: claude-3-5-haiku-20241022
  • Elon Musks xAI-Neuestes-Modell hinzugefügt: grok-beta

23. Oktober

  • Modell hinzugefügt: claude-3-5-sonnet-20241022

10. Oktober

  • OpenAIs neuestes Caching-Feature ist live
    Aktuell unterstützte Modelle:
    • GPT-4o
    • GPT-4o-mini
    • o1-preview
    • o1-mini
  • Hinweis: gpt-4o-2024-05-13 steht nicht auf der offiziell unterstützten Liste
  • Cache-Hit-Token werden in den Backend-Logs sichtbar, wenn ein Request den Cache trifft
  • Vollständige Details und Nutzungsregeln finden Sie in der offiziellen OpenAI-Dokumentation

3. Oktober

  • Backend-Abrechnung für gpt-4o wurde an die offiziellen Preise angeglichen
  • Modelle hinzugefügt:
    aihubmix-Llama-3-2-90B-Vision, aihubmix-Llama-3-70B-Instruct
  • Cohere-neuste Modelle hinzugefügt:
    aihubmix-command-r-08-2024, aihubmix-command-r-plus-08-2024

19. September

  • Modelle hinzugefügt: whisper-large-v3 und distil-whisper-large-v3-en
  • Hinweis: Whisper-Modell-Abrechnung erfolgt nach Eingabe-Sekunden
    Die aktuelle Preisanzeige auf der Seite ist falsch und wird korrigiert
    Backend-Abrechnung für whisper-1 entspricht vollständig den offiziellen OpenAI-Preisen

13. September

  • Modelle hinzugefügt: o1-mini und o1-preview
    Hinweis: Diese Modelle erfordern aktualisierte Parameter
    Manche Client-Oberflächen können Fehler werfen, wenn Standardwerte nicht aktualisiert sind
Tests zeigen, dass das o1-Modell Folgendes NICHT unterstützt:
  • system-Feld → 400-Fehler
  • tools-Feld → 400-Fehler
  • Bildeingabe → 400-Fehler
  • json_object-Ausgabe → 500-Fehler
  • structured-Ausgabe → 400-Fehler
  • logprobs-Ausgabe → 403-Fehler
  • stream-Ausgabe → 400-Fehler
Ratenlimits und feste Parameter:
  • o1-Serie: 20 RPM, 150.000.000 TPM – extrem niedrig, häufige 429-Fehler möglich
  • temperature, top_p und n sind auf 1 festgelegt
  • presence_penalty und frequency_penalty sind auf 0 festgelegt

10. September

  • Modell hinzugefügt: mattshumer/Reflection-Llama-3.1-70B
    (Berichten zufolge eine der stärksten Feintuning-Varianten von LLaMA 3.1 70B)
  • Preise der Claude-3-Modelle erhöht
    Zur Sicherstellung der stabilen Versorgung sind Aufrufe über diese Plattform aktuell ca. 10 % teurer als die direkte offizielle Nutzung
  • Erhöhte Concurrency-Kapazität für OpenAI-Modelle
    Das System unterstützt theoretisch nahezu unbegrenzte Parallelität

11. August

  • Modelle hinzugefügt:
    Phi3medium128k, ahm-Phi-3-medium-4k, ahm-Phi-3-small-128k
  • Stabilität für LLaMA-Modelle verbessert
  • Kompatibilität für Claude-Modelle weiter optimiert

7. August

4. August

  • Direkte Online-Zahlung für Aufladungen hinzugefügt
  • Claude-Mehrfach-Konversationsformat-Fehler behoben:
    messages: roles must alternate between "user" and "assistant", but found multiple "user" roles in a row
  • Index-Handling bei Function-Calling mit Claude-Modellen optimiert
  • Der Backup-Server https://orisound.cn wird am 7. September vollständig stillgelegt
    Bitte migrieren Sie zum Hauptserver https://aihubmix.com oder Backup-Server https://api.aihubmix.com

27. Juli

  • Unterstützung für Mistral Large 2 hinzugefügt
    Modellname: Mistral-large-2407 oder aihubmix-Mistral-large-2407
  • Systemoptimierungen

24. Juli

  • Neueste LLaMA-3.1-Modelle hinzugefügt:
    llama-3.1-405b-instruct, llama-3.1-70b-versatile, llama-3.1-8b-instant

20. Juli

  • Probleme bei der Preisberechnung für gpt-4o-mini behoben
    • Texteingabe-Preis: 1/33 von GPT-4o offiziell
    • Bildeingabe-Preis: gleich GPT-4o
  • Um mit offiziellen Preisen übereinzustimmen, werden Image-Token-Counts von gpt-4o-mini bei der Abrechnung mit 33 multipliziert
  • Details siehe offizielle OpenAI-Preise

19. Juli

  • Unterstützung für das gpt-4o-mini-Modell hinzugefügt
    Backend-Abrechnung entspricht vollständig den offiziellen Preisen

15. Juli

  • Unterstützung für den offiziellen API-Parameter include_usage hinzugefügt
    Damit können Usage-Daten im Stream-Modus zurückgegeben werden
    Details siehe offizielle Dokumentation

14. Juli

  • Die neue Version von NextWeb unterstützt jetzt das Aufrufen von Nicht-OpenAI-Modellen über diese Plattform
  • Backend-Abrechnungsunterstützung für Alibaba-Qwen-Modelle hinzugefügt
    Aufrufe über diese Plattform kosten ca. 10 % mehr als direkte Nutzung über Alibaba Cloud
  • Azure-OpenAI-Ausgabe-Kompatibilität mit der Standard-OpenAI-API verbessert
  • Tool-Calling-Unterstützung für Claude-3 hinzugefügt
  • Viele neue Modelle hinzugefügt (siehe Einstellungen → Verfügbare Modelle)

3. Juli

  • Backend-UI insgesamt optimiert
  • Jeder Log-Eintrag zeigt jetzt den Modell-Einheitspreis zum Zeitpunkt der Anfrage
  • „Modell & Preis”-Seite hinzugefügt

20. Juni

  • Das neueste claude-3-5-sonnet-20240620 wird jetzt unterstützt
    Siehe Anleitung für den Aufruf von Nicht-OpenAI-Modellen auf dieser Plattform

18. Juni

  • Backend-Logs unterstützen jetzt den Download historischer Request-Datensätze

16. Juni

  • Die Wahrscheinlichkeit, Requests zufällig an Azure OpenAI zu routen, wurde deutlich reduziert

13. Juni

  • Backend-Kosten für Claude-3-Modelle gesenkt
    (Claude 3 Haiku, Claude 3 Sonnet, Claude 3 Opus)
    Die Backend-Abrechnung entspricht jetzt den offiziellen Preisen
    In Folge entspricht der effektive Retail-API-Preis dieser Seite ca. 86 % der offiziellen Preise

10. Juni

  • GPT-4o-Token-Abrechnung optimiert
    Tokenizer von cl100k_base auf o200k_base geändert
    In Folge sind Streaming-Token-Counts für Chinesisch, Koreanisch und Japanisch niedriger als zuvor

8. Juni

  • Alibabas neueste Open-Source-Qwen-2-Modelle hinzugefügt:
    • alibaba/Qwen2-7B-Instruct
    • alibaba/Qwen2-57B-A14B-Instruct
    • alibaba/Qwen2-72B-Instruct

20. Mai

  • Modell hinzugefügt: gemini-1.5-flash
  • Modell hinzugefügt: gpt-4o
  • Modelle hinzugefügt:
    llama3-70b-8192, llama3-8b-8192,
    gemini-1.5-pro, command-r, command-r-plus
  • Claude-3-Modell-Versorgung wiederhergestellt
    Endpoints sind derzeit über AWS und Google Cloud deployed
  • Zur Deckung von Infrastruktur- und Betriebskosten ist die Claude-3-Backend-Abrechnung ca. 10 % höher als die offiziellen Preise
    Mit steigender Nutzung wird dies schrittweise auf ca. 5 % oder darunter gesenkt
  • Concurrency-Limits werden derzeit getestet und werden mit steigender Nachfrage erhöht

Zuletzt aktualisiert: 2026-06-22