媒體生成累計用量統計更完整
- 媒體生成任務完成結算後,會同步補記帳號累計已用額度。使用者在控制台查看累計已用、餘額扣減和消費記錄時,媒體生成部分會更完整地反映真實用量。
- 呼叫 deployment/model 名稱中包含點號的 Azure 模型時,模型名稱在 Chat、Responses 與 Messages 轉換路徑中保持原樣,不再被自動改寫;既有 Azure 呼叫行為保持不變。
新增影片生成模型
- 新增
doubao-seedance-2-5-260628:ByteDance Seed 新一代統一多模態音視訊生成模型,可一次生成最長 30 秒的音訊與影片同步內容,並支援多輪延展。相較於 Seedance 2.0,它在敘事、轉場、參考素材支援、真實感與精準編輯方面進一步提升,適合影視製作、廣告、教育、模擬與長內容創作。
新增模型
- 新增
wan3.0-video:阿里通義實驗室推出的一體化影片生成與編輯模型,目前處於公測階段。它支援最長 30 秒的原生影片生成、生產級角色一致性、逼真的畫面與聲音,以及統一的參考生成、編輯、複刻與動作驅動工作流,適合廣告、電商、影視製作、角色動畫、影片編輯與文件轉影片。 - 新增
qwen-image-3.0:阿里雲通義千問團隊的圖像生成與編輯模型,支援文生圖、參考圖創作和圖像編輯。兼顧畫質與速度,適合社群媒體、電商、創意設計、日常內容生產以及高頻大規模創作。 - 新增
qwen-image-3.0-pro:阿里雲通義千問旗艦級圖像生成與編輯模型,面向廣告、品牌視覺、UI、簡報、產品圖與專業設計場景。擅長複雜版式、精準的中英文字渲染、真實材質、參考圖編輯,以及細節、構圖與商業級視覺品質。
Gemini embedding 支援多模態輸入與分模態計費
gemini-embedding-2-preview現在可透過 OpenAI 相容 embeddings 入口和 Gemini 原生入口處理文字、圖片、音訊、影片和文件輸入。使用多模態向量檢索、內容理解或知識庫建置的使用者,可在同一模型上接入更多輸入類型。- Gemini embedding 的費用會優先按模型推理廠商返回的分模態 token 用量計算;圖片、音訊、影片和文件不再被統一當作文字估算。多模態 embedding 帳單更貼近真實用量。
- 單條 embedding 請求可直接使用新一代 Gemini embedding;包含多條輸入的批次請求會明確返回能力不支援的提示。
- Seedance 2.0 的圖片、音訊、影片等引用會按媒體類型更準確地映射,
adaptive、4K、尺寸等能力約束更清晰。影片生成工作流中因參數映射不準導致的失敗會減少。 - 自適應時長請求會先按 15 秒預扣,並在任務完成後按真實時長結算;使用者餘額預扣和最終帳單更一致。
- 媒體生成失敗時,介面會返回脫敏後的錯誤資訊,方便使用者和客服定位參數、簽名連結或模型推理廠商限制問題,同時避免暴露敏感憑證。
新增模型
- 新增
qwen3.8-max:阿里雲旗艦原生視覺語言模型,基於 2.4 兆參數的 Mixture-of-Experts (MoE) 架構,最大上下文視窗達 100 萬 tokens。適合複雜多模態理解、高階推理、軟體開發、agent 工作流程以及長上下文處理。與 Qwen3.7-Max 價格相近,在推理、程式碼撰寫和 agent 能力上均有明顯提升,整體表現對齊當前主流領先模型。
- 模型詳情會優先展示目前更適合呼叫的供應商,並把僅作備援或暫不可用的供應商放到後面。使用者選擇模型供應商、客服排查模型可用性時,可以更直觀看到哪些供應商目前更適合使用,減少因展示順序過期帶來的誤判。
小額帳單與使用紀錄更準確
- by-bill 計費模型的小額請求不再因取整歸零而缺少扣費與使用紀錄。受影響的請求會按最小有效 quota 入帳,讓帳單、餘額預扣與使用紀錄更一致;客服與營運排查小額 embedding 等高頻請求時,可以看到更完整的紀錄。
新增模型
- 新增
deepseek-v4-flash:面向效率優化的 Mixture-of-Experts 模型,總參數 284B,激活參數 13B,上下文視窗 100 萬 tokens。為快速推理和高吞吐場景設計,同時保留強勁的推理與程式碼撰寫能力,適合程式碼助手、聊天系統和 agent 工作流程。
- 新增
minimax-h3:MiniMax 的通用多模態影片模型,支援文字、圖像、音訊和影片輸入,可用於文生影片、圖生影片、首尾幀生成、參考素材生成和影片編輯。需要建立影片創作、廣告素材、產品展示或多模態內容流程的使用者,可透過 AIHubMix 統一 API 呼叫。
glm-5.2調用價格按每日時段打折,時間以 UTC 為準:每日 14:00 至 24:00 享 5 折,每日 00:00 至 14:00 享 7 折。活動限時。
gpt-5.6-luna已同步官方降價 80%,目前價格為輸入 1.20;gpt-5.6-terra已同步官方降價 20%,目前價格為輸入 12.00。對這兩個模型有穩定調用量的用戶,可重新評估成本敏感與通用任務的模型選擇。
AIHubMix 官方 MCP Server 上線
- 新增面向 MCP 客戶端的官方託管入口 mcp.aihubmix.com/mcp 或 mcp.inferera.com/mcp。可在 Claude Code、Codex、Cursor 等工具中透過同一入口查詢模型與價格、檢索文件、查看餘額,並呼叫聊天、圖像生成和影片生成等工具能力。
- MCP 請求憑證由客戶端逐次傳入,服務端不保存 API Key;適合希望在 IDE 或 Agent 工具中直接使用 AIHubMix 模型和媒體能力的開發者。
新增模型
- 新增
jina-reranker-v3.5:Jina AI 的 0.6B 多語言 listwise 文件重排模型,可作為jina-reranker-v3的同介面升級版本。它面向 RAG、搜尋和結構化資料排序場景,支援長上下文候選排序,並提升領域魯棒性、多語言檢索、結構化資料排序和推理效率。
快取計費更準確
- 對顯式快取與隱式快取請求,平台會更一致地識別快取讀寫用量,並優先採用上游返回的快取類型計費。使用 Qwen、Claude 等支援快取能力的使用者,可取得更貼近真實用量的計費明細。
- 媒體生成首批模型列表已收斂到驗證過的模型,並修復部分圖像模型經媒體入口呼叫時可能 404 的問題。控制台中的 LLM 任務下載也補齊文字存檔場景,歷史大型結果更容易下載與交付。
- 官網、模型資料、部落格資料與站點地圖的快取策略已調整為發布後更快生效;模型廣場與文件入口在內容更新後更不容易受舊快取影響。
媒體生成 API 上線
- 新增
/ai/v1/images/generations與/ai/v1/images/edits媒體生成入口,並提供統一的非同步任務、結果查詢、產物下載和 webhook 回呼能力。圖像與影片類工作流程可透過同一套任務生命週期接入,便於客戶端追蹤長耗時生成結果。 - 生成產物會透過 AIHubMix 統一任務結果返回,並支援受限次數下載與批次取得。營運和客服可重點關注首批使用者的任務狀態、下載連結有效性和計費明細回饋。
新增模型
- 新增
claude-opus-5:Anthropic 旗艦模型,面向高強度推理、程式碼撰寫與長程 agent 任務。擅長端到端軟體開發、程式碼審查與缺陷發現、圖表與文件視覺分析、複雜辦公交付以及並行子代理協作,具備 1M 上下文視窗,最大輸出 128K。
新增模型
- 新增
mai-image-2.5-pro:微軟旗艦級圖像生成與編輯模型,具備高保真寫實效果、精準的圖內文字渲染以及強大的圖像編輯能力,適合商業設計、產品攝影和專業創意工作流程。 - 新增
qwen-audio-3.0-tts-flash:通義千問即時語音合成模型,支援更多低資源語言與中文方言,具備豐富的表現力控制,首包延遲低於 200 ms,適合語音助手、即時對話和智慧客服。 - 新增
qwen-audio-3.0-tts-plus:通義千問高品質語音合成模型,可精細控制情感、語氣、角色、語速、音量與合成風格,並在噪聲和混響環境下更穩定,適合內容創作、有聲書、影視配音、品牌聲音設計及高品質語音服務。 Qwen TTS 音訊生成能力 - 兩個 Qwen TTS 模型均可透過
/v1/audio/speech呼叫;非串流請求返回音訊結果連結,串流請求返回 SSE 音訊生成事件。下表結合 AIHubMix 相容欄位與阿里雲官方 Qwen-Audio-TTS 口徑整理;voice需按模型分別選擇,plus 與 flash 的系統音色不可混用。
Messages 回應相容性提升
- 透過
/v1/messages呼叫橋接模型或 Claude/Bedrock 等相容模型服務時,回應欄位與 Anthropic Messages 生態更一致,減少嚴格 SDK 或 schema validator 因缺少回應欄位而報錯的情況。
- 用戶端中途斷開 AWS Bedrock 串流請求時,AIHubMix 會繼續收口模型推理廠商結束訊號和最終 usage,減少斷線場景下請求日誌、結算明細和實際模型推理廠商用量不一致的情況。
新增模型
- 新增
qwen3-coder-480b-a35b-instruct:Qwen3-Coder 旗艦程式碼模型,面向程式碼生成、軟體工程 Agent 和工具呼叫工作流程,適合長上下文程式碼理解與自動化開發任務。 - 新增
gemini-2.5-flash-lite:Google 2.5 系列輕量模型,面向低延遲、低成本的高頻文字、多模態和批次處理場景。 - 新增
Qwen/Qwen3-235B-A22B-Instruct-2507:Qwen3 235B-A22B Instruct 2507 版本,適合通用對話、指令跟隨、多語種與長上下文任務。
新增模型
- 新增
gemini-3.6-flash:Google 最新 Flash 系列模型,適合複雜工作流程、電腦使用、圖表推理和長上下文任務。 - 新增
gemini-3.5-flash-lite:更輕量、低成本的 3.5 系列模型,適合高吞吐、日常自動化和批次處理場景。 - 新增
glm-5.2-fast-preview:智譜 GLM-5.2 系列快速預覽模型,適合低延遲對話、快速推理和高吞吐應用場景。
- 透過
/v1/responses和/v1/messages呼叫qwen3.8-max-preview的串流請求更穩定;此前可能被誤判為empty_stream或 502 的有效串流回應,現在可正常完成。
Gemini 圖像參數透傳
- 透過 OpenAI 相容的 Chat Completions 呼叫 Gemini/Vertex 圖像輸出模型時,現在可在
extra_body.generationConfig.imageConfig中傳遞aspectRatio和imageSize。
- Gemini embedding 回應提供真實
usageMetadata時,平台會優先按模型推理廠商返回的 token 用量計費;缺失時仍保留原本地估算兜底。
/v1/responses請求中的 system/developer 訊息現在可攜帶 message-local function tools,並在橋接到 Chat 模型時保留工具宣告。依賴 Kimi K3 等動態工具工作流程的客戶端,工具呼叫鏈路更穩定。
- 透過
/v1/responses呼叫會橋接到 Chat 的模型時,stop現在會隨請求傳給模型推理廠商。單個停止詞可正常生效,超過模型推理廠商限制的數量或長度會返回與 Chat Completions 一致的邊界錯誤。
- DeepSeek V4 相關模型可按配置支援峰谷分時段計費;預扣與最終結算使用同一請求提交時間口徑,跨峰谷邊界的串流請求也按提交時刻計價。預扣保護僅作用於配置了分時段計費的模型,避免影響其他普通模型的餘額凍結體驗。
Claude Messages thinking 相容性修復
- 透過
/v1/messages呼叫 OpenAI/Azure Chat 橋接模型時,Claudethinking設定現在會轉換為模型推理廠商可識別的思考強度,減少帶 thinking 請求返回 400 的情況。Opus 4.8 等 Claude 原生思考請求仍保持相容。
- 生產環境 gateway 的最長串流連線時間已從 1 小時放寬到 2 小時。Kimi K3 等長思考、長生成任務更不容易在思考或生成過程中被提前切斷。
新增模型
新增 qwen3.8-max-preview:
限時福利:Qwen3.8-Max-Preview 調用價格按 1 折計算,相當於用量直接擴大 10 倍,活動限時,先到先得。
Qwen3.8-Max-Preview 是通義千問系列最新一代基座模型,參數量達 2.4T,並仍在持續進化中。相較上一代旗艦 Qwen3.7-Max,它在程式開發(Coding)、專業辦公(Cowork)等核心能力上實現顯著提升,在全端開發、資料分析、Office 辦公工作流等複雜長程任務中展現出全球領先的綜合能力。
新增 qwen3.8-max-preview:
限時福利:Qwen3.8-Max-Preview 調用價格按 1 折計算,相當於用量直接擴大 10 倍,活動限時,先到先得。
Qwen3.8-Max-Preview 是通義千問系列最新一代基座模型,參數量達 2.4T,並仍在持續進化中。相較上一代旗艦 Qwen3.7-Max,它在程式開發(Coding)、專業辦公(Cowork)等核心能力上實現顯著提升,在全端開發、資料分析、Office 辦公工作流等複雜長程任務中展現出全球領先的綜合能力。
新增模型
- 新增
kimi-k3:Kimi K3 是 Moonshot AI 發布的開放 3T 級長上下文模型,採用 2.8T 參數、1M 上下文窗口,並原生支援視覺輸入,適合長程編碼、知識工作、複雜推理與多模態理解場景。呼叫方式見 Kimi K3 實測呼叫指南(三介面範例與能力支援矩陣)。 - 新增
hy-3d-3.1:騰訊混元生 3D 專業版模型,支援文生 3D、圖生 3D 與多視角輸入,面向遊戲、電商展示、3D 列印、產品設計等 3D 資產生成場景;3.1 版本在幾何精度與紋理細節上進一步提升,並支援八視角多角度輸入。
- 新增
/v1/3d/generations非同步 3D 生成接口,首期接入騰訊 TokenHub 混元 3D。支援提交生成任務和查詢任務結果,便於把 3D 資產生成接入自動化工作流程。
- Kimi K3 請求中的 message-level 動態工具宣告會被保留並透傳,模型推理廠商不再因工具宣告遺失而返回 400;使用 Kimi dynamic tool loading 的客戶端相容性更好。
- Chat Completions 中的 custom tool、Cohere 文字區塊和
assistant.content: null等請求形態相容性提升。合法請求更穩定地到達模型推理廠商;畸形或不支援的輸入會返回結構化錯誤,不再被誤判為空 200 成功。
doubao-seedream-5-0-pro的圖片生成計費現在支援按輸出像素檔和輸入圖片張數計價,文生圖、圖生圖等請求的費用更貼近實際生成規格。
Gemini 工具呼叫相容性修復
- 透過 OpenAI 相容介面呼叫 Gemini/Vertex 時,工具定義或結構化輸出 schema 中包含空字串列舉值的請求,不再因模型推理廠商校驗返回 400;工具呼叫與 JSON Schema 工作流程更穩定。
新增音訊模型
- 新增
gpt-audio-1.5:OpenAI 首個正式可用(GA)的音訊模型,支援音訊輸入與音訊輸出,可透過 Chat Completions REST API 呼叫,適合語音對話、音訊理解與音訊生成場景。 - 新增
gpt-4o-transcribe-diarize:內建說話人分離的 ASR 轉寫模型,可將對話中的音訊片段關聯到不同說話人;此模型僅可在 Transcription API 使用。
- 智能路由功能介紹頁現已上線,展示公開路由維度評分與在池模型。同時新增兩個開放介面:取得自動路由策略對應模型範圍回傳 5 大類 23 個子維度的模型評分、價格係數、首字延遲與在池模型,取得模型廠商圖示回傳模型廠商的顯示名稱與圖示;圖像與影片生成維度暫未納入。使用方式參見模型智慧路由文件。
API 錯誤提示更一致
/v1/responses使用未知模型時,現在返回 400no_available_channel,與其他 API 入口保持一致,方便用戶端按「無可用服務」情境處理,而不是收到 500。
- 請求體轉換或參數校驗失敗時,API 會直接返回相應的 400/錯誤資訊,不再把原始請求繼續轉給模型推理廠商,減少無效呼叫和難以理解的失敗。
- Claude Code 透過 Bedrock 呼叫 Claude 時,同一會話內的 prompt cache 命中更穩定,有助於減少重複快取寫入費用和首 token 延遲。
- Gemini 請求現在按回應中實際出現的思考簽名或快取活動決定是否保持同一服務,減少多輪驗簽或快取狀態不一致;圖片生成等無狀態任務不會被不必要地固定到同一服務。
新增模型
- 新增
gpt-5.6-sol、gpt-5.6-terra、gpt-5.6-luna三款 GPT-5.6 系列模型(OpenAI 2026-07-09 正式發布)。三檔均為 1,050,000 上下文視窗、128K 最大輸出、知識截止 2026-02-16,支援文字與圖像輸入,可透過 Chat Completions、Responses 與 Claude 相容的 Messages 介面呼叫。Sol 為旗艦檔,面向複雜專業工作,官方稱其為當前最佳編碼模型;Terra 性能與 GPT-5.5 相當且價格減半;Luna 面向成本敏感場景。
- 新增 GPT 提示詞快取文件:GPT-5.6 系列起快取寫入按 1.25 倍輸入價計費、快取讀取按 0.1 倍計費、快取至少保留 30 分鐘;涵蓋
prompt_cache_key與顯式快取斷點參數說明、計費邏輯、介面範例與命中排查。提示詞快取實踐與 Claude 提示詞快取的 OpenAI 快取口徑同步更新。
- Claude Fable 與 Mythos 系列在請求中使用
reasoning_effort時,現在會按 adaptive thinking 處理,減少這類模型因思考參數不匹配導致的模型推理廠商 400。
- OpenAI 相容請求中的
stop現在會映射到 Claude 與 Gemini 原生請求。Claude 不接受的純空白 stop 會被過濾,OpenAI/Gemini 的數量限制也按各自規則處理,跨協議生成截斷更穩定。
gpt-chat-latest以及後續 GPT/ChatGPT latest 別名在需要時會保留max_completion_tokens,減少因誤發舊字段max_tokens導致的 400。
- 當 Key 級別使用限額耗盡時,API 現在返回更明確的引導文案,提示去調整並啟用 Key 限額,而不是僅返回底層 quota 報錯。
- 非串流 chat 回應在只有
tool_calls、沒有文字內容時,現在會顯式返回content: null,提升 OpenAI 風格 SDK 與回應解析器的相容性。
結構化輸出修復:JSON 格式錯誤自動修復
- 新增 Key 級別的結構化輸出修復能力,預設關閉。開啟後,對宣告了結構化 JSON 輸出的非串流請求,當模型回傳的 JSON 存在截斷、尾隨逗號、程式碼區塊包裹等格式錯誤時,閘道在回傳前自動修復為可解析的合法 JSON,數值保持原樣,用戶端無需改動。支援 Chat Completions、Responses、Claude、Gemini 四種協議;發生修復時回應帶有
X-JSON-Repaired: true回應標頭。
- 完善 Claude 提示詞快取 與提示詞快取實踐文件,補齊按模型區分的最小可快取 token 門檻(512 / 1,024 / 2,048 / 4,096),新增 Claude Opus 4.8、Opus 4.7、Fable 5 等當前模型。該門檻並非隨模型版本升級而提高;低於門檻的前綴即使顯式設定
cache_control也不會被快取。
- 用量看板的彙總結果現在更接近日誌明細結算口徑,減少並發彙總遺漏,並統一延遲重放時的小時歸桶。歷史看板數據仍可能存在小幅差異;對帳和結算仍以請求日誌明細為準。
- 新增
grok-4.5,面向程式碼、Agent 任務和知識工作,支援可配置推理、工具呼叫和 500K 上下文,適合程式碼修復、複雜工程任務、知識問答與 Agent 工作流。
gpt-5.5+ 工具呼叫自動橋接 Responses
- 使用 OpenAI 相容
/v1/chat/completions呼叫 gpt-5.5 及以上模型時,帶 tools 和reasoning_effort的請求會自動使用 Responses 能力,減少模型推理廠商因參數組合不支援導致的 400。現有用戶端不必改成/v1/responses也能獲得更穩定的工具呼叫體驗。詳見:Responses API
結構化輸出跨協議相容
- OpenAI 相容的
response_format與 Claude 原生output_config.format現在可在相關路徑中雙向適配。呼叫方在跨 OpenAI/Claude 協議切換時,更容易保留結構化輸出約束。詳見:Structured Output。
/v1/messages 呼叫更穩定- 透過 Vertex AI 呼叫 Gemini 等非 Claude 模型時,
/v1/messages請求會按模型族正確分流,減少誤走 Claude 路徑導致的 not found 或 404。
Gemini 原生端點補齊
- 透過 AIHubMix 的 Gemini 入口使用
@google/genaiSDK 時,現在已支援原生 embeddings、interactions create 與 context caching 相關能力。此前這些路徑可能返回路由未註冊或 404;現在可用於向量生成、互動式呼叫,以及快取建立/查詢/更新/刪除等工作流。詳見:Gemini 原生 SDK 接入
hy3-preview、ERNIE、Grok、Mimo 等長上下文模型現已支援按上下文長度分級計費,費用計算更精確。
- Vertex AI 的 Gemini/Claude 串流請求現在會記錄更準確的首 token 與延遲資料,日誌頁和監控排查看到的耗時資訊更可信;此變更不影響模型回應內容。
- 新增
tencent-hy3文字生成模型(騰訊混元 Hy3 正式版)。MoE 架構,295B 總參數 / 21B 啟動參數,256K 上下文視窗。支援快慢思維融合推理模式,適合複雜推理、程式碼生成和 Agent 工作流。Apache 2.0 授權條款開源。
Jina Search/Reader 支援 POST 與檔案上傳
- Jina Search 與 Reader 現在支援 POST 呼叫;Reader 可透過 multipart 上傳 PDF、Word、Excel、PPT、HTML 和圖片等本機檔案。預設回應更貼近 Jina 原生 markdown;需要 JSON 的用戶端可明確送出
Accept: application/json。
- 修復
/v1/responses經相容橋接呼叫 Azure 類非 GPT 服務時,可能因api-version為空而返回 404 的問題,減少此類請求的直接失敗。
- 修復部分 vLLM / Azure Foundry 類模型推理服務在串流輸出中可能隨機截斷的問題,使用者更容易收到完整回答、結束訊號與用量資訊。
- 新增
command-a-plus-05-2026文字生成模型,適合企業對話、文字生成和 Agent 工作流。
Jina 搜尋與網頁讀取 API 上線
- 新增 Jina 搜尋與 Reader 能力,支援透過 AIHubMix API Key 呼叫 Jina 搜尋結果取得與網頁內容讀取,適合需要外部網頁資訊檢索、資料讀取與 Agent 工具呼叫的場景。詳見:Jina AI
- Veo 3.1 圖生影片現支援首幀、尾幀和參考圖輸入,使用者可以更精準地控制影片起止畫面、角色參考和風格參考,適用於更複雜的影片創作工作流。詳見:影片生成
- 優化 Gemini 請求在跨渠道重試時的相容性,減少部分重試場景下的 400 錯誤,提升多渠道兜底呼叫的成功率。詳見:Gemini 使用指南
- OpenAI 相容介面在非串流與串流回應中保留
logprobs、refusal、finish_reason等欄位的null值,降低依賴 OpenAI 標準回應結構的 SDK、Agent 與日誌解析工具出現相容差異。
- 優化 Claude Code 透過 AIHubMix 呼叫 Claude 模型時的請求相容處理,減少用戶端環境資訊進入發往模型推理廠商的請求,提升第三方 Agent 用戶端接入的隱私保護。
- 自建帳號系統補齊信箱驗證碼登入/註冊、密碼設定、資料修改、第三方帳號綁定/解除綁定與帳號註銷等後端能力,並加強驗證碼用途隔離與停用帳號攔截;Stripe 儲值回呼處理也更穩定。
- claude-sonnet-5(對話 / 推理 / Agent 場景)。
- gemma-4-31b、longcat-2.0(文字生成模型)。
- gemini-3.1-flash-lite-image(圖像能力模型)。
- mai-image-2.5、mai-image-2.5-flash(圖像生成模型)。
圖像生成計費與參數相容性優化
gpt-image-2在 Images 端點的計費口徑統一為按 token 結算;GLM 圖像生成支援透傳watermark_enabled、quality等擴充參數,去浮水印與品質控制等設定可依模型推理廠商能力生效。詳見:圖像生成
- Gemini 檔案上傳介面失敗時不再寫入使用者可見的普通請求日誌,減少非推理介面在日誌頁產生的噪音;內部排障日誌仍會保留。
新增 Deep Research 模型
- 新增 o4-mini-deep-research 與 o3-deep-research,僅支援透過
/v1/responses端點呼叫;請求需包含web_search_preview或mcptools,適合需要深度網頁研究與研究型回答的場景。
Responses 協定支援任意模型
/v1/responses端點不再侷限於 GPT 系列,現可呼叫平台上的任意模型。基於 Responses 協定的工具(如 Codex CLI)因此能透過本機模型目錄使用 GLM、Gemini、DeepSeek、Kimi、Qwen 等模型,不再侷限於 OpenAI 官方模型。
- 修復
step-3.7-flash透過/v1/responses呼叫時可能返回空白內容或空回應的問題,推理內容和最終回答現在可正常返回。
- Codex CLI 文件新增「在 Codex 中使用自訂模型」教學:透過本機模型目錄(
model_catalog_json)宣告 AIHubMix 上的任意模型(GLM、Gemini、DeepSeek、Kimi、Qwen 等),即可在 Codex 的/model清單裡自由切換,不再侷限於 OpenAI 官方模型。文件含一鍵產生前 30 名模型目錄的指令稿與常見踩坑說明。詳見:Codex CLI · 在 Codex 中使用自訂模型
新增備用網域支援
- 新增備用網域
https://api.inferera.com,端點與能力和主網域https://aihubmix.com完全一致。當主網域存取異常(如無法連線、逾時)時,可將請求位址替換為備用網域,API Key、模型、請求主體等參數保持不變。
新增模型
- 豆包 doubao-seed-2-1-pro、doubao-seed-2-1-turbo。
- HappyHorse 影片系列 happyhorse-1.1-t2v(文生影片)、happyhorse-1.1-r2v(參考生成)、happyhorse-1.1-i2v(圖生影片)。
- Stripe 結帳頁會自動預填帳戶信箱,並減少不必要的姓名和帳單地址收集,支付寶等付款方式的儲值流程更簡潔。
- 當帳戶餘額低於 -$1 時,將無法繼續呼叫免費模型;請儲值後再發起呼叫。
新增 AIHubMix CLI(命令列工具)文件
- 新增 AIHubMix CLI(命令列工具) 文件:單一二進位、零依賴(無需 Python / Node / Go),在終端機即可查詢帳戶餘額、管理 API Key、查看可用模型,並對腳本與 AI Agent(如 Claude Code)友好。
- 請求模型名填
auto,閘道依請求內容從平台數百個模型中自動選出最適模型,支援成本優先 / 品質優先 / 低延遲等策略,依實際命中模型計費,用戶端程式碼零改動。詳見:模型智慧路由
- 修復
deepseek-v4-pro、deepseek-v4-flash兩個模型快取命中率低於預期的問題。
- 為 Codex、Claude Code、Cursor、Cline 等支援 Skills 的 AI Agent 提供本機擴充能力:用自然語言完成 AIHubMix 接入、模型查詢、依能力選型、範例生成與錯誤排查。該 Skill 按需從官方介面讀取模型、價格、協定契約等即時資訊,避免 Agent 依賴過期記憶。詳見:Skills
新增可靈(Kling)影片模型
- 接入可靈影片生成全能力:文生影片、圖生影片、多圖參考與 omni 多模態生成,按模型名走原生協定呼叫。
OpenClaw 接入外掛問題已修復
- AIHubMix 的 OpenClaw 接入外掛 aihubmix-auth 已修復此前的接入問題,現可穩定使用。安裝並填入一把 AIHubMix Key 即可在 OpenClaw 中同時呼叫 OpenAI / Anthropic / Gemini 等模型。
- 智譜 glm-5.2。
新增 Open Design 接入支援
- AIHubMix 現已是 Open Design(開源、本地優先的 Claude Design 平替)內建支援的 BYOK 閘道。在其 API(BYOK)模式裡選 AIHubMix、填一把 Key,即可同時驅動聊天 / 圖像 / 影片 / 語音生成,並按模型名走各家原生協定。詳見:Open Design 接入教學
- 原生智譜渠道的
glm-5.2支援reasoning_effort分檔調節思考深度,舊版模型按版本自動分流,呼叫方無需改動。
- kimi-k2.7-code-highspeed(Kimi 程式碼高速版)。
新增模型
- coding-glm-5.2 及免費版 coding-glm-5.2-free。
模型映射與錯誤回退
- 新增模型映射(Mapping)與錯誤回退(Fallback): 在主控台為每個 API Key 設定模型名映射與錯誤時回退,把用戶端的模型別名改寫為真實模型名稱,主模型失敗時自動切換到備用模型,按最終回應模型計費,用戶端程式碼零改動。詳見:模型映射與回退
- kimi-k2.7-code。
step-3.7-flash 限時 1 折
- step-3.7-flash 限時 1 折優惠:輸入每百萬 token 僅 0.022 美元,輸出每百萬 token 僅 0.132 美元,歡迎體驗。
claude-opus-4-20250514、claude-sonnet-4-20250514官方將於 6 月 15 日下架,屆時平台會自動將下架模型路由至同系列 4-5 版本。
新增模型
- claude-fable-5【已退役】。
- Fable 5 有更強的安全護欄,部分正常問題也可能被攔截: 會對網路安全、生物 / 化學、模型蒸餾 / 推理提取等方向做額外分類。有些技術研究、漏洞分析、生物醫藥相關問題,可能被拒絕,或轉交到 Opus 4.8 回答。
- Mythos 5 是受限存取,不是普通開放模型: Mythos 5 和 Fable 5 能力同源,但少了部分安全分類器;目前只面向 Project Glasswing / 獲批客戶。一般使用者實際用到的是帶護欄的 Fable 5。
- API 成本更高: Fable 5 價格為每百萬輸入 token 10 美元、每百萬輸出 token 50 美元,約為 Opus 4.8 的兩倍。
- 隱私: Fable 5 / Mythos 5 被列為 Covered Models,預設要求至少 30 天資料保留,不支援 Zero Data Retention。
- API 呼叫拒絕顯示: Fable 5 拒絕請求時,API 返回的是 HTTP 200,但
stop_reason是refusal。
Gemini 相容介面支援音訊輸入
- OpenAI 相容介面(
/v1/chat/completions)呼叫 Gemini 時支援input_audio音訊輸入(此前會被靜默丟棄),並在返回的 usage 中補齊 audio_tokens 計量。
新增模型
- grok-build-0.1、hy3-preview、免費模型 step-3.7-flash-free。
新增模型
- 通義千問 qwen3.7-plus。
新增模型
- MiniMax minimax-m3。
- 百度 musesteamer-air-image(圖像生成)。
- 推出 Aihubmix 圖片生成 MCP,方便開發者接入圖片生成服務
- 可在 Claude Code 中使用 AiHubMix 平台上的任何大型模型
- 新增 Gemini Cli 轉發支援,多種使用方式,由你靈活掌控。
- OpenAI Responses API 介面新增程式碼解析器和 Remote MCP 呼叫。
- 推出 應用標識碼 APP-Code,為開發者們提供全部模型 10% 優惠;
- 支援 openai 的推理總結 (Reasoning summaries) 顯示,適用於 responses api。
- 新增 Gemini 隱式快取功能,支援自動命中與命中回饋。開發者可以透過 usage_metadata 判斷命中情況。成本節省非保證,實際效果因請求結構和使用情境而異。
Claude 4 新功能全面支援
- ⏳ 新的快取週期:1 小時級別的快取Beta 支援
- 🎉 新的文字編輯工具:Claude 4 模型支援全新的
text_editor_20250429工具類型和str_replace_based_edit_tool工具名稱 - 🚫 拒絕停止原因:引入新的
refusal停止原因,用於處理模型因安全原因拒絕產生的內容 - 🧠 擴展思考:Claude 4 模型返回完整思考過程的摘要,提供擴展思考的全部智慧優勢
- 🔄 交錯思考:支援工具使用與擴展思考交錯,實現更自然的對話體驗(Beta)
- ⚠️ 不再支援的功能:
- Claude 4 文字編輯工具不再支援
undo_edit命令 - 移除了
token-efficient-tools-2025-02-19支援(僅 Claude 3.7 可用) - 移除了
output-128k-2025-02-19支援(僅 Claude 3.7 可用)
- Claude 4 文字編輯工具不再支援
- 📚 更新了完整的遷移指南和程式碼範例,幫助使用者從 Claude 3.7 平滑遷移到 Claude 4
- 新增對 Dify 外掛的支援,實現 Aihubmix 模型在 Dify 中的無縫整合。只需一個密鑰,擴展並管理兩百多個模型。
- 支援為程式任務而生的 codex-mini-latest,可透過 Responses api 端點或 Codex CLI 呼叫。
- 支援 Google imagen 3.0 繪圖和 veo 2.0 影片產生,豐富你的創作形式。
- gemini-2.0-flash-exp 升級為正式預覽版 gemini-2.0-flash-preview-image-generation
新增 Ideogram AI V3 介面,Ideogram 最先進的圖像產生模型。
- 萬眾期待的 OpenAI 繪圖介面
gpt-image-1正式上線,支援文生圖、圖生圖。 - 支援 Gemini 原生呼叫,可以精準控制 Flash 2.5 的推理預算。
整合了 Jina AI 的三個核心介面,助你輕鬆建構功能強大的智慧體。三個介面分別是:向量嵌入 (Embeddings)、重排序 (Rerank) 和深度搜尋 (DeepSearch)
OpenAI Responses api 端點支援,工具支援更全面。
新增 OpenAI CodeX CLI 支援!在命令列中用自然語言程式設計。
透過在模型 id 後方追加
:surfing,讓任何模型具備搜尋能力 Beta支援 Claude prompt caching,高頻提示詞重複使用可節省高達 76% 成本!
支援 Ideogram AI 繪圖介面,文字繪製能力強勁,支援生圖、混合、局部編輯和放大等。
全新文件,帶給大家更好的體驗
支援 Claude 文字編輯工具 (Claude Text Edit Tool)
啟用全新的三叉戟 Logo
新增了對 OpenAi 和 Google Gemini 模型的原生搜尋功能的支援;未來將完善這個介面擴展支援第三方搜尋;
新增模型:gpt-4o-mini-search-preview 和 gpt-4o-search-preview
o1 和 o3-mini 價格下降 10%,與官網一致;
aihubmix-DeepSeek-R1 因微軟價格上漲 7 倍因此該模型價格上漲 7 倍,推薦使用火山的 DeepSeek-R1,穩定又便宜;新增 qwen-qwq-32b 和 qwen2.5-vl-72b-instruct
Claude 模型全面降價 15%;新增模型 gpt-4.5-preview;注意價格極其昂貴,呼叫請注意;
提升 Deepseek 穩定性;來自字節的最穩定,推薦用這兩個:DeepSeek-R1 和 DeepSeek-V3;
增模型 claude-3-7-sonnet-20250219
- gpt-4o 概率性出現返回很慢的情況,這是廠商問題;建議暫時改用 gpt-4o-2024-11-20
- Perplexity api 暫時下線,Perplexity 官方的計費模式較為複雜,成本高於本平台的定價結構,我們調整價格後重新上線;
- 字節官方限時折扣結束恢復原價,DeepSeek-R1 價格已上調
- 新增模型詳情頁及參數資訊
- 字節官方限時折扣結束恢復原價,DeepSeek-V3 價格已上調;預計字節的 R1 近期也會恢復原價,所以我們也會同步漲價
- 新增模型:kimi-latest(官方計費根據輸入內容長度 8k,32k,128k 分 3 檔計費,本站不支援該計費結構,取中 32k 檔為計費標準,價格敏感者請勿用)
- 優化了網站頁面結構;
- 日誌頁面併入用量統計頁;
- 公告內容移到模型廣場頁,
- 設定移到頭像下面;
- aihubmix-DeepSeek-R1 價格下降 50%
- 新增模型:gemini-2.0-pro-exp-02-05-search,gemini-2.0-flash-exp-search,整合了 Google 官方搜尋聯網功能
- 新增模型:gemini-2.0-flash、gemini-2.0-pro-exp-02-05、gemini-2.0-flash-lite-preview-02-05 新增模型:o3-mini,o1(註這兩個模型後台扣費比官方貴 10% 左右,因為這兩個模型帳號有限)
- o1 模型 openai 官方不支援傳入參數 stream
- o3-mini 不支援傳入參數 temperature,o3-mini 新增參數 Reasoning effort;可以傳入”low, medium, high” 如果不傳預設為 medium
功能:新增 openai 聲音模型輸入輸出的功能支援,api.aihubmix.com 伺服器可用,主站伺服器穩定 1 週後更新支援。整體後台扣費和官方一致,暫時日誌只展示文字部分 token 聲音費用暫時無法展示,但不影響使用新增模型:
- o3-mini,o1;(註這兩個模型後台扣費比官方貴 10% 左右,因為這兩個模型帳號有限)
- aihubmix-DeepSeek-R1(推薦,較穩定)
- qwen-max-0125(即 Qwen2.5-Max)、sonar-reasoning
- deepseek-ai/DeepSeek-R1-Zero 和 deepseek-ai/DeepSeek-R1,deepseek-r1-distill-llama-70b
- aihub-Phi-4
- Doubao-1.5-pro-256k、Doubao-1.5-pro-32k、Doubao-1.5-lite-32k、Doubao-1.5-vision-pro-32k
- sonar、sonar-pro(perplexity ai 最新發布)
- gemini-2.0-flash-thinking-exp-01-21
- deepseek-reasoner(即 DeepSeek-R1)
- MiniMax-Text-01
- codestral-latest(Mistral 推出了新的 code 模型 - Codestral 25.01)
新增模型:
- aihub-Phi-4
- Doubao-1.5-pro-256k、Doubao-1.5-pro-32k、Doubao-1.5-lite-32k、Doubao-1.5-vision-pro-32k
- sonar、sonar-pro(perplexity ai 最新發布)
- gemini-2.0-flash-thinking-exp-01-21
- deepseek-reasoner(即 DeepSeek-R1)
- 新增 Perplexity Ai API 模型;僅支援 api.aihubmix.com 預覽版伺服器呼叫,如果沒問題我們會更新到主伺服器 aihubmix.com; api.aihubmix.com 為預覽版伺服器,後續新功能先更新到這個伺服器,通常穩定 1 週我們再更新到主伺服器 aihubmix.com
- MiniMax-Text-01
- codestral-latest(Mistral 推出了新的 code 模型 - Codestral 25.01)
- 新增 gemini-2.0-flash-exp-search,支援 Google 原生聯網搜尋功能;官方 gemini 2.0 flash 模型的聯網需要額外傳入參數才支援聯網功能,aihubmix 做了整合,模型名字加上 search 參數即可使用
- 新增模型 deepseek-ai/DeepSeek-V3
- 新增模型廣場頁面代替原來的模型/價格頁面
- 修復 gemini-2.0-flash-thinking-exp-1219 模型只輸出思考沒有答案問題
- 修復餘額提醒郵件收不到問題
- 新增用量統計頁面,新增充值記錄頁面
- 新增豆包系列模型:Doubao-lite-128k、Doubao-lite-32k、Doubao-lite-4k、Doubao-pro-128k、Doubao-pro-256k、Doubao-pro-32k、Doubao-pro-4k
- 新增模型:gemini-2.0-flash-thinking-exp-1219
- 新增模型:gemini-2.0-flash-exp、aihubmix-Mistral-Large-2411、aihubmix-Llama-3-3-70B-Instruct、grok-2-1212、grok-2-vision-1212
- 新增模型:gemini-exp-1206、llama-3.3-70b-versatile、learnlm-1.5-pro-experimental
- 新增模型:gemini-2.0-flash-exp、aihubmix-Mistral-Large-2411、aihubmix-Llama-3-3-70B-Instruct
- 新增模型:gemini-exp-1206、llama-3.3-70b-versatile、learnlm-1.5-pro-experimental
- 新增用量統計頁面
- 近期新增模型:gpt-4o-2024-11-20,step-2-16k,grok-vision-beta,
- 千問 2.5turbo 百萬上下文模型:qwen-turbo-2024-11-01
- 相容 Claude 原生 sdk,v1/messages 介面已支援上線;
- Claude 原生介面的快取和控制計算機功能還不支援(prompt caching 和 computer use)我們會在接下來的兩週內繼續完善。
- 新增模型:claude-3-5-haiku-20241022
- 新增馬斯克 x.ai 最新模型 grok-beta
- 新增模型:claude-3-5-sonnet-20241022
OpenAI 最新的快取功能現已上線。此功能目前支援以下模型:
- GPT-4o
- GPT-4o-mini
- o1-preview
- o1-mini
- gpt-4o 模型後台計費下降價格同步官方
- 新增模型:aihubmix-Llama-3-2-90B-Vision,aihubmix-Llama-3-70B-Instruct
- 新增 Cohere 最新模型 aihubmix-command-r-08-2024,aihubmix-command-r-plus-08-2024
- 新增模型:whisper-large-v3 和 distil-whisper-large-v3-en
- 注意:Whisper 模型實際計費是按照輸入的秒數計費的,但是目前頁面價格展示有問題未來會修復,後台底層計費沒有問題 whisper-1 完全同步 Openai 官方扣費
- 新增模型 o1-mini 和 o1-preview;
註:最新這兩個模型,要求傳入參數有變,一些殼軟體如果不更新預設傳入的參數會報錯;
需要注意
經測試,o1 模型不支援以下內容,並報錯:- system 欄位:400 報錯
- tools 欄位:400 報錯
- 圖片輸入:400 報錯
- json_object 輸出:500 報錯
- structured 輸出:400 報錯
- logprobs 輸出:403 報錯
- stream 輸出:400 報錯
- o1 系列:20 RPM,150,000,000 TPM,很低,隨時 429 報錯
- 其他:temperature, top_p and n 被固定為 1;presence_penalty 和 frequency_penalty 被固定為 0
- 新增模型:mattshumer/Reflection-Llama-3.1-70B;ps:據說 llama3.1-70b 最強微調版本
- claude-3 模型價格上調調整,為了維持 Claude 模型穩定供應,目前呼叫我們會比直接呼叫官方貴 10%,後續會逐步下調;
- 增加了 Openai 系列模型的併發能力,理論上基本支援無限併發;
- 新增模型:Phi3medium128k、ahm-Phi-3-medium-4k、ahm-Phi-3-small-128k
- 增加了 Llama 相關模型的穩定性
- 進一步優化了 Claude 模型的相容性
- 新增 Openai 剛剛更新 4o 版本 gpt-4o-2024-08-06,見 https://platform.openai.com/docs/guides/structured-outputs
- 新增 Google 最新模型:gemini-1.5-pro-exp-0801
- 增加了線上直接支付充值
- 修復了 Claude 多輪對話格式報錯問題:1、messages: roles must alternate between “user” and “assistant”, but found multiple “user” roles in a row;
- 優化了 Claude 模型的使用 function 功能時 index 問題
- https://orisound.cn 備用伺服器將在 9 月 7 日全面下線;目前在使用這個地址的請抽空改成主伺服器 https://aihubmix.com 或者備用伺服器 https://api.aihubmix.com
- 新增支援 Mistral Large 2,模型名稱:Mistral-large-2407 或 aihubmix-Mistral-large-2407;
- 系統優化
- 新增最新 llama-3.1 模型 llama-3.1-405b-instruct、llama-3.1-70b-versatile 和 llama-3.1-8b-instant,歡迎嘗試;
- 已修復 gpt-4o-mini 模型在價格計算方面的問題。具體情況如下:
文字輸入價格:OpenAI 官方的 gpt-4o-mini 模型輸入文字的價格僅為 gpt-4o 模型價格的 1/33。
圖片輸入價格:OpenAI 官方的 gpt-4o-mini 模型輸入圖片的價格與 gpt-4o 模型價格相等。 - 為了確保價格計算的準確性,我們在計算 gpt-4o-mini 模型輸入圖片的 token 數時,將其乘以 33 倍,以與官方價格對齊。
- 詳情可見 Open AI 官方價格

- 新增支援 gpt-4o-mini 模型,後台計費同步官方
- 新版本 nextweb 增加了支援呼叫非 Openai 模型 呼叫本站非 OpenAI 模型
- 增加了阿里千問模型的後台扣費,總體呼叫我們的成本比呼叫阿里雲官方貴 10% 左右
- 優化 azure openai 返回的輸出更好地相容了 Openai 介面
- 支援 Claude-3 的 tool Calling
- 增加了很多新模型,見設定/可用模型
- 最新 claude-3-5-sonnet-20240620 已支援,呼叫方法見 呼叫本站非 open AI 模型教學
- 後台日誌頁面現在開始,支援下載使用請求記錄
- 降低了隨機到 azure openai 的機率,現在幾乎很小機率會隨機到
- 下調 Claude-3 相關模型的費用(Claude 3 Haiku、Claude 3 Sonnet、Claude 3 Opus)後台扣費和官方一致;因此目前我們網站額度零售價格,使用我們的 API 的成本相當於官網 86 折;
- 優化 gpt-4o 的 token 計費,tokenizer 的 cI100k_base 改為 0200k_base,之前的 gpt-4 系列用的是 cI100k_base;結果就是中文、韓文、日文的流式請求的 token 計數會比之前下降;
- 新增阿里最新開源模型 Qinwen2
- alibaba/Qwen2-7B-Instruct、alibaba/Qwen2-57B-A14B-Instruct、alibaba/Qwen2-72B-Instruct
- 新增模型 gemini-1.5-flash
- 新增模型 gpt-4o
- 新增 llama3(llama3-70b-8192、llama3-8b-8192)gemini-1.5-pro、command-r、command-r-plus、歡迎呼叫嘗試
- Claude-3 模型恢復供應;目前本站正在連接 Claude-3 部署在 aws 和 Google cloud 上的端點。
- 為了維持伺服器費用及團隊成本,Claude-3 模型和價格後台扣費比官方貴 10%
- 後續呼叫量增加的話,會逐步下調至 5% 左右,甚至更低,
- 目前併發有待測試和隨著呼叫增加而去申請更高的併發呼叫。
最後更新:2026-06-22