Skip to main content
새 모델
  • hy4-preview가 추가되었습니다: Tencent Hunyuan의 Hy4 Preview로, 총 파라미터 770B, 활성 파라미터 49B의 MoE 아키텍처를 채택하여 Agent, 코딩, 생산성 워크플로에 최적화되어 있습니다. 복잡한 작업에서의 이해, 계획, 도구 사용, 지속적인 실행을 강화하며 코딩, 복잡한 소프트웨어 엔지니어링, 문서 처리, 정보 분석, 오피스 자동화, 웹 생성, 도구 간 협업에 적합합니다. 100만 토큰 컨텍스트 윈도우, 최대 64K 출력, 추론, 웹 검색, 도구/함수 호출, 구조화된 출력을 지원합니다.
새 모델
  • qwen3.8-flash가 추가되었습니다: Alibaba Cloud 통이치엔원의 플래그십 네이티브 비전-언어 모델로, 코딩, 오피스 작업, 긴 컨텍스트 추론 및 에이전트 워크플로에 적합합니다. 100만 토큰 컨텍스트 윈도우, 최대 128K 출력, 사고, 웹 액세스, 도구 호출, 구조화된 출력을 지원합니다. Qwen3.7-Plus와 비교하여 코딩과 오피스 능력을 한층 강화하고, 학습 및 추론 효율도 함께 향상되었습니다.
MCP 이미지 도구 호출이 더 명확해졌습니다
  • MCP 이미지 생성 도구는 이제 호출자가 모델을 명시적으로 전달해야 합니다. 모델이 없을 때 기본 모델을 조용히 사용하는 상황을 피합니다.
  • openai/gpt-image-1이 외부에 표시되고 전달되는 표준 모델 ID입니다. 과거의 오타는 입력 호환용 alias로만 계속 허용하며, 요청을 보내기 전에 정규화합니다.
새 모델
  • glm-5.3-flash가 추가되었습니다: Z.AI의 Coding Agent, 복잡한 추론, 장기 소프트웨어 엔지니어링 작업을 위한 고효율 멀티모달 모델입니다. 텍스트, 이미지, 비디오 입력과 약 100만 토큰 컨텍스트, 최대 128K 출력, 사고, 도구 호출, 구조화된 출력을 지원합니다. 기존 GLM 기술 스택을 기반으로 추가적인 포스트 트레이닝과 최적화를 적용하여 추론 효율성과 응답 속도를 강조합니다.
새 기능
  • Broadcast가 추가되었습니다. 애플리케이션에 별도 계측을 추가하지 않고 AIHubMix API 요청의 Trace를 LangWatch로 자동 전송할 수 있습니다. 개인정보 보호 모드, 샘플링 비율, API Key 필터를 지원하며 LangWatch에서 모델, token 사용량, 실제 청구 비용, 지연 시간, 세션 및 Trace 정보를 확인할 수 있습니다.
MCP와 Access Key 진입점 보강
  • 기존 /mcp/ 진입점은 기존 인증 방식을 유지하면서 통합 원격 HTTP MCP 기능으로 라우팅됩니다. 오래된 클라이언트도 즉시 마이그레이션할 필요 없이 모델·가격 조회, 문서 검색, 크레딧 확인, 채팅, 이미지, 비디오 도구를 계속 사용할 수 있습니다.
  • 콘솔은 Access Key를 읽기 전용으로 복사하는 경로를 제공하며, 외부 MCP 클라이언트는 X-Aihubmix-Access-Key 헤더도 사용할 수 있습니다. 서버는 키를 로테이션하지 않고 이 응답을 캐시하지 않습니다.
투명 배경 이미지 요청이 더 안정적입니다
  • 투명 배경을 요청하는 gpt-image-2 호출은 해당 기능을 지원하는 OpenAI 네이티브 채널을 우선 사용하여, 지원하지 않는 채널에서 반복 실패하는 상황을 줄입니다. 다른 이미지 요청 경로는 변경되지 않습니다.
Agent 대상 파일이 더 빠르게 갱신됩니다
  • AI Agent와 외부 도구용 모델 목록 및 가이드가 더 빠르게 갱신됩니다.
기존 미디어 API 마이그레이션 오류 안내 개선
  • 기존 프로토콜을 더 이상 지원하지 않는 미디어 모델의 경우 /v1/images/generations, /v1/images/edits, /v1/models/:organization/:model/predictions, /v1/videos는 이제 protocol_not_supported를 반환하고 /ai/v1 비동기 미디어 API 및 관련 문서로의 전환을 안내합니다.
  • model=auto는 기존 자동 모델 선택 동작을 유지합니다. 최종 선택된 모델이 기존 엔드포인트를 지원하지 않으면 다른 모델로 조용히 전환하지 않고 명확한 오류를 반환합니다. Playground도 이러한 모델의 기존 진입점을 숨겨 실수로 사용하는 일을 줄입니다.
새 모델
  • wan3.0-video가 추가되었습니다: Alibaba Cloud Wan(통이완샹)의 프리뷰 All-in-One 비디오 모델로, 텍스트-투-비디오, 시작/끝 프레임 이미지-투-비디오, 참조 비디오 워크플로를 통합하고, 480P/720P/1080P에서 최대 30초·30 fps를 지원하여 통합 생성과 편집에 적합합니다.
  • wan3.0-video-prime가 추가되었습니다: 통합 비디오 생성 및 편집 워크플로를 위한 능력 정렬 고속 에디션으로, 더 빠른 엔드투엔드 처리량을 제공합니다.
GPT-5.6 Sol 가격 인하
  • gpt-5.6-sol은 공식 20% 가격 인하를 동기화했으며, 현재 입력 100만 token당 4달러, 출력 100만 token당 20달러입니다. 기존 호출 방식은 그대로 유지되며, 복잡한 추론, 코딩, 긴 컨텍스트 워크로드의 실행 비용이 낮아집니다.
비동기 미디어 작업 활성화 안내 개선
  • 계정에서 비동기 작업을 활성화하지 않은 경우, 미디어 생성 API는 이제 async_not_enabled 오류에 해당 콘솔의 활성화 페이지를 포함합니다. aihubmix, inferera, shkq 사용자는 각자의 콘솔로 안내되어, 403 이후 다음 단계를 알기 어려운 상황이 줄어듭니다.
새 모델
  • deepseek-v4-flash-0731-fast가 추가되었습니다: DeepSeek 에이전트 모델의 고속 버전으로, 코딩, 도구 사용, 대규모 Agent 워크로드에 적합합니다. V4 Flash 0731의 능력을 유지하면서 더 빠른 추론을 제공하며, V4 Pro와 비교해 낮은 지연 시간과 실행 효율을 우선합니다. 100만 토큰 컨텍스트 윈도우, 최대 384K 출력, 사고, 도구 호출, 구조화된 출력을 지원합니다.
  • deepseek-v4-flash-vision-exp가 추가되었습니다: DeepSeek의 실험적 멀티모달 시각 이해 모델로, 텍스트와 이미지 입력 및 텍스트 출력을 지원합니다. 이미지 설명, 스크린샷 OCR, 차트 분석, 시각 기반 Agent에 적합하며, 순수 텍스트의 Agent, 추론, 세계 지식 능력은 공식 DeepSeek V4 Flash와 같은 수준입니다.
  • ox-alpha가 추가되었습니다: 실제 개발자와 소유자가 공개되지 않은 익명의 서드파티 공급자가 제공하는 스텔스 추론 모델입니다. AIHubMix에서 무료로 제공되며, 텍스트 및 이미지 입력, 텍스트 출력, 1,048,576 토큰 컨텍스트 윈도우를 지원해 코딩, 장기 소프트웨어 엔지니어링, 지속적인 에이전트 작업, 복잡한 추론, 텍스트와 시각을 결합한 워크플로에 적합합니다.
이미지 생성 실패 복구가 더 안정적입니다
  • 이미지 생성 요청에서 일시적인 서비스 오류가 발생하면 AIHubMix가 더 일관되게 복구합니다. 선택한 모델의 능력 제한이 명확한 오류라면 계속 재시도를 멈추고 이유를 반환합니다. gpt-image-2 같은 모델에서 일시적인 서비스 차이로 인한 직접 실패가 줄어듭니다.
플랫폼 공지
  • AI Agent를 위한 연동 기능이 출시되었습니다: agents.md 연동 가이드, 사이트 및 모델별 llms.txt 기계 판독형 문서, Playground Skill(고정 주소 배포), Playground 딥링크(?models=는 링크 하나로 최대 6개의 모델 탭을 열고, ?config=는 구성을 바로 불러옵니다)를 제공합니다. 두 모델의 사양과 가격을 나란히 보려면 비교 페이지 https://aihubmix.com/compare/{model_a}/{model_b}를 사용하세요. 전체 엔트리 목록은 Agent 연동에서 확인할 수 있습니다.
이미지 생성 API 파라미터와 오류가 더 일관됩니다
  • 이미지 생성 요청에서 resolution, imageSize 같은 크기 파라미터를 더 안정적으로 처리합니다. 선택한 모델의 현재 능력을 벗어난 요청에는 호출자가 더 빨리 수정할 수 있도록 명확한 오류를 반환합니다.
모델 허브가 기본 모델과 여러 버전 표시를 지원합니다
  • GLM 5.2, Coding 에디션, Free 에디션처럼 관련된 변형을 하나의 기본 모델과 여러 버전으로 표시할 수 있습니다. 모델 탐색, 가격 비교, 버전 선택을 더 이해하기 쉽습니다.
비동기 이미지 작업이 더 빠르게 진행될 수 있습니다
  • 비동기 이미지 작업은 사용 가능한 용량에 맞춘 제한된 동시성으로 진행됩니다. 혼잡 시간대에도 대기열이 더 부드럽게 처리되고 상태/결과 전달이 더 안정적입니다.
새 모델
  • gpt-5.6-sol-disc이 추가되었습니다: AIHubMix가 OpenAI의 GPT 5.6 Sol을 위해 제공하는 한시적 할인 경로로, 최대 50% 할인 혜택을 제공하며 표준 gpt-5.6-sol과 동일한 기본 성능을 갖추고 있습니다. 이 프런티어 추론 모델은 복잡한 코딩, 전문 지식 작업, 심층 리서치, 장시간 실행 에이전트에 적합하며 텍스트 및 이미지 입력, 약 105만 토큰 컨텍스트, 최대 128K 출력, 사고, 도구, 구조화된 출력을 지원합니다.
미디어 생성 작업 안정성 향상
  • 이미지와 동영상 작업의 완료 시각, 결과 만료 시각, 산출물 보관 기준이 더 일관됩니다. 롤링 배포나 높은 동시성 상황에서도 작업 상태, 다운로드 결과, 사용자 기록이 지연되거나 중복 처리될 가능성이 낮아졌습니다.
  • 미디어 프로덕션 서비스 용량이 늘었고, 큰 미디어 응답 처리 여유도 확대되어 장시간 작업이나 큰 산출물 작업의 가용성이 더 안정적입니다.
모델 상세가 더 완전해졌습니다
  • 모델 상세에 release_date가 표시되어 공식 출시일과 AIHubMix 등록 시점을 더 쉽게 구분할 수 있습니다.
Gemini 이미지 및 업로드 호환성이 더 안정적입니다
  • Gemini 이미지 생성/편집과 Vertex 멀티 이미지 흐름에서 imageSize와 관련 이미지 파라미터가 더 일관되게 유지되어 크기나 프로토콜 불일치를 줄입니다.
  • Gemini 파일 업로드는 원래 Content-Type을 유지해 동영상 등 미디어가 잘못된 타입으로 분류될 가능성이 낮아졌습니다.
공개 오류 메시지가 더 읽기 쉬워졌습니다
  • 사용자에게 노출되는 schema, enum, capability 오류가 더 분명한 문구로 표시되어 파라미터 문제를 더 빨리 파악할 수 있습니다.
새 모델
  • glm-5.3이 추가되었습니다: Z.AI의 플래그십 텍스트 전용 추론 모델의 정식 API로, 복잡한 소프트웨어 엔지니어링, 장기 실행 Agent 작업, 취약점 분석에 적합합니다. 100만 토큰 컨텍스트 윈도우와 최대 128K 출력을 지원하며, AIHubMix에서는 무제한 동시성을 제공하고 한시적으로 10% 할인 혜택을 제공합니다.
새 모델
  • mai-thinking-1이 추가되었습니다: Microsoft MAI 시리즈의 추론 모델로, 엔터프라이즈 규모의 추론, 수학, 범용 지능, 고처리량 워크로드를 위한 모델입니다. 256K 토큰 컨텍스트 윈도우, Chat Completions, 구조화된 출력을 지원해 긴 컨텍스트 추론, 안정적인 응답 형식, 비용을 고려한 상시 사용에 적합합니다.
새 모델
  • gemini-3.7-flash이 추가되었습니다: Google의 네이티브 멀티모달 추론 모델로, 코딩, 에이전트, 웹 개발, 지식 작업을 위한 모델입니다. 텍스트, 이미지, 오디오, 비디오 입력, 100만 토큰 컨텍스트 윈도우, 조정 가능한 사고 수준, 도구 호출, 웹 검색, 구조화된 출력을 지원하며 Gemini 3.6 Flash 대비 코딩, 도구 사용, 다단계 계획 수립, 지시 따르기가 강화되었습니다.
  • coding-glm-5.3이 추가되었습니다: Z.AI의 코딩 및 에이전트 워크플로용 추론 모델로, 복잡한 소프트웨어 엔지니어링, 장시간 실행 에이전트, 취약점 분석을 위해 설계되었습니다. GLM-5.2와 동일한 베이스 모델을 사용하며, 사후 학습 규모를 확장해 코딩, 작업 실행, 토큰 효율성을 향상시켰습니다. 이 경로는 테스트 및 평가 전용의 한시적 프리뷰이며, 서비스 안정성은 보장되지 않고 프로덕션 사용은 권장되지 않습니다.
API 호환성 및 작업 안정성
  • Gemini 네이티브 embedding 요청은 Gemini Files API가 반환한 fileUri의 소유 채널을 올바르게 유지합니다. 업로드된 파일을 참조하는 embedContent / batchEmbedContents 호출에서 채널 불일치로 인한 403이 줄어들며, 서로 다른 채널의 파일을 섞은 batch 요청은 명확한 400을 반환합니다.
  • OpenRouter가 모델 프로바이더의 구조화된 오류를 반환하면 API 오류는 내부 message / param / type을 우선 표시하여 파싱하기 어려운 긴 메시지를 줄입니다. 단일 모델 프로바이더 오류가 전체 OpenRouter 서비스에 영향을 줄 가능성도 낮아졌습니다.
  • 미디어 비동기 작업의 폴링, 최종 상태 보관, 산출물 처리가 더 안정적입니다. 이미지·비디오 생성처럼 오래 걸리는 작업은 높은 동시성, 재시작, 큰 산출물 조건에서도 중복 처리, 최종 상태 누락, 전달 지연이 줄어듭니다. 공개 API 필드, 상태어, 과금 공식은 변경되지 않습니다.
새 모델
  • grok-4.6이 추가되었습니다: xAI의 플래그십 멀티모달 추론 모델로, 코딩, 장시간 실행 에이전트, 지식 작업, 대화형 애플리케이션 개발을 위한 모델입니다. 이미지 이해, 500K 컨텍스트 윈도우, 도구 호출, 구조화된 출력을 지원하며 Grok 4.5 대비 다단계 실행, 자기 검증, 코딩, 시각적 프로젝트 생성이 강화되었습니다.
  • deepseek-v4-pro-0813이 추가되었습니다: DeepSeek의 고성능 범용 추론 및 에이전트 모델로, 복잡한 추론, 코딩, 장문서 분석, 에이전트 워크플로에 적합합니다. 사고 모드와 비사고 모드, 100만 토큰 컨텍스트 윈도우, 최대 384K 출력, 도구 호출, Responses API를 지원합니다.
새 모델Veo 비디오 길이 표시 정확도 개선
  • Gemini Veo 작업은 생성, 폴링, 결과 조회 단계에서 실제 비디오 길이를 더 안정적으로 보존합니다. 사용자 지정 초 단위로 비디오를 생성하는 경우 작업 길이, 다운로드 파일 길이, 이후 청구 및 표시 기준이 더 잘 맞게 됩니다.
Azure Responses 도구 호출 호환성 개선
  • Azure Responses에서 namespace 도구를 사용할 때 description이 비어 있거나 누락되어도 Azure가 모델 실행 전에 400으로 거절하는 문제가 줄어듭니다. OpenAI 공식 채널에서 정상 동작하던 도구 호출이 Azure 채널에서도 더 일관되게 동작합니다.
모델 및 공급자 페이지 데이터 보강
  • /call/devs가 공급자 웹사이트 필드를 지원합니다. 데이터가 채워지면 모델 집계 페이지와 공급자 페이지에서 Official site 항목을 표시할 수 있습니다. /providers/<slug> 페이지도 엣지 캐시 동작을 유지해 페이지 응답이 더 안정적입니다.
Gemini interactions가 비동기 작업을 지원
  • Gemini interactions 요청에서 background: true를 명시해 비동기 작업을 만들고, 반환된 작업 ID로 상태 조회, 취소, 정리를 할 수 있습니다. 오래 걸리는 멀티모달/omni interactions를 완료될 때까지 동기 연결을 유지하지 않고도 더 쉽게 통합할 수 있습니다.
  • 비동기 작업은 실제 사용량 기준으로 정산되며 token 컬럼, 취소 시 전액 해제, 대용량 응답 보호가 보강되었습니다. 콘솔의 사용 기록, 잔액 사전 차감, 최종 과금이 더 일관되게 유지됩니다.
Claude Messages thinking 호환성 개선
  • Messages 프로토콜로 OpenAI 호환 모델 제공자를 호출할 때 반환된 thinking/reasoning 내용이 보존되고 이후 턴에서 다시 전달될 수 있습니다. Claude SDK, 여러 턴의 tools, DeepSeek thinking mode를 사용하는 앱에서 빈 응답, 400 오류, 추론 컨텍스트 손실이 줄어듭니다.
  • 서명 없는 thinking 블록은 네이티브 Claude 채널로 전환될 때도 더 호환성 있게 처리되어, 다중 모델 fallback 또는 브리지 플로의 형식 오류를 줄입니다.
Doubao 비디오 prompt와 참조 소재 호환성 개선
  • Doubao 비디오 모델 호출 시 promptextra_body.content의 참조 소재가 함께 적용될 수 있습니다. 소재만 포함된 요청도 prompt와 소재 순서를 유지합니다.
  • 생성 응답의 크기와 prompt 정보가 실제 전송 내용에 더 가깝게 표시되며, 아직 지원하지 않는 네이티브 필드는 계속 무시됩니다. SDK의 추가 파라미터로 인한 비디오 생성 실패가 줄어듭니다.
미디어 생성 누적 사용량을 더 정확하게 반영
  • 미디어 생성 작업이 정산된 뒤 계정 단위 누적 사용량도 함께 업데이트됩니다. 콘솔의 누적 사용량, 잔액 차감, 사용 기록에서 미디어 생성의 실제 사용량을 더 정확하게 확인할 수 있습니다.
Azure 모델명 호환성 개선
  • deployment/model 이름에 점이 포함된 Azure 모델을 호출할 때 Chat, Responses, Messages 변환 경로에서 모델명이 그대로 유지되며 자동으로 재작성되지 않습니다. 기존 Azure 호출 동작은 변경되지 않습니다.
새 비디오 생성 모델
  • doubao-seedance-2-5-260628 추가: ByteDance Seed의 차세대 통합 멀티모달 오디오-비디오 생성 모델입니다. 한 번의 생성으로 최대 30초 분량의 오디오와 비디오가 동기화된 콘텐츠를 만들 수 있고, 다중 라운드 확장을 지원합니다. Seedance 2.0 대비 스토리텔링, 장면 전환, 참조 소재 지원, 사실감, 정밀 편집이 향상되어 영상 제작, 광고, 교육, 시뮬레이션, 장편 콘텐츠 제작에 적합합니다.
새 모델
  • wan3.0-video 추가: Alibaba 통이 연구소의 올인원 비디오 생성 및 편집 모델로 현재 공개 베타 단계입니다. 최대 30초의 네이티브 비디오 생성, 프로덕션 수준의 캐릭터 일관성, 사실적인 영상과 사운드, 참조 생성·편집·복제·모션 구동을 통합한 워크플로를 지원하며, 광고, 이커머스, 영상 제작, 캐릭터 애니메이션, 비디오 편집, 문서-비디오 변환에 적합합니다.
  • qwen-image-3.0 추가: Alibaba Cloud Qwen 팀의 이미지 생성 및 편집 모델로, 텍스트-투-이미지, 참조 이미지 기반 생성, 이미지 편집을 지원합니다. 화질과 속도의 균형을 갖춰 소셜 미디어, 이커머스, 크리에이티브 디자인, 일상 콘텐츠 제작, 대량·고빈도 창작에 적합합니다.
  • qwen-image-3.0-pro 추가: Alibaba Cloud Qwen의 플래그십 이미지 생성 및 편집 모델로, 광고, 브랜드 비주얼, UI, 프레젠테이션, 제품 이미지, 전문 디자인에 적합합니다. 복잡한 레이아웃, 정확한 한글·중문·영문 텍스트 렌더링, 사실적인 질감, 참조 이미지 기반 편집, 디테일, 구도, 상업 등급의 시각 품질에 강점을 가집니다.
Gemini embedding의 멀티모달 입력 및 모달리티별 과금 지원
  • gemini-embedding-2-preview는 OpenAI 호환 embeddings 엔드포인트와 Gemini 네이티브 경로 모두에서 텍스트, 이미지, 오디오, 비디오, 문서 입력을 처리할 수 있습니다. 멀티모달 검색, 콘텐츠 이해, 지식베이스 워크플로를 만드는 사용자는 같은 모델에서 더 많은 입력 유형을 사용할 수 있습니다.
  • Gemini embedding 과금은 모델 프로바이더가 반환한 모달리티별 token 사용량을 우선 적용합니다. 이미지, 오디오, 비디오, 문서를 하나의 텍스트 추정값으로 취급하지 않아 멀티모달 embedding 청구가 실제 사용량에 더 가까워집니다.
  • 단일 input embedding 요청은 새로운 Gemini embedding 경로를 직접 호출할 수 있습니다. 여러 input을 포함한 batch 요청은 명확한 기능 불일치 응답을 반환합니다.
Seedance 2.0 비디오 생성 호출 안정성 개선
  • Seedance 2.0의 이미지, 오디오, 비디오 참조가 미디어 유형별로 더 정확히 매핑되고, adaptive, 4K, 크기 옵션 제약도 더 명확해졌습니다. 파라미터 매핑 불일치로 인한 비디오 생성 워크플로 실패가 줄어듭니다.
  • adaptive duration 요청은 먼저 15초 기준으로 선차감되고, 작업 완료 후 실제 길이에 따라 정산됩니다. 잔액 선차감과 최종 청구의 일관성이 높아집니다.
  • 미디어 생성 실패 시 API는 민감 정보가 제거된 오류 상세를 반환합니다. 사용자와 지원팀은 민감한 인증 정보를 노출하지 않고 파라미터, 서명 URL, 모델 프로바이더 제한 문제를 더 쉽게 진단할 수 있습니다.
새 모델
  • qwen3.8-max 추가: Alibaba Cloud의 플래그십 네이티브 비전-언어 모델로, 2.4조 파라미터 Mixture-of-Experts(MoE) 아키텍처를 기반으로 하며 최대 100만 토큰 컨텍스트 윈도우를 지원합니다. 복잡한 멀티모달 이해, 고급 추론, 소프트웨어 개발, 에이전트 워크플로, 장문 컨텍스트 처리에 적합합니다. Qwen3.7-Max와 비슷한 가격대에서 추론·코딩·에이전트 역량을 크게 개선했으며, 전체 성능은 현재 최상위 모델과 견줄 만합니다.
모델 상세에서 공급자 가용성을 더 쉽게 판단
  • 모델 상세에서는 현재 요청에 더 적합한 공급자가 먼저 표시되고, 예비용이거나 일시적으로 사용하기 어려운 공급자는 뒤쪽에 표시됩니다. 사용자가 공급자를 선택하거나 지원 팀이 모델 가용성을 확인할 때, 지금 어떤 공급자를 쓰는 것이 나은지 더 빠르게 판단하고 오래된 표시 순서로 인한 오해를 줄일 수 있습니다.
소액 요청의 과금 및 사용 로그 정확도 개선
  • by-bill 모델의 소액 요청이 계산 금액이 0으로 반올림되어 과금 및 사용 로그에서 누락되는 문제가 해결되었습니다. 해당 요청은 최소 유효 quota로 기록되어 청구, 잔액 선차감, 사용 기록이 더 일관되며, 지원 및 운영 팀은 embedding 유형의 고빈도 트래픽에 대해 더 완전한 기록을 확인할 수 있습니다.
새 모델
  • deepseek-v4-flash 추가: 효율성 최적화된 Mixture-of-Experts 모델로, 총 284B 파라미터, 활성 파라미터 13B, 100만 토큰 컨텍스트 윈도우를 제공합니다. 빠른 추론과 고처리량 워크로드를 위해 설계되었으며, 강한 추론·코딩 성능을 유지해 코딩 어시스턴트, 채팅 시스템, 에이전트 워크플로에 적합합니다.
새 비디오 생성 모델
  • minimax-h3가 추가되었습니다. MiniMax의 범용 멀티모달 비디오 모델로, 텍스트, 이미지, 오디오, 비디오 입력을 받을 수 있으며 텍스트-비디오, 이미지-비디오, 첫/마지막 프레임 생성, 참조 기반 생성, 비디오 편집을 지원합니다. 비디오 제작, 광고 소재, 제품 데모, 멀티모달 콘텐츠 워크플로를 구축하는 사용자는 AIHubMix 통합 API로 호출할 수 있습니다.
GLM-5.2 시간대별 한정 할인
  • glm-5.2 호출 가격이 매일 시간대에 따라 할인됩니다(UTC 기준): 매일 14:00부터 24:00까지 50% 할인, 00:00부터 14:00까지 30% 할인입니다. 기간 한정입니다.
GPT-5.6 Luna/Terra 가격 인하
  • gpt-5.6-luna는 공식 80% 가격 인하를 반영해 현재 입력 0.20,출력0.20, 출력 1.20입니다. gpt-5.6-terra는 공식 20% 가격 인하를 반영해 현재 입력 2.00,출력2.00, 출력 12.00입니다. 두 모델을 꾸준히 사용하는 사용자는 비용 민감 작업과 일반 작업의 모델 선택을 다시 검토할 수 있습니다.
AIHubMix 공식 MCP Server 제공
  • MCP 지원 클라이언트를 위한 공식 호스팅 MCP 엔드포인트 mcp.aihubmix.com/mcp 또는 mcp.inferera.com/mcp가 추가되었습니다. Claude Code, Codex, Cursor 같은 도구에서 하나의 진입점으로 모델과 가격 조회, 문서 검색, 크레딧 확인, 채팅, 이미지 생성, 비디오 생성 도구를 사용할 수 있습니다.
  • MCP 자격 증명은 클라이언트가 요청마다 전달하며 서버에 저장되지 않습니다. IDE나 에이전트 도구 안에서 AIHubMix 모델과 미디어 기능에 직접 접근하려는 개발자에게 적합합니다.
새 모델
  • jina-reranker-v3.5 추가: Jina AI의 0.6B 다국어 listwise 문서 reranker로, jina-reranker-v3와 같은 스키마로 교체할 수 있는 업그레이드입니다. RAG, 검색, 구조화 데이터 랭킹 워크플로를 대상으로 하며 긴 컨텍스트 후보 랭킹, 도메인 견고성, 다국어 검색, 구조화 랭킹, 추론 효율을 개선합니다.
캐시 과금 정확도 개선
  • 명시적 캐시와 암시적 캐시 요청에서 AIHubMix가 캐시 읽기/쓰기 사용량을 더 일관되게 식별하고, 상위 제공자가 반환한 캐시 유형을 우선합니다. Qwen, Claude 등 캐시 지원 모델 사용자는 실제 사용량에 더 가까운 과금 상세를 확인할 수 있습니다.
미디어 생성 및 작업 결과 안정성 개선
  • 첫 미디어 생성 모델 목록을 검증된 모델로 좁혔고, 일부 이미지 모델을 미디어 엔드포인트로 호출할 때 404가 발생할 수 있던 문제를 수정했습니다. 콘솔의 LLM 작업 다운로드도 텍스트 아카이브를 포함하여, 큰 과거 결과를 더 쉽게 가져올 수 있습니다.
사이트와 모델 데이터 갱신 안정성 개선
  • 웹사이트, 모델 데이터, 블로그 데이터, 사이트맵의 캐시 동작을 조정해 릴리스 후 변경 사항이 더 안정적으로 반영됩니다. 모델 페이지와 문서 진입점은 업데이트 후 오래된 캐시 데이터의 영향을 덜 받습니다.
미디어 생성 API 제공
  • /ai/v1/images/generations/ai/v1/images/edits가 추가되었으며, 통합 비동기 작업, 결과 조회, 산출물 다운로드, webhook 콜백을 지원합니다. 이미지와 비디오 워크플로를 동일한 작업 수명 주기로 통합할 수 있어 오래 걸리는 생성 결과를 더 쉽게 추적할 수 있습니다.
  • 생성된 산출물은 AIHubMix 작업 결과로 반환되며 제한된 다운로드와 일괄 가져오기를 지원합니다. 고객 대응 팀은 초기 사용자의 작업 상태, 다운로드 링크 유효성, 과금 상세 피드백을 확인해야 합니다.
새 모델
  • claude-opus-5 추가: Anthropic의 플래그십 모델로, 고난도 추론, 코딩, 장기 에이전트 작업을 위해 설계되었습니다. 엔드투엔드 소프트웨어 작업, 코드 리뷰 및 버그 발견, 차트·문서 시각 분석, 복잡한 오피스 산출물, 병렬 서브 에이전트 조율에 뛰어나며, 1M 컨텍스트 윈도우와 최대 128K 출력을 지원합니다.
새 모델
  • mai-image-2.5-pro 추가: Microsoft의 플래그십 이미지 생성 및 편집 모델로, 고해상도 사실성, 정확한 이미지 내 텍스트 렌더링, 강력한 편집 기능을 갖추고 있어 상업 디자인, 제품 사진, 전문 크리에이티브 워크플로에 적합합니다.
  • qwen-audio-3.0-tts-flash 추가: Qwen의 실시간 음성 합성 모델로, 저자원 언어 및 중국어 방언 지원이 확대되었고 표현력 있는 음성 제어와 200 ms 미만의 첫 패킷 지연을 제공하여 음성 비서, 실시간 대화, 지능형 고객 서비스에 적합합니다.
  • qwen-audio-3.0-tts-plus 추가: Qwen의 프리미엄 음성 합성 모델로, 감정, 톤, 캐릭터, 말하기 속도, 볼륨, 스타일을 세밀하게 제어할 수 있고 소음·잔향 환경에서도 견고하여 콘텐츠 제작, 오디오북, 영상 더빙, 브랜드 보이스 디자인, 고품질 음성 서비스에 적합합니다. Qwen TTS 오디오 생성 기능
  • 두 Qwen TTS 모델은 모두 /v1/audio/speech에서 호출할 수 있습니다. 비스트리밍 요청은 오디오 결과 URL을, 스트리밍 요청은 SSE 오디오 생성 이벤트를 반환합니다. 아래 표는 AIHubMix 호환 필드와 Alibaba Cloud 공식 Qwen-Audio-TTS 문서를 함께 정리한 것입니다. voice는 모델별로 선택해야 하며 plus와 flash의 시스템 음색은 서로 사용할 수 없습니다.
Messages 응답 호환성 개선
  • 브리지된 모델과 Bedrock 같은 Claude 호환 서비스의 /v1/messages 응답이 Anthropic Messages 생태계와 더 잘 맞도록 개선되어, 엄격한 SDK나 schema validator에서 응답 필드 누락으로 발생하는 오류가 줄어듭니다.
AWS Bedrock 스트림 연결 해제 후 usage 수집 개선
  • 클라이언트가 AWS Bedrock 스트리밍 요청에서 중간에 연결을 끊어도 AIHubMix는 모델 추론 제공자의 종료 신호와 최종 usage 수집을 계속합니다. 연결 해제 상황에서 요청 로그, 과금 상세, 모델 추론 제공자 사용량 간 불일치를 줄입니다.
새 모델
  • qwen3-coder-480b-a35b-instruct 추가: Qwen3-Coder의 플래그십 코딩 모델로, 코드 생성, 소프트웨어 엔지니어링 Agent, 도구 호출 워크플로에 적합하며 긴 컨텍스트 코드 이해와 자동화 개발 작업에 사용할 수 있습니다.
  • gemini-2.5-flash-lite 추가: 낮은 지연 시간과 낮은 비용이 필요한 고빈도 텍스트, 멀티모달, 배치 워크로드용 경량 Gemini 2.5 모델입니다.
  • Qwen/Qwen3-235B-A22B-Instruct-2507 추가: 일반 대화, 지시 이행, 다국어 작업, 긴 컨텍스트 작업에 적합한 Qwen3 235B-A22B Instruct 2507 릴리스입니다.
새 모델
  • gemini-3.6-flash 추가: Google의 최신 Flash 모델로, 복잡한 워크플로, 컴퓨터 사용, 차트 추론, 긴 컨텍스트 작업에 적합합니다.
  • gemini-3.5-flash-lite 추가: 더 가볍고 저렴한 Gemini 3.5 계열 모델로, 고처리량 작업, 일상 자동화, 배치 처리에 적합합니다.
  • glm-5.2-fast-preview 추가: Zhipu GLM-5.2 시리즈의 빠른 프리뷰 모델로, 저지연 채팅, 빠른 추론, 고처리량 애플리케이션에 적합합니다.
Qwen 3.8 스트리밍 안정성 개선
  • /v1/responses/v1/messagesqwen3.8-max-preview를 스트리밍 호출할 때 안정성이 개선되었습니다. 이전에 empty_stream 또는 502로 표시될 수 있던 정상 스트림이 이제 정상적으로 완료될 수 있습니다.
Gemini 이미지 파라미터 passthrough
  • OpenAI 호환 Chat Completions API로 Gemini/Vertex 이미지 출력 모델을 호출할 때 extra_body.generationConfig.imageConfigaspectRatioimageSize를 전달할 수 있습니다.
Gemini embedding 과금 정확도 개선
  • Gemini embedding 응답에 실제 usageMetadata가 포함되면 AIHubMix는 모델 프로바이더가 반환한 토큰 사용량을 우선 과금에 사용합니다. 값이 없으면 기존 로컬 추정치를 fallback으로 유지합니다.
Responses 동적 도구 호환성 개선
  • /v1/responses 요청의 system/developer 메시지에 message-local function tools를 포함할 수 있으며, Chat 모델로 브리지될 때도 도구 선언이 보존됩니다. Kimi K3 같은 동적 도구 워크플로를 사용하는 클라이언트에서 도구 호출이 더 안정적입니다.
Responses stop 파라미터 수정
  • Chat 모델로 브리지되는 /v1/responses 호출에서 stop이 모델 프로바이더로 전달됩니다. 단일 stop은 정상 동작하고, 모델 프로바이더 제한을 넘는 개수나 길이는 Chat Completions와 일관된 경계 오류를 반환합니다.
DeepSeek V4 시간대별 과금 지원
  • DeepSeek V4 모델은 설정에 따라 피크/오프피크 시간대별 과금을 지원할 수 있습니다. 사전 차감과 최종 과금은 같은 요청 제출 시각을 사용하므로 시간대 경계를 넘는 스트리밍 요청도 제출 시각 기준으로 과금됩니다. 사전 차감 보호는 시간대별 과금이 설정된 모델에만 적용되어 일반 모델의 잔액 동결 경험을 바꾸지 않습니다.
Claude Messages thinking 호환성 수정
  • /v1/messages 요청을 OpenAI 또는 Azure Chat 모델로 브리지할 때 Claude thinking 설정을 모델 프로바이더가 지원하는 reasoning effort로 변환합니다. thinking을 포함한 요청의 400 오류가 줄어들며, Opus 4.8 같은 Claude 네이티브 thinking 요청 호환성은 유지됩니다.
긴 스트리밍 요청 안정성 개선
  • 프로덕션 gateway의 스트리밍 제한이 1시간에서 2시간으로 늘어났습니다. Kimi K3처럼 긴 reasoning 또는 생성 작업이 처리 중간에 끊길 가능성이 낮아집니다.
신규 모델
  • qwen3.8-max-preview 추가:
    기간 한정 혜택: Qwen3.8-Max-Preview 호출 요금이 정가의 10%로 계산되어, 사실상 사용량이 10배로 늘어납니다. 기간 한정, 선착순입니다.
    Qwen3.8-Max-Preview는 Qwen(통이첸원) 시리즈의 최신 세대 파운데이션 모델로, 파라미터 수가 2.4T에 달하며 지금도 계속 진화하고 있습니다. 이전 플래그십 Qwen3.7-Max 대비 코딩(Coding), 오피스 업무(Cowork) 등 핵심 역량이 크게 향상되었으며, 풀스택 개발, 데이터 분석, Office 업무 워크플로 등 복잡한 장기 과제에서 세계 최고 수준의 종합 성능을 보여줍니다.
신규 모델
  • kimi-k3가 추가되었습니다. Kimi K3는 Moonshot AI의 오픈 3T급 장문맥 모델로, 2.8T 파라미터, 1M 토큰 컨텍스트 창, 네이티브 비전 입력을 지원합니다. 장기 코딩, 지식 작업, 복잡한 추론, 멀티모달 이해에 적합합니다. 사용 방법은 Kimi K3 실측 호출 가이드(3개 인터페이스 예제 및 지원 매트릭스)를 참조하세요.
  • hy-3d-3.1가 추가되었습니다. Tencent Hunyuan 3D Professional 모델로, 텍스트-3D, 이미지-3D, 멀티뷰 3D 생성을 지원합니다. 게임 에셋, 이커머스 전시, 3D 프린팅, 제품 디자인에 적합하며 3.1 버전은 기하 구조와 텍스처 품질을 개선하고 8뷰 입력을 지원합니다.
3D 생성 API 제공
  • 비동기 /v1/3d/generations API가 추가되었습니다. 첫 연결 대상은 Tencent TokenHub Hunyuan 3D입니다. 생성 작업 제출과 결과 조회를 지원하여 3D 에셋 생성을 자동화 워크플로에 쉽게 통합할 수 있습니다.
Kimi K3 동적 도구 호환성 개선
  • Kimi K3 요청의 message-level 동적 도구 선언이 보존되어 그대로 전달됩니다. 도구 선언 누락으로 인한 모델 프로바이더 400 오류를 줄이고, Kimi dynamic tool loading을 사용하는 클라이언트의 호환성이 개선됩니다.
요청 변환 오류 명확화
  • Chat Completions custom tool, Cohere 텍스트 content block, assistant.content: null 요청의 호환성이 개선되었습니다. 정상 요청은 더 안정적으로 모델 프로바이더에 도달하며, 잘못되었거나 지원되지 않는 입력은 빈 HTTP 200 성공으로 처리되지 않고 구조화된 오류를 반환합니다.
Seedream 이미지 과금 업데이트
  • doubao-seedream-5-0-pro 이미지 생성은 출력 픽셀 구간과 입력 이미지 개수 기반 과금을 지원합니다. 텍스트-이미지 및 이미지-이미지 요청이 실제 생성 사양에 더 가깝게 과금됩니다.
Gemini 도구 호출 호환성 개선
  • OpenAI 호환 API로 Gemini/Vertex를 호출할 때 도구 정의 또는 구조화 출력 schema의 enum에 빈 문자열이 포함되어 있어도 모델 프로바이더 검증에서 400 오류가 발생하지 않습니다. 도구 호출과 JSON Schema 워크플로가 더 안정적으로 동작합니다.
신규 오디오 모델
  • gpt-audio-1.5가 추가되었습니다. OpenAI의 첫 정식 제공(GA) 오디오 모델로, 오디오 입력과 출력을 지원하며 Chat Completions REST API에서 사용할 수 있습니다. 음성 대화, 오디오 이해, 오디오 생성 워크플로에 적합합니다.
  • gpt-4o-transcribe-diarize가 추가되었습니다. 내장 화자 분리 기능을 갖춘 ASR 모델로, 대화의 오디오 구간을 서로 다른 화자와 연결합니다. 이 모델은 Transcription API에서만 사용할 수 있습니다.
스마트 라우팅 소개 페이지 공개
API 오류 응답 일관성 개선
  • /v1/responses에서 알 수 없는 모델을 호출하면 이제 HTTP 400을 반환합니다. 다른 API 진입점과 동일해져, 클라이언트가 500 대신 “사용 가능한 서비스 없음” 상황으로 처리하기 쉬워졌습니다.
요청 검증 실패를 더 일찍 반환
  • 요청 본문 변환이나 파라미터 검증이 실패하면 API가 해당 400/오류 응답을 직접 반환합니다. 원본 요청을 모델 프로바이더로 계속 보내지 않아 무효 호출과 이해하기 어려운 실패를 줄입니다.
Claude Code 캐시 적중 안정성 개선
  • Claude Code가 Bedrock을 통해 Claude를 호출할 때 같은 세션 내 prompt cache 적중이 더 안정적이며, 중복 cache write 비용과 first-token latency를 줄이는 데 도움이 됩니다.
Gemini 멀티턴/캐시 유지 조건 정밀화
  • Gemini 요청은 응답에 실제 thinking signature 또는 캐시 활동이 있을 때만 같은 서비스를 유지합니다. 멀티턴 서명이나 캐시 상태 불일치를 줄이면서, 이미지 생성처럼 상태가 없는 작업은 불필요하게 고정되지 않습니다.
신규 모델
  • gpt-5.6-sol, gpt-5.6-terra, gpt-5.6-luna 등 GPT-5.6 시리즈 모델 3종이 추가되었습니다(OpenAI 2026-07-09 정식 발표). 3개 모델 모두 1,050,000 컨텍스트 윈도우, 128K 최대 출력, 지식 컷오프 2026-02-16이며, 텍스트와 이미지 입력을 지원하고 Chat Completions, Responses, Claude 호환 Messages 인터페이스로 호출할 수 있습니다. Sol은 복잡한 전문 업무를 위한 플래그십 등급으로, 공식적으로 현재 최고의 코딩 모델로 소개되었습니다. Terra는 GPT-5.5와 성능이 동등하면서 가격은 절반이고, Luna는 비용 민감 시나리오를 대상으로 합니다.
GPT 프롬프트 캐싱 문서 공개
  • GPT 프롬프트 캐싱 문서가 추가되었습니다. GPT-5.6 시리즈부터 캐시 쓰기는 입력 가격의 1.25배, 캐시 읽기는 0.1배로 과금되며, 캐시는 최소 30분 유지됩니다. prompt_cache_key와 명시적 캐시 중단점 파라미터 설명, 과금 로직, 인터페이스 예시, 히트 문제 해결을 다룹니다. 프롬프트 캐싱Claude 프롬프트 캐싱의 OpenAI 캐시 기준도 함께 업데이트되었습니다.
Claude Fable/Mythos thinking 호환성
  • reasoning_effort를 사용하는 Claude Fable 및 Mythos 요청은 이제 adaptive thinking으로 처리되어, 클라이언트 변경 없이 해당 모델군의 모델 프로바이더 400 오류를 줄입니다.
Claude 및 Gemini stop sequence 지원
  • OpenAI 호환 stop 설정이 Claude 및 Gemini 네이티브 요청으로 매핑됩니다. Claude에서 유효하지 않은 공백 stop은 필터링하고, OpenAI/Gemini 제한은 제공자별 규칙에 따라 처리해 생성 중단 동작이 더 일관됩니다.
gpt-chat-latest 토큰 제한 호환성
  • gpt-chat-latest 및 향후 GPT/ChatGPT latest 별칭은 필요할 때 max_completion_tokens를 보존하여, 이전 max_tokens 필드로 인한 400 오류를 줄입니다.
Key 한도 소진 메시지 개선
  • Key 단위 사용 한도가 소진되면, API가 낮은 수준의 quota 오류 대신 Key 한도를 조정하고 다시 활성화하라는 더 명확한 안내를 반환합니다.
Tool calls 응답 형식 OpenAI와 정렬
  • 비스트리밍 chat 응답에 tool_calls만 있고 텍스트가 없을 때 이제 명시적으로 content: null을 반환하여 OpenAI 스타일 SDK와 응답 파서 호환성을 높입니다.
구조화된 출력 복구: JSON 형식 오류 자동 복구
  • Key 단위의 구조화된 출력 복구 기능이 추가되었으며, 기본적으로 비활성화되어 있습니다. 활성화하면 구조화된 JSON 출력을 선언한 비스트리밍 요청에 대해 모델이 반환한 JSON에 잘림, 후행 쉼표, 코드 블록 래핑 등의 형식 오류가 있을 때, 게이트웨이가 반환 전에 이를 파싱 가능한 유효한 JSON으로 자동 복구하며, 수치는 원본 그대로 유지하고, 클라이언트 변경이 필요 없습니다. Chat Completions, Responses, Claude, Gemini 네 가지 프로토콜을 지원하며, 복구가 발생하면 응답에 X-JSON-Repaired: true 응답 헤더가 붙습니다.
Claude 프롬프트 캐싱 문서: 모델별 최소 캐시 토큰 임계값 보완
  • Claude 프롬프트 캐싱프롬프트 캐싱 문서에 모델별 최소 캐시 가능 토큰 임계값(512 / 1,024 / 2,048 / 4,096)을 보완하고 Claude Opus 4.8, Opus 4.7, Fable 5 등 현재 모델을 추가했습니다. 임계값은 모델 버전의 높낮이에 비례하지 않으며, 임계값 미만의 프리픽스는 cache_control을 지정해도 캐시에 기록되지 않습니다.
사용량 대시보드와 정산 상세 기준 정렬
  • 사용량 대시보드 집계가 요청 로그 기반 정산 기록에 더 가까워졌습니다. 동시 집계 손실을 줄이고 지연 재처리 시 사용하는 시간 단위 버킷을 통일했습니다. 과거 대시보드 숫자는 여전히 소폭 차이가 있을 수 있으며, 대조와 정산에는 요청 로그 상세를 기준으로 사용해야 합니다.
신규 모델
  • grok-4.5가 추가되었습니다. 코딩, 에이전트형 작업, 지식 업무에 적합한 모델로, 구성 가능한 추론, 도구 호출, 500K 컨텍스트를 지원합니다. 코드 수정, 복잡한 엔지니어링 작업, 지식 질의응답, Agent 워크플로에 적합합니다.
gpt-5.5+ 도구 호출이 자동으로 Responses로 브리지됩니다
  • OpenAI 호환 /v1/chat/completions 엔드포인트로 gpt-5.5 이상 모델을 사용할 때 tools와 reasoning_effort가 포함된 요청은 이제 자동으로 Responses 기능을 사용합니다. 이 파라미터 조합으로 발생하던 모델 프로바이더 400 오류를 줄이며, 클라이언트를 /v1/responses로 마이그레이션하지 않아도 더 안정적인 도구 호출을 사용할 수 있습니다. 자세히 보기: Responses API
구조화 출력의 프로토콜 간 호환성 개선
  • OpenAI 호환 response_format과 Claude 네이티브 output_config.format이 관련 경로에서 상호 적용됩니다. OpenAI 스타일과 Claude 스타일 프로토콜을 오가는 클라이언트가 구조화 출력 제약을 더 안정적으로 유지할 수 있습니다. 자세히 보기: Structured Output.
Vertex AI /v1/messages 호출 안정화
  • Vertex AI를 통해 Gemini 등 Claude가 아닌 모델을 호출할 때 /v1/messages 요청이 모델 계열에 따라 라우팅됩니다. Claude 전용 경로로 잘못 전달되어 발생하던 not found 또는 404 실패를 줄입니다.
Gemini 네이티브 엔드포인트 보강
  • AIHubMix의 Gemini 진입점을 통해 @google/genai SDK를 사용할 때 네이티브 embeddings, interactions create, context caching 워크플로를 사용할 수 있습니다. 이전에는 이 경로들이 등록되지 않은 라우트 오류나 404를 반환할 수 있었지만, 이제 embedding 생성, 대화형 호출, 캐시 생성/조회/수정/삭제 워크플로에 사용할 수 있습니다. 자세히 보기: Gemini 네이티브 SDK 통합
긴 컨텍스트 모델 과금 범위 확대
  • hy3-preview, ERNIE, Grok, Mimo 같은 긴 컨텍스트 모델이 컨텍스트 길이 기반 단계별 과금을 지원합니다. 요금 계산이 더 정확해집니다.
Vertex AI 스트리밍 로그 지표 수정
  • Vertex AI Gemini/Claude 스트리밍 요청에서 첫 token 및 지연 시간 데이터가 더 정확히 기록됩니다. 로그와 모니터링 신뢰성이 높아지며, 모델 응답 내용은 변경되지 않습니다.
신규 모델
  • 텍스트 생성 모델 tencent-hy3 (Tencent Hunyuan Hy3 정식 버전)가 추가되었습니다. MoE 아키텍처, 총 파라미터 295B / 활성 파라미터 21B, 256K 컨텍스트 윈도우. 빠른/느린 사고 융합 추론 모드를 지원하며, 복잡한 추론, 코드 생성, Agent 워크플로에 적합합니다. Apache 2.0 라이선스로 오픈소스 공개.
Jina Search/Reader가 POST와 파일 업로드 지원
  • Jina Search와 Reader가 이제 POST 요청을 지원합니다. Reader는 multipart 업로드로 PDF, Word, Excel, PPT, HTML, 이미지 등 로컬 파일을 받을 수 있습니다. 기본 응답은 Jina의 네이티브 markdown 출력에 더 가까우며, JSON이 필요한 클라이언트는 Accept: application/json을 명시적으로 보낼 수 있습니다.
Responses를 통한 Azure 계열 서비스 호출 안정성 개선
  • /v1/responses가 Azure 계열 non-GPT 서비스로 브리지될 때 api-version이 비어 404가 발생할 수 있던 문제를 수정했습니다. 이러한 요청이 직접 실패하는 상황이 줄어듭니다.
스트리밍 응답 잘림 문제 수정
  • 일부 vLLM / Azure Foundry 계열 모델 추론 서비스에서 스트리밍 응답이 무작위로 잘릴 수 있던 문제를 수정했습니다. 사용자는 완전한 답변, 종료 신호, 사용량 정보를 더 안정적으로 받을 수 있습니다.
신규 모델: Command A Plus 05-2026
  • command-a-plus-05-2026을 추가했습니다. 채팅, 텍스트 생성, Agent 워크플로에 적합한 텍스트 생성 모델입니다.
Jina 검색 및 웹페이지 Reader API 출시
  • Jina 검색과 Reader 기능을 추가했습니다. 이제 AIHubMix API Key로 Jina 검색 결과를 가져오고 웹페이지 내용을 읽을 수 있으며, 외부 웹 검색, 자료 읽기, Agent 도구 호출 워크플로에 적합합니다. 자세히 보기: Jina AI
Veo 3.1 이미지-투-비디오가 첫/마지막 프레임과 참조 이미지 지원
  • Veo 3.1 이미지-투-비디오에서 첫 프레임, 마지막 프레임, 참조 이미지 입력을 지원합니다. 사용자는 영상의 시작/종료 화면, 캐릭터 레퍼런스, 스타일 레퍼런스를 더 정밀하게 제어할 수 있어 고급 영상 생성 워크플로에 적합합니다. 자세히 보기: Video Generation
Gemini 다중 채널 재시도 안정성 개선
  • Gemini 요청의 교차 채널 재시도 호환성을 개선하여 일부 폴백 시나리오의 400 오류를 줄이고, 다중 채널 장애 조치 호출의 성공률을 높였습니다. 자세히 보기: Gemini Guides
OpenAI 호환 응답 필드 정렬
  • OpenAI 호환 API의 비스트리밍 및 스트리밍 응답에서 logprobs, refusal, finish_reason 등의 null 값을 보존합니다. OpenAI 표준 응답 형태를 기대하는 SDK, Agent, 로그 파서의 호환성 차이를 줄입니다.
Claude Code 개인정보 보호 및 호환성 개선
  • Claude Code가 AIHubMix를 통해 Claude 모델을 호출할 때의 요청 호환성을 개선하고, 모델 프로바이더로 전달되는 요청에 포함되는 클라이언트 환경 정보를 줄였습니다. 서드파티 Agent 클라이언트의 개인정보 보호가 강화됩니다.
로그인, 회원가입, 개인 센터 기능 개선
  • 자체 계정 시스템에 이메일 코드 로그인/회원가입, 비밀번호 설정, 프로필 수정, 타사 계정 연결/해제, 계정 삭제 백엔드 기능을 보강했습니다. OTP 용도 분리와 비활성 계정 차단도 강화했으며, Stripe 충전 콜백 처리도 더 안정적입니다.
신규 모델
  • claude-sonnet-5(채팅 / 추론 / Agent 워크플로).
  • gemma-4-31b, longcat-2.0(텍스트 생성 모델).
  • gemini-3.1-flash-lite-image(이미지 기능 모델).
  • mai-image-2.5, mai-image-2.5-flash(이미지 생성 모델).
이미지 생성 과금 및 파라미터 호환성 개선
  • Images 엔드포인트의 gpt-image-2 과금 기준을 token 기반으로 통일했습니다. GLM 이미지 생성은 watermark_enabled, quality 같은 확장 파라미터를 전달해, 모델 프로바이더가 지원하는 경우 워터마크 및 품질 설정이 적용됩니다. 자세히 보기: Image Generation
Gemini 파일 업로드 로그 정리
  • Gemini 파일 업로드 실패가 더 이상 사용자에게 보이는 일반 요청 로그에 기록되지 않습니다. 추론이 아닌 엔드포인트의 로그 노이즈를 줄이면서 내부 문제 해결 로그는 유지합니다.
Deep Research 모델 추가
  • o4-mini-deep-researcho3-deep-research를 추가했습니다. 두 모델은 /v1/responses 엔드포인트에서만 사용할 수 있으며, 요청에는 web_search_preview 또는 mcp tools가 필요합니다. 심층 웹 조사와 research 유형 답변에 적합합니다.
Responses 프로토콜이 임의의 모델 지원
  • /v1/responses 엔드포인트가 더 이상 GPT 시리즈에 국한되지 않고, 이제 플랫폼의 임의의 모델을 호출할 수 있습니다. 따라서 Responses 프로토콜 기반의 도구(예: Codex CLI)는 로컬 모델 목록을 통해 GLM, Gemini, DeepSeek, Kimi, Qwen 등의 모델을 사용할 수 있으며, 더 이상 OpenAI 공식 모델에 국한되지 않습니다.
Step 3.7 Flash Responses 출력 수정
  • step-3.7-flash/v1/responses로 호출할 때 빈 내용이나 빈 응답이 반환될 수 있던 문제를 수정했습니다. 추론 내용과 최종 답변이 이제 정상적으로 반환됩니다.
Codex CLI 사용자 지정 모델 지원 추가
  • Codex CLI 문서에 「Codex에서 사용자 지정 모델 사용하기」 튜토리얼을 추가했습니다: 로컬 모델 목록(model_catalog_json)을 통해 AIHubMix의 임의의 모델(GLM, Gemini, DeepSeek, Kimi, Qwen 등)을 선언하면, Codex의 /model 목록에서 자유롭게 전환할 수 있어 더 이상 OpenAI 공식 모델에 국한되지 않습니다. 문서에는 상위 30개 모델 목록을 한 번에 생성하는 스크립트와 흔히 겪는 문제 안내가 포함되어 있습니다. 자세히 보기: Codex CLI · Codex에서 사용자 지정 모델 사용하기
백업 도메인 지원 추가
  • 백업 도메인 https://api.inferera.com을 추가했습니다. 엔드포인트와 기능은 기본 도메인 https://aihubmix.com과 완전히 동일합니다. 기본 도메인에 접속할 수 없는 경우(연결 불가, 타임아웃 등) 요청 주소를 백업 도메인으로 교체하세요. API Key, 모델, 요청 본문 등의 파라미터는 그대로 유지하면 됩니다.
신규 모델
  • Doubao doubao-seed-2-1-pro, doubao-seed-2-1-turbo.
  • HappyHorse 영상 시리즈 happyhorse-1.1-t2v(텍스트-투-비디오), happyhorse-1.1-r2v(레퍼런스 생성), happyhorse-1.1-i2v(이미지-투-비디오).
Stripe 결제 경험 개선
  • Stripe checkout에서 계정 이메일을 자동으로 채우고 불필요한 이름 및 청구 주소 수집을 줄여, Alipay 같은 결제 수단으로 충전하는 흐름이 더 간단해졌습니다.
마이너스 잔액 계정 제한
  • 계정 잔액이 -$1 미만이면 충전하기 전까지 무료 모델을 더 이상 호출할 수 없습니다.
AIHubMix CLI(명령줄 도구) 문서 추가
  • AIHubMix CLI(명령줄 도구) 문서를 추가했습니다: 단일 바이너리·제로 의존성(Python / Node / Go 불필요)으로 터미널에서 계정 잔액 조회, API Key 관리, 사용 가능한 모델 확인이 가능하며 스크립트 및 AI Agent(예: Claude Code)와의 연동에도 적합합니다.
LLM Router(모델 자동 라우팅)
  • modelauto로 설정하면 게이트웨이가 요청 내용을 분석해 수백 개 모델 중 최적 모델을 자동으로 선택하며, 비용 / 품질 / 지연 정책을 지원하고, 실제로 사용된 모델 기준으로 과금하며, 클라이언트 코드 변경이 전혀 필요 없습니다. 자세히 보기: LLM Router(모델 자동 라우팅)
DeepSeek 캐시 적중률 수정
  • deepseek-v4-prodeepseek-v4-flash의 캐시 적중률이 예상보다 낮게 나타나던 문제를 수정했습니다.
AIHubMix Skill(AI 코딩 어시스턴트 확장) 추가
  • Codex, Claude Code, Cursor, Cline 등 Skills를 지원하는 AI Agent에 로컬 확장 기능을 제공합니다: 자연어로 AIHubMix 연동, 모델 조회, 능력 기반 모델 선택, 예제 생성, 오류 해결을 수행할 수 있습니다. 이 Skill은 필요에 따라 공식 인터페이스에서 모델, 가격, 프로토콜 계약 등의 실시간 정보를 읽어와, Agent가 오래된 기억에 의존하지 않도록 합니다. 자세히 보기: Skills
可灵(Kling) 영상 모델 추가
  • Kling 영상 생성의 전체 기능을 연동했습니다: 텍스트-투-비디오, 이미지-투-비디오, 다중 이미지 레퍼런스 및 omni 멀티모달 생성을 지원하며, 모델명에 따라 네이티브 프로토콜로 호출합니다.
OpenClaw 연동 플러그인 문제가 수정되었습니다
  • AIHubMix의 OpenClaw 연동 플러그인 aihubmix-auth가 이전의 연동 문제를 수정하여 이제 안정적으로 사용 가능합니다. 설치하고 AIHubMix Key 하나만 입력하면 OpenClaw에서 OpenAI / Anthropic / Gemini 모델을 동시에 호출할 수 있습니다.
신규 모델
  • Zhipu glm-5.2.
Open Design 연동 지원 추가
  • AIHubMix는 이제 Open Design(오픈소스, 로컬 우선의 Claude Design 대체재)이 기본으로 지원하는 BYOK 게이트웨이입니다. API(BYOK) 모드에서 AIHubMix를 선택하고 Key 하나만 입력하면 채팅 / 이미지 / 영상 / 음성 생성을 동시에 구동하며, 모델명에 따라 각 업체의 네이티브 프로토콜을 사용합니다. 자세히 보기: Open Design 연동 튜토리얼
Zhipu GLM 5.2가 추론 강도 분급 지원
  • 네이티브 Zhipu 채널의 glm-5.2reasoning_effort로 사고 깊이를 분급 조절할 수 있으며, 구버전 모델은 버전에 따라 자동 분류되어 호출 측의 변경이 필요 없습니다.
신규 모델
  • kimi-k2.7-code-highspeed(Kimi 코드 고속 버전).
신규 모델
  • coding-glm-5.2 및 무료 버전 coding-glm-5.2-free.
모델명 매핑과 오류 시 폴백
  • 모델명 매핑(Mapping)과 오류 시 폴백(Fallback) 추가: 콘솔에서 API Key 단위로 모델명 매핑과 오류 시 폴백을 설정할 수 있습니다. 클라이언트의 모델 별칭을 실제 모델 이름으로 변환하고, 주 모델이 실패하면 자동으로 백업 모델로 전환하며, 최종 응답 모델 기준으로 과금합니다. 클라이언트 코드 변경은 필요 없습니다. 자세히 보기: 모델명 매핑과 폴백
신규 모델
  • kimi-k2.7-code.
step-3.7-flash 한정 1할 특가
  • step-3.7-flash 한정 1할 할인: 입력 100만 token당 0.022 USD, 출력 100만 token당 0.132 USD에 불과하니 많은 이용 바랍니다.
모델 종료와 자동 라우팅
  • claude-opus-4-20250514, claude-sonnet-4-20250514는 공식적으로 6월 15일에 종료될 예정이며, 종료 시점에 플랫폼이 해당 모델을 동일 시리즈의 4-5 버전으로 자동 라우팅합니다.
신규 모델
  • claude-fable-5【지원 종료】.
Claude 신규 모델 Fable 5 / Mythos 5 특성 안내
  • Fable 5는 더 강한 안전 가드레일을 적용하므로 일부 정상 요청도 차단될 수 있습니다: 사이버 보안, 생물 / 화학, 모델 증류, 추론 추출 등의 영역에 추가 분류가 적용됩니다. 일부 기술 연구, 취약점 분석, 생의학 관련 질문은 거부되거나 Opus 4.8로 라우팅될 수 있습니다.
  • Mythos 5는 제한된 접근 모델이며 일반 공개 모델이 아닙니다: Mythos 5와 Fable 5는 같은 능력 기반을 공유하지만, Mythos 5는 안전 분류기가 더 적습니다. 현재는 Project Glasswing / 승인된 고객에게만 제공되며, 일반 사용자가 실제로 사용하는 것은 가드레일이 적용된 Fable 5입니다.
  • API 비용이 더 높습니다: Fable 5는 입력 100만 token당 10 USD, 출력 100만 token당 50 USD이며, Opus 4.8의 약 2배입니다.
  • 개인정보 보호: Fable 5 / Mythos 5는 Covered Models로 분류되며, 기본적으로 최소 30일 데이터 보관이 필요하고 Zero Data Retention은 지원하지 않습니다.
  • API 거부 표시: Fable 5가 요청을 거부할 때 API는 HTTP 200을 반환하지만 stop_reasonrefusal입니다.
Gemini 호환 인터페이스가 오디오 입력 지원
  • OpenAI 호환 인터페이스(/v1/chat/completions)로 Gemini를 호출할 때 input_audio 오디오 입력을 지원하며(이전에는 조용히 무시되었습니다), 반환되는 usage에 audio_tokens 계량도 추가됩니다.
신규 모델
  • grok-build-0.1, hy3-preview, 무료 모델 step-3.7-flash-free.
신규 모델
  • Tongyi Qianwen qwen3.7-plus.
신규 모델
  • MiniMax minimax-m3.
  • Baidu musesteamer-air-image(이미지 생성).
  • AiHubMix 플랫폼에서 모든 대형 모델을 Claude Code 내에서 사용할 수 있습니다
  • AI SDK 지원이 추가되어, 하나의 키로 다양한 모델에 접속할 수 있습니다.
  • Qwen Code 지원이 추가되었으며, Aihubmix 플랫폼의 모든 대형 언어 모델을 활용합니다.
  • llms.txt 지원 추가 — LLM 어시스턴트가 주요 모델 생태계를 빠르게 탐색할 수 있는 단일 링크입니다.
  • Gemini Cli 문서가 추가되어 터미널에서 Gemini 모델 사용을 지원합니다.
  • OpenAI Responses API가 이제 Code Interpreter와 Remote MCP 호출을 지원합니다.
  • OpenAI, Ideogram, Stability, Google Imagen을 포함한 여러 주류 모델을 지원하는 범용 이미지 생성 API가 추가되었습니다.
  • 개발자를 위해 모든 모델에 10% 할인을 제공하는 APP-Code가 도입되었습니다.
  • 사용자가 오류 정보를 더 잘 이해할 수 있도록 HTTP 상태 코드 문서가 추가되었습니다.
  • Veo3.0 생성 지원이 추가되어 더 다양한 창작 형식을 가능하게 합니다.
  • OpenAI Reasoning 요약 표시를 지원하며, responses API에 적용됩니다.
  • Gemini 암시적 캐싱 기능이 추가되어 자동 히트 및 히트 피드백을 지원합니다. 개발자는 usage_metadata를 통해 히트 상태를 확인할 수 있습니다. 비용 절약은 보장되지 않으며, 실제 효과는 요청 구조와 사용 시나리오에 따라 달라집니다.
포괄적인 Claude 4 새로운 기능 지원
  • 새로운 캐시 지속 시간: Claude 1시간 캐시 지속 시간베타 지원.
  • 🎉 새로운 텍스트 편집기 도구: Claude 4 모델이 새로운 text_editor_20250429 도구 유형과 str_replace_based_edit_tool 도구 이름을 지원합니다
  • 🚫 거부 중단 이유: 모델이 안전상의 이유로 생성을 거부하는 콘텐츠에 대한 새로운 refusal 중단 이유가 도입되었습니다
  • 🧠 확장된 사고: Claude 4 모델이 전체 사고 과정의 요약을 반환하여 확장된 사고의 완전한 지능적 이점을 제공합니다
  • 🔄 인터리브된 사고: 확장된 사고와 도구 사용을 인터리브하는 것을 지원하여 더 자연스러운 대화 경험을 가능하게 합니다 (베타 기능)
  • ⚠️ 폐기된 기능:
    • Claude 4 텍스트 편집기 도구는 더 이상 undo_edit 명령을 지원하지 않습니다
    • token-efficient-tools-2025-02-19 지원 제거 (Claude 3.7 전용)
    • output-128k-2025-02-19 지원 제거 (Claude 3.7 전용)
  • 📚 사용자가 Claude 3.7에서 Claude 4로 원활하게 마이그레이션할 수 있도록 포괄적인 마이그레이션 가이드와 코드 예제가 업데이트되었습니다
  • Dify 플러그인 지원이 추가되어 Dify에서 Aihubmix 모델을 원활하게 통합할 수 있습니다.
  • 프로그래밍 작업을 위해 특별히 설계된 codex-mini-latest 모델이 이제 지원되며 Responses API 엔드포인트 또는 Codex CLI를 통해 액세스할 수 있습니다.
  • 이미지 생성을 위한 Google Imagen 3.0과 비디오 생성을 위한 Veo 2.0을 지원하여 창작 형식을 풍부하게 합니다.
  • gemini-2.0-flash-exp가 gemini-2.0-flash-preview-image-generation으로 업그레이드되었습니다
가장 진보된 이미지 생성 모델인 Ideogram AI V3 인터페이스가 추가되었습니다.
키, 계정 정보, 사용 가능한 모델 목록의 명령줄 관리를 지원하는 AiHubMix CLI가 추가되었습니다.
  1. 오랫동안 기다려온 OpenAI 이미지 생성 인터페이스가 공식 출시되어 텍스트-이미지 생성과 이미지-이미지 편집을 지원합니다.
  2. Gemini 모델의 네이티브 호출을 지원합니다
강력한 지능형 에이전트를 쉽게 구축할 수 있도록 Jina AI의 3가지 핵심 API와 통합되었습니다. 세 가지 API는 Vector Embeddings, Rerank, Deep Search입니다.
OpenAI Responses API가 지원되어 더 포괄적인 도구 통합을 제공합니다.
OpenAI CodeX Cli 지원이 추가되었습니다. Codex CLI에게 무엇을 만들고, 수정하고, 설명할지 말해주면 아이디어를 현실로 만드는 것을 지켜볼 수 있습니다.
모델 ID에 :surfing을 추가하여 모든 모델에 대한 검색 기능 활성화 베타
Claude 프롬프트 캐싱을 지원하여 고빈도 프롬프트에서 최대 76%의 비용을 절약할 수 있습니다!
이미지 생성, 리믹스, 부분 편집 및 업스케일링을 포함한 강력한 텍스트-이미지 기능을 특징으로 하는 Ideogram AI 그리기 인터페이스 지원이 추가되었습니다.
더 나은 경험을 제공하는 새로운 문서가 게시되었습니다
Claude Text Edit Tool 지원이 추가되었습니다
새로운 트라이던트 로고가 활성화되었습니다
OpenAI와 Google Gemini 모델에 대한 네이티브 검색 기능 지원이 추가되었습니다; 향후 계획에는 타사 검색 지원을 위한 이 인터페이스 확장이 포함됩니다
새로운 모델이 추가되었습니다: gpt-4o-mini-search-preview 및 gpt-4o-search-preview
o1 및 o3-mini 가격이 10% 인하되어 이제 공식 가격과 일치합니다
Microsoft 가격 인상으로 인해 aihubmix-DeepSeek-R1 가격이 7배 인상되었습니다; 안정성과 경제성을 위해 Volcano의 DeepSeek-R1 사용을 권장합니다. 새로운 모델이 추가되었습니다: qwen-qwq-32b 및 qwen2.5-vl-72b-instruct
Claude 모델 가격이 15% 인하되었습니다; 새로운 모델 gpt-4.5-preview가 추가되었습니다 (참고: 매우 비싸니 주의해서 사용하세요)
Deepseek 안정성이 개선되었습니다; ByteDance에서 가장 안정적이며, 권장 모델: DeepSeek-R1 및 DeepSeek-V3
모델 claude-3-7-sonnet-20250219가 추가되었습니다
  • 벤더 문제로 인해 gpt-4o가 때때로 느린 응답을 경험하고 있습니다; 임시로 gpt-4o-2024-11-20 사용을 권장합니다
  • 복잡한 공식 가격 구조가 플랫폼의 가격 구조를 초과하여 Perplexity API가 일시적으로 오프라인되었습니다; 가격 조정 후 재출시 예정
  • ByteDance 공식 한정 할인이 종료되어 DeepSeek-R1 가격이 인상되었습니다
  • 모델 세부 정보 페이지와 매개변수 정보가 추가되었습니다
  • ByteDance 공식 한정 할인이 종료되어 DeepSeek-V3 가격이 인상되었습니다; R1 가격도 곧 인상될 것으로 예상되며, 그에 따라 조정할 예정입니다
  • 새로운 모델이 추가되었습니다: kimi-latest (입력 길이 계층 8k/32k/128k에 기반한 공식 가격, 저희 플랫폼은 32k 계층을 표준으로 사용하며, 가격에 민감한 사용자는 주의하세요)
  • 웹사이트 구조가 최적화되었습니다
  • 로그 페이지가 사용 통계 페이지로 병합되었습니다
  • 공지사항이 모델 마켓플레이스 페이지로 이동되었습니다
  • 설정이 프로필 사진 아래로 이동되었습니다
  • aihubmix-DeepSeek-R1 가격이 50% 인하되었습니다
  • Google 공식 검색 기능이 통합된 새로운 모델이 추가되었습니다: gemini-2.0-pro-exp-02-05-search, gemini-2.0-flash-exp-search
  • 새로운 모델이 추가되었습니다: gemini-2.0-flash, gemini-2.0-pro-exp-02-05, gemini-2.0-flash-lite-preview-02-05
  • 새로운 모델이 추가되었습니다: o3-mini, o1 (참고: 제한된 계정으로 인해 백엔드 청구가 공식보다 ~10% 높음)
  • o1 모델: OpenAI 공식에서 stream 매개변수를 지원하지 않음
  • o3-mini는 temperature 매개변수를 지원하지 않습니다; “low, medium, high”를 허용하는 새로운 매개변수 “Reasoning effort”가 추가되었습니다 (기본값은 medium)
기능: OpenAI 음성 모델 입력/출력 기능 지원이 추가되었습니다. api.aihubmix.com 서버에서 사용 가능하며, 메인 서버 지원은 1주일의 안정성 확인 후 제공됩니다. 전체 백엔드 청구는 공식 요금과 일치합니다. 현재 로그는 텍스트 토큰만 표시하며; 음성 비용은 아직 표시되지 않지만 기능에는 영향이 없습니다.새로운 모델이 추가되었습니다:
  • o3-mini, o1 (참고: 제한된 계정으로 인해 백엔드 청구가 공식보다 ~10% 높음)
  • aihubmix-DeepSeek-R1 (권장, 더 안정적)
  • qwen-max-0125 (Qwen2.5-Max), sonar-reasoning
  • deepseek-ai/DeepSeek-R1-Zero 및 deepseek-ai/DeepSeek-R1, deepseek-r1-distill-llama-70b
  • aihub-Phi-4
  • Doubao-1.5-pro-256k, Doubao-1.5-pro-32k, Doubao-1.5-lite-32k, Doubao-1.5-vision-pro-32k
  • sonar, sonar-pro (Perplexity AI 최신)
  • gemini-2.0-flash-thinking-exp-01-21
  • deepseek-reasoner (DeepSeek-R1이라고도 함)
  • MiniMax-Text-01
  • codestral-latest (Mistral의 새로운 코드 모델 - Codestral 25.01)
새로운 모델이 추가되었습니다:
  • aihub-Phi-4
  • Doubao-1.5-pro-256k, Doubao-1.5-pro-32k, Doubao-1.5-lite-32k, Doubao-1.5-vision-pro-32k
  • sonar, sonar-pro (Perplexity AI 최신)
  • gemini-2.0-flash-thinking-exp-01-21
  • deepseek-reasoner (DeepSeek-R1이라고도 함)
  • Perplexity AI API 모델이 추가되었습니다; 현재 프리뷰 서버 api.aihubmix.com에서만 사용 가능하며, 안정적이면 메인 서버 aihubmi.com으로 업데이트될 예정입니다
  • api.aihubmix.com은 프리뷰 서버로, 새로운 기능이 여기서 먼저 업데이트되며, 일반적으로 1주일의 안정성 확인 후 메인 서버 aihubmix.com으로 이동됩니다
새로운 모델이 추가되었습니다:
  • MiniMax-Text-01
  • codestral-latest (Mistral의 새로운 코드 모델 - Codestral 25.01)
  • Google 네이티브 웹 검색 기능이 있는 gemini-2.0-flash-exp-search가 추가되었습니다; 공식 gemini 2.0 flash 모델의 웹 검색은 추가 매개변수가 필요하지만, aihubmix가 이를 통합했습니다 - 모델 이름에 ‘search’를 추가하기만 하면 사용할 수 있습니다
  • 새로운 모델 deepseek-ai/DeepSeek-V3이 추가되었습니다
  • 기존 모델/가격 페이지를 대체하는 모델 마켓플레이스 페이지가 추가되었습니다
  • gemini-2.0-flash-thinking-exp-1219 모델이 답변 없이 사고만 출력하는 문제가 수정되었습니다
  • 잔액 알림 이메일을 받지 못하는 문제가 수정되었습니다
  • 사용 통계 페이지와 충전 기록 페이지가 추가되었습니다
  • Doubao 시리즈 모델이 추가되었습니다: Doubao-lite-128k, Doubao-lite-32k, Doubao-lite-4k, Doubao-pro-128k, Doubao-pro-256k, Doubao-pro-32k, Doubao-pro-4k
  • 새로운 모델이 추가되었습니다: gemini-2.0-flash-thinking-exp-1219, gemini-2.0-flash-exp, aihubmix-Mistral-Large-2411, aihubmix-Llama-3-3-70B-Instruct, grok-2-1212, grok-2-vision-1212
  • 새로운 모델이 추가되었습니다: gemini-exp-1206, llama-3.3-70b-versatile, learnlm-1.5-pro-experimental
  • 새로운 모델이 추가되었습니다: gemini-2.0-flash-exp, aihubmix-Mistral-Large-2411, aihubmix-Llama-3-3-70B-Instruct
  • 새로운 모델이 추가되었습니다: gemini-exp-1206, llama-3.3-70b-versatile, learnlm-1.5-pro-experimental
  • 사용 통계 페이지가 추가되었습니다
  • 최근 추가된 모델: gpt-4o-2024-11-20, step-2-16k, grok-vision-beta
  • Qwen 2.5 Turbo Million Context 모델: qwen-turbo-2024-11-01
  • Claude 네이티브 SDK와 호환되며, v1/messages 인터페이스가 이제 지원됩니다
  • Claude 네이티브 인터페이스용 캐시 및 컴퓨터 사용 기능은 아직 지원되지 않습니다 (프롬프트 캐싱 및 컴퓨터 사용); 향후 2주 내에 이러한 기능을 계속 개선할 예정입니다
  • 새로운 모델이 추가되었습니다: claude-3-5-haiku-20241022
  • Elon Musk의 x.ai 최신 모델 grok-beta가 추가되었습니다
  • 새로운 모델이 추가되었습니다: claude-3-5-sonnet-20241022
OpenAI의 최신 캐싱 기능이 온라인에 출시되었습니다. 현재 지원됩니다:
  • GPT-4o
  • GPT-4o-mini
  • o1-preview
  • o1-mini
참고: gpt-4o-2024-05-13 버전은 공식적으로 지원되지 않습니다.요청이 캐시에 히트되면 백엔드 로그에서 관련 캐시 토큰 데이터를 볼 수 있습니다.자세한 정보와 사용 규칙은 다음을 방문하세요: OpenAI 캐싱 기능 세부사항
  • gpt-4o 모델의 백엔드 청구가 감소하여 공식 가격과 동기화되었습니다
  • 새로운 모델이 추가되었습니다: aihubmix-Llama-3-2-90B-Vision, aihubmix-Llama-3-70B-Instruct
  • Cohere의 최신 모델이 추가되었습니다: aihubmix-command-r-08-2024, aihubmix-command-r-plus-08-2024
  • 새로운 모델이 추가되었습니다: whisper-large-v3 및 distil-whisper-large-v3-en
  • 참고: Whisper 모델 청구는 입력 초를 기준으로 합니다; 현재 페이지 가격 표시 문제가 수정될 예정입니다. 백엔드 청구는 정확하며, OpenAI 공식 요금과 완전히 동기화되어 있습니다
  • 모델 o1-mini 및 o1-preview가 추가되었습니다 참고: 이러한 최신 모델은 입력 매개변수 변경이 필요합니다. 기본 매개변수가 업데이트되지 않으면 일부 래퍼 소프트웨어에서 오류가 보고될 수 있습니다.
중요한 참고사항: 테스트 결과 o1 모델은 다음을 지원하지 않습니다:
  • system 필드: 400 오류
  • tools 필드: 400 오류
  • 이미지 입력: 400 오류
  • json_object 출력: 500 오류
  • 구조화된 출력: 400 오류
  • logprobs 출력: 403 오류
  • stream 출력: 400 오류
  • o1 시리즈: 20 RPM, 150,000,000 TPM, 매우 낮아서 언제든지 429 오류가 발생할 수 있습니다
  • 기타: temperature, top_p, n이 1로 고정; presence_penalty 및 frequency_penalty가 0으로 고정
  • 새로운 모델이 추가되었습니다: mattshumer/Reflection-Llama-3.1-70B (llama3.1-70b의 가장 강력한 미세 조정 버전으로 보고됨)
  • 안정적인 공급을 유지하기 위해 Claude-3 모델 가격이 인상되었으며, 현재 직접 공식 API 사용보다 10% 비쌉니다; 가격은 점진적으로 감소할 예정입니다
  • OpenAI 시리즈 모델의 동시 처리 능력이 향상되어 이론적으로 무제한 동시 처리를 지원합니다
  • 새로운 모델이 추가되었습니다: Phi3medium128k, ahm-Phi-3-medium-4k, ahm-Phi-3-small-128k
  • Llama 관련 모델의 안정성이 개선되었습니다
  • Claude 모델의 호환성이 더욱 최적화되었습니다
  • 온라인 직접 결제 충전이 추가되었습니다
  • Claude 멀티턴 대화 형식 오류가 수정되었습니다: 메시지 역할은 “user”와 “assistant” 사이에서 번갈아 나타나야 하지만 연속적인 여러 “user” 역할이 발견되었습니다
  • Claude 모델의 함수 기능 사용 시 인덱스 문제가 최적화되었습니다
  • 백업 서버 https://orisound.cn은 9월 7일에 완전히 폐기될 예정입니다; 메인 서버 https://aihubmix.com 또는 백업 서버 https://api.aihubmix.com으로 전환하세요
  • Mistral Large 2 지원이 추가되었습니다, 모델 이름: Mistral-large-2407 또는 aihubmix-Mistral-large-2407
  • 시스템 최적화
  • 최신 llama-3.1 모델이 추가되었습니다: llama-3.1-405b-instruct, llama-3.1-70b-versatile, llama-3.1-8b-instant
  • gpt-4o-mini 모델의 가격 계산 문제가 수정되었습니다: 텍스트 입력 가격: 공식 gpt-4o-mini 모델 텍스트 입력 가격은 gpt-4o 모델 가격의 1/33입니다 이미지 입력 가격: 공식 gpt-4o-mini 모델 이미지 입력 가격은 gpt-4o 모델 가격과 같습니다
  • 정확한 가격 계산을 위해 gpt-4o-mini 모델 이미지 입력의 토큰 수에 33배를 곱하여 공식 가격과 일치시킵니다
  • 자세한 내용은 OpenAI 공식 가격에서 확인하세요 이미지 이미지
  • gpt-4o-mini 모델 지원이 추가되었으며, 백엔드 청구가 공식과 동기화되었습니다
  • 공식 API 매개변수 include_usage를 지원하며, 매개변수를 전달하면 스트림 모드에서 사용량을 반환할 수 있습니다, 공식 문서 참조
  • 새로운 nextweb 버전이 비 OpenAI 모델 호출을 지원합니다 저희 사이트에서 비 OpenAI 모델 호출
  • Alibaba Qwen 모델의 백엔드 청구가 추가되었으며, 전체 비용은 Alibaba Cloud 공식보다 ~10% 높습니다
  • Azure OpenAI 출력과 OpenAI 인터페이스의 호환성이 최적화되었습니다
  • Claude-3의 도구 호출을 지원합니다
  • 많은 새로운 모델이 추가되었습니다, 사용 가능한 모델은 설정에서 확인하세요
  • 전체 백엔드 인터페이스가 최적화되었습니다
  • 각 로그 요청 기록이 요청 시점의 모델 단가를 표시합니다
  • 모델 및 가격 페이지가 추가되었습니다 모델/가격
  • 백엔드 로그 페이지가 이제 사용량 요청 기록 다운로드를 지원합니다
  • 무작위로 Azure OpenAI에 히트될 확률이 감소하여 이제 거의 무시할 수 있는 수준입니다
  • Claude-3 관련 모델(Claude 3 Haiku, Claude 3 Sonnet, Claude 3 Opus)의 수수료가 공식 백엔드 요금과 일치하도록 인하되었습니다; 현재 소매 가격은 공식 가격의 ~14% 할인입니다
  • gpt-4o의 토큰 청구가 최적화되었으며, 토크나이저가 cI100k_base에서 0200k_base로 변경되었습니다; 결과적으로 중국어, 한국어, 일본어의 스트리밍 요청에서 토큰 수가 감소했습니다
  • Alibaba의 최신 오픈 소스 모델이 추가되었습니다:
    • alibaba/Qwen2-7B-Instruct
    • alibaba/Qwen2-57B-A14B-Instruct
    • alibaba/Qwen2-72B-Instruct
  • 새로운 모델 gemini-1.5-flash가 추가되었습니다
  • 새로운 모델 gpt-4o가 추가되었습니다
  • llama3 (llama3-70b-8192, llama3-8b-8192) gemini-1.5-pro, command-r, command-r-plus가 추가되었습니다
  • Claude-3 모델 공급이 복원되었습니다; 현재 AWS와 Google Cloud에 배포된 Claude-3 엔드포인트에 연결됩니다
  • Claude-3 모델 및 가격 백엔드 청구가 서버 비용과 팀 비용을 충당하기 위해 공식보다 10% 비쌉니다
  • 호출량이 증가하면 가격이 점진적으로 ~5% 또는 더 낮게 감소할 예정입니다
  • 현재 동시 처리는 테스트가 필요합니다; 사용량이 증가하면 더 높은 동시 호출을 신청할 예정입니다

마지막 업데이트: 2026-06-22