2026
2026
28 de agosto
Novos modelos
- Adicionado
hy4-preview: Hy4 Preview da Tencent Hunyuan, um modelo MoE com 770B de parâmetros totais e 49B de parâmetros ativos, otimizado para fluxos de trabalho de Agent, programação e produtividade. Reforça a compreensão de tarefas, o planejamento, o uso de ferramentas e a execução sustentada em tarefas complexas de múltiplas etapas, engenharia de software, processamento de documentos, análise de informações, automação de escritório, geração web e colaboração entre ferramentas. Suporta janela de contexto de 1 milhão de tokens, até 64K de saída, raciocínio, busca na web, chamada de ferramentas/funções e saídas estruturadas.
2026
27 de agosto
Novos modelos
- Adicionado
qwen3.8-flash: o modelo de visão e linguagem nativo principal da Alibaba Cloud Qwen, voltado a programação, tarefas de escritório, raciocínio com contexto longo e fluxos de trabalho de agentes. Oferece suporte a uma janela de contexto de 1 milhão de tokens, até 128K de saída, thinking, acesso à web, chamadas de ferramentas e saídas estruturadas. Em comparação com o Qwen3.7-Plus, reforça as capacidades de programação e de escritório e melhora a eficiência de treinamento e inferência.
- A ferramenta MCP de geração de imagens agora exige que o chamador informe explicitamente o modelo, evitando o uso silencioso de um modelo padrão quando nenhum modelo é enviado.
openai/gpt-image-1é o ID de modelo padrão exibido e encaminhado externamente. O erro histórico de grafia continua aceito apenas como alias de entrada compatível e é normalizado antes do envio da requisição.
2026
26 de agosto
Novos modelos
- Adicionado
glm-5.3-flash: o modelo multimodal de alta eficiência da Z.AI voltado a Coding Agents, raciocínio complexo e tarefas de engenharia de software de longa duração. Oferece suporte a entradas de texto, imagem e vídeo, aproximadamente 1 milhão de tokens de contexto, até 128K de saída, thinking, chamadas de ferramentas e saídas estruturadas. Construído sobre a pilha tecnológica GLM com pós-treinamento e otimização adicionais, prioriza a eficiência de inferência e a capacidade de resposta.
- Adicionado o Broadcast, que envia automaticamente traces de solicitações da API AIHubMix ao LangWatch sem instrumentação adicional na aplicação. Oferece modo de privacidade, amostragem e filtros de chaves de API; modelo, uso de tokens, custo real cobrado, latência, sessão e dados de Trace ficam disponíveis no LangWatch.
- A entrada antiga
/mcp/pode continuar usando a autenticação existente e agora é roteada para as capacidades MCP HTTP remotas unificadas. Clientes antigos não precisam migrar imediatamente e ainda podem consultar modelos e preços, pesquisar documentação, verificar créditos e usar ferramentas de chat, imagem e vídeo. - O console terá um caminho somente leitura para copiar a Access Key, e clientes MCP externos podem usar o cabeçalho
X-Aihubmix-Access-Key. O servidor não rotaciona a chave nem armazena essa resposta em cache.
- Requisições
gpt-image-2com fundo transparente agora priorizam canais nativos da OpenAI que oferecem suporte a essa capacidade, reduzindo falhas repetidas em canais incompatíveis. Os demais caminhos de requisição de imagem não mudam.
- Listas de modelos e guias para AI Agents e ferramentas externas agora atualizam mais rápido.
2026
25 de agosto
Erros de migração mais claros para APIs de mídia antigas
- Para modelos de mídia que não oferecem mais suporte ao protocolo antigo,
/v1/images/generations,/v1/images/edits,/v1/models/:organization/:model/predictionse/v1/videosagora retornamprotocol_not_supported, com orientação para as APIs assíncronas de mídia em/ai/v1e a documentação relacionada. model=automantém o comportamento atual de seleção automática de modelo. Se o modelo final selecionado não suportar o endpoint antigo, o chamador recebe um erro claro em vez de ser alternado silenciosamente para outro modelo. O Playground também oculta as entradas antigas desses modelos para reduzir uso acidental.
2026
24 de agosto
Novos modelos
- Adicionado
wan3.0-video: o modelo de vídeo All-in-One em versão preview da Alibaba Cloud Wan (Tongyi Wanxiang) unifica os fluxos de trabalho de texto-para-vídeo, imagem-para-vídeo com primeiro/último frame e vídeo de referência, suportando até 30 segundos a 30 fps em 480P/720P/1080P para geração e edição integradas. - Adicionado
wan3.0-video-prime: uma edição de alta velocidade alinhada em capacidades para fluxos de trabalho integrados de geração e edição de vídeo, com processamento ponta a ponta mais rápido.
gpt-5.6-solsincronizou a redução oficial de 20% e agora custa US 20 por milhão de tokens de saída. Os caminhos de chamada existentes não mudam, enquanto cargas de raciocínio complexo, programação e contexto longo ficam mais baratas.
- Quando uma conta ainda não ativou tarefas assíncronas, as APIs de criação de mídia agora incluem a página correspondente do console no erro
async_not_enabled. Usuários de aihubmix, inferera e shkq são direcionados ao próprio console, reduzindo respostas 403 sem próximo passo claro.
2026
21 de agosto
Novos modelos
- Adicionado
deepseek-v4-flash-0731-fast: uma variante de alta velocidade do modelo agêntico da DeepSeek, voltada para programação, uso de ferramentas e cargas de trabalho de Agent de alto volume. Preserva as capacidades do V4 Flash 0731 entregando inferência mais rápida; em comparação com o V4 Pro, prioriza menor latência e eficiência de execução. Suporta janela de contexto de 1 M de tokens, até 384K de saída, thinking, chamada de ferramentas e saídas estruturadas. - Adicionado
deepseek-v4-flash-vision-exp: modelo experimental multimodal de compreensão visual da DeepSeek, com entrada de texto e imagem e saída de texto. É indicado para descrição de imagens, OCR de capturas de tela, análise de gráficos e agentes com base visual; suas capacidades puramente textuais de agente, raciocínio e conhecimento geral ficam alinhadas à versão oficial DeepSeek V4 Flash. - Adicionado
ox-alpha, um modelo de raciocínio stealth de um provedor terceiro anônimo cujo verdadeiro desenvolvedor e proprietário não foram divulgados. Gratuito na AIHubMix, suporta entrada de texto e imagem, saída de texto e uma janela de contexto de 1.048.576 tokens para programação, engenharia de software de longa duração, trabalho agêntico contínuo, raciocínio complexo e fluxos de trabalho que combinam texto e imagem.
- Quando uma requisição de geração de imagem encontra um erro temporário de serviço, a AIHubMix se recupera com mais consistência. Se o erro indicar claramente uma limitação de capacidade do modelo escolhido, a requisição ainda para as tentativas e retorna um motivo claro. Isso deve reduzir falhas diretas causadas por diferenças temporárias de serviço em modelos como
gpt-image-2.
2026
20 de agosto
Anúncio da plataforma
- Lançadas capacidades de integração para AI Agents: instruções de integração em
agents.md, documentação legível por máquinallms.txtdo site e por modelo, Playground Skill (distribuída em endereço fixo) e deep links do Playground (?models=abre até 6 abas de modelos com um único link e?config=carrega uma configuração diretamente). Para ver as especificações e os preços de dois modelos lado a lado, use a página de comparaçãohttps://aihubmix.com/compare/{model_a}/{model_b}. A lista de pontos de entrada está em Integração para Agents.
- Requisições de geração de imagem tratam parâmetros de tamanho como
resolutioneimageSizecom mais consistência. Quando uma requisição fica fora da capacidade do modelo escolhido, a API retorna erros mais claros para corrigir parâmetros mais rápido.
- Variantes relacionadas, como GLM 5.2, edição Coding e edição Free, podem aparecer como um modelo principal com várias versões. Isso facilita navegar, comparar preços e escolher a versão adequada.
- Tarefas assíncronas de imagem agora podem progredir com concorrência limitada pela capacidade disponível. Em períodos de pico, as filas devem fluir melhor e a entrega de status/resultados fica mais estável.
2026
19 de agosto
Novos modelos
- Adicionado
gpt-5.6-sol-disc: a rota de desconto por tempo limitado da AIHubMix para o GPT 5.6 Sol da OpenAI, oferecendo até 50% de desconto com as mesmas capacidades subjacentes dogpt-5.6-solpadrão. Este modelo de raciocínio de fronteira é adequado para programação complexa, trabalho profissional de conhecimento, pesquisa aprofundada e agentes de longa execução, com entrada de texto e imagem, cerca de 1,05 M tokens de contexto, até 128K de saída, thinking, ferramentas e saídas estruturadas.
- Horário de conclusão, expiração de resultados e arquivamento de artefatos estão mais consistentes para tarefas de imagem e vídeo. Em rolling releases ou alta concorrência, status da tarefa, resultados baixáveis e registros visíveis ao usuário têm menos chance de atraso ou processamento duplicado.
- A capacidade de produção de mídia foi ampliada, e respostas de mídia maiores têm mais margem, melhorando a disponibilidade de tarefas longas ou com artefatos grandes.
2026
18 de agosto
Os detalhes do modelo estão mais completos
- Os detalhes do modelo agora exibem
release_date, facilitando distinguir a data oficial de lançamento do horário em que a AIHubMix disponibilizou o modelo.
- Os fluxos de geração/edição de imagens do Gemini e o caminho multi-imagem do Vertex preservam
imageSizee parâmetros relacionados com mais consistência, reduzindo divergências de tamanho ou protocolo. - Os uploads de arquivos do Gemini mantêm o
Content-Typeoriginal, então vídeos e outras mídias têm menos chance de ser classificados incorretamente.
- Erros de schema, enumeração e capacidade voltados ao usuário agora exibem mensagens mais legíveis, facilitando diagnosticar problemas de parâmetros.
2026
17 de agosto
Novos modelos
- Adicionado
glm-5.3, a API de produção da Z.AI para o seu modelo de raciocínio principal apenas de texto, voltado para engenharia de software complexa, tarefas de Agent de longo horizonte e análise de vulnerabilidades. Suporta janela de contexto de 1 M de tokens, até 128K de saída e concorrência ilimitada no AIHubMix, com desconto por tempo limitado de 10%.
2026
15 de agosto
Novo modelo
- Adicionado
mai-thinking-1: modelo de raciocínio da série Microsoft MAI para raciocínio empresarial, matemática, inteligência geral e cargas de alto throughput. Suporta janela de contexto de 256K tokens, Chat Completions e saídas estruturadas, sendo adequado para raciocínio de contexto longo, formatos de resposta estáveis e uso contínuo com controle de custos.
2026
14 de agosto
Novos modelos
- Adicionado
gemini-3.7-flash: o modelo de raciocínio nativamente multimodal do Google, voltado para programação, agentes, desenvolvimento web e trabalho de conhecimento. Suporta entrada de texto, imagem, áudio e vídeo, janela de contexto de 1 milhão de tokens, níveis de thinking ajustáveis, chamada de ferramentas, busca na web e saídas estruturadas, com programação, uso de ferramentas, planejamento em várias etapas e seguimento de instruções mais fortes do que o Gemini 3.6 Flash. - Adicionado
coding-glm-5.3: o modelo de raciocínio da Z.AI para programação e fluxos de trabalho agênticos, projetado para engenharia de software complexa, agentes de longa execução e análise de vulnerabilidades. Utiliza o mesmo modelo base do GLM-5.2 e, com pós-treinamento em maior escala, melhora a programação, a execução de tarefas e a eficiência de tokens. Esta rota é uma prévia por tempo limitado, destinada apenas a testes e avaliação; a estabilidade do serviço não é garantida e o uso em produção não é recomendado.
- Solicitações nativas de Gemini embedding agora preservam a origem de serviço do
fileUriretornado pela Gemini Files API. Ao usarembedContentoubatchEmbedContentscom arquivos enviados, erros 403 por inconsistência de origem são reduzidos; lotes que misturam arquivos de várias origens retornam um 400 claro. - Quando o OpenRouter retorna um erro estruturado de provedor de modelos, o erro da API prioriza os campos internos
message,parametype, reduzindo mensagens longas e difíceis de interpretar. Erros de um único provedor de modelos também têm menor chance de afetar todo o serviço OpenRouter. - O polling, o arquivamento terminal e o processamento de artefatos de tarefas assíncronas de mídia estão mais confiáveis. Tarefas longas de imagem e vídeo têm menor probabilidade de processamento duplicado, perda de estado terminal ou entrega atrasada durante alta concorrência, reinícios ou artefatos grandes; campos públicos, status e fórmulas de cobrança da API permanecem inalterados.
2026
13 de agosto
Novos modelos
- Adicionado
grok-4.6: o modelo multimodal de raciocínio principal da xAI, voltado para programação, agentes de longa duração, trabalho de conhecimento e desenvolvimento de aplicações interativas. Suporta compreensão de imagens, janela de contexto de 500K, chamada de ferramentas e saídas estruturadas, com execução em várias etapas, autoverificação, programação e geração de projetos visuais mais fortes do que o Grok 4.5. - Adicionado
deepseek-v4-pro-0813: o modelo de raciocínio e agente de propósito geral e alto desempenho da DeepSeek, voltado para raciocínio complexo, programação, análise de documentos longos e fluxos de trabalho agênticos. Suporta modos thinking e non-thinking, janela de contexto de 1 milhão de tokens, até 384K de saída, chamada de ferramentas e a API Responses.
2026
12 de agosto
Novos modelos
- Adicionados
agnes-2.5-flash,agnes-2.5-pro,agnes-2.5-pro-alphaeagnes-image-2.1-flash. Os modelos Agnes de texto e imagem agora estão disponíveis pela entrada unificada da AIHubMix.
- Tarefas Gemini Veo preservam a duração real do vídeo com mais confiabilidade na criação, no polling e na leitura do resultado. Usuários que geram vídeos com segundos personalizados devem ver a duração da tarefa, do arquivo baixado e dos registros posteriores de cobrança ou exibição mais alinhadas.
- Ao usar ferramentas namespace pelo Azure Responses, descriptions vazias ou ausentes não fazem mais o Azure rejeitar a solicitação com 400 antes da execução do modelo. Tool calls que já funcionavam pela interface oficial da OpenAI devem se comportar de forma mais consistente no Azure.
/call/devsagora oferece suporte a um campo de site do fornecedor, permitindo que páginas de agregação de modelos e fornecedores mostrem uma entrada Official site quando os dados forem preenchidos. As páginas/providers/<slug>também preservam o comportamento de cache de borda para respostas mais estáveis.
2026
11 de agosto
Gemini interactions agora oferece suporte a tarefas assíncronas
- Requisições Gemini interactions agora podem usar explicitamente
background: truepara tarefas assíncronas e depois usar o ID da tarefa retornado para consultar status, cancelar ou limpar a tarefa. Interações multimodais/omni de longa duração ficam mais fáceis de integrar sem manter uma conexão síncrona aberta até a conclusão. - Tarefas assíncronas são liquidadas com base no uso real, com colunas de tokens, liberação integral no cancelamento e proteções para respostas grandes. Registros de uso, pré-dedução de saldo e cobranças finais no console ficam mais consistentes.
- Quando o protocolo Messages chama provedores de modelo compatíveis com OpenAI, o conteúdo thinking/reasoning retornado é preservado e pode ser reenviado em rodadas posteriores. Apps que usam SDKs Claude, ferramentas em múltiplas rodadas ou o modo thinking do DeepSeek devem ver menos respostas vazias, erros 400 ou perda de contexto de raciocínio.
- Blocos thinking sem assinatura são tratados de forma mais compatível quando o tráfego muda para o serviço Claude nativo, reduzindo erros de formato em fallback multimodelo ou fluxos de ponte.
- Ao chamar modelos de vídeo Doubao,
prompte recursos de referência emextra_body.contentagora podem funcionar juntos; requisições que contêm apenas recursos mantêm o prompt e a ordem dos recursos. - Respostas de criação agora refletem tamanho e prompt mais próximos do que é realmente enviado, enquanto campos nativos sem suporte continuam sendo ignorados. Isso reduz falhas de geração de vídeo causadas por parâmetros extras de SDK.
2026
10 de agosto
Uso acumulado mais completo para geração de mídia
- Depois que uma tarefa de geração de mídia é liquidada, o uso acumulado no nível da conta também é atualizado. No console, uso acumulado, dedução de saldo e registros de consumo refletem de forma mais completa o consumo real de geração de mídia.
- Ao chamar modelos do Azure cujo nome de deployment/model contém pontos, o nome do modelo é preservado nos caminhos de conversão de Chat, Responses e Messages, sem reescrita automática. O comportamento das chamadas Azure existentes permanece inalterado.
2026
8 de agosto
Novo modelo de geração de vídeo
- Adicionado
doubao-seedance-2-5-260628: modelo unificado de geração multimodal de áudio e vídeo de nova geração do ByteDance Seed. Gera até 30 segundos de áudio e vídeo sincronizados em uma única execução, oferece suporte a extensões em múltiplas rodadas e aprimora narrativa, transições, suporte a referências, realismo e edição precisa, adequado para produção cinematográfica, publicidade, educação, simulação e criação de conteúdo longo.
2026
6 de agosto
Novos modelos
- Adicionado
wan3.0-video: modelo integrado de geração e edição de vídeo do Tongyi Lab da Alibaba, atualmente em beta pública. Oferece suporte a vídeos nativos de até 30 segundos, consistência de personagens em nível de produção, imagem e som realistas e fluxos de trabalho unificados de referência, edição, replicação e controle de movimento para publicidade, e-commerce, produção cinematográfica, animação de personagens, edição de vídeo e conversão de documentos em vídeo. - Adicionado
qwen-image-3.0: modelo de geração e edição de imagens da equipe Qwen da Alibaba Cloud, com suporte a texto para imagem, criação com imagens de referência e edição de imagens. Equilibra qualidade e velocidade para redes sociais, e-commerce, design criativo, produção diária de conteúdo e criação em larga escala e alta frequência. - Adicionado
qwen-image-3.0-pro: modelo carro-chefe de geração e edição de imagens da Qwen (Alibaba Cloud), voltado para publicidade, identidade de marca, UI, apresentações, imagens de produto e design profissional. Destaca-se em composições complexas, renderização precisa de texto em chinês e inglês, materiais realistas, edição baseada em imagens de referência, detalhamento, composição e qualidade visual de nível comercial.
2026
4 de agosto
Gemini embedding suporta entrada multimodal e cobrança por modalidade
gemini-embedding-2-previewagora processa texto, imagem, áudio, vídeo e documentos tanto pelo endpoint de embeddings compatível com OpenAI quanto pelo caminho nativo Gemini. Usuários que criam busca multimodal, entendimento de conteúdo ou bases de conhecimento podem usar mais tipos de entrada no mesmo modelo.- A cobrança de Gemini embedding prioriza o uso de tokens por modalidade retornado pelo provedor de modelos. Imagens, áudio, vídeo e documentos deixam de ser tratados como uma única estimativa de texto, deixando a fatura multimodal mais próxima do uso real.
- Requisições embedding com entrada única podem chamar diretamente o caminho Gemini embedding mais novo. Requisições batch com vários inputs agora retornam uma resposta clara de capacidade incompatível.
- As referências do Seedance 2.0 para imagem, áudio e vídeo são mapeadas com mais precisão por tipo de mídia, com restrições mais claras para
adaptive, 4K e opções de tamanho. Workflows de geração de vídeo têm menos falhas causadas por mapeamento incorreto de parâmetros. - Requisições de duração adaptativa são pré-deduzidas com base em 15 segundos e ajustadas pela duração real ao fim da tarefa, mantendo pré-dedução de saldo e cobrança final mais consistentes.
- Quando a geração de mídia falha, as APIs retornam detalhes de erro sanitizados, facilitando o diagnóstico de parâmetros, URLs assinadas ou limites do provedor de modelos sem expor credenciais sensíveis.
3 de agosto
Novos modelos- Adicionado
qwen3.8-max: modelo carro-chefe nativo de visão e linguagem da Alibaba Cloud, baseado em uma arquitetura Mixture-of-Experts (MoE) de 2,4 trilhões de parâmetros e com suporte a janelas de contexto de até 1 milhão de tokens. É adequado para compreensão multimodal complexa, raciocínio avançado, desenvolvimento de software, fluxos agênticos e processamento de contexto longo. Com preço próximo ao do Qwen3.7-Max, o Qwen3.8-Max traz melhorias significativas em raciocínio, programação e capacidades agênticas, com desempenho geral comparável aos principais modelos atuais.
- Os detalhes do modelo agora mostram primeiro os fornecedores mais adequados para as requisicoes atuais, enquanto fornecedores apenas de reserva ou temporariamente indisponiveis aparecem mais abaixo. Ao escolher um fornecedor ou verificar a disponibilidade de um modelo, usuarios e equipes de suporte conseguem identificar mais rapidamente quais opcoes convem usar e evitam decisoes baseadas em uma ordem desatualizada.
2 de agosto
Cobranca e logs mais precisos para requisicoes pequenas- Requisicoes pequenas em modelos by-bill nao desaparecem mais da cobranca nem dos logs de uso quando o valor calculado era arredondado para zero. As requisicoes afetadas agora entram com a quota minima efetiva, mantendo faturas, pre-deducao de saldo e registros de uso alinhados; equipes de suporte e operacoes passam a ver registros mais completos para trafego frequente do tipo embedding.
31 de julho
Novos modelos- Adicionado
deepseek-v4-flash: modelo Mixture-of-Experts otimizado para eficiência, com 284B de parâmetros totais, 13B de parâmetros ativos e janela de contexto de 1M tokens. É projetado para inferência rápida e cargas de trabalho de alto throughput, mantendo forte desempenho em raciocínio e programação, o que o torna adequado para assistentes de código, sistemas de chat e fluxos agênticos.
- Adicionado
minimax-h3: modelo de video multimodal de uso geral da MiniMax. Ele aceita entradas de texto, imagem, audio e video, e suporta texto para video, imagem para video, geracao com primeiro/ultimo quadro, geracao baseada em referencias e edicao de video. Usuarios que criam fluxos de video, criativos de anuncios, demonstracoes de produto ou conteudo multimodal podem chama-lo pela API unificada da AIHubMix.
glm-5.2tem desconto conforme a faixa horaria diaria, em UTC: 50% de desconto das 14:00 as 24:00 e 30% de desconto das 00:00 as 14:00 todos os dias. Oferta por tempo limitado.
gpt-5.6-lunasincronizou a reducao oficial de 80% e agora custa 1.20 na saida;gpt-5.6-terrasincronizou a reducao oficial de 20% e agora custa 12.00 na saida. Usuarios com trafego constante nesses modelos podem reavaliar a escolha de modelo para cargas sensiveis a custo e usos gerais.
30 de julho
Servidor MCP oficial da AIHubMix disponivel- Foi adicionado o endpoint MCP hospedado oficial mcp.aihubmix.com/mcp ou mcp.inferera.com/mcp para clientes compativeis com MCP. Desenvolvedores podem usar uma unica entrada em ferramentas como Claude Code, Codex e Cursor para consultar modelos e precos, pesquisar documentacao, verificar creditos e chamar ferramentas de chat, geracao de imagens e geracao de video.
- As credenciais MCP sao enviadas pelo cliente em cada requisicao e nao sao armazenadas pelo servidor, adequado para desenvolvedores que querem acesso direto a modelos e recursos de midia da AIHubMix dentro de IDEs ou ferramentas de agentes.
29 de julho
Novo modelo- Adicionado
jina-reranker-v3.5: reranker de documentos listwise multilingue de 0,6B parametros da Jina AI e upgrade com o mesmo esquema dojina-reranker-v3. Ele atende fluxos de RAG, busca e ranking de dados estruturados, suporta ranking de candidatos em contexto longo e melhora robustez por dominio, recuperacao multilingue, ranking estruturado e eficiencia de inferencia.
28 de julho
Cobranca de cache mais precisa- Para requisicoes com cache explicito ou implicito, a AIHubMix agora identifica de forma mais consistente o uso de leitura/escrita de cache e prioriza o tipo de cache retornado pelo provedor de modelos. Usuarios de modelos com cache, como Qwen e Claude, devem ver detalhes de cobranca mais alinhados ao uso real.
- A primeira lista de modelos de geracao de midia foi reduzida a modelos verificados, e foi corrigido um caso que podia retornar 404 em algumas chamadas de modelos de imagem pelo endpoint de midia. Downloads de tarefas LLM no console agora tambem cobrem arquivos de texto, facilitando recuperar grandes resultados historicos.
- O comportamento de cache do site, dos dados de modelos, dos dados de blog e dos sitemaps foi ajustado para que publicacoes tenham efeito com mais confianca. Paginas de modelos e entradas de documentacao ficam menos sujeitas a dados antigos em cache depois de atualizacoes.
27 de julho
APIs de geracao de midia disponiveis- Foram adicionados
/ai/v1/images/generationse/ai/v1/images/edits, com tarefas assincronas unificadas, consulta de resultados, download de artefatos e callbacks de webhook. Fluxos de imagem e video agora podem usar o mesmo ciclo de vida de tarefas, facilitando o acompanhamento de geracoes demoradas. - Os artefatos gerados sao retornados pelos resultados de tarefa da AIHubMix e oferecem downloads limitados e recuperacao em lote. Equipes voltadas ao cliente devem acompanhar os primeiros feedbacks sobre status das tarefas, validade dos links de download e detalhes de cobranca.
25 de julho
Novos modelos- Adicionado
claude-opus-5: modelo carro-chefe da Anthropic para raciocínio exigente, programação e tarefas agênticas de longo horizonte. Destaca-se em tarefas de software de ponta a ponta, revisão de código e detecção de bugs, análise visual de gráficos e documentos, entregáveis de escritório complexos e coordenação de subagentes em paralelo, com janela de contexto de 1M e saída de até 128K.
24 de julho
Novos modelos- Adicionado
mai-image-2.5-pro: modelo carro-chefe de geração e edição de imagens da Microsoft, com realismo de alta fidelidade, renderização precisa de texto na imagem e edição poderosa para design comercial, fotografia de produto e fluxos criativos profissionais. - Adicionado
qwen-audio-3.0-tts-flash: modelo de síntese de voz em tempo real da Qwen, com suporte ampliado a idiomas de baixos recursos e dialetos chineses, controle expressivo da voz e latência do primeiro pacote abaixo de 200 ms, adequado para assistentes de voz, diálogo em tempo real e atendimento inteligente ao cliente. - Adicionado
qwen-audio-3.0-tts-plus: modelo premium de síntese de voz da Qwen, com controle mais rico de emoção, tom, personagem, velocidade da fala, volume e estilo, projetado para criação de conteúdo, audiolivros, dublagem, vozes de marca e outros fluxos de voz de alta qualidade.
- Ambos os modelos Qwen TTS podem ser chamados por
/v1/audio/speech; requisicoes sem streaming retornam uma URL de resultado de audio, enquanto requisicoes com streaming retornam eventos SSE de geracao de audio. A tabela abaixo combina campos compativeis com AIHubMix e a documentacao oficial Qwen-Audio-TTS da Alibaba Cloud;voicedeve ser escolhido por modelo, e as vozes de sistema plus/flash nao sao intercambiaveis.
Melhor compatibilidade das respostas Messages
- Respostas de
/v1/messagesvindas de modelos em ponte e servicos compativeis com Claude, como Bedrock, agora ficam mais alinhadas ao ecossistema Anthropic Messages, reduzindo erros em SDKs estritos ou validadores de schema causados por campos ausentes.
- Quando um cliente se desconecta de uma requisicao streaming do AWS Bedrock, o AIHubMix continua coletando o sinal final do provedor de inferencia de modelos e o usage final, reduzindo divergencias entre logs de requisicao, detalhes de cobranca e uso do provedor de inferencia de modelos nesses cenarios.
23 de julho
Novos modelos- Adicionado
qwen3-coder-480b-a35b-instruct: modelo principal Qwen3-Coder para geração de código, agentes de engenharia de software e fluxos com chamadas de ferramentas, adequado para compreensão de código em contexto longo e tarefas de desenvolvimento automatizado. - Adicionado
gemini-2.5-flash-lite: modelo Gemini 2.5 leve para cargas frequentes de texto, multimodais e em lote com baixa latência e menor custo. - Adicionado
Qwen/Qwen3-235B-A22B-Instruct-2507: versão Qwen3 235B-A22B Instruct 2507 para chat geral, seguimento de instruções, trabalho multilíngue e tarefas de contexto longo.
22 de julho
Novos modelos- Adicionado
gemini-3.6-flash: o modelo Flash mais recente do Google, adequado para fluxos de trabalho complexos, uso de computador, raciocínio com gráficos e tarefas de contexto longo. - Adicionado
gemini-3.5-flash-lite: um modelo Gemini 3.5 mais leve e de menor custo, adequado para alto rendimento, automação diária e processamento em lote. - Adicionado
glm-5.2-fast-preview: modelo de prévia rápida Zhipu GLM-5.2, adequado para chat de baixa latência, raciocínio rápido e aplicações de alto throughput.
- As chamadas em streaming para
qwen3.8-max-previewpor/v1/responsese/v1/messagesestão mais confiáveis. Streams válidos que antes podiam aparecer comoempty_streamou 502 agora podem ser concluídos normalmente.
21 de julho
Parametros de imagem Gemini em passthrough- Ao chamar modelos Gemini/Vertex com saida de imagem pela API Chat Completions compativel com OpenAI, clientes agora podem enviar
aspectRatioeimageSizeemextra_body.generationConfig.imageConfig.
- Quando respostas de Gemini embedding trazem
usageMetadatareal, a AIHubMix cobra primeiro pelo uso de tokens retornado pelo provedor de modelos, mantendo a estimativa local anterior como fallback quando o dado nao vier.
- Requisicoes
/v1/responsesagora podem carregar function tools locais da mensagem em mensagens system/developer, e essas declaracoes sao preservadas ao fazer bridge para modelos Chat. Clientes com fluxos de ferramentas dinamicas, como Kimi K3, devem ter chamadas de ferramentas mais confiaveis.
- Em chamadas
/v1/responsesque fazem bridge para modelos Chat,stopagora e enviado ao provedor de modelos. Um stop unico pode funcionar normalmente; quantidades ou comprimentos acima do limite provedor de modelos retornam erros de limite consistentes com Chat Completions.
- Modelos DeepSeek V4 podem suportar cobranca configurada por horarios de pico e vale. A pre-deducao e a cobranca final usam o mesmo horario de envio da requisicao, entao um streaming que cruza a fronteira de horario continua cobrado pelo horario de envio. A protecao de pre-deducao fica limitada a modelos com cobranca por horario, evitando mudancas no saldo congelado de modelos comuns.
20 de julho
Compatibilidade de thinking no Claude Messages- Quando requisicoes
/v1/messagessao encaminhadas para modelos OpenAI ou Azure Chat, a configuracao Claudethinkingagora e convertida para um effort de raciocinio aceito pelo provedor de modelos, reduzindo erros 400 em chamadas com thinking. Requisicoes Claude nativas com thinking, como Opus 4.8, continuam compativeis.
- O limite de streaming do gateway de producao aumentou de 1 hora para 2 horas. Tarefas longas de raciocinio ou geracao, como Kimi K3, tem menor chance de serem interrompidas durante o processamento.
19 de julho
Novos modelos- Novo: qwen3.8-max-preview:
Oferta por tempo limitado: o Qwen3.8-Max-Preview é cobrado a apenas 10% do preço padrão, o equivalente a 10× mais uso. Por tempo limitado, por ordem de chegada.
O Qwen3.8-Max-Preview é o modelo de fundação de última geração da família Qwen, com 2,4 trilhões (2.4T) de parâmetros e em evolução contínua. Em comparação com o carro-chefe anterior, o Qwen3.7-Max, traz avanços significativos em capacidades essenciais como Coding e Cowork (produtividade profissional), com desempenho de nível mundial em tarefas complexas e de longo horizonte, como desenvolvimento full-stack, análise de dados e fluxos de trabalho do Office.
17 de julho
Novos modelos- Adicionado
kimi-k3: Kimi K3 e o modelo aberto de contexto longo de classe 3T da Moonshot AI, com 2,8T parametros, janela de contexto de 1M tokens e suporte nativo a entrada visual. E indicado para programacao de longo horizonte, trabalho de conhecimento, raciocinio complexo e compreensao multimodal. Consulte o guia prático do Kimi K3 (exemplos das três APIs e matriz de suporte). - Adicionado
hy-3d-3.1: modelo Tencent Hunyuan 3D Professional para texto-para-3D, imagem-para-3D e geracao 3D multivisao. E indicado para assets de jogos, apresentacoes de ecommerce, impressao 3D e design de produtos; a versao 3.1 melhora geometria e texturas e suporta entrada de oito vistas.
- Adicionada a API assincrona
/v1/3d/generations, inicialmente conectada ao Tencent TokenHub Hunyuan 3D. Ela permite enviar tarefas e consultar resultados, facilitando integrar geracao de assets 3D em fluxos automatizados.
- Ferramentas carregadas dinamicamente no nivel da mensagem em requisicoes Kimi K3 agora sao preservadas e encaminhadas, evitando erros 400 do provedor de modelos causados por declaracoes de ferramentas perdidas. Clientes que usam dynamic tool loading do Kimi devem ter melhor compatibilidade.
- A compatibilidade melhorou para custom tools de Chat Completions, blocos de texto Cohere e requisicoes com
assistant.content: null. Requisicoes validas chegam ao provedor de modelos de forma mais estavel; entradas malformadas ou nao suportadas retornam erros estruturados em vez de serem reportadas como sucessos HTTP 200 vazios.
- A geracao de imagens
doubao-seedream-5-0-proagora suporta cobranca por faixa de pixels de saida e quantidade de imagens de entrada, fazendo com que requisicoes texto-para-imagem e imagem-para-imagem sejam cobradas mais perto das especificacoes reais.
15 de julho
Compatibilidade aprimorada para chamadas de ferramentas no Gemini- Ao chamar Gemini ou Vertex pela API compativel com OpenAI, solicitacoes cujas definicoes de ferramentas ou schemas de saida estruturada contem valores enum de string vazia nao falham mais com erro 400 de validacao provedor de modelos. Os fluxos de chamadas de ferramentas e JSON Schema ficaram mais confiaveis.
14 de julho
Novos modelos de audio- Adicionado
gpt-audio-1.5, o primeiro modelo de audio da OpenAI geralmente disponivel. Ele aceita entradas e saidas de audio e pode ser usado pela API REST Chat Completions, para conversas por voz, compreensao de audio e geracao de audio. - Adicionado
gpt-4o-transcribe-diarize, um modelo ASR com diarizacao de falantes integrada que associa segmentos de audio a diferentes falantes em uma conversa. Este modelo esta disponivel apenas na API de Transcription.
- A pagina de apresentacao do LLM Router ja esta no ar, exibindo as pontuacoes publicas das dimensoes de roteamento e os modelos no pool. Tambem foram adicionados dois endpoints abertos: Escopo de Modelos da Estrategia LLM Router retorna as pontuacoes de modelos em 5 categorias e 23 subdimensoes, coeficientes de preco, latencia do primeiro token e modelos no pool, e Icones de Fornecedores de Modelos retorna os nomes de exibicao e os icones dos fornecedores de modelos; dimensoes de geracao de imagem e video ainda nao estao incluidas. Para o modo de uso, consulte a documentacao de roteamento inteligente de modelos.
13 de julho
Respostas de erro da API mais consistentes- Quando
/v1/responsese chamado com um modelo desconhecido, agora retorna HTTP 400, alinhado aos outros pontos de entrada da API. Assim os clientes podem tratar o caso como “sem servico disponivel” em vez de receber 500.
- Se a conversao do corpo da requisicao ou a validacao de parametros falhar, a API retorna diretamente o 400/erro correspondente em vez de encaminhar a requisicao original ao servico provedor de modelos, reduzindo chamadas invalidas e falhas confusas.
- Chamadas do Claude Code para Claude via Bedrock agora tem acertos de prompt cache mais estaveis dentro da mesma sessao, ajudando a diminuir custo de cache write duplicado e latencia do primeiro token.
- Requisicoes Gemini agora permanecem no mesmo servico somente quando a resposta realmente contem assinaturas de pensamento ou atividade de cache. Isso reduz divergencias de assinatura ou estado de cache em multivolta, enquanto tarefas sem estado como geracao de imagem nao ficam presas desnecessariamente.
10 de julho
Novos modelos- Adicionados os três modelos da série GPT-5.6:
gpt-5.6-sol,gpt-5.6-terraegpt-5.6-luna(lançamento oficial da OpenAI em 2026-07-09). Os três níveis têm janela de contexto de 1.050.000 tokens, saída máxima de 128K e corte de conhecimento em 2026-02-16, aceitam entrada de texto e imagem e podem ser chamados via Chat Completions, Responses e a interface Messages compatível com Claude. Sol é o nível flagship para trabalho profissional complexo, descrito pela OpenAI como seu melhor modelo de código atual; Terra tem desempenho equivalente ao GPT-5.5 pela metade do preço; Luna é voltado a cenários sensíveis a custo.
- Nova documentação Cache de Prompt do GPT: a partir da série GPT-5.6, a escrita de cache é cobrada a 1.25x o preço de entrada, a leitura a 0.1x e o cache é mantido por no mínimo 30 minutos; a página cobre os parâmetros
prompt_cache_keye pontos de quebra de cache explícitos, a lógica de cobrança, exemplos de interface e solução de problemas de acerto. As seções sobre o cache da OpenAI em Cache de prompts e Cache de Prompt do Claude foram atualizadas com o mesmo critério.
- Requisições para Claude Fable e Mythos com
reasoning_effortagora usam adaptive thinking, reduzindo erros 400 do provedor de modelos nessas famílias de modelos sem exigir mudanças no cliente.
- Configurações
stopcompatíveis com OpenAI agora são mapeadas para requisições nativas Claude e Gemini. Stops em branco inválidos para Claude são filtrados, e os limites de OpenAI/Gemini são tratados por provedor para tornar a parada da geração mais consistente.
gpt-chat-lateste futuros aliases latest de GPT/ChatGPT agora preservammax_completion_tokensquando necessário, reduzindo erros 400 causados pelo campo antigomax_tokens.
- Quando o limite de uso de uma Key se esgota, a API agora retorna uma orientação mais clara para ajustar e reativar o limite da Key, em vez de apenas um erro de quota de baixo nível.
- Respostas chat não streaming com
tool_callse sem texto agora retornam explicitamentecontent: null, melhorando a compatibilidade com SDKs e parsers no estilo OpenAI.
9 de julho
Reparo de saída estruturada: correção automática de erros de formato no JSON- Adicionada a capacidade de Reparo de saída estruturada em nível de Key, desativada por padrão. Uma vez ativada, para requisições não-streaming que declaram saída JSON estruturada, quando o JSON retornado pelo modelo apresenta erros de formato como truncamento, vírgulas finais ou empacotamento em bloco de código, o gateway o repara automaticamente para um JSON válido e analisável antes de retornar, mantendo os valores intactos e sem exigir alterações no cliente. Suporte aos quatro protocolos Chat Completions, Responses, Claude e Gemini; quando ocorre reparo, a resposta traz o cabeçalho
X-JSON-Repaired: true.
- Atualizada a documentação Cache de Prompt do Claude e Cache de prompts com os limites mínimos de tokens que podem ser armazenados em cache por modelo (512 / 1.024 / 2.048 / 4.096), adicionando modelos atuais como Claude Opus 4.8, Opus 4.7 e Fable 5. O limite não é proporcional à versão do modelo; um prefixo abaixo do limite não é armazenado em cache mesmo com
cache_control.
- A agregacao do dashboard de uso agora fica mais proxima dos registros de liquidacao dos request logs, reduzindo perdas em agregacoes concorrentes e alinhando o bucket horario usado em reprocessamentos atrasados. Numeros historicos do dashboard ainda podem ter pequenas diferencas; para conciliacao e liquidacao, os request logs continuam sendo a fonte da verdade.
- Adicionado
grok-4.5, um modelo para programacao, tarefas agenticas e trabalho de conhecimento, com raciocinio configuravel, chamadas de ferramentas e janela de contexto de 500K. E indicado para correcao de codigo, tarefas complexas de engenharia, perguntas de conhecimento e fluxos de agentes.
8 de julho
Chamadas com tools em gpt-5.5+ passam automaticamente por Responses- Ao usar o endpoint compativel com OpenAI
/v1/chat/completionscom gpt-5.5 ou modelos mais recentes, requisicoes que incluem tools ereasoning_effortagora usam automaticamente capacidades de Responses. Isso reduz erros 400 do provedor de modelos para essa combinacao de parametros sem exigir migracao do cliente para/v1/responses. Veja: Responses API
7 de julho
Compatibilidade de saida estruturada entre protocolosresponse_formatcompativel com OpenAI eoutput_config.formatnativo do Claude agora sao adaptados nos caminhos relevantes. Clientes que alternam entre protocolos no estilo OpenAI e Claude podem preservar restricoes de saida estruturada com mais confiabilidade. Veja: Structured Output.
/v1/messages mais estaveis no Vertex AI
- Ao chamar Gemini e outros modelos que nao sao Claude pelo Vertex AI, requisicoes
/v1/messagesagora sao roteadas por familia de modelo, reduzindo falhas not found ou 404 causadas por caminhos especificos do Claude.
6 de julho
Endpoints nativos do Gemini concluidos- Ao usar o SDK
@google/genaipela entrada Gemini da AIHubMix, agora ha suporte a workflows nativos de embeddings, interactions create e context caching. Essas rotas antes podiam retornar erros de rota nao registrada ou 404; agora servem para gerar embeddings, fazer chamadas interativas e criar/ler/atualizar/excluir caches. Saiba mais: Integracao com SDK nativo do Gemini
- Modelos de contexto longo como
hy3-preview, ERNIE, Grok e Mimo agora suportam cobranca por faixas com base no comprimento do contexto. O calculo de tarifas e mais preciso.
- Requisicoes streaming do Vertex AI Gemini/Claude agora registram dados mais precisos de primeiro token e latencia. Logs e monitoramento ficam mais confiaveis; isso nao altera as respostas do modelo.
- Adicionado
tencent-hy3, um modelo de geracao de texto (Tencent Hunyuan Hy3, versao oficial). Arquitetura MoE com 295B de parametros totais / 21B de parametros ativos e janela de contexto de 256K. Suporta modos de inferencia combinados rapido e lento, adequado para raciocinio complexo, geracao de codigo e workflows de agentes. Codigo aberto sob a licenca Apache 2.0.
3 de julho
Jina Search/Reader agora aceita POST e upload de arquivos- Jina Search e Reader agora aceitam requisições POST. O Reader pode receber arquivos locais via upload multipart, incluindo PDF, Word, Excel, PPT, HTML e imagens. As respostas padrão ficam mais próximas do markdown nativo da Jina; clientes que precisam de JSON podem enviar explicitamente
Accept: application/json.
- Corrigido um problema em que chamadas
/v1/responsesencaminhadas para serviços do tipo Azure não GPT podiam falhar com 404 porque oapi-versionficava vazio, reduzindo falhas diretas nesse tipo de requisição.
- Corrigido um caso em que alguns serviços de inferência de modelos do tipo vLLM / Azure Foundry podiam truncar respostas streaming aleatoriamente. Os usuários devem receber respostas completas, sinais de término e informações de uso com mais confiabilidade.
- Adicionado
command-a-plus-05-2026, um modelo de geracao de texto para chat, criacao de conteudo e fluxos de agentes.
1 de julho
APIs de busca Jina e leitura de páginas web disponíveis- Foram adicionadas as capacidades Jina Search e Reader. Agora você pode usar sua API Key da AIHubMix para obter resultados de busca da Jina e ler conteúdo de páginas web, ideal para pesquisa web externa, leitura de documentos e fluxos de trabalho com ferramentas de agentes. Saiba mais: Jina AI
- O Veo 3.1 imagem para vídeo agora aceita quadro inicial, quadro final e imagens de referência, permitindo controlar com mais precisão as cenas de início/fim, referências de personagem e referências de estilo em fluxos avançados de geração de vídeo. Saiba mais: Geração de vídeo
- Melhoramos a compatibilidade das requisições Gemini durante tentativas e fallback, reduzindo certos erros 400 e aumentando a taxa de sucesso de chamadas de reserva. Saiba mais: Guias Gemini
- Respostas compatíveis com OpenAI, tanto sem streaming quanto com streaming, agora preservam valores
nullem campos comologprobs,refusalefinish_reason, reduzindo diferenças para SDKs, agentes e analisadores de logs que esperam o formato padrão da OpenAI.
- Melhoramos a compatibilidade das requisições quando o Claude Code chama modelos Claude pela AIHubMix, reduzindo informações do ambiente do cliente enviadas ao provedor de modelos e reforçando a proteção de privacidade para clientes Agent de terceiros.
- O sistema próprio de contas agora cobre login/cadastro por código de e-mail, definição de senha, edição de perfil, vinculação/desvinculação de contas de terceiros e exclusão de conta, com isolamento mais forte do propósito do OTP e bloqueio de contas desativadas. Callbacks de recarga via Stripe também são tratados com mais confiabilidade.
- claude-sonnet-5 para chat, raciocínio e fluxos com agentes.
- gemma-4-31b e longcat-2.0 para geração de texto.
- gemini-3.1-flash-lite-image para fluxos com capacidades de imagem.
- mai-image-2.5 e mai-image-2.5-flash para geração de imagens.
29 de junho
Melhorias na cobrança e compatibilidade de parâmetros de geração de imagens- A cobrança de
gpt-image-2nos endpoints Images agora é unificada por tokens. A geração de imagens GLM transmite parâmetros estendidos comowatermark_enabledequality, permitindo que controles de marca d’água e qualidade sejam aplicados quando suportados pelo provedor de modelos. Saiba mais: Geração de imagens
- Falhas no upload de arquivos Gemini não criam mais logs normais visíveis ao usuário, reduzindo ruído de endpoints que não são de inferência na página de logs, enquanto os logs internos de diagnóstico continuam preservados.
27 de junho
Novos modelos Deep Research- Adicionados o4-mini-deep-research e o3-deep-research, disponíveis somente pelo endpoint
/v1/responses. As requisições devem incluirweb_search_previewoumcptools, sendo indicadas para pesquisa web aprofundada e respostas em estilo research.
25 de junho
Protocolo Responses agora compatível com qualquer modelo- O endpoint
/v1/responsesnão está mais limitado à série GPT e agora pode chamar qualquer modelo da plataforma. Assim, ferramentas baseadas no protocolo Responses (como o Codex CLI) podem usar modelos como GLM, Gemini, DeepSeek, Kimi, Qwen etc. por meio de um catálogo de modelos local, sem ficar mais limitadas aos modelos próprios da OpenAI.
- Corrigido um problema em que
step-3.7-flashpodia retornar conteúdo em branco ou resposta vazia via/v1/responses; o conteúdo de raciocínio e as respostas finais agora retornam corretamente.
- A documentação do Codex CLI traz um novo tutorial “Usar modelos personalizados no Codex”: declare qualquer modelo da AIHubMix (GLM, Gemini, DeepSeek, Kimi, Qwen etc.) por meio de um catálogo de modelos local (
model_catalog_json) e alterne livremente a partir da lista/modeldo Codex, sem ficar mais limitado aos modelos próprios da OpenAI. A documentação inclui um script de comando único para gerar um catálogo com os 30 primeiros modelos e as armadilhas mais comuns. Saiba mais: Codex CLI · Usar modelos personalizados no Codex
24 de junho
Domínio de backup agora suportado- Adicionado o domínio de backup
https://api.inferera.com, com endpoints e capacidades idênticos ao domínio principalhttps://aihubmix.com. Quando o domínio principal estiver inacessível (por exemplo, falhas de conexão ou tempos limite), substitua a URL da requisição pelo domínio de backup; a API Key, o modelo, o corpo da requisição e os demais parâmetros permanecem inalterados.
23 de junho
Novos modelos- Doubao doubao-seed-2-1-pro, doubao-seed-2-1-turbo.
- Série de vídeo HappyHorse happyhorse-1.1-t2v (texto para vídeo), happyhorse-1.1-r2v (geração por referência), happyhorse-1.1-i2v (imagem para vídeo).
- O checkout Stripe agora preenche automaticamente o e-mail da conta e reduz a coleta desnecessária de nome e endereço de cobrança, tornando recargas com métodos como Alipay mais simples.
- Quando o saldo da conta estiver abaixo de -$1, modelos gratuitos não poderão mais ser chamados até que a conta seja recarregada.
22 de junho
Nova documentação do AIHubMix CLI- Nova documentação do AIHubMix CLI: um único binário sem dependências (não requer Python / Node / Go) para consultar o saldo da conta, gerenciar chaves API e ver os modelos disponíveis diretamente no terminal, com saída amigável para scripts e agentes de IA (como Claude Code).
- Defina
modelcomoautoe o gateway analisa sua requisição para escolher o melhor modelo entre centenas, com políticas de custo / qualidade / latência, cobrado pelo modelo realmente usado, sem alterar o código do cliente. Saiba mais: LLM Router (roteamento inteligente de modelos)
- Corrigido um problema em que a taxa de acerto de cache de
deepseek-v4-proedeepseek-v4-flashficava abaixo do esperado.
- Capacidade de extensão local para agentes de IA que suportam Skills, como Codex, Claude Code, Cursor e Cline: em linguagem natural, conclua a integração com a AIHubMix, consulte modelos, escolha por capacidade, gere exemplos e solucione erros. A Skill lê informações em tempo real, modelos, preços, contratos de protocolo etc., diretamente das interfaces oficiais sob demanda, evitando que o agente dependa de memória desatualizada. Saiba mais: Skills
17 de junho
Novos modelos de vídeo Kling (可灵)- Integração de todas as capacidades de geração de vídeo do Kling: texto para vídeo, imagem para vídeo, referência de múltiplas imagens e geração multimodal omni, com chamadas pelo protocolo nativo conforme o nome do modelo.
16 de junho
Problema do plugin de integração do OpenClaw corrigido- O plugin de integração do OpenClaw da AIHubMix aihubmix-auth corrigiu seus problemas de integração anteriores e agora é estável. Basta instalá-lo e inserir uma chave AIHubMix para chamar simultaneamente os modelos OpenAI / Anthropic / Gemini no OpenClaw.
- Zhipu glm-5.2.
15 de junho
Novo suporte à integração com o Open Design- A AIHubMix já é um gateway BYOK com suporte nativo no Open Design (a alternativa open source e local-first ao Claude Design). No modo API (BYOK), basta selecionar a AIHubMix e inserir uma única Key para impulsionar simultaneamente a geração de chat / imagens / vídeos / voz, com cada modelo seguindo o protocolo nativo do respectivo fornecedor conforme o nome do modelo. Saiba mais: Tutorial de integração com o Open Design
- O
glm-5.2do serviço nativo da Zhipu suporta o ajuste da profundidade de raciocínio por níveis viareasoning_effort; as versões antigas do modelo são selecionadas automaticamente por versão, sem necessidade de alterações pelo chamador.
- kimi-k2.7-code-highspeed (versão de código de alta velocidade do Kimi).
13 de junho
Novos modelos- coding-glm-5.2 e a versão gratuita coding-glm-5.2-free.
12 de junho
Mapeamento de modelos e fallback em caso de erro- Novo: Model Mapping e Fallback em caso de erro: Configure o mapeamento de nomes de modelo e o fallback em caso de erro por API Key no console, reescreva o alias de modelo do cliente para o modelo provedor de modelos real, alterne automaticamente para um modelo de backup quando o modelo principal falhar e cobre pelo modelo que responde por fim, sem alterar o código do cliente. Consulte: Model Mapping e Fallback
- kimi-k2.7-code.
11 de junho
step-3.7-flash com 90% de desconto por tempo limitado- Promoção por tempo limitado do step-3.7-flash com 90% de desconto: apenas 0,022 USD por milhão de tokens de entrada e 0,132 USD por milhão de tokens de saída. Experimente!
- Os modelos
claude-opus-4-20250514eclaude-sonnet-4-20250514serão descontinuados oficialmente em 15 de junho; nessa data, a plataforma roteará automaticamente os modelos descontinuados para as versões 4-5 da mesma série.
10 de junho
Novos modelos- claude-fable-5 [Descontinuado].
- O Fable 5 tem barreiras de segurança mais fortes, e algumas solicitações normais também podem ser bloqueadas: ele aplica classificações adicionais em áreas como cibersegurança, biologia / química, destilação de modelos e extração de raciocínio. Algumas pesquisas técnicas, análises de vulnerabilidades ou perguntas biomédicas podem ser recusadas ou encaminhadas para o Opus 4.8.
- O Mythos 5 tem acesso restrito e não é um modelo aberto ao público geral: Mythos 5 e Fable 5 compartilham a mesma base de capacidades, mas o Mythos 5 usa menos classificadores de segurança. No momento, está disponível apenas para Project Glasswing / clientes aprovados; a maioria dos usuários usará o Fable 5 com guardrails.
- Custo de API mais alto: o Fable 5 custa 10 USD por milhão de tokens de entrada e 50 USD por milhão de tokens de saída, cerca de duas vezes o custo do Opus 4.8.
- Privacidade: Fable 5 / Mythos 5 são classificados como Covered Models, exigem por padrão pelo menos 30 dias de retenção de dados e não oferecem suporte a Zero Data Retention.
- Comportamento de recusa na API: quando o Fable 5 recusa uma solicitação, a API retorna HTTP 200, mas
stop_reasonérefusal.
08 de junho
A interface compatível com Gemini suporta entrada de áudio- Ao chamar o Gemini pela interface compatível com OpenAI (
/v1/chat/completions), a entrada de áudioinput_audioagora é suportada (anteriormente era descartada silenciosamente), e a contagem de audio_tokens foi adicionada ao usage retornado.
05 de junho
Novos modelos- grok-build-0.1, hy3-preview e o modelo gratuito step-3.7-flash-free.
04 de junho
Novos modelos- Tongyi Qianwen qwen3.7-plus.
01 de junho
Novos modelos- MiniMax minimax-m3.
- Baidu musesteamer-air-image (geração de imagens).
Mar 29
Log Details Page- Latency: Indicates how quickly a request starts (time from request initiation to the first token returned)
- Throughput: Provides a clear measure of the model’s output speed
- E2E Latency: The total time from request submission to completion, used to evaluate overall request performance
- Provider: Identifies the model vendor that handled the request
- Status: Shows the execution result (p. ex., success / failure) for quick detection of anomalies
- TID: A unique request identifier that can be shared with support for faster troubleshooting
Mar 23
- AIHubMix Global Acceleration Network is now live: Built on self-managed global edge nodes and an intelligent routing system, with continuous monitoring and dynamic optimization, achieving 75% lower latency, 60% improved stability, and 99.99% availability, delivering a faster, more reliable AI experience.
- Added 24/7 real-time health monitoring: Distributed probes scan the entire network every minute, tracking latency, success rate, and stability. Issues are detected and resolved before users even notice, ensuring consistent performance.
- Enhanced intelligent traffic routing: Node health is dynamically evaluated across multiple time windows, enabling millisecond-level switching to the optimal path, significantly reducing fluctuations and timeouts while improving overall request success rates.
Feb 08
- New Feature: Chat → Responses Compatibility
This release introduces Chat → Responses compatibility, allowing the Chat Completions API to invoke OpenAI models that support the Responses protocol only, including gpt-5.2-codex, gpt-5.1-codex-max, and gpt-5.2-pro. If you want to force the AIHubmix Chat API to route requests through the Responses protocol, add o seguinte header à sua request:X-Use-Responses-Enabled: trueWhen a model suporta both Chat and Responses protocols, setting this header will force the request to use the Responses API.
Observe que the Responses protocol does not currently support audio input or output, so plan usage accordingly. - Model Deprecation Notice:
OpenAI will deprecatechatgpt-4o-lateston February 17, 2026. After the deprecation, we will automatically remapchatgpt-4o-latesttogpt-4o-2024-11-20.
2025
Dec 15
- New feature: Google API now suporta Files API.
Sep 22
- Added support for Qwen series, Doubao Seedream 4, and Baidu image generation models
Aug 10
- Released the Aihubmix Image Generation MCP, making it easier for developers to integrate image generation services
Aug 1
- Use any large language model on the AiHubMix platform directly in Claude Code
Jul 29
- Added support for the AI SDK: access a massive number of models with a single chave de API
Jul 26
- Added support for the Flux image generation API, enabling high-quality images in seconds
Jul 23
- Added support for Qwen Code, leveraging all large language models available on the Aihubmix platform
Jul 4
- Added support for llms.txt: get standardized model navigation with one clique so your LLM assistant can quickly understand the entire model ecosystem
Jun 29
- Added forwarding support for Gemini CLI, with multiple flexible usage modes
- Added code interpreter and Remote MCP invocation to the OpenAI Responses API
Jun 26
- Added a Unified Image Generation API, supporting major models including OpenAI, Ideogram, Stability, and Google Imagen
Jun 23
- Launched APP-Code, offering developers a 10% discount across all models
Jun 18
- Added HTTP Código de Status documentation to help users better understand error messages
Jun 13
- Added support for Veo 3.0 video generation to expand creative formats
Jun 9
- Added support for OpenAI Reasoning Summaries no Responses API
Jun 5
- Added implicit caching for Gemini, with automatic cache hits and hit feedback
Developers can useusage_metadatato determine cache hits
Cost savings are not guaranteed and depend on request structure and usage scenarios
May 31
Full Support for New Claude 4 Features- ⏳ New cache TTL: 1-hour cache support Beta
- 🎉 New text editing tools: Claude 4 now suporta
text_editor_20250429andstr_replace_based_edit_tool - 🚫 New refusal stop reason for safety-based rejections
- 🧠 Extended Thinking: Claude 4 now returns full summaries of its reasoning process
- 🔄 Interleaved Thinking: Tool usage can now interleave with extended thinking for more natural conversations (Beta)
- ⚠️ Deprecated Features:
undo_editis no longer supportedtoken-efficient-tools-2025-02-19removed (Claude 3.7 only)output-128k-2025-02-19removed (Claude 3.7 only)
- 📚 Full migration guides and code examples have been updated to help users smoothly transition from Claude 3.7 to Claude 4
May 22
- Added support for the Dify plugin, enabling seamless integration of Aihubmix models into Dify
Extend and manage over 200 models with a single chave de API
May 17
- Added support for
codex-mini-latest, optimized for programming tasks, accessible via the Responses API or Codex CLI - Added support for Google Imagen 3.0 image generation and Veo 2.0 video generation
gemini-2.0-flash-expupgraded to the official preview versiongemini-2.0-flash-preview-image-generation
May 9
- Added the Ideogram AI V3 API, Ideogram’s most advanced image generation model
May 6
- Added Utility Management Scripts for managing chave de APIs, viewing accounts, and listing available models via CLI
Apr 26
- The highly anticipated OpenAI image generation API
gpt-image-1is now live, supporting both text-to-image and image-to-image - Added native Gemini API support with precise reasoning budget control for Flash 2.5
Apr 24
- Integrated three core Jina AI APIs to help build powerful agents: Embeddings, Rerank, and DeepSearch
Apr 20
- Added support for the OpenAI Responses API endpoint with expanded tool capabilities
Apr 17
- Added OpenAI CodeX CLI support: program with natural language directly no terminal
Apr 12
- By appending
:surfingto a model ID, any model can gain search capabilities (Beta)
Apr 9
- Added Claude prompt caching, saving up to 76% in cost for repeated high-frequency prompts
Apr 7
- Added Ideogram AI image generation support with strong text rendering, hybrid generation, local edits, and upscaling
Apr 5
- Brand-new documentation experience launched
Mar 30
- Added support for the Claude Text Edit Tool
Mar 24
- Launched the brand-new Trident logo
Mar 16
- Added native search support for OpenAI and Google Gemini models
- Third-party search integration will be added in future updates
Mar 15
- Added models:
gpt-4o-mini-search-previewandgpt-4o-search-preview
Mar 7
- Prices for o1 and o3-mini reduced by 10%, in line with official pricing
Mar 6
- Due to a 7× price increase from Microsoft, the price of
aihubmix-DeepSeek-R1also increased 7×
Recommended alternative: Volcano Engine’s DeepSeek-R1 (more stable and cost-effective)
Added models:qwen-qwq-32bandqwen2.5-vl-72b-instruct
Feb 28
- All Claude models received a 15% price reduction
- Added model
gpt-4.5-preview(extremely expensive, use with caution)
Feb 26
- Improved DeepSeek stability
- ByteDance versions of DeepSeek are currently the most stable
Recommended models:DeepSeek-R1andDeepSeek-V3
Feb 25
- Added model
claude-3-7-sonnet-20250219
Feb 24
- The gpt-4o model may occasionally respond very slowly due to model provider issues
Recomenda-se to temporarily switch togpt-4o-2024-11-20 - The Perplexity API is temporarily offline
Due to Perplexity’s complex billing model and higher costs than this platform’s pricing structure, the service will be relaunched after pricing adjustments - The temporary ByteDance official discount has ended and prices have returned to normal
The price ofDeepSeek-R1has been increased accordingly - Added a new model details page with full parameter information
Feb 23
- The temporary ByteDance official discount has ended and prices have returned to normal
The price ofDeepSeek-V3has been increased
ByteDance’s R1 model is also expected to return to normal pricing soon, and this platform will同步 adjust prices accordingly
Feb 18
- Added model:
kimi-latest
(Official billing is tiered by input length at 8k, 32k, and 128k.
This platform não suporta tiered pricing and uses the mid-tier 32k as the pricing standard.
If you are price-sensitive, use with caution.) - Optimized overall website layout
- Merged the Changelog page into the Usage Statistics page
- Moved Announcements to the Model Marketplace page
- Moved Settings under the user avatar menu
- Reduced the price of
aihubmix-DeepSeek-R1by 50% - Added models:
gemini-2.0-pro-exp-02-05-search,gemini-2.0-flash-exp-search
(Integrated with Google’s official online search) - Added models:
gemini-2.0-flash,gemini-2.0-pro-exp-02-05,gemini-2.0-flash-lite-preview-02-05 - Added models:
o3-mini,o1
(These two models are billed about 10% higher than official pricing due to limited account resources)
Feb 4
- The
o1model não suporta thestreamparameter no official OpenAI API - The
o3-minimodel não suporta thetemperatureparameter
A new parameterreasoning_effortis available with values:"low","medium","high"
Default is"medium"if not specified
Feb 1
Feature Update:- Added support for OpenAI audio model input and output
Theapi.aihubmix.compreview server is now available
After one week of stable operation, the main site will be updated
Backend billing is fully consistent with official pricing
Atualmente, usage logs only display text token usage
Audio token usage is not yet shown in logs but does not affect normal usage
o3-mini,o1
(Billed about 10% higher than official pricing due to limited account availability)aihubmix-DeepSeek-R1(recommended, highly stable)qwen-max-0125(Qwen2.5-Max),sonar-reasoningdeepseek-ai/DeepSeek-R1-Zero,deepseek-ai/DeepSeek-R1,deepseek-r1-distill-llama-70baihub-Phi-4Doubao-1.5-pro-256k,Doubao-1.5-pro-32k,Doubao-1.5-lite-32k,Doubao-1.5-vision-pro-32ksonar,sonar-pro(latest from Perplexity AI)gemini-2.0-flash-thinking-exp-01-21deepseek-reasoner(aka DeepSeek-R1)MiniMax-Text-01codestral-latest(Mistral’s new code model, Codestral 25.01)
Jan 23
New Models Added:aihub-Phi-4Doubao-1.5-pro-256k,Doubao-1.5-pro-32k,Doubao-1.5-lite-32k,Doubao-1.5-vision-pro-32ksonar,sonar-pro(latest from Perplexity AI)gemini-2.0-flash-thinking-exp-01-21deepseek-reasoner(aka DeepSeek-R1)
Jan 19
- Added Perplexity AI API models
Currently supported only on the preview serverapi.aihubmix.com
After stable testing, it will be rolled out to the main serveraihubmix.com api.aihubmix.comis the preview server
New features will be deployed there first and promoted to the main server after ~1 week of stability testing
MiniMax-Text-01codestral-latest(Mistral Codestral 25.01)
Jan 6
- Added
gemini-2.0-flash-exp-search, supporting native Google online search
The official Gemini 2.0 Flash model requires additional parameters for online search
Aihubmix has integrated this functionality, simply appendsearchto the model name - Added model:
deepseek-ai/DeepSeek-V3
Jan 1
- Launched the new Model Marketplace page to replace the old Model & Pricing page
2024
Dec 30
- Fixed the issue where
gemini-2.0-flash-thinking-exp-1219only returned reasoning without final answers - Fixed the issue of balance reminder emails not being delivered
Dec 22
- Added Usage Statistics page
- Added Recharge History page
- Added Doubao series models:
Doubao-lite-128k,Doubao-lite-32k,Doubao-lite-4k,Doubao-pro-128k,Doubao-pro-256k,Doubao-pro-32k,Doubao-pro-4k - Added model:
gemini-2.0-flash-thinking-exp-1219 - Added models:
gemini-2.0-flash-exp,aihubmix-Mistral-Large-2411,aihubmix-Llama-3-3-70B-Instruct,grok-2-1212,grok-2-vision-1212 - Added models:
gemini-exp-1206,llama-3.3-70b-versatile,learnlm-1.5-pro-experimental
Dec 14
- Added models:
gemini-2.0-flash-exp,aihubmix-Mistral-Large-2411,aihubmix-Llama-3-3-70B-Instruct
Dec 8
- Added models:
gemini-exp-1206,llama-3.3-70b-versatile,learnlm-1.5-pro-experimental - Added Usage Statistics page
Nov 21
- Recently added models:
gpt-4o-2024-11-20,step-2-16k,grok-vision-beta - Qwen 2.5 Turbo million-context model:
qwen-turbo-2024-11-01
Nov 7
- Added compatibility com o native Claude SDK
Thev1/messagesendpoint is now live - Native Claude prompt caching and computer use features are not yet supported
These will be completed withno next two weeks
Nov 5
- Added model:
claude-3-5-haiku-20241022 - Added Elon Musk’s xAI latest model:
grok-beta
Oct 23
- Added model:
claude-3-5-sonnet-20241022
Oct 10
- OpenAI’s latest caching feature is now live
Currently supported models:- GPT-4o
- GPT-4o-mini
- o1-preview
- o1-mini
- Note:
gpt-4o-2024-05-13is not included no official supported list - Cache hit tokens will be visible in backend logs when a request hits the cache
- For full details and usage rules, refer to the OpenAI official documentation
Oct 3
- Backend billing for
gpt-4ohas been reduced to match official pricing - Added models:
aihubmix-Llama-3-2-90B-Vision,aihubmix-Llama-3-70B-Instruct - Added Cohere latest models:
aihubmix-command-r-08-2024,aihubmix-command-r-plus-08-2024
Sep 19
- Added models:
whisper-large-v3anddistil-whisper-large-v3-en - Note: Whisper model billing is based on input seconds
The current pricing display on the site is incorrect and will be fixed
Backend billing forwhisper-1fully matches OpenAI official pricing
Sep 13
- Added models:
o1-miniando1-preview
Note: These models require updated parameters
Some client shells may throw errors if defaults are not updated
o1 model does NOT support:
systemfield → 400 errortoolsfield → 400 error- Image input → 400 error
json_objectoutput → 500 errorstructuredoutput → 400 errorlogprobsoutput → 403 errorstreamoutput → 400 error
- o1 series: 20 RPM, 150,000,000 TPM. Limites muito baixos, erros 429 frequentes são possíveis
temperature,top_p, andnare fixed at 1presence_penaltyandfrequency_penaltyare fixed at 0
Sep 10
- Added model:
mattshumer/Reflection-Llama-3.1-70B
(Reported to be one of the strongest fine-tuned versions of LLaMA 3.1 70B) - Claude-3 model prices increased
To ensure stable supply, calls through this platform are currently ~10% more expensive than direct official usage - Increased concurrency capacity for OpenAI models
The system now theoretically suporta near-unlimited concurrency
Aug 11
- Added models:
Phi3medium128k,ahm-Phi-3-medium-4k,ahm-Phi-3-small-128k - Improved stability for LLaMA-related models
- Further optimized compatibility for Claude models
Aug 7
- Added OpenAI’s newly released
gpt-4o-2024-08-06
See: https://platform.openai.com/docs/guides/structured-outputs - Added Google’s latest model:
gemini-1.5-pro-exp-0801
Aug 4
- Added direct online payment for account top-ups
- Fixed Claude multi-turn conversation format error:
messages: roles must alternate between "user" and "assistant", but found multiple "user" roles in a row - Optimized index handling when using function calling with Claude models
- The backup server
https://orisound.cnwill be fully decommissioned on Sep 7
Please migrate to the main serverhttps://aihubmix.comor backup serverhttps://api.aihubmix.com
Jul 27
- Added support for Mistral Large 2
Model name:Mistral-large-2407oraihubmix-Mistral-large-2407 - System optimizations
Jul 24
- Added latest LLaMA 3.1 models:
llama-3.1-405b-instruct,llama-3.1-70b-versatile,llama-3.1-8b-instant
Jul 20
- Fixed pricing calculation issues for the
gpt-4o-minimodel- Text input pricing: 1/33 of GPT-4o officially
- Image input pricing: equal to GPT-4o
- To align with official pricing, image token counts for
gpt-4o-miniare multiplied by 33 during billing - Refer to OpenAI official pricing for details
Jul 19
- Added support for the
gpt-4o-minimodel
Backend billing is fully aligned with official pricing
Jul 15
- Added support for the official
include_usageAPI parameter
This allows returning usage data in stream mode
See the official documentation for details
Jul 14
- The new version of NextWeb now suporta calling non-OpenAI models through this platform
- Added backend billing support for Alibaba Qwen models
Calls through this platform cost ~10% more than direct Alibaba Cloud usage - Improved Azure OpenAI output compatibility com o standard OpenAI API
- Added tool calling support for Claude-3
- Added many new models (see Settings → Modelos Disponíveis)
Jul 3
- Overall backend UI optimization
- Each log entry now displays the model unit price at the time of the request
- Added the Model & Pricing page
Jun 20
- The latest
claude-3-5-sonnet-20240620is now supported
See the guide for calling non-OpenAI models on this platform
Jun 18
- Backend logs now support downloading historical request records
Jun 16
- The probability of randomly routing requests to Azure OpenAI has been significantly reduced
Jun 13
- Reduced backend costs for Claude-3 models
(Claude 3 Haiku,Claude 3 Sonnet,Claude 3 Opus)
Backend billing now matches official pricing
As a result, the effective retail API cost on this site is equivalent to ~86% of official pricing
Jun 10
- Optimized GPT-4o token billing
Tokenizer changed fromcl100k_basetoo200k_base
As a result, streaming token counts for Chinese, Korean, and Japanese are lower than before
Jun 8
- Added Alibaba’s latest open-source Qinwen 2 models:
alibaba/Qwen2-7B-Instructalibaba/Qwen2-57B-A14B-Instructalibaba/Qwen2-72B-Instruct
May 20
- Added model:
gemini-1.5-flash - Added model:
gpt-4o - Added models:
llama3-70b-8192,llama3-8b-8192,gemini-1.5-pro,command-r,command-r-plus - Claude-3 model supply has been restored
Endpoints are currently deployed across AWS and Google Cloud - To cover infrastructure and operational costs, Claude-3 backend billing is ~10% higher than official pricing
With increased usage, this will be gradually reduced to ~5% or lower - Concurrency limits are currently under testing and will be increased as demand grows
Última atualização: 2026-06-22