Skip to main content

2026

2026

28 de agosto

Novos modelos
  • Adicionado hy4-preview: Hy4 Preview da Tencent Hunyuan, um modelo MoE com 770B de parâmetros totais e 49B de parâmetros ativos, otimizado para fluxos de trabalho de Agent, programação e produtividade. Reforça a compreensão de tarefas, o planejamento, o uso de ferramentas e a execução sustentada em tarefas complexas de múltiplas etapas, engenharia de software, processamento de documentos, análise de informações, automação de escritório, geração web e colaboração entre ferramentas. Suporta janela de contexto de 1 milhão de tokens, até 64K de saída, raciocínio, busca na web, chamada de ferramentas/funções e saídas estruturadas.

2026

27 de agosto

Novos modelos
  • Adicionado qwen3.8-flash: o modelo de visão e linguagem nativo principal da Alibaba Cloud Qwen, voltado a programação, tarefas de escritório, raciocínio com contexto longo e fluxos de trabalho de agentes. Oferece suporte a uma janela de contexto de 1 milhão de tokens, até 128K de saída, thinking, acesso à web, chamadas de ferramentas e saídas estruturadas. Em comparação com o Qwen3.7-Plus, reforça as capacidades de programação e de escritório e melhora a eficiência de treinamento e inferência.
Chamadas da ferramenta de imagem MCP mais claras
  • A ferramenta MCP de geração de imagens agora exige que o chamador informe explicitamente o modelo, evitando o uso silencioso de um modelo padrão quando nenhum modelo é enviado.
  • openai/gpt-image-1 é o ID de modelo padrão exibido e encaminhado externamente. O erro histórico de grafia continua aceito apenas como alias de entrada compatível e é normalizado antes do envio da requisição.

2026

26 de agosto

Novos modelos
  • Adicionado glm-5.3-flash: o modelo multimodal de alta eficiência da Z.AI voltado a Coding Agents, raciocínio complexo e tarefas de engenharia de software de longa duração. Oferece suporte a entradas de texto, imagem e vídeo, aproximadamente 1 milhão de tokens de contexto, até 128K de saída, thinking, chamadas de ferramentas e saídas estruturadas. Construído sobre a pilha tecnológica GLM com pós-treinamento e otimização adicionais, prioriza a eficiência de inferência e a capacidade de resposta.
Novo recurso
  • Adicionado o Broadcast, que envia automaticamente traces de solicitações da API AIHubMix ao LangWatch sem instrumentação adicional na aplicação. Oferece modo de privacidade, amostragem e filtros de chaves de API; modelo, uso de tokens, custo real cobrado, latência, sessão e dados de Trace ficam disponíveis no LangWatch.
Entradas MCP e Access Key mais completas
  • A entrada antiga /mcp/ pode continuar usando a autenticação existente e agora é roteada para as capacidades MCP HTTP remotas unificadas. Clientes antigos não precisam migrar imediatamente e ainda podem consultar modelos e preços, pesquisar documentação, verificar créditos e usar ferramentas de chat, imagem e vídeo.
  • O console terá um caminho somente leitura para copiar a Access Key, e clientes MCP externos podem usar o cabeçalho X-Aihubmix-Access-Key. O servidor não rotaciona a chave nem armazena essa resposta em cache.
Pedidos de imagem com fundo transparente mais estáveis
  • Requisições gpt-image-2 com fundo transparente agora priorizam canais nativos da OpenAI que oferecem suporte a essa capacidade, reduzindo falhas repetidas em canais incompatíveis. Os demais caminhos de requisição de imagem não mudam.
Arquivos para Agents atualizam mais rápido
  • Listas de modelos e guias para AI Agents e ferramentas externas agora atualizam mais rápido.

2026

25 de agosto

Erros de migração mais claros para APIs de mídia antigas
  • Para modelos de mídia que não oferecem mais suporte ao protocolo antigo, /v1/images/generations, /v1/images/edits, /v1/models/:organization/:model/predictions e /v1/videos agora retornam protocol_not_supported, com orientação para as APIs assíncronas de mídia em /ai/v1 e a documentação relacionada.
  • model=auto mantém o comportamento atual de seleção automática de modelo. Se o modelo final selecionado não suportar o endpoint antigo, o chamador recebe um erro claro em vez de ser alternado silenciosamente para outro modelo. O Playground também oculta as entradas antigas desses modelos para reduzir uso acidental.

2026

24 de agosto

Novos modelos
  • Adicionado wan3.0-video: o modelo de vídeo All-in-One em versão preview da Alibaba Cloud Wan (Tongyi Wanxiang) unifica os fluxos de trabalho de texto-para-vídeo, imagem-para-vídeo com primeiro/último frame e vídeo de referência, suportando até 30 segundos a 30 fps em 480P/720P/1080P para geração e edição integradas.
  • Adicionado wan3.0-video-prime: uma edição de alta velocidade alinhada em capacidades para fluxos de trabalho integrados de geração e edição de vídeo, com processamento ponta a ponta mais rápido.
Redução de preço do GPT-5.6 Sol
  • gpt-5.6-sol sincronizou a redução oficial de 20% e agora custa US4pormilha~odetokensdeentradaeUS 4 por milhão de tokens de entrada e US 20 por milhão de tokens de saída. Os caminhos de chamada existentes não mudam, enquanto cargas de raciocínio complexo, programação e contexto longo ficam mais baratas.
Ativação de tarefas de mídia assíncronas mais clara
  • Quando uma conta ainda não ativou tarefas assíncronas, as APIs de criação de mídia agora incluem a página correspondente do console no erro async_not_enabled. Usuários de aihubmix, inferera e shkq são direcionados ao próprio console, reduzindo respostas 403 sem próximo passo claro.

2026

21 de agosto

Novos modelos
  • Adicionado deepseek-v4-flash-0731-fast: uma variante de alta velocidade do modelo agêntico da DeepSeek, voltada para programação, uso de ferramentas e cargas de trabalho de Agent de alto volume. Preserva as capacidades do V4 Flash 0731 entregando inferência mais rápida; em comparação com o V4 Pro, prioriza menor latência e eficiência de execução. Suporta janela de contexto de 1 M de tokens, até 384K de saída, thinking, chamada de ferramentas e saídas estruturadas.
  • Adicionado deepseek-v4-flash-vision-exp: modelo experimental multimodal de compreensão visual da DeepSeek, com entrada de texto e imagem e saída de texto. É indicado para descrição de imagens, OCR de capturas de tela, análise de gráficos e agentes com base visual; suas capacidades puramente textuais de agente, raciocínio e conhecimento geral ficam alinhadas à versão oficial DeepSeek V4 Flash.
  • Adicionado ox-alpha, um modelo de raciocínio stealth de um provedor terceiro anônimo cujo verdadeiro desenvolvedor e proprietário não foram divulgados. Gratuito na AIHubMix, suporta entrada de texto e imagem, saída de texto e uma janela de contexto de 1.048.576 tokens para programação, engenharia de software de longa duração, trabalho agêntico contínuo, raciocínio complexo e fluxos de trabalho que combinam texto e imagem.
A recuperação de falhas na geração de imagens está mais estável
  • Quando uma requisição de geração de imagem encontra um erro temporário de serviço, a AIHubMix se recupera com mais consistência. Se o erro indicar claramente uma limitação de capacidade do modelo escolhido, a requisição ainda para as tentativas e retorna um motivo claro. Isso deve reduzir falhas diretas causadas por diferenças temporárias de serviço em modelos como gpt-image-2.

2026

20 de agosto

Anúncio da plataforma
  • Lançadas capacidades de integração para AI Agents: instruções de integração em agents.md, documentação legível por máquina llms.txt do site e por modelo, Playground Skill (distribuída em endereço fixo) e deep links do Playground (?models= abre até 6 abas de modelos com um único link e ?config= carrega uma configuração diretamente). Para ver as especificações e os preços de dois modelos lado a lado, use a página de comparação https://aihubmix.com/compare/{model_a}/{model_b}. A lista de pontos de entrada está em Integração para Agents.
Parâmetros e erros da API de imagem estão mais consistentes
  • Requisições de geração de imagem tratam parâmetros de tamanho como resolution e imageSize com mais consistência. Quando uma requisição fica fora da capacidade do modelo escolhido, a API retorna erros mais claros para corrigir parâmetros mais rápido.
O hub de modelos suporta modelos principais com versões
  • Variantes relacionadas, como GLM 5.2, edição Coding e edição Free, podem aparecer como um modelo principal com várias versões. Isso facilita navegar, comparar preços e escolher a versão adequada.
Tarefas assíncronas de imagem podem avançar mais rápido
  • Tarefas assíncronas de imagem agora podem progredir com concorrência limitada pela capacidade disponível. Em períodos de pico, as filas devem fluir melhor e a entrega de status/resultados fica mais estável.

2026

19 de agosto

Novos modelos
  • Adicionado gpt-5.6-sol-disc: a rota de desconto por tempo limitado da AIHubMix para o GPT 5.6 Sol da OpenAI, oferecendo até 50% de desconto com as mesmas capacidades subjacentes do gpt-5.6-sol padrão. Este modelo de raciocínio de fronteira é adequado para programação complexa, trabalho profissional de conhecimento, pesquisa aprofundada e agentes de longa execução, com entrada de texto e imagem, cerca de 1,05 M tokens de contexto, até 128K de saída, thinking, ferramentas e saídas estruturadas.
Tarefas de geração de mídia mais confiáveis
  • Horário de conclusão, expiração de resultados e arquivamento de artefatos estão mais consistentes para tarefas de imagem e vídeo. Em rolling releases ou alta concorrência, status da tarefa, resultados baixáveis e registros visíveis ao usuário têm menos chance de atraso ou processamento duplicado.
  • A capacidade de produção de mídia foi ampliada, e respostas de mídia maiores têm mais margem, melhorando a disponibilidade de tarefas longas ou com artefatos grandes.

2026

18 de agosto

Os detalhes do modelo estão mais completos
  • Os detalhes do modelo agora exibem release_date, facilitando distinguir a data oficial de lançamento do horário em que a AIHubMix disponibilizou o modelo.
A compatibilidade de imagens e uploads do Gemini está mais estável
  • Os fluxos de geração/edição de imagens do Gemini e o caminho multi-imagem do Vertex preservam imageSize e parâmetros relacionados com mais consistência, reduzindo divergências de tamanho ou protocolo.
  • Os uploads de arquivos do Gemini mantêm o Content-Type original, então vídeos e outras mídias têm menos chance de ser classificados incorretamente.
As mensagens de erro públicas ficaram mais claras
  • Erros de schema, enumeração e capacidade voltados ao usuário agora exibem mensagens mais legíveis, facilitando diagnosticar problemas de parâmetros.

2026

17 de agosto

Novos modelos
  • Adicionado glm-5.3, a API de produção da Z.AI para o seu modelo de raciocínio principal apenas de texto, voltado para engenharia de software complexa, tarefas de Agent de longo horizonte e análise de vulnerabilidades. Suporta janela de contexto de 1 M de tokens, até 128K de saída e concorrência ilimitada no AIHubMix, com desconto por tempo limitado de 10%.

2026

15 de agosto

Novo modelo
  • Adicionado mai-thinking-1: modelo de raciocínio da série Microsoft MAI para raciocínio empresarial, matemática, inteligência geral e cargas de alto throughput. Suporta janela de contexto de 256K tokens, Chat Completions e saídas estruturadas, sendo adequado para raciocínio de contexto longo, formatos de resposta estáveis e uso contínuo com controle de custos.

2026

14 de agosto

Novos modelos
  • Adicionado gemini-3.7-flash: o modelo de raciocínio nativamente multimodal do Google, voltado para programação, agentes, desenvolvimento web e trabalho de conhecimento. Suporta entrada de texto, imagem, áudio e vídeo, janela de contexto de 1 milhão de tokens, níveis de thinking ajustáveis, chamada de ferramentas, busca na web e saídas estruturadas, com programação, uso de ferramentas, planejamento em várias etapas e seguimento de instruções mais fortes do que o Gemini 3.6 Flash.
  • Adicionado coding-glm-5.3: o modelo de raciocínio da Z.AI para programação e fluxos de trabalho agênticos, projetado para engenharia de software complexa, agentes de longa execução e análise de vulnerabilidades. Utiliza o mesmo modelo base do GLM-5.2 e, com pós-treinamento em maior escala, melhora a programação, a execução de tarefas e a eficiência de tokens. Esta rota é uma prévia por tempo limitado, destinada apenas a testes e avaliação; a estabilidade do serviço não é garantida e o uso em produção não é recomendado.
Compatibilidade de API e confiabilidade de tarefas
  • Solicitações nativas de Gemini embedding agora preservam a origem de serviço do fileUri retornado pela Gemini Files API. Ao usar embedContent ou batchEmbedContents com arquivos enviados, erros 403 por inconsistência de origem são reduzidos; lotes que misturam arquivos de várias origens retornam um 400 claro.
  • Quando o OpenRouter retorna um erro estruturado de provedor de modelos, o erro da API prioriza os campos internos message, param e type, reduzindo mensagens longas e difíceis de interpretar. Erros de um único provedor de modelos também têm menor chance de afetar todo o serviço OpenRouter.
  • O polling, o arquivamento terminal e o processamento de artefatos de tarefas assíncronas de mídia estão mais confiáveis. Tarefas longas de imagem e vídeo têm menor probabilidade de processamento duplicado, perda de estado terminal ou entrega atrasada durante alta concorrência, reinícios ou artefatos grandes; campos públicos, status e fórmulas de cobrança da API permanecem inalterados.

2026

13 de agosto

Novos modelos
  • Adicionado grok-4.6: o modelo multimodal de raciocínio principal da xAI, voltado para programação, agentes de longa duração, trabalho de conhecimento e desenvolvimento de aplicações interativas. Suporta compreensão de imagens, janela de contexto de 500K, chamada de ferramentas e saídas estruturadas, com execução em várias etapas, autoverificação, programação e geração de projetos visuais mais fortes do que o Grok 4.5.
  • Adicionado deepseek-v4-pro-0813: o modelo de raciocínio e agente de propósito geral e alto desempenho da DeepSeek, voltado para raciocínio complexo, programação, análise de documentos longos e fluxos de trabalho agênticos. Suporta modos thinking e non-thinking, janela de contexto de 1 milhão de tokens, até 384K de saída, chamada de ferramentas e a API Responses.

2026

12 de agosto

Novos modelos Duração de vídeo Veo mais precisa
  • Tarefas Gemini Veo preservam a duração real do vídeo com mais confiabilidade na criação, no polling e na leitura do resultado. Usuários que geram vídeos com segundos personalizados devem ver a duração da tarefa, do arquivo baixado e dos registros posteriores de cobrança ou exibição mais alinhadas.
Melhor compatibilidade de tool calls no Azure Responses
  • Ao usar ferramentas namespace pelo Azure Responses, descriptions vazias ou ausentes não fazem mais o Azure rejeitar a solicitação com 400 antes da execução do modelo. Tool calls que já funcionavam pela interface oficial da OpenAI devem se comportar de forma mais consistente no Azure.
Dados mais completos em páginas de modelos e fornecedores
  • /call/devs agora oferece suporte a um campo de site do fornecedor, permitindo que páginas de agregação de modelos e fornecedores mostrem uma entrada Official site quando os dados forem preenchidos. As páginas /providers/<slug> também preservam o comportamento de cache de borda para respostas mais estáveis.

2026

11 de agosto

Gemini interactions agora oferece suporte a tarefas assíncronas
  • Requisições Gemini interactions agora podem usar explicitamente background: true para tarefas assíncronas e depois usar o ID da tarefa retornado para consultar status, cancelar ou limpar a tarefa. Interações multimodais/omni de longa duração ficam mais fáceis de integrar sem manter uma conexão síncrona aberta até a conclusão.
  • Tarefas assíncronas são liquidadas com base no uso real, com colunas de tokens, liberação integral no cancelamento e proteções para respostas grandes. Registros de uso, pré-dedução de saldo e cobranças finais no console ficam mais consistentes.
Melhor compatibilidade de thinking no Claude Messages
  • Quando o protocolo Messages chama provedores de modelo compatíveis com OpenAI, o conteúdo thinking/reasoning retornado é preservado e pode ser reenviado em rodadas posteriores. Apps que usam SDKs Claude, ferramentas em múltiplas rodadas ou o modo thinking do DeepSeek devem ver menos respostas vazias, erros 400 ou perda de contexto de raciocínio.
  • Blocos thinking sem assinatura são tratados de forma mais compatível quando o tráfego muda para o serviço Claude nativo, reduzindo erros de formato em fallback multimodelo ou fluxos de ponte.
Melhor compatibilidade entre prompt e referências no Doubao vídeo
  • Ao chamar modelos de vídeo Doubao, prompt e recursos de referência em extra_body.content agora podem funcionar juntos; requisições que contêm apenas recursos mantêm o prompt e a ordem dos recursos.
  • Respostas de criação agora refletem tamanho e prompt mais próximos do que é realmente enviado, enquanto campos nativos sem suporte continuam sendo ignorados. Isso reduz falhas de geração de vídeo causadas por parâmetros extras de SDK.

2026

10 de agosto

Uso acumulado mais completo para geração de mídia
  • Depois que uma tarefa de geração de mídia é liquidada, o uso acumulado no nível da conta também é atualizado. No console, uso acumulado, dedução de saldo e registros de consumo refletem de forma mais completa o consumo real de geração de mídia.
Melhor compatibilidade com nomes de modelo do Azure
  • Ao chamar modelos do Azure cujo nome de deployment/model contém pontos, o nome do modelo é preservado nos caminhos de conversão de Chat, Responses e Messages, sem reescrita automática. O comportamento das chamadas Azure existentes permanece inalterado.

2026

8 de agosto

Novo modelo de geração de vídeo
  • Adicionado doubao-seedance-2-5-260628: modelo unificado de geração multimodal de áudio e vídeo de nova geração do ByteDance Seed. Gera até 30 segundos de áudio e vídeo sincronizados em uma única execução, oferece suporte a extensões em múltiplas rodadas e aprimora narrativa, transições, suporte a referências, realismo e edição precisa, adequado para produção cinematográfica, publicidade, educação, simulação e criação de conteúdo longo.

2026

6 de agosto

Novos modelos
  • Adicionado wan3.0-video: modelo integrado de geração e edição de vídeo do Tongyi Lab da Alibaba, atualmente em beta pública. Oferece suporte a vídeos nativos de até 30 segundos, consistência de personagens em nível de produção, imagem e som realistas e fluxos de trabalho unificados de referência, edição, replicação e controle de movimento para publicidade, e-commerce, produção cinematográfica, animação de personagens, edição de vídeo e conversão de documentos em vídeo.
  • Adicionado qwen-image-3.0: modelo de geração e edição de imagens da equipe Qwen da Alibaba Cloud, com suporte a texto para imagem, criação com imagens de referência e edição de imagens. Equilibra qualidade e velocidade para redes sociais, e-commerce, design criativo, produção diária de conteúdo e criação em larga escala e alta frequência.
  • Adicionado qwen-image-3.0-pro: modelo carro-chefe de geração e edição de imagens da Qwen (Alibaba Cloud), voltado para publicidade, identidade de marca, UI, apresentações, imagens de produto e design profissional. Destaca-se em composições complexas, renderização precisa de texto em chinês e inglês, materiais realistas, edição baseada em imagens de referência, detalhamento, composição e qualidade visual de nível comercial.

2026

4 de agosto

Gemini embedding suporta entrada multimodal e cobrança por modalidade
  • gemini-embedding-2-preview agora processa texto, imagem, áudio, vídeo e documentos tanto pelo endpoint de embeddings compatível com OpenAI quanto pelo caminho nativo Gemini. Usuários que criam busca multimodal, entendimento de conteúdo ou bases de conhecimento podem usar mais tipos de entrada no mesmo modelo.
  • A cobrança de Gemini embedding prioriza o uso de tokens por modalidade retornado pelo provedor de modelos. Imagens, áudio, vídeo e documentos deixam de ser tratados como uma única estimativa de texto, deixando a fatura multimodal mais próxima do uso real.
  • Requisições embedding com entrada única podem chamar diretamente o caminho Gemini embedding mais novo. Requisições batch com vários inputs agora retornam uma resposta clara de capacidade incompatível.
Chamadas de geração de vídeo Seedance 2.0 mais confiáveis
  • As referências do Seedance 2.0 para imagem, áudio e vídeo são mapeadas com mais precisão por tipo de mídia, com restrições mais claras para adaptive, 4K e opções de tamanho. Workflows de geração de vídeo têm menos falhas causadas por mapeamento incorreto de parâmetros.
  • Requisições de duração adaptativa são pré-deduzidas com base em 15 segundos e ajustadas pela duração real ao fim da tarefa, mantendo pré-dedução de saldo e cobrança final mais consistentes.
  • Quando a geração de mídia falha, as APIs retornam detalhes de erro sanitizados, facilitando o diagnóstico de parâmetros, URLs assinadas ou limites do provedor de modelos sem expor credenciais sensíveis.

3 de agosto

Novos modelos
  • Adicionado qwen3.8-max: modelo carro-chefe nativo de visão e linguagem da Alibaba Cloud, baseado em uma arquitetura Mixture-of-Experts (MoE) de 2,4 trilhões de parâmetros e com suporte a janelas de contexto de até 1 milhão de tokens. É adequado para compreensão multimodal complexa, raciocínio avançado, desenvolvimento de software, fluxos agênticos e processamento de contexto longo. Com preço próximo ao do Qwen3.7-Max, o Qwen3.8-Max traz melhorias significativas em raciocínio, programação e capacidades agênticas, com desempenho geral comparável aos principais modelos atuais.
Disponibilidade de fornecedores mais clara nos detalhes do modelo
  • Os detalhes do modelo agora mostram primeiro os fornecedores mais adequados para as requisicoes atuais, enquanto fornecedores apenas de reserva ou temporariamente indisponiveis aparecem mais abaixo. Ao escolher um fornecedor ou verificar a disponibilidade de um modelo, usuarios e equipes de suporte conseguem identificar mais rapidamente quais opcoes convem usar e evitam decisoes baseadas em uma ordem desatualizada.

2 de agosto

Cobranca e logs mais precisos para requisicoes pequenas
  • Requisicoes pequenas em modelos by-bill nao desaparecem mais da cobranca nem dos logs de uso quando o valor calculado era arredondado para zero. As requisicoes afetadas agora entram com a quota minima efetiva, mantendo faturas, pre-deducao de saldo e registros de uso alinhados; equipes de suporte e operacoes passam a ver registros mais completos para trafego frequente do tipo embedding.

31 de julho

Novos modelos
  • Adicionado deepseek-v4-flash: modelo Mixture-of-Experts otimizado para eficiência, com 284B de parâmetros totais, 13B de parâmetros ativos e janela de contexto de 1M tokens. É projetado para inferência rápida e cargas de trabalho de alto throughput, mantendo forte desempenho em raciocínio e programação, o que o torna adequado para assistentes de código, sistemas de chat e fluxos agênticos.
Novo modelo de geracao de video
  • Adicionado minimax-h3: modelo de video multimodal de uso geral da MiniMax. Ele aceita entradas de texto, imagem, audio e video, e suporta texto para video, imagem para video, geracao com primeiro/ultimo quadro, geracao baseada em referencias e edicao de video. Usuarios que criam fluxos de video, criativos de anuncios, demonstracoes de produto ou conteudo multimodal podem chama-lo pela API unificada da AIHubMix.
Oferta por tempo limitado do GLM-5.2 por faixa horaria
  • glm-5.2 tem desconto conforme a faixa horaria diaria, em UTC: 50% de desconto das 14:00 as 24:00 e 30% de desconto das 00:00 as 14:00 todos os dias. Oferta por tempo limitado.
Reducao de preco do GPT-5.6 Luna/Terra
  • gpt-5.6-luna sincronizou a reducao oficial de 80% e agora custa 0.20naentradae0.20 na entrada e 1.20 na saida; gpt-5.6-terra sincronizou a reducao oficial de 20% e agora custa 2.00naentradae2.00 na entrada e 12.00 na saida. Usuarios com trafego constante nesses modelos podem reavaliar a escolha de modelo para cargas sensiveis a custo e usos gerais.

30 de julho

Servidor MCP oficial da AIHubMix disponivel
  • Foi adicionado o endpoint MCP hospedado oficial mcp.aihubmix.com/mcp ou mcp.inferera.com/mcp para clientes compativeis com MCP. Desenvolvedores podem usar uma unica entrada em ferramentas como Claude Code, Codex e Cursor para consultar modelos e precos, pesquisar documentacao, verificar creditos e chamar ferramentas de chat, geracao de imagens e geracao de video.
  • As credenciais MCP sao enviadas pelo cliente em cada requisicao e nao sao armazenadas pelo servidor, adequado para desenvolvedores que querem acesso direto a modelos e recursos de midia da AIHubMix dentro de IDEs ou ferramentas de agentes.

29 de julho

Novo modelo
  • Adicionado jina-reranker-v3.5: reranker de documentos listwise multilingue de 0,6B parametros da Jina AI e upgrade com o mesmo esquema do jina-reranker-v3. Ele atende fluxos de RAG, busca e ranking de dados estruturados, suporta ranking de candidatos em contexto longo e melhora robustez por dominio, recuperacao multilingue, ranking estruturado e eficiencia de inferencia.

28 de julho

Cobranca de cache mais precisa
  • Para requisicoes com cache explicito ou implicito, a AIHubMix agora identifica de forma mais consistente o uso de leitura/escrita de cache e prioriza o tipo de cache retornado pelo provedor de modelos. Usuarios de modelos com cache, como Qwen e Claude, devem ver detalhes de cobranca mais alinhados ao uso real.
Geracao de midia e resultados de tarefas mais confiaveis
  • A primeira lista de modelos de geracao de midia foi reduzida a modelos verificados, e foi corrigido um caso que podia retornar 404 em algumas chamadas de modelos de imagem pelo endpoint de midia. Downloads de tarefas LLM no console agora tambem cobrem arquivos de texto, facilitando recuperar grandes resultados historicos.
Site e dados de modelos mais atualizados
  • O comportamento de cache do site, dos dados de modelos, dos dados de blog e dos sitemaps foi ajustado para que publicacoes tenham efeito com mais confianca. Paginas de modelos e entradas de documentacao ficam menos sujeitas a dados antigos em cache depois de atualizacoes.

27 de julho

APIs de geracao de midia disponiveis
  • Foram adicionados /ai/v1/images/generations e /ai/v1/images/edits, com tarefas assincronas unificadas, consulta de resultados, download de artefatos e callbacks de webhook. Fluxos de imagem e video agora podem usar o mesmo ciclo de vida de tarefas, facilitando o acompanhamento de geracoes demoradas.
  • Os artefatos gerados sao retornados pelos resultados de tarefa da AIHubMix e oferecem downloads limitados e recuperacao em lote. Equipes voltadas ao cliente devem acompanhar os primeiros feedbacks sobre status das tarefas, validade dos links de download e detalhes de cobranca.

25 de julho

Novos modelos
  • Adicionado claude-opus-5: modelo carro-chefe da Anthropic para raciocínio exigente, programação e tarefas agênticas de longo horizonte. Destaca-se em tarefas de software de ponta a ponta, revisão de código e detecção de bugs, análise visual de gráficos e documentos, entregáveis de escritório complexos e coordenação de subagentes em paralelo, com janela de contexto de 1M e saída de até 128K.

24 de julho

Novos modelos
  • Adicionado mai-image-2.5-pro: modelo carro-chefe de geração e edição de imagens da Microsoft, com realismo de alta fidelidade, renderização precisa de texto na imagem e edição poderosa para design comercial, fotografia de produto e fluxos criativos profissionais.
  • Adicionado qwen-audio-3.0-tts-flash: modelo de síntese de voz em tempo real da Qwen, com suporte ampliado a idiomas de baixos recursos e dialetos chineses, controle expressivo da voz e latência do primeiro pacote abaixo de 200 ms, adequado para assistentes de voz, diálogo em tempo real e atendimento inteligente ao cliente.
  • Adicionado qwen-audio-3.0-tts-plus: modelo premium de síntese de voz da Qwen, com controle mais rico de emoção, tom, personagem, velocidade da fala, volume e estilo, projetado para criação de conteúdo, audiolivros, dublagem, vozes de marca e outros fluxos de voz de alta qualidade.
Capacidades de geracao de audio Qwen TTS
  • Ambos os modelos Qwen TTS podem ser chamados por /v1/audio/speech; requisicoes sem streaming retornam uma URL de resultado de audio, enquanto requisicoes com streaming retornam eventos SSE de geracao de audio. A tabela abaixo combina campos compativeis com AIHubMix e a documentacao oficial Qwen-Audio-TTS da Alibaba Cloud; voice deve ser escolhido por modelo, e as vozes de sistema plus/flash nao sao intercambiaveis.
Melhor compatibilidade das respostas Messages
  • Respostas de /v1/messages vindas de modelos em ponte e servicos compativeis com Claude, como Bedrock, agora ficam mais alinhadas ao ecossistema Anthropic Messages, reduzindo erros em SDKs estritos ou validadores de schema causados por campos ausentes.
Uso mais completo apos desconexoes em streams AWS Bedrock
  • Quando um cliente se desconecta de uma requisicao streaming do AWS Bedrock, o AIHubMix continua coletando o sinal final do provedor de inferencia de modelos e o usage final, reduzindo divergencias entre logs de requisicao, detalhes de cobranca e uso do provedor de inferencia de modelos nesses cenarios.

23 de julho

Novos modelos
  • Adicionado qwen3-coder-480b-a35b-instruct: modelo principal Qwen3-Coder para geração de código, agentes de engenharia de software e fluxos com chamadas de ferramentas, adequado para compreensão de código em contexto longo e tarefas de desenvolvimento automatizado.
  • Adicionado gemini-2.5-flash-lite: modelo Gemini 2.5 leve para cargas frequentes de texto, multimodais e em lote com baixa latência e menor custo.
  • Adicionado Qwen/Qwen3-235B-A22B-Instruct-2507: versão Qwen3 235B-A22B Instruct 2507 para chat geral, seguimento de instruções, trabalho multilíngue e tarefas de contexto longo.

22 de julho

Novos modelos
  • Adicionado gemini-3.6-flash: o modelo Flash mais recente do Google, adequado para fluxos de trabalho complexos, uso de computador, raciocínio com gráficos e tarefas de contexto longo.
  • Adicionado gemini-3.5-flash-lite: um modelo Gemini 3.5 mais leve e de menor custo, adequado para alto rendimento, automação diária e processamento em lote.
  • Adicionado glm-5.2-fast-preview: modelo de prévia rápida Zhipu GLM-5.2, adequado para chat de baixa latência, raciocínio rápido e aplicações de alto throughput.
Streaming do Qwen 3.8 mais confiável
  • As chamadas em streaming para qwen3.8-max-preview por /v1/responses e /v1/messages estão mais confiáveis. Streams válidos que antes podiam aparecer como empty_stream ou 502 agora podem ser concluídos normalmente.

21 de julho

Parametros de imagem Gemini em passthrough
  • Ao chamar modelos Gemini/Vertex com saida de imagem pela API Chat Completions compativel com OpenAI, clientes agora podem enviar aspectRatio e imageSize em extra_body.generationConfig.imageConfig.
Cobranca de Gemini embedding mais fiel ao uso real
  • Quando respostas de Gemini embedding trazem usageMetadata real, a AIHubMix cobra primeiro pelo uso de tokens retornado pelo provedor de modelos, mantendo a estimativa local anterior como fallback quando o dado nao vier.
Melhor compatibilidade de ferramentas dinamicas em Responses
  • Requisicoes /v1/responses agora podem carregar function tools locais da mensagem em mensagens system/developer, e essas declaracoes sao preservadas ao fazer bridge para modelos Chat. Clientes com fluxos de ferramentas dinamicas, como Kimi K3, devem ter chamadas de ferramentas mais confiaveis.
Parametro stop corrigido em Responses
  • Em chamadas /v1/responses que fazem bridge para modelos Chat, stop agora e enviado ao provedor de modelos. Um stop unico pode funcionar normalmente; quantidades ou comprimentos acima do limite provedor de modelos retornam erros de limite consistentes com Chat Completions.
Suporte a cobranca por horario no DeepSeek V4
  • Modelos DeepSeek V4 podem suportar cobranca configurada por horarios de pico e vale. A pre-deducao e a cobranca final usam o mesmo horario de envio da requisicao, entao um streaming que cruza a fronteira de horario continua cobrado pelo horario de envio. A protecao de pre-deducao fica limitada a modelos com cobranca por horario, evitando mudancas no saldo congelado de modelos comuns.

20 de julho

Compatibilidade de thinking no Claude Messages
  • Quando requisicoes /v1/messages sao encaminhadas para modelos OpenAI ou Azure Chat, a configuracao Claude thinking agora e convertida para um effort de raciocinio aceito pelo provedor de modelos, reduzindo erros 400 em chamadas com thinking. Requisicoes Claude nativas com thinking, como Opus 4.8, continuam compativeis.
Streaming longo mais estavel
  • O limite de streaming do gateway de producao aumentou de 1 hora para 2 horas. Tarefas longas de raciocinio ou geracao, como Kimi K3, tem menor chance de serem interrompidas durante o processamento.

19 de julho

Novos modelos
  • Novo: qwen3.8-max-preview:
    Oferta por tempo limitado: o Qwen3.8-Max-Preview é cobrado a apenas 10% do preço padrão, o equivalente a 10× mais uso. Por tempo limitado, por ordem de chegada.
    O Qwen3.8-Max-Preview é o modelo de fundação de última geração da família Qwen, com 2,4 trilhões (2.4T) de parâmetros e em evolução contínua. Em comparação com o carro-chefe anterior, o Qwen3.7-Max, traz avanços significativos em capacidades essenciais como Coding e Cowork (produtividade profissional), com desempenho de nível mundial em tarefas complexas e de longo horizonte, como desenvolvimento full-stack, análise de dados e fluxos de trabalho do Office.

17 de julho

Novos modelos
  • Adicionado kimi-k3: Kimi K3 e o modelo aberto de contexto longo de classe 3T da Moonshot AI, com 2,8T parametros, janela de contexto de 1M tokens e suporte nativo a entrada visual. E indicado para programacao de longo horizonte, trabalho de conhecimento, raciocinio complexo e compreensao multimodal. Consulte o guia prático do Kimi K3 (exemplos das três APIs e matriz de suporte).
  • Adicionado hy-3d-3.1: modelo Tencent Hunyuan 3D Professional para texto-para-3D, imagem-para-3D e geracao 3D multivisao. E indicado para assets de jogos, apresentacoes de ecommerce, impressao 3D e design de produtos; a versao 3.1 melhora geometria e texturas e suporta entrada de oito vistas.
API de geracao 3D disponivel
  • Adicionada a API assincrona /v1/3d/generations, inicialmente conectada ao Tencent TokenHub Hunyuan 3D. Ela permite enviar tarefas e consultar resultados, facilitando integrar geracao de assets 3D em fluxos automatizados.
Compatibilidade com ferramentas dinamicas do Kimi K3
  • Ferramentas carregadas dinamicamente no nivel da mensagem em requisicoes Kimi K3 agora sao preservadas e encaminhadas, evitando erros 400 do provedor de modelos causados por declaracoes de ferramentas perdidas. Clientes que usam dynamic tool loading do Kimi devem ter melhor compatibilidade.
Erros de conversao de requisicao mais claros
  • A compatibilidade melhorou para custom tools de Chat Completions, blocos de texto Cohere e requisicoes com assistant.content: null. Requisicoes validas chegam ao provedor de modelos de forma mais estavel; entradas malformadas ou nao suportadas retornam erros estruturados em vez de serem reportadas como sucessos HTTP 200 vazios.
Cobranca Seedream atualizada
  • A geracao de imagens doubao-seedream-5-0-pro agora suporta cobranca por faixa de pixels de saida e quantidade de imagens de entrada, fazendo com que requisicoes texto-para-imagem e imagem-para-imagem sejam cobradas mais perto das especificacoes reais.

15 de julho

Compatibilidade aprimorada para chamadas de ferramentas no Gemini
  • Ao chamar Gemini ou Vertex pela API compativel com OpenAI, solicitacoes cujas definicoes de ferramentas ou schemas de saida estruturada contem valores enum de string vazia nao falham mais com erro 400 de validacao provedor de modelos. Os fluxos de chamadas de ferramentas e JSON Schema ficaram mais confiaveis.

14 de julho

Novos modelos de audio
  • Adicionado gpt-audio-1.5, o primeiro modelo de audio da OpenAI geralmente disponivel. Ele aceita entradas e saidas de audio e pode ser usado pela API REST Chat Completions, para conversas por voz, compreensao de audio e geracao de audio.
  • Adicionado gpt-4o-transcribe-diarize, um modelo ASR com diarizacao de falantes integrada que associa segmentos de audio a diferentes falantes em uma conversa. Este modelo esta disponivel apenas na API de Transcription.
Pagina de apresentacao do LLM Router no ar

13 de julho

Respostas de erro da API mais consistentes
  • Quando /v1/responses e chamado com um modelo desconhecido, agora retorna HTTP 400, alinhado aos outros pontos de entrada da API. Assim os clientes podem tratar o caso como “sem servico disponivel” em vez de receber 500.
Falhas de validacao retornam mais cedo
  • Se a conversao do corpo da requisicao ou a validacao de parametros falhar, a API retorna diretamente o 400/erro correspondente em vez de encaminhar a requisicao original ao servico provedor de modelos, reduzindo chamadas invalidas e falhas confusas.
Cache mais estavel para Claude Code
  • Chamadas do Claude Code para Claude via Bedrock agora tem acertos de prompt cache mais estaveis dentro da mesma sessao, ajudando a diminuir custo de cache write duplicado e latencia do primeiro token.
Gemini multivolta e cache mais precisos
  • Requisicoes Gemini agora permanecem no mesmo servico somente quando a resposta realmente contem assinaturas de pensamento ou atividade de cache. Isso reduz divergencias de assinatura ou estado de cache em multivolta, enquanto tarefas sem estado como geracao de imagem nao ficam presas desnecessariamente.

10 de julho

Novos modelos
  • Adicionados os três modelos da série GPT-5.6: gpt-5.6-sol, gpt-5.6-terra e gpt-5.6-luna (lançamento oficial da OpenAI em 2026-07-09). Os três níveis têm janela de contexto de 1.050.000 tokens, saída máxima de 128K e corte de conhecimento em 2026-02-16, aceitam entrada de texto e imagem e podem ser chamados via Chat Completions, Responses e a interface Messages compatível com Claude. Sol é o nível flagship para trabalho profissional complexo, descrito pela OpenAI como seu melhor modelo de código atual; Terra tem desempenho equivalente ao GPT-5.5 pela metade do preço; Luna é voltado a cenários sensíveis a custo.
Documentação de cache de prompts do GPT disponível
  • Nova documentação Cache de Prompt do GPT: a partir da série GPT-5.6, a escrita de cache é cobrada a 1.25x o preço de entrada, a leitura a 0.1x e o cache é mantido por no mínimo 30 minutos; a página cobre os parâmetros prompt_cache_key e pontos de quebra de cache explícitos, a lógica de cobrança, exemplos de interface e solução de problemas de acerto. As seções sobre o cache da OpenAI em Cache de prompts e Cache de Prompt do Claude foram atualizadas com o mesmo critério.
Compatibilidade de thinking para Claude Fable/Mythos
  • Requisições para Claude Fable e Mythos com reasoning_effort agora usam adaptive thinking, reduzindo erros 400 do provedor de modelos nessas famílias de modelos sem exigir mudanças no cliente.
Suporte a stop sequences em Claude e Gemini
  • Configurações stop compatíveis com OpenAI agora são mapeadas para requisições nativas Claude e Gemini. Stops em branco inválidos para Claude são filtrados, e os limites de OpenAI/Gemini são tratados por provedor para tornar a parada da geração mais consistente.
Compatibilidade de limite de tokens para gpt-chat-latest
  • gpt-chat-latest e futuros aliases latest de GPT/ChatGPT agora preservam max_completion_tokens quando necessário, reduzindo erros 400 causados pelo campo antigo max_tokens.
Mensagem mais clara para limite de Key esgotado
  • Quando o limite de uso de uma Key se esgota, a API agora retorna uma orientação mais clara para ajustar e reativar o limite da Key, em vez de apenas um erro de quota de baixo nível.
Formato de resposta de tool calls alinhado ao OpenAI
  • Respostas chat não streaming com tool_calls e sem texto agora retornam explicitamente content: null, melhorando a compatibilidade com SDKs e parsers no estilo OpenAI.

9 de julho

Reparo de saída estruturada: correção automática de erros de formato no JSON
  • Adicionada a capacidade de Reparo de saída estruturada em nível de Key, desativada por padrão. Uma vez ativada, para requisições não-streaming que declaram saída JSON estruturada, quando o JSON retornado pelo modelo apresenta erros de formato como truncamento, vírgulas finais ou empacotamento em bloco de código, o gateway o repara automaticamente para um JSON válido e analisável antes de retornar, mantendo os valores intactos e sem exigir alterações no cliente. Suporte aos quatro protocolos Chat Completions, Responses, Claude e Gemini; quando ocorre reparo, a resposta traz o cabeçalho X-JSON-Repaired: true.
Documentação de cache de prompts do Claude: limites mínimos de tokens por modelo completados
  • Atualizada a documentação Cache de Prompt do Claude e Cache de prompts com os limites mínimos de tokens que podem ser armazenados em cache por modelo (512 / 1.024 / 2.048 / 4.096), adicionando modelos atuais como Claude Opus 4.8, Opus 4.7 e Fable 5. O limite não é proporcional à versão do modelo; um prefixo abaixo do limite não é armazenado em cache mesmo com cache_control.
Dashboard de uso alinhado aos dados de liquidacao
  • A agregacao do dashboard de uso agora fica mais proxima dos registros de liquidacao dos request logs, reduzindo perdas em agregacoes concorrentes e alinhando o bucket horario usado em reprocessamentos atrasados. Numeros historicos do dashboard ainda podem ter pequenas diferencas; para conciliacao e liquidacao, os request logs continuam sendo a fonte da verdade.
Novo modelo
  • Adicionado grok-4.5, um modelo para programacao, tarefas agenticas e trabalho de conhecimento, com raciocinio configuravel, chamadas de ferramentas e janela de contexto de 500K. E indicado para correcao de codigo, tarefas complexas de engenharia, perguntas de conhecimento e fluxos de agentes.

8 de julho

Chamadas com tools em gpt-5.5+ passam automaticamente por Responses
  • Ao usar o endpoint compativel com OpenAI /v1/chat/completions com gpt-5.5 ou modelos mais recentes, requisicoes que incluem tools e reasoning_effort agora usam automaticamente capacidades de Responses. Isso reduz erros 400 do provedor de modelos para essa combinacao de parametros sem exigir migracao do cliente para /v1/responses. Veja: Responses API

7 de julho

Compatibilidade de saida estruturada entre protocolos
  • response_format compativel com OpenAI e output_config.format nativo do Claude agora sao adaptados nos caminhos relevantes. Clientes que alternam entre protocolos no estilo OpenAI e Claude podem preservar restricoes de saida estruturada com mais confiabilidade. Veja: Structured Output.
Chamadas /v1/messages mais estaveis no Vertex AI
  • Ao chamar Gemini e outros modelos que nao sao Claude pelo Vertex AI, requisicoes /v1/messages agora sao roteadas por familia de modelo, reduzindo falhas not found ou 404 causadas por caminhos especificos do Claude.

6 de julho

Endpoints nativos do Gemini concluidos
  • Ao usar o SDK @google/genai pela entrada Gemini da AIHubMix, agora ha suporte a workflows nativos de embeddings, interactions create e context caching. Essas rotas antes podiam retornar erros de rota nao registrada ou 404; agora servem para gerar embeddings, fazer chamadas interativas e criar/ler/atualizar/excluir caches. Saiba mais: Integracao com SDK nativo do Gemini
Expansao da cobranca por faixas para modelos de contexto longo
  • Modelos de contexto longo como hy3-preview, ERNIE, Grok e Mimo agora suportam cobranca por faixas com base no comprimento do contexto. O calculo de tarifas e mais preciso.
Metricas de streaming do Vertex AI corrigidas
  • Requisicoes streaming do Vertex AI Gemini/Claude agora registram dados mais precisos de primeiro token e latencia. Logs e monitoramento ficam mais confiaveis; isso nao altera as respostas do modelo.
Novo modelo
  • Adicionado tencent-hy3, um modelo de geracao de texto (Tencent Hunyuan Hy3, versao oficial). Arquitetura MoE com 295B de parametros totais / 21B de parametros ativos e janela de contexto de 256K. Suporta modos de inferencia combinados rapido e lento, adequado para raciocinio complexo, geracao de codigo e workflows de agentes. Codigo aberto sob a licenca Apache 2.0.

3 de julho

Jina Search/Reader agora aceita POST e upload de arquivos
  • Jina Search e Reader agora aceitam requisições POST. O Reader pode receber arquivos locais via upload multipart, incluindo PDF, Word, Excel, PPT, HTML e imagens. As respostas padrão ficam mais próximas do markdown nativo da Jina; clientes que precisam de JSON podem enviar explicitamente Accept: application/json.
Chamadas de serviços do tipo Azure via Responses mais estáveis
  • Corrigido um problema em que chamadas /v1/responses encaminhadas para serviços do tipo Azure não GPT podiam falhar com 404 porque o api-version ficava vazio, reduzindo falhas diretas nesse tipo de requisição.
Correção de truncamento em streaming
  • Corrigido um caso em que alguns serviços de inferência de modelos do tipo vLLM / Azure Foundry podiam truncar respostas streaming aleatoriamente. Os usuários devem receber respostas completas, sinais de término e informações de uso com mais confiabilidade.
Novo modelo: Command A Plus 05-2026
  • Adicionado command-a-plus-05-2026, um modelo de geracao de texto para chat, criacao de conteudo e fluxos de agentes.

1 de julho

APIs de busca Jina e leitura de páginas web disponíveis
  • Foram adicionadas as capacidades Jina Search e Reader. Agora você pode usar sua API Key da AIHubMix para obter resultados de busca da Jina e ler conteúdo de páginas web, ideal para pesquisa web externa, leitura de documentos e fluxos de trabalho com ferramentas de agentes. Saiba mais: Jina AI
Veo 3.1 imagem para vídeo agora suporta quadros inicial/final e imagens de referência
  • O Veo 3.1 imagem para vídeo agora aceita quadro inicial, quadro final e imagens de referência, permitindo controlar com mais precisão as cenas de início/fim, referências de personagem e referências de estilo em fluxos avançados de geração de vídeo. Saiba mais: Geração de vídeo
Melhor estabilidade nas tentativas do Gemini
  • Melhoramos a compatibilidade das requisições Gemini durante tentativas e fallback, reduzindo certos erros 400 e aumentando a taxa de sucesso de chamadas de reserva. Saiba mais: Guias Gemini
Campos de resposta compatíveis com OpenAI alinhados
  • Respostas compatíveis com OpenAI, tanto sem streaming quanto com streaming, agora preservam valores null em campos como logprobs, refusal e finish_reason, reduzindo diferenças para SDKs, agentes e analisadores de logs que esperam o formato padrão da OpenAI.
Mais privacidade e compatibilidade para Claude Code
  • Melhoramos a compatibilidade das requisições quando o Claude Code chama modelos Claude pela AIHubMix, reduzindo informações do ambiente do cliente enviadas ao provedor de modelos e reforçando a proteção de privacidade para clientes Agent de terceiros.
Login, cadastro e perfil aprimorados
  • O sistema próprio de contas agora cobre login/cadastro por código de e-mail, definição de senha, edição de perfil, vinculação/desvinculação de contas de terceiros e exclusão de conta, com isolamento mais forte do propósito do OTP e bloqueio de contas desativadas. Callbacks de recarga via Stripe também são tratados com mais confiabilidade.
Novos modelos
  • claude-sonnet-5 para chat, raciocínio e fluxos com agentes.
  • gemma-4-31b e longcat-2.0 para geração de texto.
  • gemini-3.1-flash-lite-image para fluxos com capacidades de imagem.
  • mai-image-2.5 e mai-image-2.5-flash para geração de imagens.

29 de junho

Melhorias na cobrança e compatibilidade de parâmetros de geração de imagens
  • A cobrança de gpt-image-2 nos endpoints Images agora é unificada por tokens. A geração de imagens GLM transmite parâmetros estendidos como watermark_enabled e quality, permitindo que controles de marca d’água e qualidade sejam aplicados quando suportados pelo provedor de modelos. Saiba mais: Geração de imagens
Logs mais limpos para upload de arquivos Gemini
  • Falhas no upload de arquivos Gemini não criam mais logs normais visíveis ao usuário, reduzindo ruído de endpoints que não são de inferência na página de logs, enquanto os logs internos de diagnóstico continuam preservados.

27 de junho

Novos modelos Deep Research
  • Adicionados o4-mini-deep-research e o3-deep-research, disponíveis somente pelo endpoint /v1/responses. As requisições devem incluir web_search_preview ou mcp tools, sendo indicadas para pesquisa web aprofundada e respostas em estilo research.

25 de junho

Protocolo Responses agora compatível com qualquer modelo
  • O endpoint /v1/responses não está mais limitado à série GPT e agora pode chamar qualquer modelo da plataforma. Assim, ferramentas baseadas no protocolo Responses (como o Codex CLI) podem usar modelos como GLM, Gemini, DeepSeek, Kimi, Qwen etc. por meio de um catálogo de modelos local, sem ficar mais limitadas aos modelos próprios da OpenAI.
Correção da saída Responses do Step 3.7 Flash
  • Corrigido um problema em que step-3.7-flash podia retornar conteúdo em branco ou resposta vazia via /v1/responses; o conteúdo de raciocínio e as respostas finais agora retornam corretamente.
Codex CLI agora com suporte a modelos personalizados
  • A documentação do Codex CLI traz um novo tutorial “Usar modelos personalizados no Codex”: declare qualquer modelo da AIHubMix (GLM, Gemini, DeepSeek, Kimi, Qwen etc.) por meio de um catálogo de modelos local (model_catalog_json) e alterne livremente a partir da lista /model do Codex, sem ficar mais limitado aos modelos próprios da OpenAI. A documentação inclui um script de comando único para gerar um catálogo com os 30 primeiros modelos e as armadilhas mais comuns. Saiba mais: Codex CLI · Usar modelos personalizados no Codex

24 de junho

Domínio de backup agora suportado
  • Adicionado o domínio de backup https://api.inferera.com, com endpoints e capacidades idênticos ao domínio principal https://aihubmix.com. Quando o domínio principal estiver inacessível (por exemplo, falhas de conexão ou tempos limite), substitua a URL da requisição pelo domínio de backup; a API Key, o modelo, o corpo da requisição e os demais parâmetros permanecem inalterados.

23 de junho

Novos modelos
  • Doubao doubao-seed-2-1-pro, doubao-seed-2-1-turbo.
  • Série de vídeo HappyHorse happyhorse-1.1-t2v (texto para vídeo), happyhorse-1.1-r2v (geração por referência), happyhorse-1.1-i2v (imagem para vídeo).
Experiência de checkout Stripe aprimorada
  • O checkout Stripe agora preenche automaticamente o e-mail da conta e reduz a coleta desnecessária de nome e endereço de cobrança, tornando recargas com métodos como Alipay mais simples.
Limite para contas com saldo negativo
  • Quando o saldo da conta estiver abaixo de -$1, modelos gratuitos não poderão mais ser chamados até que a conta seja recarregada.

22 de junho

Nova documentação do AIHubMix CLI
  • Nova documentação do AIHubMix CLI: um único binário sem dependências (não requer Python / Node / Go) para consultar o saldo da conta, gerenciar chaves API e ver os modelos disponíveis diretamente no terminal, com saída amigável para scripts e agentes de IA (como Claude Code).
LLM Router (roteamento inteligente de modelos)
  • Defina model como auto e o gateway analisa sua requisição para escolher o melhor modelo entre centenas, com políticas de custo / qualidade / latência, cobrado pelo modelo realmente usado, sem alterar o código do cliente. Saiba mais: LLM Router (roteamento inteligente de modelos)
Correção da taxa de acerto de cache do DeepSeek
  • Corrigido um problema em que a taxa de acerto de cache de deepseek-v4-pro e deepseek-v4-flash ficava abaixo do esperado.
AIHubMix Skill (extensão para assistentes de programação de IA)
  • Capacidade de extensão local para agentes de IA que suportam Skills, como Codex, Claude Code, Cursor e Cline: em linguagem natural, conclua a integração com a AIHubMix, consulte modelos, escolha por capacidade, gere exemplos e solucione erros. A Skill lê informações em tempo real, modelos, preços, contratos de protocolo etc., diretamente das interfaces oficiais sob demanda, evitando que o agente dependa de memória desatualizada. Saiba mais: Skills

17 de junho

Novos modelos de vídeo Kling (可灵)
  • Integração de todas as capacidades de geração de vídeo do Kling: texto para vídeo, imagem para vídeo, referência de múltiplas imagens e geração multimodal omni, com chamadas pelo protocolo nativo conforme o nome do modelo.

16 de junho

Problema do plugin de integração do OpenClaw corrigido
  • O plugin de integração do OpenClaw da AIHubMix aihubmix-auth corrigiu seus problemas de integração anteriores e agora é estável. Basta instalá-lo e inserir uma chave AIHubMix para chamar simultaneamente os modelos OpenAI / Anthropic / Gemini no OpenClaw.
Novos modelos
  • Zhipu glm-5.2.

15 de junho

Novo suporte à integração com o Open Design
  • A AIHubMix já é um gateway BYOK com suporte nativo no Open Design (a alternativa open source e local-first ao Claude Design). No modo API (BYOK), basta selecionar a AIHubMix e inserir uma única Key para impulsionar simultaneamente a geração de chat / imagens / vídeos / voz, com cada modelo seguindo o protocolo nativo do respectivo fornecedor conforme o nome do modelo. Saiba mais: Tutorial de integração com o Open Design
O Zhipu GLM 5.2 suporta níveis de intensidade de raciocínio
  • O glm-5.2 do serviço nativo da Zhipu suporta o ajuste da profundidade de raciocínio por níveis via reasoning_effort; as versões antigas do modelo são selecionadas automaticamente por versão, sem necessidade de alterações pelo chamador.
Novos modelos
  • kimi-k2.7-code-highspeed (versão de código de alta velocidade do Kimi).

13 de junho

Novos modelos
  • coding-glm-5.2 e a versão gratuita coding-glm-5.2-free.

12 de junho

Mapeamento de modelos e fallback em caso de erro
  • Novo: Model Mapping e Fallback em caso de erro: Configure o mapeamento de nomes de modelo e o fallback em caso de erro por API Key no console, reescreva o alias de modelo do cliente para o modelo provedor de modelos real, alterne automaticamente para um modelo de backup quando o modelo principal falhar e cobre pelo modelo que responde por fim, sem alterar o código do cliente. Consulte: Model Mapping e Fallback
Novos modelos
  • kimi-k2.7-code.

11 de junho

step-3.7-flash com 90% de desconto por tempo limitado
  • Promoção por tempo limitado do step-3.7-flash com 90% de desconto: apenas 0,022 USD por milhão de tokens de entrada e 0,132 USD por milhão de tokens de saída. Experimente!
Descontinuação de modelos e roteamento automático
  • Os modelos claude-opus-4-20250514 e claude-sonnet-4-20250514 serão descontinuados oficialmente em 15 de junho; nessa data, a plataforma roteará automaticamente os modelos descontinuados para as versões 4-5 da mesma série.

10 de junho

Novos modelos
  • claude-fable-5 [Descontinuado].
Notas sobre os novos modelos Claude Fable 5 / Mythos 5
  • O Fable 5 tem barreiras de segurança mais fortes, e algumas solicitações normais também podem ser bloqueadas: ele aplica classificações adicionais em áreas como cibersegurança, biologia / química, destilação de modelos e extração de raciocínio. Algumas pesquisas técnicas, análises de vulnerabilidades ou perguntas biomédicas podem ser recusadas ou encaminhadas para o Opus 4.8.
  • O Mythos 5 tem acesso restrito e não é um modelo aberto ao público geral: Mythos 5 e Fable 5 compartilham a mesma base de capacidades, mas o Mythos 5 usa menos classificadores de segurança. No momento, está disponível apenas para Project Glasswing / clientes aprovados; a maioria dos usuários usará o Fable 5 com guardrails.
  • Custo de API mais alto: o Fable 5 custa 10 USD por milhão de tokens de entrada e 50 USD por milhão de tokens de saída, cerca de duas vezes o custo do Opus 4.8.
  • Privacidade: Fable 5 / Mythos 5 são classificados como Covered Models, exigem por padrão pelo menos 30 dias de retenção de dados e não oferecem suporte a Zero Data Retention.
  • Comportamento de recusa na API: quando o Fable 5 recusa uma solicitação, a API retorna HTTP 200, mas stop_reason é refusal.

08 de junho

A interface compatível com Gemini suporta entrada de áudio
  • Ao chamar o Gemini pela interface compatível com OpenAI (/v1/chat/completions), a entrada de áudio input_audio agora é suportada (anteriormente era descartada silenciosamente), e a contagem de audio_tokens foi adicionada ao usage retornado.

05 de junho

Novos modelos
  • grok-build-0.1, hy3-preview e o modelo gratuito step-3.7-flash-free.

04 de junho

Novos modelos
  • Tongyi Qianwen qwen3.7-plus.

01 de junho

Novos modelos
  • MiniMax minimax-m3.
  • Baidu musesteamer-air-image (geração de imagens).

Mar 29

Log Details Page
  • Latency: Indicates how quickly a request starts (time from request initiation to the first token returned)
  • Throughput: Provides a clear measure of the model’s output speed
  • E2E Latency: The total time from request submission to completion, used to evaluate overall request performance
  • Provider: Identifies the model vendor that handled the request
  • Status: Shows the execution result (p. ex., success / failure) for quick detection of anomalies
  • TID: A unique request identifier that can be shared with support for faster troubleshooting

Mar 23

  • AIHubMix Global Acceleration Network is now live: Built on self-managed global edge nodes and an intelligent routing system, with continuous monitoring and dynamic optimization, achieving 75% lower latency, 60% improved stability, and 99.99% availability, delivering a faster, more reliable AI experience.
  • Added 24/7 real-time health monitoring: Distributed probes scan the entire network every minute, tracking latency, success rate, and stability. Issues are detected and resolved before users even notice, ensuring consistent performance.
  • Enhanced intelligent traffic routing: Node health is dynamically evaluated across multiple time windows, enabling millisecond-level switching to the optimal path, significantly reducing fluctuations and timeouts while improving overall request success rates.

Feb 08

  • New Feature: Chat → Responses Compatibility
    This release introduces Chat → Responses compatibility, allowing the Chat Completions API to invoke OpenAI models that support the Responses protocol only, including gpt-5.2-codex, gpt-5.1-codex-max, and gpt-5.2-pro. If you want to force the AIHubmix Chat API to route requests through the Responses protocol, add o seguinte header à sua request:
    X-Use-Responses-Enabled: true When a model suporta both Chat and Responses protocols, setting this header will force the request to use the Responses API.
    Observe que the Responses protocol does not currently support audio input or output, so plan usage accordingly.
  • Model Deprecation Notice:
    OpenAI will deprecate chatgpt-4o-latest on February 17, 2026. After the deprecation, we will automatically remap chatgpt-4o-latest to gpt-4o-2024-11-20.

2025

Dec 15

  • New feature: Google API now suporta Files API.

Sep 22

Aug 10

Aug 1

Jul 29

  • Added support for the AI SDK: access a massive number of models with a single chave de API

Jul 26

Jul 23

  • Added support for Qwen Code, leveraging all large language models available on the Aihubmix platform

Jul 4

  • Added support for llms.txt: get standardized model navigation with one clique so your LLM assistant can quickly understand the entire model ecosystem

Jun 29

  • Added forwarding support for Gemini CLI, with multiple flexible usage modes
  • Added code interpreter and Remote MCP invocation to the OpenAI Responses API

Jun 26

Jun 23

  • Launched APP-Code, offering developers a 10% discount across all models

Jun 18

Jun 13

  • Added support for Veo 3.0 video generation to expand creative formats

Jun 9

  • Added support for OpenAI Reasoning Summaries no Responses API

Jun 5

  • Added implicit caching for Gemini, with automatic cache hits and hit feedback
    Developers can use usage_metadata to determine cache hits
    Cost savings are not guaranteed and depend on request structure and usage scenarios

May 31

Full Support for New Claude 4 Features
  • New cache TTL: 1-hour cache support Beta
  • 🎉 New text editing tools: Claude 4 now suporta text_editor_20250429 and str_replace_based_edit_tool
  • 🚫 New refusal stop reason for safety-based rejections
  • 🧠 Extended Thinking: Claude 4 now returns full summaries of its reasoning process
  • 🔄 Interleaved Thinking: Tool usage can now interleave with extended thinking for more natural conversations (Beta)
  • ⚠️ Deprecated Features:
    • undo_edit is no longer supported
    • token-efficient-tools-2025-02-19 removed (Claude 3.7 only)
    • output-128k-2025-02-19 removed (Claude 3.7 only)
  • 📚 Full migration guides and code examples have been updated to help users smoothly transition from Claude 3.7 to Claude 4

May 22

  • Added support for the Dify plugin, enabling seamless integration of Aihubmix models into Dify
    Extend and manage over 200 models with a single chave de API

May 17

  • Added support for codex-mini-latest, optimized for programming tasks, accessible via the Responses API or Codex CLI
  • Added support for Google Imagen 3.0 image generation and Veo 2.0 video generation
  • gemini-2.0-flash-exp upgraded to the official preview version gemini-2.0-flash-preview-image-generation

May 9

  • Added the Ideogram AI V3 API, Ideogram’s most advanced image generation model

May 6

Apr 26

  1. The highly anticipated OpenAI image generation API gpt-image-1 is now live, supporting both text-to-image and image-to-image
  2. Added native Gemini API support with precise reasoning budget control for Flash 2.5

Apr 24

  • Integrated three core Jina AI APIs to help build powerful agents: Embeddings, Rerank, and DeepSearch

Apr 20

  • Added support for the OpenAI Responses API endpoint with expanded tool capabilities

Apr 17

Apr 12

Apr 9

  • Added Claude prompt caching, saving up to 76% in cost for repeated high-frequency prompts

Apr 7

  • Added Ideogram AI image generation support with strong text rendering, hybrid generation, local edits, and upscaling

Apr 5

  • Brand-new documentation experience launched

Mar 30

  • Added support for the Claude Text Edit Tool

Mar 24

  • Launched the brand-new Trident logo

Mar 16

  • Added native search support for OpenAI and Google Gemini models
  • Third-party search integration will be added in future updates

Mar 15

  • Added models: gpt-4o-mini-search-preview and gpt-4o-search-preview

Mar 7

  • Prices for o1 and o3-mini reduced by 10%, in line with official pricing

Mar 6

  • Due to a 7× price increase from Microsoft, the price of aihubmix-DeepSeek-R1 also increased 7×
    Recommended alternative: Volcano Engine’s DeepSeek-R1 (more stable and cost-effective)
    Added models: qwen-qwq-32b and qwen2.5-vl-72b-instruct

Feb 28

  • All Claude models received a 15% price reduction
  • Added model gpt-4.5-preview (extremely expensive, use with caution)

Feb 26

  • Improved DeepSeek stability
  • ByteDance versions of DeepSeek are currently the most stable
    Recommended models: DeepSeek-R1 and DeepSeek-V3

Feb 25

  • Added model claude-3-7-sonnet-20250219

Feb 24

  • The gpt-4o model may occasionally respond very slowly due to model provider issues
    Recomenda-se to temporarily switch to gpt-4o-2024-11-20
  • The Perplexity API is temporarily offline
    Due to Perplexity’s complex billing model and higher costs than this platform’s pricing structure, the service will be relaunched after pricing adjustments
  • The temporary ByteDance official discount has ended and prices have returned to normal
    The price of DeepSeek-R1 has been increased accordingly
  • Added a new model details page with full parameter information

Feb 23

  • The temporary ByteDance official discount has ended and prices have returned to normal
    The price of DeepSeek-V3 has been increased
    ByteDance’s R1 model is also expected to return to normal pricing soon, and this platform will同步 adjust prices accordingly

Feb 18

  • Added model: kimi-latest
    (Official billing is tiered by input length at 8k, 32k, and 128k.
    This platform não suporta tiered pricing and uses the mid-tier 32k as the pricing standard.
    If you are price-sensitive, use with caution.)
  • Optimized overall website layout
  • Merged the Changelog page into the Usage Statistics page
  • Moved Announcements to the Model Marketplace page
  • Moved Settings under the user avatar menu
  • Reduced the price of aihubmix-DeepSeek-R1 by 50%
  • Added models:
    gemini-2.0-pro-exp-02-05-search, gemini-2.0-flash-exp-search
    (Integrated with Google’s official online search)
  • Added models:
    gemini-2.0-flash, gemini-2.0-pro-exp-02-05, gemini-2.0-flash-lite-preview-02-05
  • Added models:
    o3-mini, o1
    (These two models are billed about 10% higher than official pricing due to limited account resources)

Feb 4

  • The o1 model não suporta the stream parameter no official OpenAI API
  • The o3-mini model não suporta the temperature parameter
    A new parameter reasoning_effort is available with values: "low", "medium", "high"
    Default is "medium" if not specified

Feb 1

Feature Update:
  • Added support for OpenAI audio model input and output
    The api.aihubmix.com preview server is now available
    After one week of stable operation, the main site will be updated
    Backend billing is fully consistent with official pricing
    Atualmente, usage logs only display text token usage
    Audio token usage is not yet shown in logs but does not affect normal usage
New Models Added:
  • o3-mini, o1
    (Billed about 10% higher than official pricing due to limited account availability)
  • aihubmix-DeepSeek-R1 (recommended, highly stable)
  • qwen-max-0125 (Qwen2.5-Max), sonar-reasoning
  • deepseek-ai/DeepSeek-R1-Zero, deepseek-ai/DeepSeek-R1, deepseek-r1-distill-llama-70b
  • aihub-Phi-4
  • Doubao-1.5-pro-256k, Doubao-1.5-pro-32k,
    Doubao-1.5-lite-32k, Doubao-1.5-vision-pro-32k
  • sonar, sonar-pro (latest from Perplexity AI)
  • gemini-2.0-flash-thinking-exp-01-21
  • deepseek-reasoner (aka DeepSeek-R1)
  • MiniMax-Text-01
  • codestral-latest (Mistral’s new code model, Codestral 25.01)

Jan 23

New Models Added:
  • aihub-Phi-4
  • Doubao-1.5-pro-256k, Doubao-1.5-pro-32k,
    Doubao-1.5-lite-32k, Doubao-1.5-vision-pro-32k
  • sonar, sonar-pro (latest from Perplexity AI)
  • gemini-2.0-flash-thinking-exp-01-21
  • deepseek-reasoner (aka DeepSeek-R1)

Jan 19

  • Added Perplexity AI API models
    Currently supported only on the preview server api.aihubmix.com
    After stable testing, it will be rolled out to the main server aihubmix.com
  • api.aihubmix.com is the preview server
    New features will be deployed there first and promoted to the main server after ~1 week of stability testing
New Models Added:
  • MiniMax-Text-01
  • codestral-latest (Mistral Codestral 25.01)

Jan 6

  • Added gemini-2.0-flash-exp-search, supporting native Google online search
    The official Gemini 2.0 Flash model requires additional parameters for online search
    Aihubmix has integrated this functionality, simply append search to the model name
  • Added model: deepseek-ai/DeepSeek-V3

Jan 1

  • Launched the new Model Marketplace page to replace the old Model & Pricing page

2024

Dec 30

  • Fixed the issue where gemini-2.0-flash-thinking-exp-1219 only returned reasoning without final answers
  • Fixed the issue of balance reminder emails not being delivered

Dec 22

  • Added Usage Statistics page
  • Added Recharge History page
  • Added Doubao series models:
    Doubao-lite-128k, Doubao-lite-32k, Doubao-lite-4k,
    Doubao-pro-128k, Doubao-pro-256k, Doubao-pro-32k, Doubao-pro-4k
  • Added model: gemini-2.0-flash-thinking-exp-1219
  • Added models:
    gemini-2.0-flash-exp, aihubmix-Mistral-Large-2411,
    aihubmix-Llama-3-3-70B-Instruct, grok-2-1212, grok-2-vision-1212
  • Added models:
    gemini-exp-1206, llama-3.3-70b-versatile, learnlm-1.5-pro-experimental

Dec 14

  • Added models:
    gemini-2.0-flash-exp, aihubmix-Mistral-Large-2411,
    aihubmix-Llama-3-3-70B-Instruct

Dec 8

  • Added models:
    gemini-exp-1206, llama-3.3-70b-versatile, learnlm-1.5-pro-experimental
  • Added Usage Statistics page

Nov 21

  • Recently added models:
    gpt-4o-2024-11-20, step-2-16k, grok-vision-beta
  • Qwen 2.5 Turbo million-context model:
    qwen-turbo-2024-11-01

Nov 7

  • Added compatibility com o native Claude SDK
    The v1/messages endpoint is now live
  • Native Claude prompt caching and computer use features are not yet supported
    These will be completed withno next two weeks

Nov 5

  • Added model: claude-3-5-haiku-20241022
  • Added Elon Musk’s xAI latest model: grok-beta

Oct 23

  • Added model: claude-3-5-sonnet-20241022

Oct 10

  • OpenAI’s latest caching feature is now live
    Currently supported models:
    • GPT-4o
    • GPT-4o-mini
    • o1-preview
    • o1-mini
  • Note: gpt-4o-2024-05-13 is not included no official supported list
  • Cache hit tokens will be visible in backend logs when a request hits the cache
  • For full details and usage rules, refer to the OpenAI official documentation

Oct 3

  • Backend billing for gpt-4o has been reduced to match official pricing
  • Added models:
    aihubmix-Llama-3-2-90B-Vision, aihubmix-Llama-3-70B-Instruct
  • Added Cohere latest models:
    aihubmix-command-r-08-2024, aihubmix-command-r-plus-08-2024

Sep 19

  • Added models: whisper-large-v3 and distil-whisper-large-v3-en
  • Note: Whisper model billing is based on input seconds
    The current pricing display on the site is incorrect and will be fixed
    Backend billing for whisper-1 fully matches OpenAI official pricing

Sep 13

  • Added models: o1-mini and o1-preview
    Note: These models require updated parameters
    Some client shells may throw errors if defaults are not updated
Test results show that the o1 model does NOT support:
  • system field → 400 error
  • tools field → 400 error
  • Image input → 400 error
  • json_object output → 500 error
  • structured output → 400 error
  • logprobs output → 403 error
  • stream output → 400 error
Rate limits and fixed parameters:
  • o1 series: 20 RPM, 150,000,000 TPM. Limites muito baixos, erros 429 frequentes são possíveis
  • temperature, top_p, and n are fixed at 1
  • presence_penalty and frequency_penalty are fixed at 0

Sep 10

  • Added model: mattshumer/Reflection-Llama-3.1-70B
    (Reported to be one of the strongest fine-tuned versions of LLaMA 3.1 70B)
  • Claude-3 model prices increased
    To ensure stable supply, calls through this platform are currently ~10% more expensive than direct official usage
  • Increased concurrency capacity for OpenAI models
    The system now theoretically suporta near-unlimited concurrency

Aug 11

  • Added models:
    Phi3medium128k, ahm-Phi-3-medium-4k, ahm-Phi-3-small-128k
  • Improved stability for LLaMA-related models
  • Further optimized compatibility for Claude models

Aug 7

Aug 4

  • Added direct online payment for account top-ups
  • Fixed Claude multi-turn conversation format error:
    messages: roles must alternate between "user" and "assistant", but found multiple "user" roles in a row
  • Optimized index handling when using function calling with Claude models
  • The backup server https://orisound.cn will be fully decommissioned on Sep 7
    Please migrate to the main server https://aihubmix.com or backup server https://api.aihubmix.com

Jul 27

  • Added support for Mistral Large 2
    Model name: Mistral-large-2407 or aihubmix-Mistral-large-2407
  • System optimizations

Jul 24

  • Added latest LLaMA 3.1 models:
    llama-3.1-405b-instruct, llama-3.1-70b-versatile, llama-3.1-8b-instant

Jul 20

  • Fixed pricing calculation issues for the gpt-4o-mini model
    • Text input pricing: 1/33 of GPT-4o officially
    • Image input pricing: equal to GPT-4o
  • To align with official pricing, image token counts for gpt-4o-mini are multiplied by 33 during billing
  • Refer to OpenAI official pricing for details

Jul 19

  • Added support for the gpt-4o-mini model
    Backend billing is fully aligned with official pricing

Jul 15

  • Added support for the official include_usage API parameter
    This allows returning usage data in stream mode
    See the official documentation for details

Jul 14

  • The new version of NextWeb now suporta calling non-OpenAI models through this platform
  • Added backend billing support for Alibaba Qwen models
    Calls through this platform cost ~10% more than direct Alibaba Cloud usage
  • Improved Azure OpenAI output compatibility com o standard OpenAI API
  • Added tool calling support for Claude-3
  • Added many new models (see Settings → Modelos Disponíveis)

Jul 3

  • Overall backend UI optimization
  • Each log entry now displays the model unit price at the time of the request
  • Added the Model & Pricing page

Jun 20

  • The latest claude-3-5-sonnet-20240620 is now supported
    See the guide for calling non-OpenAI models on this platform

Jun 18

  • Backend logs now support downloading historical request records

Jun 16

  • The probability of randomly routing requests to Azure OpenAI has been significantly reduced

Jun 13

  • Reduced backend costs for Claude-3 models
    (Claude 3 Haiku, Claude 3 Sonnet, Claude 3 Opus)
    Backend billing now matches official pricing
    As a result, the effective retail API cost on this site is equivalent to ~86% of official pricing

Jun 10

  • Optimized GPT-4o token billing
    Tokenizer changed from cl100k_base to o200k_base
    As a result, streaming token counts for Chinese, Korean, and Japanese are lower than before

Jun 8

  • Added Alibaba’s latest open-source Qinwen 2 models:
    • alibaba/Qwen2-7B-Instruct
    • alibaba/Qwen2-57B-A14B-Instruct
    • alibaba/Qwen2-72B-Instruct

May 20

  • Added model: gemini-1.5-flash
  • Added model: gpt-4o
  • Added models:
    llama3-70b-8192, llama3-8b-8192,
    gemini-1.5-pro, command-r, command-r-plus
  • Claude-3 model supply has been restored
    Endpoints are currently deployed across AWS and Google Cloud
  • To cover infrastructure and operational costs, Claude-3 backend billing is ~10% higher than official pricing
    With increased usage, this will be gradually reduced to ~5% or lower
  • Concurrency limits are currently under testing and will be increased as demand grows

Última atualização: 2026-06-22