2026
2026
28 de agosto
Nuevos modelos
- Añadido
hy4-preview: Hy4 Preview de Tencent Hunyuan, un modelo MoE con 770B de parámetros totales y 49B de parámetros activos, optimizado para flujos de trabajo de Agent, programación y productividad. Refuerza la comprensión de tareas, la planificación, el uso de herramientas y la ejecución sostenida en tareas complejas de varios pasos, ingeniería de software, procesamiento de documentos, análisis de información, automatización de oficina, generación web y colaboración entre herramientas. Admite una ventana de contexto de 1 M de tokens, hasta 64K de salida, razonamiento, búsqueda web, llamada de herramientas/funciones y salidas estructuradas.
2026
27 de agosto
Nuevos modelos
- Añadido
qwen3.8-flash: el modelo insignia nativo de visión y lenguaje de Alibaba Cloud Qwen, pensado para programación, tareas de oficina, razonamiento con contexto largo y flujos de trabajo de agentes. Admite una ventana de contexto de 1 M de tokens, hasta 128K de salida, thinking, acceso a la web, llamada de herramientas y salidas estructuradas. Frente a Qwen3.7-Plus, refuerza las capacidades de programación y de oficina y mejora la eficiencia de entrenamiento e inferencia.
- La herramienta MCP de generación de imágenes ahora exige que quien llama indique explícitamente el modelo, evitando el uso silencioso de un modelo predeterminado cuando no se proporciona ninguno.
openai/gpt-image-1es el ID de modelo estándar mostrado y reenviado al exterior. El error histórico de escritura sigue aceptándose solo como alias de entrada compatible y se normaliza antes de enviar la solicitud.
2026
26 de agosto
Nuevos modelos
- Añadido
glm-5.3-flash: el modelo multimodal de alta eficiencia de Z.AI para Coding Agents, razonamiento complejo y tareas de ingeniería de software de larga duración. Admite entradas de texto, imagen y vídeo, alrededor de 1 millón de tokens de contexto, hasta 128K de salida, thinking, llamada de herramientas y salidas estructuradas. Construido sobre la pila tecnológica GLM con un postentrenamiento y optimización adicionales, pone énfasis en la eficiencia de inferencia y la capacidad de respuesta.
- Añadido Broadcast, que envía automáticamente las trazas de las solicitudes de la API de AIHubMix a LangWatch sin instrumentación adicional en la aplicación. Admite modo de privacidad, muestreo y filtros de claves API; LangWatch muestra el modelo, uso de tokens, coste real facturado, latencia, sesión y datos de Trace.
- La entrada antigua
/mcp/puede seguir usando la autenticación existente y ahora se enruta hacia las capacidades MCP HTTP remotas unificadas. Los clientes antiguos no necesitan migrar de inmediato y pueden seguir consultando modelos y precios, buscando documentación, comprobando saldo y usando herramientas de chat, imagen y vídeo. - La consola ofrecerá una ruta de solo lectura para copiar la Access Key, y los clientes MCP externos pueden usar la cabecera
X-Aihubmix-Access-Key. El servidor no rota la clave ni almacena en caché esta respuesta.
- Las solicitudes
gpt-image-2con fondo transparente priorizan ahora canales nativos de OpenAI que sí admiten esta capacidad, reduciendo fallos repetidos en canales no compatibles. Las demás rutas de solicitud de imagen no cambian.
- Las listas de modelos y guías para AI Agents y herramientas externas se actualizan con más rapidez.
2026
25 de agosto
Errores de migración más claros para las API multimedia antiguas
- Para los modelos multimedia que ya no admiten el protocolo antiguo,
/v1/images/generations,/v1/images/edits,/v1/models/:organization/:model/predictionsy/v1/videosahora devuelvenprotocol_not_supported, con orientación hacia las API multimedia asíncronas/ai/v1y la documentación relacionada. model=automantiene el comportamiento actual de selección automática de modelo. Si el modelo finalmente elegido no admite el endpoint antiguo, la llamada recibe un error claro en lugar de cambiarse silenciosamente a otro modelo. Playground también oculta las entradas antiguas de estos modelos para reducir usos accidentales.
2026
24 de agosto
Nuevos modelos
- Añadido
wan3.0-video: el modelo de vídeo All-in-One en versión preliminar de Alibaba Cloud Wan (Tongyi Wanxiang) unifica los flujos de trabajo de texto a vídeo, imagen a vídeo con primer/último fotograma y vídeo de referencia, con soporte de hasta 30 segundos a 30 fps en 480P/720P/1080P para generación y edición integradas. - Añadido
wan3.0-video-prime: una edición de alta velocidad alineada en capacidades para flujos de trabajo integrados de generación y edición de vídeo, con un procesamiento de extremo a extremo más rápido.
gpt-5.6-solsincronizó la reducción oficial del 20 % y ahora cuesta 4 por millón de tokens de salida. Las rutas de llamada existentes no cambian, mientras que las cargas de razonamiento complejo, programación y contexto largo cuestan menos.
- Cuando una cuenta no tiene activadas las tareas asíncronas, las API de creación multimedia ahora incluyen la página de consola correspondiente en el error
async_not_enabled. Los usuarios de aihubmix, inferera y shkq son dirigidos a su propia consola, reduciendo respuestas 403 sin un siguiente paso claro.
2026
21 de agosto
Nuevos modelos
- Añadido
deepseek-v4-flash-0731-fast: una variante de alta velocidad del modelo agéntico de DeepSeek, orientado a programación, uso de herramientas y cargas de trabajo de Agent de alto volumen. Conserva las capacidades de V4 Flash 0731 y ofrece una inferencia más rápida; en comparación con V4 Pro, prioriza una menor latencia y la eficiencia de ejecución. Admite una ventana de contexto de 1 M de tokens, hasta 384K de salida, thinking, llamadas a herramientas y salidas estructuradas. - Añadido
deepseek-v4-flash-vision-exp: modelo experimental multimodal de comprensión visual de DeepSeek, con entrada de texto e imagen y salida de texto. Es adecuado para descripción de imágenes, OCR de capturas, análisis de gráficos y agentes visuales; sus capacidades de agente, razonamiento y conocimiento general en texto puro se mantienen al nivel de la versión oficial DeepSeek V4 Flash. - Añadido
ox-alpha, un modelo de razonamiento sigiloso de un proveedor externo anónimo cuyo verdadero desarrollador y propietario no se han divulgado. Gratis en AIHubMix, admite entrada de texto e imagen, salida de texto y una ventana de contexto de 1.048.576 tokens para programación, ingeniería de software de largo alcance, trabajo agéntico sostenido, razonamiento complejo y flujos de trabajo con texto e imagen.
- Cuando una solicitud de generación de imágenes encuentra un error temporal del servicio, AIHubMix se recupera con más consistencia. Si el error indica claramente una limitación de capacidad del modelo elegido, sigue deteniendo los reintentos y devuelve una razón clara. Esto debería reducir fallos directos por diferencias temporales del servicio en modelos como
gpt-image-2.
2026
20 de agosto
Anuncio de la plataforma
- Lanzadas las capacidades de integración para agentes de IA: instrucciones de integración
agents.md, documentación legible por máquinasllms.txtdel sitio y por modelo, Playground Skill (distribuida en una dirección fija) y enlaces profundos al Playground (?models=abre hasta 6 pestañas de modelos con un solo enlace y?config=carga una configuración directamente). Para ver las especificaciones y los precios de dos modelos en paralelo, usa la página de comparaciónhttps://aihubmix.com/compare/{model_a}/{model_b}. Consulta la lista de entradas en Integración para agentes.
- Las solicitudes de generación de imágenes gestionan con más estabilidad parámetros de tamaño como
resolutioneimageSize. Cuando una solicitud queda fuera de las capacidades del modelo elegido, la API devuelve errores más claros para corregir parámetros con rapidez.
- Variantes relacionadas como GLM 5.2, la edición Coding y la edición Free pueden mostrarse como un modelo principal con varias versiones. Explorar modelos, comparar precios y elegir versión resulta más fácil de entender.
- Las tareas asíncronas de imagen pueden progresar con concurrencia limitada según la capacidad disponible. En horas punta, las colas deberían vaciarse de forma más fluida y la entrega de estados/resultados será más estable.
2026
19 de agosto
Nuevos modelos
- Añadido
gpt-5.6-sol-disc: la ruta de descuento por tiempo limitado de AIHubMix para GPT 5.6 Sol de OpenAI, con hasta un 50 % de descuento y las mismas capacidades subyacentes que elgpt-5.6-solestándar. Este modelo de razonamiento de frontera es adecuado para programación compleja, trabajo profesional de conocimiento, investigación profunda y agentes de larga ejecución, con entrada de texto e imagen, aproximadamente 1,05 M de tokens de contexto, hasta 128K de salida, thinking, herramientas y salidas estructuradas.
- La hora de finalización, la expiración de resultados y el archivado de artefactos son más consistentes para tareas de imagen y vídeo. Durante despliegues graduales o alta concurrencia, el estado de tareas, los resultados descargables y los registros visibles para el usuario tienen menos riesgo de retrasarse o procesarse dos veces.
- La capacidad de producción multimedia aumentó y las respuestas multimedia grandes tienen más margen, mejorando la disponibilidad de tareas largas o con artefactos grandes.
2026
18 de agosto
Los detalles del modelo están más completos
- Los detalles del modelo ahora muestran
release_date, lo que ayuda a distinguir mejor la fecha oficial de lanzamiento del momento en que AIHubMix lo publica.
- Los flujos de generación/edición de imágenes de Gemini y el recorrido multiimagen de Vertex conservan
imageSizey parámetros de imagen asociados con más consistencia, reduciendo discrepancias de tamaño o protocolo. - Las cargas de archivos de Gemini mantienen el
Content-Typeoriginal, por lo que los vídeos y otros medios tienen menos probabilidades de clasificarse mal.
- Los errores de schema, enum y capacidades dirigidos al usuario muestran mensajes más legibles, lo que facilita diagnosticar problemas de parámetros.
2026
17 de agosto
Nuevos modelos
- Añadido
glm-5.3, la API de producción de Z.AI para su modelo de razonamiento insignia solo de texto, diseñado para ingeniería de software compleja, tareas de Agent de horizonte largo y análisis de vulnerabilidades. Admite una ventana de contexto de 1 M de tokens, hasta 128K de salida y concurrencia ilimitada en AIHubMix, con un descuento por tiempo limitado del 10 %.
2026
15 de agosto
Nuevo modelo
- Añadido
mai-thinking-1: modelo de razonamiento de la serie Microsoft MAI para razonamiento empresarial, matemáticas, inteligencia general y cargas de alto rendimiento. Admite una ventana de contexto de 256K tokens, Chat Completions y salidas estructuradas, por lo que es adecuado para razonamiento de contexto largo, formatos de respuesta estables y uso continuo con control de costes.
2026
14 de agosto
Nuevos modelos
- Añadido
gemini-3.7-flash: el modelo de razonamiento nativamente multimodal de Google, orientado a programación, agentes, desarrollo web y trabajo de conocimiento. Admite entrada de texto, imagen, audio y video, ventana de contexto de 1 M de tokens, niveles de thinking ajustables, llamadas a herramientas, búsqueda web y salidas estructuradas, con una programación, uso de herramientas, planificación multipaso y seguimiento de instrucciones más sólidos que Gemini 3.6 Flash. - Añadido
coding-glm-5.3: el modelo de razonamiento de Z.AI para programación y flujos de trabajo agénticos, diseñado para ingeniería de software compleja, agentes de larga ejecución y análisis de vulnerabilidades. Utiliza el mismo modelo base que GLM-5.2 y, mediante un post-entrenamiento a mayor escala, mejora la programación, la ejecución de tareas y la eficiencia de tokens. Esta ruta es una vista previa por tiempo limitado destinada únicamente a pruebas y evaluación; no se garantiza la estabilidad del servicio y no se recomienda su uso en producción.
- Las solicitudes nativas de Gemini embedding ahora conservan el origen de servicio del
fileUridevuelto por Gemini Files API. Al usarembedContentobatchEmbedContentscon archivos subidos, se reducen los 403 por discrepancias de origen; los lotes que mezclan archivos de varios orígenes devuelven un 400 claro. - Cuando OpenRouter devuelve un error estructurado de un proveedor de modelos, el error de la API prioriza los campos internos
message,paramytype, reduciendo mensajes largos y difíciles de analizar. Los errores de un único proveedor de modelos también tienen menos probabilidad de afectar a todo el servicio OpenRouter. - El polling, el archivado terminal y el manejo de artefactos de tareas multimedia asíncronas son más fiables. Las tareas largas de imagen y video tienen menos probabilidad de procesarse dos veces, perder el estado terminal o entregarse tarde durante alta concurrencia, reinicios o artefactos grandes; los campos públicos, estados y fórmulas de facturación de la API no cambian.
2026
13 de agosto
Nuevos modelos
- Añadido
grok-4.6: el modelo insignia de razonamiento multimodal de xAI, orientado a programación, agentes de larga duración, trabajo de conocimiento y desarrollo de aplicaciones interactivas. Admite comprensión de imágenes, ventana de contexto de 500K, llamadas a herramientas y salidas estructuradas, con una ejecución multipaso, autoverificación, programación y generación de proyectos visuales más sólidas que Grok 4.5. - Añadido
deepseek-v4-pro-0813: el modelo generalista de razonamiento y agentes de alto rendimiento de DeepSeek, orientado a razonamiento complejo, programación, análisis de documentos largos y flujos de trabajo agénticos. Admite modos thinking y non-thinking, ventana de contexto de 1 M de tokens, hasta 384K de salida, llamadas a herramientas y la API Responses.
2026
12 de agosto
Nuevos modelos
- Añadidos
agnes-2.5-flash,agnes-2.5-pro,agnes-2.5-pro-alphayagnes-image-2.1-flash. Los modelos Agnes de texto e imagen ya están disponibles desde la entrada unificada de AIHubMix.
- Las tareas Gemini Veo conservan con más fiabilidad la duración real del video durante la creación, el sondeo y la lectura del resultado. Los usuarios que generen videos con una duración personalizada deberían ver mejor alineadas la duración de la tarea, la del archivo descargado y los registros posteriores de facturación o visualización.
- Al usar herramientas namespace mediante Azure Responses, las descriptions vacías o ausentes ya no hacen que Azure rechace la solicitud con 400 antes de ejecutar el modelo. Las llamadas a herramientas que ya funcionaban por la interfaz oficial de OpenAI deberían comportarse de forma más consistente en Azure.
/call/devsahora admite un campo de sitio web del proveedor, para que las páginas de agregación de modelos y proveedores puedan mostrar una entrada Official site cuando los datos estén completos. Las páginas/providers/<slug>también conservan el comportamiento de caché en el borde para respuestas más estables.
2026
11 de agosto
Gemini interactions ahora admite tareas asíncronas
- Las solicitudes de Gemini interactions ahora pueden usar explícitamente
background: truepara tareas asíncronas y luego usar el ID de tarea devuelto para consultar el estado, cancelar o limpiar la tarea. Las interacciones multimodales/omni de larga duración son más fáciles de integrar sin mantener abierta una conexión síncrona hasta que terminen. - Las tareas asíncronas se liquidan según el uso real, con columnas de tokens, liberación completa al cancelar y protecciones para respuestas grandes. Los registros de uso, la pre-deducción de saldo y los cargos finales en la consola se mantienen más coherentes.
- Cuando el protocolo Messages llama a proveedores de modelos compatibles con OpenAI, el contenido thinking/reasoning devuelto se conserva y puede reenviarse en turnos posteriores. Las apps que usan SDK de Claude, herramientas en varias rondas o el modo thinking de DeepSeek deberían ver menos respuestas vacías, errores 400 o pérdida de contexto de razonamiento.
- Los bloques thinking sin firma se gestionan de forma más compatible cuando el tráfico cambia al servicio Claude nativo, lo que reduce errores de formato en flujos de fallback multimodelo o de puente.
- Al llamar modelos de video Doubao,
prompty los recursos de referencia enextra_body.contentahora pueden funcionar juntos; las solicitudes que solo contienen recursos conservan tanto el prompt como el orden de los recursos. - Las respuestas de creación reflejan el tamaño y el prompt de forma más cercana a lo que se envía realmente, y siguen ignorando campos nativos no compatibles. Esto reduce fallos de generación de video causados por parámetros extra de SDK.
2026
10 de agosto
Uso acumulado más completo para generación multimedia
- Cuando se liquida una tarea de generación multimedia, también se actualiza el uso acumulado a nivel de cuenta. En la consola, el uso acumulado, la deducción de saldo y los registros de consumo reflejan de forma más completa el consumo real de generación multimedia.
- Al llamar modelos de Azure cuyo nombre de deployment/model contiene puntos, el nombre del modelo se conserva tal cual en las rutas de conversión de Chat, Responses y Messages, sin reescritura automática. El comportamiento de las llamadas de Azure existentes no cambia.
2026
8 de agosto
Nuevo modelo de generación de video
- Añadido
doubao-seedance-2-5-260628: modelo unificado de generación multimodal de audio y video de nueva generación de ByteDance Seed. Genera hasta 30 segundos de audio y video sincronizados en una sola pasada, admite extensiones en varias rondas y mejora la narrativa, las transiciones, el soporte de referencias, el realismo y la edición precisa para producción cinematográfica, publicidad, educación, simulación y creación de contenido de larga duración.
2026
6 de agosto
Nuevos modelos
- Añadido
wan3.0-video: modelo integral de generación y edición de video del Tongyi Lab de Alibaba, actualmente en beta pública. Admite videos nativos de hasta 30 segundos, consistencia de personajes a nivel de producción, imagen y sonido realistas, y flujos de trabajo unificados de referencia, edición, replicación y control de movimiento para publicidad, comercio electrónico, producción cinematográfica, animación, edición de video y conversión de documentos a video. - Añadido
qwen-image-3.0: modelo de generación y edición de imágenes del equipo Qwen de Alibaba Cloud, compatible con texto a imagen, creación a partir de imágenes de referencia y edición de imágenes. Equilibra calidad y velocidad para redes sociales, comercio electrónico, diseño creativo, producción de contenido cotidiana y creación a gran escala y de alta frecuencia. - Añadido
qwen-image-3.0-pro: modelo insignia de generación y edición de imágenes de Qwen (Alibaba Cloud), pensado para publicidad, identidad de marca, UI, presentaciones, imágenes de producto y diseño profesional. Destaca en composiciones complejas, renderizado preciso de texto en chino e inglés, materiales realistas, edición basada en imágenes de referencia, detalle, composición y calidad visual de nivel comercial.
2026
4 de agosto
Gemini embedding admite entrada multimodal y facturación por modalidad
gemini-embedding-2-previewahora puede procesar texto, imágenes, audio, video y documentos mediante el endpoint de embeddings compatible con OpenAI y también mediante la ruta nativa de Gemini. Los usuarios que creen búsqueda multimodal, comprensión de contenido o bases de conocimiento pueden usar más tipos de entrada en el mismo modelo.- La facturación de Gemini embedding prioriza el uso de tokens por modalidad devuelto por el proveedor de modelos. Las imágenes, el audio, el video y los documentos ya no se tratan como una única estimación de texto, por lo que las facturas multimodales reflejan mejor el uso real.
- Las solicitudes embedding de una sola entrada pueden llamar directamente a la nueva ruta de Gemini embedding. Las solicitudes batch con varias entradas ahora devuelven una respuesta clara de capacidad no compatible.
- Las referencias de Seedance 2.0 para imágenes, audio y video se asignan con mayor precisión por tipo de medio, con restricciones más claras para
adaptive, 4K y opciones de tamaño. Los flujos de generación de video sufren menos fallos por mapeos de parámetros incorrectos. - Las solicitudes de duración adaptativa se prededucen a 15 segundos y se liquidan según la duración real cuando termina la tarea, manteniendo más alineadas la prededucción de saldo y la factura final.
- Cuando falla la generación multimedia, las API devuelven detalles de error depurados, lo que ayuda a usuarios y soporte a diagnosticar problemas de parámetros, enlaces firmados o límites del proveedor de modelos sin exponer credenciales sensibles.
3 ago
Nuevos modelos- Añadido
qwen3.8-max: modelo insignia nativo de visión y lenguaje de Alibaba Cloud, basado en una arquitectura Mixture-of-Experts (MoE) de 2,4 billones de parámetros y con soporte para ventanas de contexto de hasta 1 millón de tokens. Es adecuado para comprensión multimodal compleja, razonamiento avanzado, desarrollo de software, flujos agénticos y procesamiento de contexto largo. A un precio similar al de Qwen3.7-Max, Qwen3.8-Max ofrece mejoras significativas en razonamiento, programación y capacidades agénticas, con un rendimiento global comparable al de los principales modelos actuales.
- Los detalles del modelo ahora muestran primero los proveedores mas adecuados para las solicitudes actuales, mientras que los proveedores solo de respaldo o temporalmente no disponibles aparecen mas abajo. Al elegir un proveedor o revisar la disponibilidad de un modelo, usuarios y equipos de soporte pueden identificar antes que proveedores conviene usar y evitar decisiones basadas en un orden desactualizado.
2 ago
Facturacion y registros mas precisos para solicitudes pequenas- Las solicitudes pequenas en modelos by-bill ya no desaparecen de la facturacion ni de los registros de uso cuando el importe calculado se redondeaba a cero. Las solicitudes afectadas ahora se contabilizan con la cuota minima efectiva, manteniendo alineadas las facturas, la prededuccion de saldo y los registros; los equipos de soporte y operaciones tendran trazas mas completas para trafico frecuente tipo embedding.
31 jul
Nuevos modelos- Añadido
deepseek-v4-flash: modelo Mixture-of-Experts optimizado para eficiencia, con 284B parámetros totales, 13B parámetros activos y ventana de contexto de 1M tokens. Está diseñado para inferencia rápida y cargas de trabajo de alto rendimiento manteniendo un sólido desempeño en razonamiento y programación, lo que lo hace adecuado para asistentes de código, sistemas de chat y flujos agénticos.
- Añadido
minimax-h3: modelo de video multimodal general de MiniMax. Acepta entradas de texto, imagen, audio y video, y admite texto a video, imagen a video, generacion con primer/ultimo fotograma, generacion basada en referencias y edicion de video. Los usuarios que creen flujos de video, creatividades publicitarias, demos de producto o contenido multimodal pueden llamarlo mediante la API unificada de AIHubMix.
glm-5.2tiene descuento segun la franja horaria diaria, en UTC: 50 % de descuento de 14:00 a 24:00 y 30 % de descuento de 00:00 a 14:00 cada dia. Oferta por tiempo limitado.
gpt-5.6-lunasincronizo la rebaja oficial del 80 % y ahora cuesta 1.20 de salida;gpt-5.6-terrasincronizo la rebaja oficial del 20 % y ahora cuesta 12.00 de salida. Los usuarios con trafico estable en estos modelos pueden reevaluar la seleccion de modelos para cargas sensibles al coste y usos generales.
30 jul
Servidor MCP oficial de AIHubMix disponible- Se agrego el endpoint MCP alojado oficial mcp.aihubmix.com/mcp o mcp.inferera.com/mcp para clientes compatibles con MCP. Los desarrolladores pueden usar una sola entrada desde herramientas como Claude Code, Codex y Cursor para consultar modelos y precios, buscar documentacion, revisar creditos y llamar herramientas de chat, generacion de imagenes y generacion de video.
- Las credenciales MCP se envian desde el cliente en cada solicitud y no se almacenan en el servidor, lo que lo hace adecuado para desarrolladores que quieren acceso directo a modelos y capacidades multimedia de AIHubMix dentro de IDEs o herramientas de agentes.
29 jul
Nuevo modelo- Añadido
jina-reranker-v3.5: reranker de documentos listwise multilingue de 0,6B parametros de Jina AI y actualizacion con el mismo esquema dejina-reranker-v3. Esta orientado a flujos RAG, busqueda y ranking de datos estructurados, admite ranking de candidatos con contexto largo y mejora la robustez por dominio, la recuperacion multilingue, el ranking estructurado y la eficiencia de inferencia.
28 jul
Facturacion de cache mas precisa- Para solicitudes con cache explicita o implicita, AIHubMix identifica de forma mas consistente el uso de lectura/escritura de cache y prioriza el tipo de cache devuelto por el proveedor ascendente. Los usuarios de modelos con cache, como Qwen y Claude, deberian ver detalles de facturacion mas alineados con el uso real.
- La primera lista de modelos de generacion multimedia se redujo a modelos verificados, y se corrigio un caso que podia devolver 404 en algunas llamadas de modelos de imagen mediante el endpoint multimedia. Las descargas de tareas LLM en la consola ahora tambien cubren archivos de texto, facilitando recuperar resultados historicos grandes.
- El comportamiento de cache del sitio, los datos de modelos, los datos de blog y los sitemaps se ajusto para que las publicaciones surtan efecto con mayor fiabilidad. Las paginas de modelos y entradas de documentacion tienen menos probabilidad de quedar afectadas por datos antiguos en cache tras una actualizacion.
27 jul
APIs de generacion multimedia disponibles- Se agregaron
/ai/v1/images/generationsy/ai/v1/images/edits, con tareas asincronas unificadas, consulta de resultados, descarga de artefactos y callbacks webhook. Los flujos de imagen y video pueden integrarse mediante el mismo ciclo de vida de tareas, lo que facilita el seguimiento de generaciones de larga duracion. - Los artefactos generados se devuelven mediante resultados de tareas de AIHubMix y admiten descargas limitadas y recuperacion por lote. Los equipos de atencion al cliente deben observar los primeros comentarios sobre estado de tareas, validez de enlaces de descarga y detalles de facturacion.
25 jul
Nuevos modelos- Añadido
claude-opus-5: modelo insignia de Anthropic para razonamiento exigente, programación y tareas agénticas de largo horizonte. Destaca en tareas de software de extremo a extremo, revisión de código y detección de errores, análisis visual de gráficos y documentos, entregables ofimáticos complejos y coordinación de subagentes en paralelo, con una ventana de contexto de 1M y hasta 128K de salida.
24 jul
Nuevos modelos- Añadido
mai-image-2.5-pro: modelo insignia de generación y edición de imágenes de Microsoft, con realismo de alta fidelidad, renderizado preciso de texto dentro de la imagen y potente edición para diseño comercial, fotografía de producto y flujos creativos profesionales. - Añadido
qwen-audio-3.0-tts-flash: modelo de síntesis de voz en tiempo real de Qwen, con soporte ampliado de idiomas de bajos recursos y dialectos chinos, control expresivo de la voz y latencia del primer paquete inferior a 200 ms, adecuado para asistentes de voz, diálogo en tiempo real y atención al cliente inteligente. - Añadido
qwen-audio-3.0-tts-plus: modelo premium de síntesis de voz de Qwen, con control más rico de emoción, tono, personaje, velocidad de habla, volumen y estilo, diseñado para creación de contenido, audiolibros, doblaje, voces de marca y otros flujos de voz de alta calidad.
- Ambos modelos Qwen TTS pueden llamarse mediante
/v1/audio/speech; las solicitudes no streaming devuelven una URL de resultado de audio, mientras que las solicitudes streaming devuelven eventos SSE de generacion de audio. La tabla siguiente combina los campos compatibles con AIHubMix y la documentacion oficial Qwen-Audio-TTS de Alibaba Cloud;voicedebe elegirse por modelo, y las voces de sistema plus/flash no son intercambiables.
Mejor compatibilidad de respuestas Messages
- Las respuestas de
/v1/messagesdesde modelos puenteados y servicios compatibles con Claude, como Bedrock, se alinean mejor con el ecosistema Anthropic Messages, reduciendo errores en SDK estrictos o validadores de esquema causados por campos de respuesta faltantes.
- Cuando un cliente se desconecta de una solicitud streaming de AWS Bedrock, AIHubMix sigue recopilando la senal final del proveedor de inferencia de modelos y el usage final, reduciendo diferencias entre logs de solicitud, detalles de facturacion y uso del proveedor de inferencia de modelos en escenarios de desconexion.
23 jul
Nuevos modelos- Añadido
qwen3-coder-480b-a35b-instruct: modelo insignia de Qwen3-Coder para generación de código, agentes de ingeniería de software y flujos con llamadas a herramientas, adecuado para comprensión de código de contexto largo y tareas de desarrollo automatizado. - Añadido
gemini-2.5-flash-lite: modelo Gemini 2.5 ligero para cargas frecuentes de texto, multimodales y por lotes con baja latencia y menor coste. - Añadido
Qwen/Qwen3-235B-A22B-Instruct-2507: versión Qwen3 235B-A22B Instruct 2507 para chat general, seguimiento de instrucciones, trabajo multilingüe y tareas de contexto largo.
22 jul
Nuevos modelos- Añadido
gemini-3.6-flash: el modelo Flash más reciente de Google, adecuado para flujos de trabajo complejos, uso de ordenador, razonamiento con gráficos y tareas de contexto largo. - Añadido
gemini-3.5-flash-lite: un modelo Gemini 3.5 más ligero y de menor coste, adecuado para alto rendimiento, automatización diaria y procesamiento por lotes. - Añadido
glm-5.2-fast-preview: modelo de vista previa rápida Zhipu GLM-5.2, adecuado para chat de baja latencia, razonamiento rápido y aplicaciones de alto rendimiento.
- Las llamadas en streaming a
qwen3.8-max-previewmediante/v1/responsesy/v1/messagesson más fiables. Los streams válidos que antes podían aparecer comoempty_streamo 502 ahora pueden completarse con normalidad.
21 jul
Paso directo de parametros de imagen Gemini- Al llamar modelos Gemini/Vertex con salida de imagen mediante la API Chat Completions compatible con OpenAI, los clientes ahora pueden enviar
aspectRatioeimageSizeenextra_body.generationConfig.imageConfig.
- Cuando las respuestas de Gemini embedding incluyen
usageMetadatareal, AIHubMix factura primero segun el uso de tokens devuelto por el proveedor de modelos, y conserva la estimacion local anterior como respaldo si falta ese dato.
- Las solicitudes
/v1/responsesahora pueden incluir function tools locales al mensaje en mensajes system/developer, y esas declaraciones se conservan al puentear hacia modelos Chat. Los clientes con flujos de herramientas dinamicas, como Kimi K3, tendran llamadas de herramientas mas estables.
- En llamadas
/v1/responsesque se puentean a modelos Chat,stopahora se envia al proveedor de modelos. Un stop individual puede funcionar normalmente; cantidades o longitudes por encima del limite del proveedor de modelos devuelven errores de limite consistentes con Chat Completions.
- Los modelos DeepSeek V4 pueden admitir facturacion configurada por horas pico y valle. La pre-deduccion y la facturacion final usan el mismo momento de envio de la solicitud, por lo que un streaming que cruza un limite horario se cobra por el momento de envio. La proteccion de pre-deduccion se limita a modelos con facturacion por horario y evita cambios de saldo congelado en modelos normales.
20 jul
Compatibilidad de thinking en Claude Messages- Cuando las solicitudes
/v1/messagesse puentean hacia modelos OpenAI o Azure Chat, la configuracion Claudethinkingahora se convierte en un esfuerzo de razonamiento admitido por el proveedor de modelos, reduciendo errores 400 en solicitudes con thinking. Las solicitudes Claude nativas con thinking, como Opus 4.8, siguen siendo compatibles.
- El limite de streaming del gateway de produccion paso de 1 hora a 2 horas. Las tareas de razonamiento o generacion largas, como Kimi K3, tienen menos probabilidad de cortarse durante el proceso.
19 jul
Nuevos modelos- Nuevo: qwen3.8-max-preview:
Oferta por tiempo limitado: Qwen3.8-Max-Preview se factura a solo el 10 % del precio estándar, lo que equivale a multiplicar por 10 tu uso. Tiempo limitado, por orden de llegada.
Qwen3.8-Max-Preview es el modelo fundacional de última generación de la familia Qwen, con 2,4 billones (2.4T) de parámetros y en evolución continua. En comparación con el anterior buque insignia, Qwen3.7-Max, ofrece mejoras notables en capacidades clave como Coding y Cowork (ofimática profesional), con un rendimiento líder a nivel mundial en tareas complejas de largo recorrido: desarrollo full-stack, análisis de datos y flujos de trabajo de Office.
17 jul
Nuevos modelos- Se agrego
kimi-k3: Kimi K3 es el modelo abierto de contexto largo de clase 3T de Moonshot AI, con 2,8T parametros, ventana de contexto de 1M tokens y soporte nativo para entrada visual. Es adecuado para programacion de largo horizonte, trabajo de conocimiento, razonamiento complejo y comprension multimodal. Consulte la guía práctica de Kimi K3 (ejemplos de las tres API y matriz de compatibilidad). - Se agrego
hy-3d-3.1: modelo Tencent Hunyuan 3D Professional para texto a 3D, imagen a 3D y generacion 3D multivista. Es adecuado para activos de juegos, presentaciones de ecommerce, impresion 3D y diseno de productos; la version 3.1 mejora geometria y texturas y admite entrada de ocho vistas.
- Se agrego la API asincrona
/v1/3d/generations, inicialmente conectada a Tencent TokenHub Hunyuan 3D. Permite enviar tareas y consultar resultados, facilitando integrar generacion de activos 3D en flujos automatizados.
- Las herramientas cargadas dinamicamente a nivel de mensaje en solicitudes Kimi K3 ahora se conservan y se reenvian, evitando errores 400 del proveedor de modelos por declaraciones de herramientas perdidas. Los clientes que usan dynamic tool loading de Kimi tienen mejor compatibilidad.
- Mejoro la compatibilidad para custom tools de Chat Completions, bloques de texto de Cohere y solicitudes con
assistant.content: null. Las solicitudes validas llegan de forma mas estable al proveedor de modelos; las entradas mal formadas o no admitidas devuelven errores estructurados en vez de ser reportadas como HTTP 200 vacios.
- La generacion de imagenes
doubao-seedream-5-0-proahora admite facturacion por nivel de pixeles de salida y cantidad de imagenes de entrada, de modo que las solicitudes texto-a-imagen e imagen-a-imagen se cobren mas cerca de sus especificaciones reales.
15 jul
Mejor compatibilidad de llamadas a herramientas en Gemini- Al llamar a Gemini o Vertex mediante la API compatible con OpenAI, las solicitudes cuyas definiciones de herramientas o esquemas de salida estructurada contienen valores enum de cadena vacia ya no fallan con un error 400 de validacion del proveedor de modelos. Los flujos de herramientas y JSON Schema son ahora mas fiables.
14 jul
Nuevos modelos de audio- Se agrego
gpt-audio-1.5, el primer modelo de audio de OpenAI disponible de forma general. Acepta entradas y salidas de audio y puede usarse mediante la API REST de Chat Completions, para conversaciones de voz, comprension de audio y generacion de audio. - Se agrego
gpt-4o-transcribe-diarize, un modelo ASR con diarizacion de hablantes integrada que asocia segmentos de audio con distintos hablantes en una conversacion. Este modelo solo esta disponible en la API de Transcription.
- La pagina de presentacion de LLM Router ya esta disponible y muestra las puntuaciones publicas por dimension de enrutamiento y los modelos en el pool. Ademas se agregaron dos endpoints abiertos: Alcance de modelos de la estrategia de LLM Router devuelve las puntuaciones de los modelos en 5 categorias y 23 subdimensiones, los coeficientes de precio, la latencia del primer token y los modelos en el pool, e Iconos de proveedores de modelos devuelve los nombres de visualizacion y los iconos de los proveedores de modelos; las dimensiones de generacion de imagen y video aun no se incluyen. Consulta la documentacion de LLM Router (enrutamiento inteligente de modelos) para el uso.
13 jul
Respuestas de error de API mas consistentes- Cuando
/v1/responsesse llama con un modelo desconocido, ahora devuelve HTTP 400, igual que otros puntos de entrada de la API. Asi los clientes pueden tratarlo como “sin servicio disponible” en lugar de recibir un 500.
- Si falla la conversion del cuerpo o la validacion de parametros, la API devuelve directamente el 400/error correspondiente en vez de reenviar la solicitud original al proveedor de modelos, reduciendo llamadas invalidas y fallos confusos.
- Las llamadas de Claude Code a Claude a traves de Bedrock tienen ahora aciertos de prompt cache mas estables dentro de la misma sesion, lo que ayuda a bajar el coste de escrituras duplicadas y la latencia del primer token.
- Las solicitudes Gemini solo permanecen en el mismo servicio cuando la respuesta contiene realmente firmas de pensamiento o actividad de cache. Esto reduce desajustes de firma o estado de cache en multivuelta, mientras que trabajos sin estado como generacion de imagen no quedan fijados innecesariamente.
10 de julio
Nuevos modelos- Se añadieron los tres modelos de la serie GPT-5.6:
gpt-5.6-sol,gpt-5.6-terraygpt-5.6-luna(lanzamiento oficial de OpenAI el 2026-07-09). Los tres niveles tienen ventana de contexto de 1.050.000, salida máxima de 128K y corte de conocimiento el 2026-02-16, admiten entrada de texto e imagen, y pueden llamarse mediante Chat Completions, Responses y la interfaz Messages compatible con Claude. Sol es el nivel insignia, orientado a trabajo profesional complejo, descrito oficialmente como el mejor modelo de programación actual; Terra tiene rendimiento equivalente a GPT-5.5 a mitad de precio; Luna está orientado a escenarios sensibles al costo.
- Se añadió la documentación de Caché de prompts de GPT: desde la serie GPT-5.6, la escritura en caché se factura a 1,25 veces el precio de entrada, la lectura a 0,1 veces y la caché se conserva al menos 30 minutos; cubre la descripción de los parámetros
prompt_cache_keyy puntos de corte de caché explícitos, la lógica de facturación, ejemplos de la interfaz y la resolución de fallos de acierto. El criterio de caché de OpenAI en Almacenamiento en caché de prompts y Caché de prompts de Claude se actualizó en consecuencia.
- Las solicitudes a Claude Fable y Mythos con
reasoning_effortahora usan adaptive thinking, reduciendo errores 400 del proveedor de modelos en estas familias de modelos sin cambios del lado del cliente.
- Los ajustes
stopcompatibles con OpenAI ahora se asignan a solicitudes nativas de Claude y Gemini. Los stops en blanco inválidos para Claude se filtran, y los límites de OpenAI/Gemini se aplican por proveedor.
gpt-chat-latesty futuros alias latest de GPT/ChatGPT ahora conservanmax_completion_tokenscuando es necesario, reduciendo errores 400 causados por el campo antiguomax_tokens.
- Cuando se agota el límite de uso de una Key, la API ahora devuelve una guía más clara para ajustar y reactivar el límite de la Key, en lugar de solo un error de quota de bajo nivel.
- Las respuestas chat no streaming con
tool_callsy sin texto ahora devuelven explícitamentecontent: null, mejorando la compatibilidad con SDKs y parsers estilo OpenAI.
9 de julio
Reparación de salida estructurada: corrección automática de errores de formato JSON- Se añadió la capacidad de Reparación de salida estructurada a nivel de Key, desactivada por defecto. Una vez activada, para las solicitudes no en streaming que declaran una salida JSON estructurada, cuando el JSON devuelto por el modelo presenta errores de formato como truncamiento, comas finales o envoltura en bloques de código, la pasarela lo repara automáticamente a un JSON válido y parseable antes de devolverlo, conservando los valores tal cual y sin cambios en el cliente. Compatible con los cuatro protocolos Chat Completions, Responses, Claude y Gemini; cuando se produce una reparación, la respuesta incluye la cabecera
X-JSON-Repaired: true.
- Se actualizó la documentación de Caché de prompts de Claude y Almacenamiento en caché de prompts con los umbrales mínimos de tokens almacenables en caché por modelo (512 / 1.024 / 2.048 / 4.096), añadiendo modelos actuales como Claude Opus 4.8, Opus 4.7 y Fable 5. El umbral no es proporcional a la versión del modelo; un prefijo por debajo del umbral no se almacena en caché ni siquiera con
cache_control.
- La agregacion del dashboard de uso ahora se acerca mas a los registros de liquidacion basados en logs de solicitud, al reducir perdidas por concurrencia y unificar el bucket horario usado en reprocesos diferidos. Los datos historicos del dashboard aun pueden tener pequenas diferencias; para conciliacion y liquidacion, los logs de solicitud siguen siendo la fuente de verdad.
- Se anadio
grok-4.5, un modelo para programacion, tareas agenticas y trabajo de conocimiento, con razonamiento configurable, llamadas a herramientas y ventana de contexto de 500K. Es adecuado para reparar codigo, tareas complejas de ingenieria, preguntas de conocimiento y flujos de agentes.
8 de julio
Las llamadas con tools en gpt-5.5+ se puentean automaticamente a Responses- Al usar el endpoint compatible con OpenAI
/v1/chat/completionscon gpt-5.5 o modelos posteriores, las solicitudes que incluyen tools yreasoning_effortahora usan automaticamente capacidades de Responses. Esto reduce errores 400 del proveedor de modelos para esa combinacion de parametros sin exigir que los clientes migren a/v1/responses. Consulta: Responses API
7 de julio
Compatibilidad de salida estructurada entre protocolosresponse_formatcompatible con OpenAI youtput_config.formatnativo de Claude ahora se adaptan en las rutas relevantes. Los clientes que alternan entre protocolos estilo OpenAI y Claude pueden conservar mejor las restricciones de salida estructurada. Consulta: Structured Output.
/v1/messages mas estables en Vertex AI
- Al llamar modelos Gemini u otros no Claude mediante Vertex AI, las solicitudes
/v1/messagesahora se enrutan por familia de modelo, reduciendo fallos not found o 404 provocados por rutas especificas de Claude.
6 de julio
Endpoints nativos de Gemini completados- Al usar el SDK
@google/genaimediante la entrada Gemini de AIHubMix, ahora se admiten workflows nativos de embeddings, interactions create y context caching. Estas rutas antes podian devolver errores de ruta no registrada o 404; ahora sirven para generar embeddings, hacer llamadas interactivas y crear/leer/actualizar/eliminar caches. Consulta: Integracion con SDK nativo de Gemini
- Modelos de contexto largo como
hy3-preview, ERNIE, Grok y Mimo ahora soportan facturacion por tramos segun la longitud del contexto. El calculo de tarifas es mas preciso.
- Las solicitudes streaming de Vertex AI Gemini/Claude ahora registran datos mas precisos de primer token y latencia. Los logs y el monitoreo son mas confiables; esto no cambia las respuestas del modelo.
- Se anadio
tencent-hy3, un modelo de generacion de texto (Tencent Hunyuan Hy3, version oficial). Arquitectura MoE con 295B de parametros totales / 21B de parametros activos y ventana de contexto de 256K. Soporta modos de inferencia combinados rapido y lento, adecuado para razonamiento complejo, generacion de codigo y flujos de trabajo de agentes. Codigo abierto bajo la licencia Apache 2.0.
3 de julio
Jina Search/Reader ahora admite POST y subida de archivos- Jina Search y Reader ahora admiten solicitudes POST. Reader puede recibir archivos locales mediante subida multipart, incluidos PDF, Word, Excel, PPT, HTML e imágenes. Las respuestas predeterminadas se acercan más al markdown nativo de Jina; los clientes que necesiten JSON pueden enviar explícitamente
Accept: application/json.
- Se corrigió un problema por el que las llamadas
/v1/responsespuenteadas a servicios tipo Azure no GPT podían fallar con 404 porqueapi-versionquedaba vacío, reduciendo los fallos directos de este tipo de solicitudes.
- Se corrigió un caso en el que algunos servicios de inferencia de modelos tipo vLLM / Azure Foundry podían truncar respuestas streaming de forma aleatoria. Los usuarios deberían recibir con más fiabilidad respuestas completas, señales de finalización e información de uso.
- Se anadio
command-a-plus-05-2026, un modelo de generacion de texto para chat, generacion de contenido y flujos de trabajo con agentes.
1 de julio
APIs de búsqueda Jina y lectura de páginas web disponibles- Se añadieron las capacidades Jina Search y Reader. Ahora puedes usar tu API Key de AIHubMix para obtener resultados de búsqueda de Jina y leer contenido de páginas web, ideal para búsqueda web externa, lectura de documentos y flujos de trabajo con herramientas de agentes. Consulta: Jina AI
- Veo 3.1 imagen a vídeo ahora admite entradas de fotograma inicial, fotograma final e imágenes de referencia, lo que permite controlar con más precisión las escenas de inicio/final, las referencias de personajes y las referencias de estilo en flujos avanzados de generación de vídeo. Consulta: Generación de vídeo
- Se mejoró la compatibilidad de las solicitudes Gemini durante reintentos y fallback, reduciendo ciertos errores 400 y aumentando la tasa de éxito de las llamadas de respaldo. Consulta: Guías de Gemini
- Las respuestas no streaming y streaming compatibles con OpenAI ahora conservan valores
nullen campos comologprobs,refusalyfinish_reason, reduciendo diferencias para SDK, agentes y analizadores de logs que esperan la estructura estándar de OpenAI.
- Se mejoró la compatibilidad de las solicitudes cuando Claude Code llama a modelos Claude a través de AIHubMix, reduciendo la información del entorno del cliente incluida en las solicitudes enviadas al proveedor de modelos y mejorando la protección de privacidad para clientes Agent de terceros.
- El sistema de cuentas propio cubre inicio de sesión/registro con código por correo, configuración de contraseña, edición de perfil, vinculación/desvinculación de cuentas de terceros y eliminación de cuenta, con mejor aislamiento del propósito de OTP y bloqueo de cuentas deshabilitadas. Los callbacks de recarga con Stripe también se gestionan de forma más fiable.
- claude-sonnet-5 para chat, razonamiento y flujos con agentes.
- gemma-4-31b y longcat-2.0 para generación de texto.
- gemini-3.1-flash-lite-image para flujos con capacidades de imagen.
- mai-image-2.5 y mai-image-2.5-flash para generación de imágenes.
29 de junio
Mejoras en facturación y compatibilidad de parámetros de generación de imágenes- La facturación de
gpt-image-2en los endpoints Images ahora se unifica por tokens. La generación de imágenes GLM transmite parámetros extendidos comowatermark_enabledyquality, para que los ajustes de marca de agua y calidad se apliquen cuando el proveedor de modelos los soporte. Consulta: Generación de imágenes
- Los fallos en la subida de archivos Gemini ya no crean logs normales visibles para el usuario, reduciendo ruido de endpoints que no son de inferencia en la página de logs, mientras se conservan los logs internos de diagnóstico.
27 de junio
Nuevos modelos Deep Research- Se añadieron o4-mini-deep-research y o3-deep-research, disponibles solo mediante el endpoint
/v1/responses. Las solicitudes deben incluirweb_search_previewomcptools, por lo que son adecuados para investigación web profunda y respuestas de tipo research.
25 de junio
El protocolo Responses admite cualquier modelo- El endpoint
/v1/responsesya no se limita a la serie GPT y ahora puede invocar cualquier modelo de la plataforma. Gracias a ello, las herramientas basadas en el protocolo Responses (como Codex CLI) pueden usar modelos como GLM, Gemini, DeepSeek, Kimi o Qwen a través de un catálogo de modelos local, sin limitarse a los modelos propios de OpenAI.
- Se corrigió un problema por el que
step-3.7-flashpodía devolver contenido en blanco o una respuesta vacía a través de/v1/responses; el contenido de razonamiento y las respuestas finales ahora se devuelven correctamente.
- Se ha añadido un nuevo tutorial «Usar modelos personalizados en Codex» a la documentación de Codex CLI: declara cualquier modelo de AIHubMix (GLM, Gemini, DeepSeek, Kimi, Qwen, etc.) mediante un catálogo de modelos local (
model_catalog_json) y cámbialo libremente desde la lista/modelde Codex, sin limitarte a los modelos propios de OpenAI. Incluye un script de un solo comando para generar un catálogo con los 30 modelos principales y notas sobre los errores más comunes. Más información: Codex CLI · Usar modelos personalizados en Codex
24 de junio
Ahora se admite un dominio de respaldo- Se agregó el dominio de respaldo
https://api.inferera.com, con endpoints y capacidades idénticos al dominio principalhttps://aihubmix.com. Cuando el dominio principal no esté disponible (por ejemplo, fallos de conexión o tiempos de espera), reemplaza la URL de la solicitud por el dominio de respaldo; la API Key, el modelo, el cuerpo de la solicitud y los demás parámetros se mantienen igual.
23 de junio
Nuevos modelos- Doubao doubao-seed-2-1-pro, doubao-seed-2-1-turbo.
- Serie de vídeo HappyHorse happyhorse-1.1-t2v (texto a vídeo), happyhorse-1.1-r2v (generación por referencia), happyhorse-1.1-i2v (imagen a vídeo).
- El checkout de Stripe ahora prerrellena el correo de la cuenta y reduce la recopilación innecesaria de nombre y dirección de facturación, haciendo más fluida la recarga con métodos como Alipay.
- Cuando el saldo de la cuenta sea inferior a -$1, no se podrán seguir usando modelos gratuitos hasta recargar la cuenta.
22 de junio
Nueva documentación de AIHubMix CLI (herramienta de línea de comandos)- Nueva documentación de AIHubMix CLI: un único binario sin dependencias (no requiere Python / Node / Go) para consultar el saldo de la cuenta, gestionar claves API y ver los modelos disponibles directamente en el terminal, con salida amigable para scripts y agentes de IA (como Claude Code).
- Establece
modelenautoy la pasarela analiza tu solicitud para elegir el mejor modelo entre cientos, con políticas de coste / calidad / latencia, facturado según el modelo realmente usado, sin cambios en el código del cliente. Consulta: LLM Router (enrutamiento inteligente de modelos)
- Se corrigió un problema por el que la tasa de acierto de caché de
deepseek-v4-proydeepseek-v4-flashera inferior a lo esperado.
- Aporta capacidades de extensión local a agentes de IA compatibles con Skills (Codex, Claude Code, Cursor, Cline, etc.): integra AIHubMix, consulta modelos, elige según capacidad, genera ejemplos y resuelve errores usando lenguaje natural. La Skill lee bajo demanda información en tiempo real (modelos, precios, contratos de protocolo, etc.) desde las interfaces oficiales, evitando que el agente dependa de memoria desactualizada. Más información: Skills
17 de junio
Nuevos modelos de vídeo Kling (可灵)- Integración de todas las capacidades de generación de vídeo de Kling: texto a vídeo, imagen a vídeo, referencia con múltiples imágenes y generación multimodal omni, invocadas mediante el protocolo nativo según el nombre del modelo.
16 de junio
Problema del plugin de integración de OpenClaw corregido- El plugin de integración de OpenClaw de AIHubMix aihubmix-auth ha corregido sus problemas de integración anteriores y ahora es estable. Simplemente instálalo e introduce una clave AIHubMix para llamar simultáneamente a los modelos OpenAI / Anthropic / Gemini en OpenClaw.
- Zhipu glm-5.2.
15 de junio
Nuevo soporte de integración con Open Design- AIHubMix ya es un gateway BYOK con soporte integrado en Open Design (la alternativa de código abierto y local-first a Claude Design). En su modo API (BYOK) selecciona AIHubMix, introduce una Key y podrás impulsar a la vez la generación de chat / imágenes / vídeo / voz, enrutando según el nombre del modelo por el protocolo nativo de cada proveedor. Más información: Tutorial de integración con Open Design
- El modelo
glm-5.2del servicio nativo de Zhipu admite el ajuste de la profundidad de razonamiento por niveles mediantereasoning_effort; las versiones anteriores se seleccionan automáticamente según su versión, sin que el cliente tenga que hacer cambios.
- kimi-k2.7-code-highspeed (versión de alta velocidad de código de Kimi).
13 de junio
Nuevos modelos- coding-glm-5.2 y su versión gratuita coding-glm-5.2-free.
12 de junio
Mapeo de modelos y fallback ante errores- Nuevo: Model Mapping y Fallback ante errores: Configura el mapeo de nombres de modelo y el fallback ante errores por API Key en la consola: reescribe el alias de modelo del cliente al nombre real del modelo, cambia automáticamente a un modelo de respaldo cuando el modelo principal falla y factura según el modelo que finalmente responde, sin cambios en el código del cliente. Consulta: Model Mapping y Fallback
- kimi-k2.7-code.
11 de junio
step-3.7-flash con un 90 % de descuento por tiempo limitado- Oferta por tiempo limitado de step-3.7-flash con un 90 % de descuento: solo 0,022 USD por millón de tokens de entrada y 0,132 USD por millón de tokens de salida. ¡Te invitamos a probarlo!
claude-opus-4-20250514yclaude-sonnet-4-20250514serán retirados oficialmente el 15 de junio; llegado ese momento, la plataforma enrutará automáticamente los modelos retirados a la versión 4-5 de la misma serie.
10 de junio
Nuevos modelos- claude-fable-5 [Retirado].
- Fable 5 tiene barreras de seguridad más estrictas, por lo que algunas solicitudes normales también pueden bloquearse: aplica clasificaciones adicionales en áreas como ciberseguridad, biología / química, destilación de modelos y extracción de razonamiento. Algunas investigaciones técnicas, análisis de vulnerabilidades o preguntas biomédicas pueden rechazarse o redirigirse a Opus 4.8.
- Mythos 5 tiene acceso restringido y no es un modelo abierto al público general: Mythos 5 y Fable 5 comparten la misma fuente de capacidades, pero Mythos 5 usa menos clasificadores de seguridad. Actualmente solo está disponible para Project Glasswing / clientes aprobados; la mayoría de usuarios usará Fable 5 con protecciones.
- Coste de API más alto: Fable 5 cuesta 10 USD por millón de tokens de entrada y 50 USD por millón de tokens de salida, aproximadamente el doble que Opus 4.8.
- Privacidad: Fable 5 / Mythos 5 se clasifican como Covered Models, requieren por defecto al menos 30 días de retención de datos y no admiten Zero Data Retention.
- Comportamiento de rechazo en la API: cuando Fable 5 rechaza una solicitud, la API devuelve HTTP 200, pero
stop_reasonesrefusal.
8 de junio
La interfaz compatible con Gemini admite entrada de audio- Al llamar a Gemini a través de la interfaz compatible con OpenAI (
/v1/chat/completions), ahora se admite la entrada de audioinput_audio(que antes se descartaba silenciosamente), y se incluye el cómputo deaudio_tokensen el campo usage de la respuesta.
5 de junio
Nuevos modelos- grok-build-0.1, hy3-preview y el modelo gratuito step-3.7-flash-free.
4 de junio
Nuevos modelos- Tongyi Qianwen qwen3.7-plus.
1 de junio
Nuevos modelos- MiniMax minimax-m3.
- Baidu musesteamer-air-image (generación de imágenes).
29 de marzo
Página de detalle de registros- Latencia: Indica con qué rapidez se inicia una solicitud (tiempo desde el inicio de la solicitud hasta el primer token devuelto)
- Rendimiento (Throughput): Proporciona una medida clara de la velocidad de salida del modelo
- Latencia E2E: El tiempo total desde el envío hasta la finalización de la solicitud, utilizado para evaluar el rendimiento global de la solicitud
- Proveedor: Identifica al proveedor del modelo que gestionó la solicitud
- Estado: Muestra el resultado de la ejecución (p. ej., éxito / fallo) para detectar anomalías rápidamente
- TID: Un identificador único de la solicitud que puedes compartir con soporte para resolver problemas más rápido
23 de marzo
- La red de aceleración global de AIHubMix ya está disponible: construida sobre nodos perimetrales globales autogestionados y un sistema de enrutamiento inteligente, con monitorización continua y optimización dinámica, logrando un 75 % menos de latencia, un 60 % de mejora en la estabilidad y una disponibilidad del 99,99 %, ofreciendo una experiencia de IA más rápida y fiable.
- Añadida la monitorización de salud en tiempo real 24/7: sondas distribuidas escanean toda la red cada minuto, rastreando la latencia, la tasa de éxito y la estabilidad. Los problemas se detectan y resuelven antes de que los usuarios lo noten, garantizando un rendimiento constante.
- Enrutamiento inteligente del tráfico mejorado: la salud de los nodos se evalúa dinámicamente en múltiples ventanas de tiempo, permitiendo el cambio en milisegundos a la ruta óptima, reduciendo significativamente las fluctuaciones y los timeouts a la vez que mejora las tasas globales de éxito de las solicitudes.
8 de febrero
- Nueva función: compatibilidad Chat → Responses
Esta versión introduce la compatibilidad Chat → Responses, permitiendo que la API Chat Completions invoque modelos de OpenAI que solo admiten el protocolo Responses, incluidos gpt-5.2-codex, gpt-5.1-codex-max y gpt-5.2-pro. Si quieres forzar que la Chat API de AIHubmix enrute las solicitudes a través del protocolo Responses, añade la siguiente cabecera a tu solicitud:X-Use-Responses-Enabled: trueCuando un modelo admite tanto Chat como Responses, configurar esta cabecera forzará el uso de la Responses API.
Ten en cuenta que el protocolo Responses actualmente no admite entrada ni salida de audio, así que planifica el uso en consecuencia. - Aviso de obsolescencia de modelo:
OpenAI dejará de admitirchatgpt-4o-latestel 17 de febrero de 2026. Tras su retirada, redirigiremos automáticamentechatgpt-4o-latestagpt-4o-2024-11-20.
2025
15 de diciembre
- Nueva función: la API de Google ahora admite Files API.
22 de septiembre
- Añadido soporte para la serie Qwen, Doubao Seedream 4 y los modelos de generación de imágenes de Baidu
10 de agosto
- Lanzado el MCP de generación de imágenes de Aihubmix, facilitando a los desarrolladores la integración de servicios de generación de imágenes
1 de agosto
- Usa cualquier modelo de lenguaje grande de la plataforma AiHubMix directamente en Claude Code
29 de julio
- Añadido soporte para el AI SDK: accede a un gran número de modelos con una sola clave API
26 de julio
- Añadido soporte para la API de generación de imágenes Flux, que permite imágenes de alta calidad en segundos
23 de julio
- Añadido soporte para Qwen Code, aprovechando todos los modelos de lenguaje grandes disponibles en la plataforma Aihubmix
4 de julio
- Añadido soporte para llms.txt: obtén navegación estandarizada por modelos con un clic para que tu asistente LLM pueda entender rápidamente todo el ecosistema de modelos
29 de junio
- Añadido soporte de reenvío para Gemini CLI, con varios modos de uso flexibles
- Añadidos el code interpreter y la invocación de MCP remoto en la API Responses de OpenAI
26 de junio
- Añadida una API unificada de generación de imágenes que admite los principales modelos, incluidos OpenAI, Ideogram, Stability y Google Imagen
23 de junio
- Lanzado APP-Code, que ofrece a los desarrolladores un descuento del 10 % en todos los modelos
18 de junio
- Añadida la documentación de Códigos de estado HTTP para ayudar a los usuarios a entender mejor los mensajes de error
13 de junio
- Añadido soporte para la generación de vídeo Veo 3.0 para ampliar los formatos creativos
9 de junio
- Añadido soporte para los resúmenes de razonamiento de OpenAI en la Responses API
5 de junio
- Añadida caché implícita para Gemini, con aciertos automáticos y feedback de acierto
Los desarrolladores pueden usarusage_metadatapara determinar los aciertos de caché
No se garantizan ahorros de costos y dependen de la estructura de la solicitud y de los escenarios de uso
31 de mayo
Soporte completo para las nuevas funciones de Claude 4- ⏳ Nuevo TTL de caché: soporte de caché de 1 hora Beta
- 🎉 Nuevas herramientas de edición de texto: Claude 4 ahora admite
text_editor_20250429ystr_replace_based_edit_tool - 🚫 Nuevo motivo de detención por rechazo para rechazos por seguridad
- 🧠 Extended Thinking: Claude 4 ahora devuelve resúmenes completos de su proceso de razonamiento
- 🔄 Interleaved Thinking: el uso de herramientas ahora puede intercalarse con el razonamiento extendido para conversaciones más naturales (Beta)
- ⚠️ Funciones obsoletas:
undo_editya no se admitetoken-efficient-tools-2025-02-19eliminado (solo Claude 3.7)output-128k-2025-02-19eliminado (solo Claude 3.7)
- 📚 Las guías completas de migración y los ejemplos de código se han actualizado para ayudar a los usuarios a hacer una transición fluida de Claude 3.7 a Claude 4
22 de mayo
- Añadido soporte para el plugin de Dify, permitiendo la integración fluida de los modelos de Aihubmix en Dify
Amplía y gestiona más de 200 modelos con una sola clave API
17 de mayo
- Añadido soporte para
codex-mini-latest, optimizado para tareas de programación, accesible a través de la Responses API o de Codex CLI - Añadido soporte para la generación de imágenes Google Imagen 3.0 y la generación de vídeo Veo 2.0
gemini-2.0-flash-expactualizado a la versión preview oficialgemini-2.0-flash-preview-image-generation
9 de mayo
- Añadida la API de Ideogram AI V3: el modelo más avanzado de generación de imágenes de Ideogram
6 de mayo
- Añadidos scripts de utilidades de gestión para gestionar claves API, ver cuentas y listar los modelos disponibles desde la CLI
26 de abril
- La esperada API de generación de imágenes de OpenAI
gpt-image-1ya está disponible, con soporte de texto a imagen e imagen a imagen - Añadido soporte nativo para la API de Gemini con control preciso del presupuesto de razonamiento para Flash 2.5
24 de abril
- Integradas tres APIs principales de Jina AI para ayudar a construir agentes potentes: Embeddings, Rerank y DeepSearch
20 de abril
- Añadido soporte para el endpoint de la API Responses de OpenAI con capacidades de herramientas ampliadas
17 de abril
- Añadido soporte para la CLI de OpenAI CodeX: programa con lenguaje natural directamente desde la terminal
12 de abril
- Añadiendo
:surfingal ID de un modelo, cualquier modelo puede adquirir capacidades de búsqueda (Beta)
9 de abril
- Añadida la caché de prompts de Claude, ahorrando hasta un 76 % en costos para prompts repetidos de alta frecuencia
7 de abril
- Añadido soporte para la generación de imágenes de Ideogram AI con sólido renderizado de texto, generación híbrida, edición local y upscaling
5 de abril
- Lanzada una experiencia de documentación totalmente renovada
30 de marzo
- Añadido soporte para la herramienta Claude Text Edit Tool
24 de marzo
- Lanzado el nuevo logotipo del Tridente
16 de marzo
- Añadido soporte de búsqueda nativa para los modelos OpenAI y Google Gemini
- La integración de búsqueda de terceros se añadirá en futuras actualizaciones
15 de marzo
- Modelos añadidos:
gpt-4o-mini-search-previewygpt-4o-search-preview
7 de marzo
- Los precios de o1 y o3-mini se han reducido un 10 %, en línea con los precios oficiales
6 de marzo
- Debido a un aumento de precios de 7× por parte de Microsoft, el precio de
aihubmix-DeepSeek-R1también aumentó 7×
Alternativa recomendada: DeepSeek-R1 de Volcano Engine (más estable y rentable)
Modelos añadidos:qwen-qwq-32byqwen2.5-vl-72b-instruct
28 de febrero
- Todos los modelos Claude han recibido una reducción de precio del 15 %
- Modelo añadido
gpt-4.5-preview(extremadamente caro; úsalo con precaución)
26 de febrero
- Mejora de la estabilidad de DeepSeek
- Las versiones de ByteDance de DeepSeek son actualmente las más estables
Modelos recomendados:DeepSeek-R1yDeepSeek-V3
25 de febrero
- Modelo añadido:
claude-3-7-sonnet-20250219
24 de febrero
- El modelo gpt-4o puede responder ocasionalmente muy lento debido a problemas del proveedor de modelos
Se recomienda cambiar temporalmente agpt-4o-2024-11-20 - La API de Perplexity está temporalmente fuera de línea
Debido al modelo de facturación complejo de Perplexity y a sus costos más altos que la estructura de precios de esta plataforma, el servicio se relanzará tras los ajustes de precios - El descuento oficial temporal de ByteDance ha finalizado y los precios han vuelto a la normalidad
El precio deDeepSeek-R1se ha incrementado en consecuencia - Añadida una nueva página de detalles del modelo con información completa de parámetros
23 de febrero
- El descuento oficial temporal de ByteDance ha finalizado y los precios han vuelto a la normalidad
El precio deDeepSeek-V3se ha incrementado
También se espera que el modelo R1 de ByteDance vuelva pronto a los precios normales, y esta plataforma ajustará los precios en consecuencia
18 de febrero
- Modelo añadido:
kimi-latest
(La facturación oficial se escalona por longitud de entrada en 8k, 32k y 128k.
Esta plataforma no admite precios escalonados y utiliza la franja intermedia de 32k como estándar de precio.
Si eres sensible al precio, úsalo con precaución.) - Optimización general del diseño del sitio web
- Fusionada la página de Registro de cambios en la página de Estadísticas de uso
- Movidos los anuncios a la página del Marketplace de modelos
- Movidos los ajustes al menú del avatar del usuario
- Reducido el precio de
aihubmix-DeepSeek-R1un 50 % - Modelos añadidos:
gemini-2.0-pro-exp-02-05-search,gemini-2.0-flash-exp-search
(Integrados con la búsqueda en línea oficial de Google) - Modelos añadidos:
gemini-2.0-flash,gemini-2.0-pro-exp-02-05,gemini-2.0-flash-lite-preview-02-05 - Modelos añadidos:
o3-mini,o1
(Estos dos modelos se facturan aproximadamente un 10 % por encima del precio oficial debido a los recursos limitados de la cuenta)
4 de febrero
- El modelo
o1no admite el parámetrostreamen la API oficial de OpenAI - El modelo
o3-minino admite el parámetrotemperature
Está disponible un nuevo parámetroreasoning_effortcon los valores:"low","medium","high"
El valor predeterminado es"medium"si no se especifica
1 de febrero
Actualización de funciones:- Añadido soporte para entrada y salida de audio del modelo de OpenAI
El servidor de previsualizaciónapi.aihubmix.comya está disponible
Tras una semana de funcionamiento estable, se actualizará el sitio principal
La facturación de backend es totalmente coherente con los precios oficiales
Actualmente, los registros de uso solo muestran el uso de tokens de texto
El uso de tokens de audio aún no se muestra en los registros, pero no afecta al uso normal
o3-mini,o1
(Facturados aproximadamente un 10 % por encima del precio oficial debido a la disponibilidad limitada de cuentas)aihubmix-DeepSeek-R1(recomendado, altamente estable)qwen-max-0125(Qwen2.5-Max),sonar-reasoningdeepseek-ai/DeepSeek-R1-Zero,deepseek-ai/DeepSeek-R1,deepseek-r1-distill-llama-70baihub-Phi-4Doubao-1.5-pro-256k,Doubao-1.5-pro-32k,Doubao-1.5-lite-32k,Doubao-1.5-vision-pro-32ksonar,sonar-pro(lo último de Perplexity AI)gemini-2.0-flash-thinking-exp-01-21deepseek-reasoner(alias de DeepSeek-R1)MiniMax-Text-01codestral-latest(el nuevo modelo de código de Mistral, Codestral 25.01)
23 de enero
Nuevos modelos añadidos:aihub-Phi-4Doubao-1.5-pro-256k,Doubao-1.5-pro-32k,Doubao-1.5-lite-32k,Doubao-1.5-vision-pro-32ksonar,sonar-pro(lo último de Perplexity AI)gemini-2.0-flash-thinking-exp-01-21deepseek-reasoner(alias de DeepSeek-R1)
19 de enero
- Añadidos los modelos de la API de Perplexity AI
Actualmente solo se admiten en el servidor de previsualizaciónapi.aihubmix.com
Tras pruebas estables, se desplegará en el servidor principalaihubmix.com api.aihubmix.comes el servidor de previsualización
Las nuevas funciones se desplegarán allí primero y se promocionarán al servidor principal tras aproximadamente 1 semana de pruebas de estabilidad
MiniMax-Text-01codestral-latest(Mistral Codestral 25.01)
6 de enero
- Añadido
gemini-2.0-flash-exp-search, con soporte para la búsqueda en línea nativa de Google
El modelo oficial Gemini 2.0 Flash requiere parámetros adicionales para la búsqueda en línea
Aihubmix ha integrado esta funcionalidad: basta con añadirsearchal nombre del modelo - Modelo añadido:
deepseek-ai/DeepSeek-V3
1 de enero
- Lanzada la nueva página del Marketplace de modelos para reemplazar la antigua página de Modelos y Precios
2024
30 de diciembre
- Corregido el problema por el que
gemini-2.0-flash-thinking-exp-1219solo devolvía el razonamiento sin respuestas finales - Corregido el problema de no entrega de correos de recordatorio de saldo
22 de diciembre
- Añadida la página de Estadísticas de uso
- Añadida la página de Historial de recargas
- Añadidos modelos de la serie Doubao:
Doubao-lite-128k,Doubao-lite-32k,Doubao-lite-4k,Doubao-pro-128k,Doubao-pro-256k,Doubao-pro-32k,Doubao-pro-4k - Modelo añadido:
gemini-2.0-flash-thinking-exp-1219 - Modelos añadidos:
gemini-2.0-flash-exp,aihubmix-Mistral-Large-2411,aihubmix-Llama-3-3-70B-Instruct,grok-2-1212,grok-2-vision-1212 - Modelos añadidos:
gemini-exp-1206,llama-3.3-70b-versatile,learnlm-1.5-pro-experimental
14 de diciembre
- Modelos añadidos:
gemini-2.0-flash-exp,aihubmix-Mistral-Large-2411,aihubmix-Llama-3-3-70B-Instruct
8 de diciembre
- Modelos añadidos:
gemini-exp-1206,llama-3.3-70b-versatile,learnlm-1.5-pro-experimental - Añadida la página de Estadísticas de uso
21 de noviembre
- Modelos añadidos recientemente:
gpt-4o-2024-11-20,step-2-16k,grok-vision-beta - Modelo Qwen 2.5 Turbo de un millón de tokens de contexto:
qwen-turbo-2024-11-01
7 de noviembre
- Añadida compatibilidad con el SDK nativo de Claude
El endpointv1/messagesya está activo - La caché de prompts nativa de Claude y las funciones de uso del ordenador aún no se admiten
Estas se completarán en las próximas dos semanas
5 de noviembre
- Modelo añadido:
claude-3-5-haiku-20241022 - Añadido el último modelo de xAI de Elon Musk:
grok-beta
23 de octubre
- Modelo añadido:
claude-3-5-sonnet-20241022
10 de octubre
- La última función de caché de OpenAI ya está disponible
Modelos actualmente admitidos:- GPT-4o
- GPT-4o-mini
- o1-preview
- o1-mini
- Nota:
gpt-4o-2024-05-13no está incluido en la lista oficial admitida - Los tokens con acierto de caché serán visibles en los registros del backend cuando una solicitud acierte en la caché
- Para más detalles y reglas de uso, consulta la documentación oficial de OpenAI
3 de octubre
- La facturación de backend para
gpt-4ose ha reducido para coincidir con el precio oficial - Modelos añadidos:
aihubmix-Llama-3-2-90B-Vision,aihubmix-Llama-3-70B-Instruct - Añadidos los últimos modelos de Cohere:
aihubmix-command-r-08-2024,aihubmix-command-r-plus-08-2024
19 de septiembre
- Modelos añadidos:
whisper-large-v3ydistil-whisper-large-v3-en - Nota: La facturación de los modelos Whisper se basa en los segundos de entrada
La visualización de precios actual en el sitio es incorrecta y se corregirá
La facturación de backend parawhisper-1coincide totalmente con los precios oficiales de OpenAI
13 de septiembre
- Modelos añadidos:
o1-miniyo1-preview
Nota: Estos modelos requieren parámetros actualizados
Algunas shells de cliente pueden lanzar errores si no se actualizan los valores predeterminados
o1 NO admite:
- campo
system→ error 400 - campo
tools→ error 400 - entrada de imagen → error 400
- salida
json_object→ error 500 - salida
structured→ error 400 - salida
logprobs→ error 403 - salida
stream→ error 400
- Serie o1: 20 RPM, 150.000.000 TPM, extremadamente bajos, posibles errores 429 frecuentes
temperature,top_pynestán fijados en 1presence_penaltyyfrequency_penaltyestán fijados en 0
10 de septiembre
- Modelo añadido:
mattshumer/Reflection-Llama-3.1-70B
(Se ha informado que es una de las versiones ajustadas más potentes de LLaMA 3.1 70B) - Los precios del modelo Claude-3 han aumentado
Para garantizar un suministro estable, las llamadas a través de esta plataforma son actualmente ~10 % más caras que el uso oficial directo - Aumentada la capacidad de concurrencia para los modelos OpenAI
El sistema ahora admite teóricamente una concurrencia casi ilimitada
11 de agosto
- Modelos añadidos:
Phi3medium128k,ahm-Phi-3-medium-4k,ahm-Phi-3-small-128k - Mejora de la estabilidad para modelos relacionados con LLaMA
- Optimizada aún más la compatibilidad para los modelos Claude
7 de agosto
- Añadido el nuevo
gpt-4o-2024-08-06lanzado por OpenAI
Consulta: https://platform.openai.com/docs/guides/structured-outputs - Añadido el último modelo de Google:
gemini-1.5-pro-exp-0801
4 de agosto
- Añadido pago directo en línea para recargas de cuenta
- Corregido el error de formato de conversación multiturno de Claude:
messages: roles must alternate between "user" and "assistant", but found multiple "user" roles in a row - Optimizado el manejo de índices al usar function calling con modelos Claude
- El servidor de respaldo
https://orisound.cnquedará totalmente fuera de servicio el 7 de septiembre
Migra al servidor principalhttps://aihubmix.como al servidor de respaldohttps://api.aihubmix.com
27 de julio
- Añadido soporte para Mistral Large 2
Nombre del modelo:Mistral-large-2407oaihubmix-Mistral-large-2407 - Optimizaciones del sistema
24 de julio
- Añadidos los modelos más recientes de LLaMA 3.1:
llama-3.1-405b-instruct,llama-3.1-70b-versatile,llama-3.1-8b-instant
20 de julio
- Corregidos problemas de cálculo de precios para el modelo
gpt-4o-mini- Precio de entrada de texto: 1/33 del de GPT-4o oficial
- Precio de entrada de imagen: igual al de GPT-4o
- Para alinearse con los precios oficiales, los recuentos de tokens de imagen para
gpt-4o-minise multiplican por 33 durante la facturación - Consulta los precios oficiales de OpenAI para más detalles
19 de julio
- Añadido soporte para el modelo
gpt-4o-mini
La facturación de backend está totalmente alineada con los precios oficiales
15 de julio
- Añadido soporte para el parámetro oficial
include_usagede la API
Esto permite devolver datos de uso en modo stream
Consulta la documentación oficial para más detalles
14 de julio
- La nueva versión de NextWeb ahora admite llamar a modelos que no son de OpenAI a través de esta plataforma
- Añadido soporte de facturación de backend para los modelos Qwen de Alibaba
Las llamadas a través de esta plataforma cuestan ~10 % más que el uso directo de Alibaba Cloud - Mejorada la compatibilidad de salida de Azure OpenAI con la API estándar de OpenAI
- Añadido soporte de tool calling para Claude-3
- Añadidos muchos modelos nuevos (consulta Settings → Available Models)
3 de julio
- Optimización general de la UI del backend
- Cada entrada del registro ahora muestra el precio unitario del modelo en el momento de la solicitud
- Añadida la página de Modelos y Precios
20 de junio
- El nuevo
claude-3-5-sonnet-20240620ya es compatible
Consulta la guía para llamar a modelos que no son de OpenAI en esta plataforma
18 de junio
- Los registros del backend ahora admiten la descarga de registros históricos de solicitudes
16 de junio
- La probabilidad de enrutar aleatoriamente solicitudes a Azure OpenAI se ha reducido significativamente
13 de junio
- Reducidos los costos de backend para los modelos Claude-3
(Claude 3 Haiku,Claude 3 Sonnet,Claude 3 Opus)
La facturación de backend ahora coincide con los precios oficiales
Como resultado, el costo efectivo de la API minorista en este sitio equivale a ~86 % del precio oficial
10 de junio
- Optimizada la facturación de tokens de GPT-4o
El tokenizador se ha cambiado decl100k_baseao200k_base
Como resultado, los recuentos de tokens en streaming para chino, coreano y japonés son menores que antes
8 de junio
- Añadidos los últimos modelos open source Qinwen 2 de Alibaba:
alibaba/Qwen2-7B-Instructalibaba/Qwen2-57B-A14B-Instructalibaba/Qwen2-72B-Instruct
20 de mayo
- Modelo añadido:
gemini-1.5-flash - Modelo añadido:
gpt-4o - Modelos añadidos:
llama3-70b-8192,llama3-8b-8192,gemini-1.5-pro,command-r,command-r-plus - El suministro del modelo Claude-3 se ha restaurado
Los endpoints están desplegados actualmente en AWS y Google Cloud - Para cubrir los costos de infraestructura y operativos, la facturación de backend de Claude-3 es ~10 % superior al precio oficial
Con el aumento de uso, esto se reducirá gradualmente a ~5 % o menos - Los límites de concurrencia están actualmente en pruebas y se incrementarán a medida que aumente la demanda
Última actualización: 2026-06-22