Skip to main content
Para una integración nueva, usa Generación de vídeo con el protocolo unificado /ai/v1/videos. La interfaz compatible /v1/videos sigue disponible. Consulta la API Schema del modelo, selecciona el endpoint por path y lee su request.schema sin depender del orden del array.

Inventario actual de modelos

Este inventario indica los modelos disponibles actualmente. No significa que todos acepten los mismos campos. Selecciona el endpoint por path en el Schema del modelo y lee su request.schema.

API

Descripción detallada de la API

Cabeceras de la petición

Crear tarea de generación de vídeo

Cuerpo de la petición

El formato de respuesta varía ligeramente según el modelo, pero todos incluyen los campos id (video_id) y status. Basta con usar status para evaluar el progreso de la tarea.

Ejemplo de respuesta (Tongyi Wanxiang / Veo / Jimeng)

Ejemplo de respuesta (Sora)

Descripción de los valores de estado generales

Consultar el estado del vídeo

Sondea esta interfaz para comprobar si la tarea ha terminado. Se recomienda consultar cada 15 segundos.

Ejemplo de respuesta (generación completada - Tongyi Wanxiang)

Ejemplo de respuesta (generación completada - Sora)

Todos los modelos evalúan el estado de finalización mediante status == "completed" y luego llaman a la interfaz /content para descargar.

Descargar el contenido del vídeo

Cuando el estado sea completed, llama a esta interfaz para descargar el archivo de vídeo MP4. Respuesta: devuelve directamente el flujo binario del vídeo (Content-Type: video/mp4).
Nota: el enlace de descarga del vídeo suele tener una validez de 24 horas; descárgalo y guárdalo a tiempo.

Eliminar tarea de vídeo

Esta interfaz se usa para eliminar una tarea de vídeo ya creada.

Detalle de los parámetros de cada modelo

OpenAI Sora

Sugerencia: el parámetro seconds de todos los modelos se pasa siempre como tipo string (como "8").
Ejemplo

Google Veo

Ejemplo
Notas sobre los campos de imagen:
  • Precedencia del primer fotograma: first_frame > input_reference (fotograma único compatible con OpenAI).
  • Cada elemento de first_frame / last_frame / reference_images acepta: una URL pública, un data URL en base64 (data:image/png;base64,...) o un objeto {"mime_type":"image/png","data":"<base64>"}.
  • También se aceptan los alias al estilo OpenRouter frame_images (elementos con frame_type: first_frame | last_frame) e input_references.
  • Hasta 3 imágenes de referencia; superarlo devuelve 400.
Sugerencia: Veo admite la generación de audio nativo; puedes describir los efectos de sonido en el prompt, como “de fondo se oye el canto de los pájaros” o “una melodía de piano”.

Tongyi Wanxiang

Duraciones admitidas por cada modelo Resoluciones admitidas (ancho*alto)
Nota: wan2.6 solo admite 720P y 1080P; wan2.5 admite 480P, 720P y 1080P; wan2.2 solo admite 480P y 1080P.
Ejemplo
Sugerencia: las versiones wan2.5 y superiores generan por defecto vídeo con sonido (doblaje automático); los prompts en chino dan mejores resultados.

Doubao Seedance

Tipos de referencia admitidos por extra_body.content Ejemplo
Seedance 2.0 / 2.0 Fast

Kling

Este inventario indica los modelos disponibles actualmente. No significa que todos acepten los mismos campos. Selecciona el endpoint por path en el Schema del modelo y lee su request.schema.

Ejemplo completo de invocación

FAQ

¿Cuánto tarda la generación de vídeo?

La generación de vídeo suele tardar de 1 a 5 minutos; el tiempo concreto depende del modelo, la resolución y la duración. Se recomienda establecer un intervalo de sondeo de 15 segundos.

¿Cómo se usa el parámetro input_reference?

input_reference se usa en el escenario de imagen a vídeo y admite tres formas de pasarlo:

¿Cuál es la validez del enlace de descarga del vídeo?

El enlace de descarga del vídeo generado suele tener una validez de 24 horas; descárgalo y guárdalo a tiempo.

¿Qué diferencias hay en el parámetro seconds entre los modelos?

> Sugerencia: el parámetro seconds de todos los modelos se pasa siempre como tipo string (como "8"), y la API lo procesa automáticamente.

¿Qué diferencias hay en el formato del parámetro size entre los modelos?

¿Qué diferencia hay entre seconds y duration?

Ambos significan lo mismo: la duración del vídeo. La API admite ambos nombres de parámetro (excepto Sora, que solo acepta seconds). Se recomienda usar seconds de forma uniforme.

¿Cómo escribir un mejor prompt?

  • Describe escenas concretas: incluye sujeto, acción, entorno, iluminación y ambiente
  • Especifica el lenguaje de cámara: como “primer plano”, “toma aérea”, “travelling de aproximación”, “cámara lenta”
  • Describe el estilo: como “cinematográfico”, “estilo documental”, “estilo animación”
  • Los modelos para chino funcionan mejor con prompts en chino: Tongyi Wanxiang está optimizado para el chino
  • Veo admite descripciones de audio: puedes describir el sonido en el prompt, como “canto de pájaros” o “melodía de piano”

¿Cómo gestionar una tarea fallida?

Cuando status sea failed, el campo error de la respuesta incluirá la información del error:

Las causas frecuentes de fallo incluyen: contenido que infringe las políticas, prompt demasiado largo, formato de imagen no admitido, etc. Ajústalo según la información del error y vuelve a intentarlo.

Última actualización: 2026-06-01