Para una integración nueva, usa Generación de vídeo con el protocolo unificado
/ai/v1/videos. La interfaz compatible /v1/videos sigue disponible. Consulta la API Schema del modelo, selecciona el endpoint por path y lee su request.schema sin depender del orden del array.Inventario actual de modelos
Este inventario indica los modelos disponibles actualmente. No significa que todos acepten los mismos campos. Selecciona el endpoint por
path en el Schema del modelo y lee su request.schema.API
Descripción detallada de la API
Cabeceras de la petición
Crear tarea de generación de vídeo
Cuerpo de la petición
El formato de respuesta varía ligeramente según el modelo, pero todos incluyen los camposid(video_id) ystatus. Basta con usarstatuspara evaluar el progreso de la tarea.
Ejemplo de respuesta (Tongyi Wanxiang / Veo / Jimeng)
Descripción de los valores de estado generales
Consultar el estado del vídeo
Ejemplo de respuesta (generación completada - Tongyi Wanxiang)
Ejemplo de respuesta (generación completada - Sora)
Todos los modelos evalúan el estado de finalización mediantestatus == "completed"y luego llaman a la interfaz/contentpara descargar.
Descargar el contenido del vídeo
completed, llama a esta interfaz para descargar el archivo de vídeo MP4.
Respuesta: devuelve directamente el flujo binario del vídeo (Content-Type: video/mp4).
Nota: el enlace de descarga del vídeo suele tener una validez de 24 horas; descárgalo y guárdalo a tiempo.
Eliminar tarea de vídeo
Esta interfaz se usa para eliminar una tarea de vídeo ya creada.Detalle de los parámetros de cada modelo
OpenAI Sora
Sugerencia: el parámetroEjemplosecondsde todos los modelos se pasa siempre como tipo string (como"8").
Google Veo
Ejemplo
Notas sobre los campos de imagen:
- Precedencia del primer fotograma:
first_frame>input_reference(fotograma único compatible con OpenAI). - Cada elemento de
first_frame/last_frame/reference_imagesacepta: una URL pública, un data URL en base64 (data:image/png;base64,...) o un objeto{"mime_type":"image/png","data":"<base64>"}. - También se aceptan los alias al estilo OpenRouter
frame_images(elementos conframe_type: first_frame | last_frame) einput_references. - Hasta 3 imágenes de referencia; superarlo devuelve 400.
Sugerencia: Veo admite la generación de audio nativo; puedes describir los efectos de sonido en el prompt, como “de fondo se oye el canto de los pájaros” o “una melodía de piano”.
Tongyi Wanxiang
Duraciones admitidas por cada modelo
Resoluciones admitidas (ancho*alto)
Nota: wan2.6 solo admite 720P y 1080P; wan2.5 admite 480P, 720P y 1080P; wan2.2 solo admite 480P y 1080P.Ejemplo
Sugerencia: las versiones wan2.5 y superiores generan por defecto vídeo con sonido (doblaje automático); los prompts en chino dan mejores resultados.
Doubao Seedance
Tipos de referencia admitidos por
extra_body.content
Ejemplo
Seedance 2.0 / 2.0 Fast
Kling
Este inventario indica los modelos disponibles actualmente. No significa que todos acepten los mismos campos. Selecciona el endpoint por
path en el Schema del modelo y lee su request.schema.Ejemplo completo de invocación
FAQ
¿Cuánto tarda la generación de vídeo?
La generación de vídeo suele tardar de 1 a 5 minutos; el tiempo concreto depende del modelo, la resolución y la duración. Se recomienda establecer un intervalo de sondeo de 15 segundos.¿Cómo se usa el parámetro input_reference?
input_reference se usa en el escenario de imagen a vídeo y admite tres formas de pasarlo:
¿Cuál es la validez del enlace de descarga del vídeo?
El enlace de descarga del vídeo generado suele tener una validez de 24 horas; descárgalo y guárdalo a tiempo.¿Qué diferencias hay en el parámetro seconds entre los modelos?
> Sugerencia: el parámetro
seconds de todos los modelos se pasa siempre como tipo string (como "8"), y la API lo procesa automáticamente.
¿Qué diferencias hay en el formato del parámetro size entre los modelos?
¿Qué diferencia hay entre seconds y duration?
Ambos significan lo mismo: la duración del vídeo. La API admite ambos nombres de parámetro (excepto Sora, que solo acepta seconds). Se recomienda usar seconds de forma uniforme.
¿Cómo escribir un mejor prompt?
- Describe escenas concretas: incluye sujeto, acción, entorno, iluminación y ambiente
- Especifica el lenguaje de cámara: como “primer plano”, “toma aérea”, “travelling de aproximación”, “cámara lenta”
- Describe el estilo: como “cinematográfico”, “estilo documental”, “estilo animación”
- Los modelos para chino funcionan mejor con prompts en chino: Tongyi Wanxiang está optimizado para el chino
- Veo admite descripciones de audio: puedes describir el sonido en el prompt, como “canto de pájaros” o “melodía de piano”
¿Cómo gestionar una tarea fallida?
Cuandostatus sea failed, el campo error de la respuesta incluirá la información del error: