Para uma nova integração, use Geração de vídeos com o protocolo unificado
/ai/v1/videos. A interface compatível /v1/videos continua disponível. Consulte a API Schema do modelo, selecione o endpoint por path e leia seu request.schema sem depender da ordem do array.Inventário atual de modelos
Este inventário mostra os modelos disponíveis atualmente. Isso não significa que todos aceitem os mesmos campos. Selecione o endpoint por
path no Schema do modelo e leia seu request.schema.API
Detalhes da API
Cabeçalhos da requisição
Criar tarefa de geração de vídeo
Corpo da requisição
O formato de resposta varia ligeiramente entre os modelos, mas todos incluem os camposid(video_id) estatus. Basta usarstatuspara avaliar o progresso da tarefa.
Exemplo de resposta (Tongyi Wanxiang/Veo/Jimeng)
Descrição dos valores de status comuns
Consultar status do vídeo
Exemplo de resposta (geração concluída - Tongyi Wanxiang)
Exemplo de resposta (geração concluída - Sora)
Todos os modelos usamstatus == "completed"para avaliar o estado de conclusão e, em seguida, chamam a interface/contentpara baixar.
Baixar o conteúdo do vídeo
completed, chame esta interface para baixar o arquivo de vídeo MP4.
Resposta: retorna diretamente o stream binário do vídeo (Content-Type: video/mp4).
Atenção: o link de download do vídeo normalmente tem validade de 24 horas, baixe e salve o quanto antes.
Excluir tarefa de vídeo
Esta interface é usada para excluir tarefas de vídeo já criadas.Detalhes dos Parâmetros de Cada Modelo
OpenAI Sora
Dica: o parâmetroExemplosecondsde todos os modelos é sempre passado como tipo string (como"8").
Google Veo
Exemplo
Notas sobre os campos de imagem:
- Precedência do quadro inicial:
first_frame>input_reference(quadro único compatível com OpenAI). - Cada elemento de
first_frame/last_frame/reference_imagesaceita: uma URL pública, um data URL base64 (data:image/png;base64,...) ou um objeto{"mime_type":"image/png","data":"<base64>"}. - Os aliases no estilo OpenRouter
frame_images(elementos comframe_type: first_frame | last_frame) einput_referencestambém são aceitos. - Até 3 imagens de referência; exceder esse limite retorna 400.
Dica: o Veo suporta geração de áudio nativo; você pode descrever efeitos sonoros no prompt, como “o som de pássaros cantando ao fundo” ou “uma melodia de piano”.
Tongyi Wanxiang
Durações suportadas por cada modelo
Resoluções suportadas (largura*altura)
Atenção: wan2.6 suporta apenas 720P e 1080P; wan2.5 suporta 480P, 720P e 1080P; wan2.2 suporta apenas 480P e 1080P.Exemplo
Dica: as versões wan2.5 e superiores geram, por padrão, vídeos com som (dublagem automática), e o efeito é melhor com prompts em chinês.
Doubao Seedance
Tipos de referência suportados em
extra_body.content
Exemplo
Seedance 2.0 / 2.0 Fast
Kling
Este inventário mostra os modelos disponíveis atualmente. Isso não significa que todos aceitem os mesmos campos. Selecione o endpoint por
path no Schema do modelo e leia seu request.schema.Exemplos Completos de Chamada
FAQ
Quanto tempo leva a geração de vídeo?
A geração de vídeo normalmente leva de 1 a 5 minutos, e o tempo exato depende do modelo, da resolução e da duração. Recomenda-se definir um intervalo de consulta de 15 segundos.Como usar o parâmetro input_reference?
input_reference é usado em cenários de imagem para vídeo e suporta três formas de envio:
Qual é a validade do link de download do vídeo?
O link de download do vídeo gerado normalmente tem validade de 24 horas, baixe e salve o quanto antes.Qual é a diferença do parâmetro seconds entre os modelos?
> Dica: o parâmetro
seconds de todos os modelos é sempre passado como tipo string (como "8"), e a API o processa automaticamente.
Qual é a diferença no formato do parâmetro size entre os modelos?
Qual é a diferença entre seconds e duration?
Os dois têm o mesmo significado, ambos representam a duração do vídeo. A API suporta os dois nomes de parâmetro (exceto o Sora, que aceita apenas seconds). Recomenda-se usar sempre seconds.
Como escrever um prompt melhor?
- Descreva cenas concretas: inclua o sujeito, a ação, o ambiente, a iluminação e a atmosfera
- Especifique a linguagem de câmera: como “close-up”, “tomada aérea”, “câmera avançando”, “câmera lenta”
- Descreva o estilo: como “cinematográfico”, “estilo documentário”, “estilo de animação”
- Modelos focados em chinês têm melhor resultado com prompts em chinês: o Tongyi Wanxiang é otimizado para chinês
- O Veo suporta descrição de áudio: você pode descrever sons no prompt, como “canto de pássaros” ou “melodia de piano”
O que fazer quando a tarefa falha?
Quando ostatus for failed, o campo error na resposta conterá a informação do erro: