Skip to main content

快速开始

视频生成是异步操作,整个流程分为三步:
最简示例

接口概览

Base URL:https://aihubmix.com 认证方式:Bearer Token

支持的模型

文生视频(Text-to-Video)

图生视频(Image-to-Video)

图生视频需通过 input_reference 参数传入参考图片(阿里通义万相);豆包 Seedance 通过 extra_body.content 数组传入,支持图片、视频、音频多种参考类型;可灵 Kling 使用 image / image_tail / image_list 传图,详见下方可灵 Kling 小节。

API 详细说明

请求头

创建视频生成任务

请求体

不同模型的响应格式略有差异,但都包含 id(video_id)和 status 字段。以 status 判断任务进度即可。

响应示例(通义万相/Veo/即梦AI

响应示例(Sora)

通用状态值说明

查询视频状态

轮询此接口检查任务是否完成。建议每 15 秒 查询一次。

响应示例(生成完成 - 通义万相)

响应示例(生成完成 - Sora)

所有模型均通过 status == "completed" 判断完成状态,然后调用 /content 接口下载。

下载视频内容

当状态为 completed 后,调用此接口下载 MP4 视频文件。 响应: 直接返回视频二进制流Content-Type: video/mp4)。
注意:视频下载链接通常有 24 小时有效期,请及时下载保存。

删除视频任务

该接口用于删除已创建的视频任务。

各模型参数详解

OpenAI Sora

提示:所有模型的 seconds 参数统一使用字符串类型传入(如 "8")。
示例

Google Veo

示例
图片字段说明
  • 首帧优先级:first_frame > input_reference(OpenAI 兼容单帧)。
  • first_frame / last_frame / reference_images 每个元素均支持:公网 URL、base64 dataURL(data:image/png;base64,...)、或 {"mime_type":"image/png","data":"<base64>"} 对象。
  • 也兼容 OpenRouter 风格的 frame_images(元素带 frame_type: first_frame | last_frame)与 input_references 别名。
  • 参考图最多 3 张,超出返回 400。
提示:Veo 支持原生音频生成,可在 prompt 中描述音效,如”背景传来鸟鸣声”、“钢琴旋律”。

通义万相

各模型支持的时长 支持的分辨率(宽*高)
注意:wan2.6 仅支持 720P 和 1080P;wan2.5 支持 480P、720P、1080P;wan2.2 仅支持 480P 和 1080P。
示例
提示:wan2.5 及以上版本默认生成有声视频(自动配音),中文 prompt 效果更佳。

即梦 AI

支持的宽高比与对应分辨率 示例

豆包 Seedance

extra_body.content 支持的引用类型 示例
Seedance 2.0 / 2.0 Fast

可灵 Kling

可灵(Kling)支持 文生视频、图生视频、多图参考生视频、OmniVideo 多模态 四类能力,统一通过 /v1/videos 接口调用,网关按「模型名 + 输入形态」自动路由到可灵对应端点,无需调用方区分。 参数
不支持或未映射的关键参数会显式报错,不会静默丢弃。其余可灵原生参数可放进 extra_body 透传到上游。
示例
说明
  • 异步三步:提交获 video_id → 轮询 GET /v1/videos/{video_id}statuscompletedGET /v1/videos/{video_id}/content 下载 MP4。状态值:in_progress / completed / failed
  • 出片通常 1~3 分钟;结果视频 URL 30 天后清理,请及时转存。
  • 删除任务:可灵无删除接口,DELETE /v1/videos/{video_id} 返回 501 not_supported
  • 计费:按 模型 × mode × 时长 × 能力(有无参考视频 / 有声)扣费;生成失败不扣费,查询与下载不计费。

完整调用示例

FAQ

视频生成需要多长时间?

视频生成通常需要 1-5 分钟,具体时间取决于模型、分辨率和时长。建议设置 15 秒的轮询间隔。

input_reference 参数怎么用?

input_reference 用于图生视频场景,支持三种传入方式:

视频下载链接有效期是多久?

生成的视频下载链接通常有 24 小时 有效期,请及时下载保存。

各模型seconds 参数有什么区别?

> 提示:所有模型的 seconds 参数统一使用字符串类型传入(如 "8"),API 会自动处理。

不同模型size 参数格式有什么区别?

### seconds duration 有什么区别? 两者含义相同,均表示视频时长。API 同时支持这两个参数名(Sora 除外,Sora 只接受 seconds)。推荐统一使用 seconds

如何编写更好的 prompt?

  • 描述具体场景:包含主体、动作、环境、光线、氛围
  • 指定镜头语言:如”特写”、“航拍”、“推镜头”、“慢动作”
  • 描述风格:如”电影感”、“纪录片风格”、“动画风格”
  • 中文模型用中文 prompt 效果更好:通义万相针对中文优化
  • Veo 支持音频描述:可在 prompt 中描述声音,如”鸟鸣声”、“钢琴旋律”

任务失败怎么处理?

statusfailed 时,响应中的 error 字段会包含错误信息:

常见失败原因包括:内容违规、prompt 过长、图片格式不支持等。请根据错误信息调整后重试。

更新时间:2026-06-01