Skip to main content
Verwenden Sie für neue Integrationen Videogenerierung mit dem einheitlichen Protokoll /ai/v1/videos. Die kompatible Schnittstelle /v1/videos bleibt verfügbar. Fragen Sie die Modell-Schema-API ab, wählen Sie den Endpunkt anhand von path und lesen Sie dessen request.schema; verlassen Sie sich nicht auf die Array-Reihenfolge.

Aktuelle Modellübersicht

Diese Übersicht zeigt aktuell verfügbare Modelle. Sie bedeutet nicht, dass alle Modelle dieselben Felder akzeptieren. Wählen Sie den Endpunkt über path im Modell-Schema und lesen Sie dessen request.schema.

API

Detaillierte API-Beschreibung

Request-Header

Videogenerierungsaufgabe erstellen

Request-Body

Das Antwortformat unterscheidet sich je nach Modell leicht, enthält aber stets die Felder id (video_id) und status. Den Aufgabenfortschritt kann man anhand von status beurteilen.

Beispielantwort (Tongyi Wanxiang/Veo/Jimeng)

Beispielantwort (Sora)

Beschreibung der allgemeinen Statuswerte

Videostatus abfragen

Fragen Sie diese Schnittstelle ab, um zu prüfen, ob die Aufgabe abgeschlossen ist. Empfohlen wird eine Abfrage alle 15 Sekunden.

Beispielantwort (Generierung abgeschlossen – Tongyi Wanxiang)

Beispielantwort (Generierung abgeschlossen – Sora)

Alle Modelle beurteilen den Abschlussstatus über status == "completed" und rufen dann die /content-Schnittstelle zum Herunterladen auf.

Videoinhalt herunterladen

Sobald der Status completed ist, rufen Sie diese Schnittstelle auf, um die MP4-Videodatei herunterzuladen. Antwort: Gibt direkt den binären Videostream zurück (Content-Type: video/mp4).
Hinweis: Der Video-Downloadlink ist in der Regel 24 Stunden gültig. Bitte zeitnah herunterladen und speichern.

Videoaufgabe löschen

Diese Schnittstelle dient dazu, eine bereits erstellte Videoaufgabe zu löschen.

Detaillierte Parameter der einzelnen Modelle

OpenAI Sora

Hinweis: Der Parameter seconds wird bei allen Modellen einheitlich als String-Typ übergeben (z. B. "8").
Beispiel

Google Veo

Beispiel
Hinweise zu Bildfeldern:
  • Vorrang beim ersten Bild: first_frame > input_reference (OpenAI-kompatibles Einzelbild).
  • Jedes Element von first_frame / last_frame / reference_images akzeptiert: eine öffentliche URL, eine base64-Data-URL (data:image/png;base64,...) oder ein {"mime_type":"image/png","data":"<base64>"}-Objekt.
  • Die OpenRouter-Aliasse frame_images (Elemente mit frame_type: first_frame | last_frame) und input_references werden ebenfalls akzeptiert.
  • Bis zu 3 Referenzbilder; bei Überschreitung wird 400 zurückgegeben.
Hinweis: Veo unterstützt native Audiogenerierung; Soundeffekte können im Prompt beschrieben werden, z. B. „im Hintergrund erklingt Vogelgezwitscher”, „Klaviermelodie”.

Tongyi Wanxiang

Von den einzelnen Modellen unterstützte Dauer Unterstützte Auflösungen (Breite*Höhe)
Hinweis: wan2.6 unterstützt nur 720P und 1080P; wan2.5 unterstützt 480P, 720P, 1080P; wan2.2 unterstützt nur 480P und 1080P.
Beispiel
Hinweis: Versionen ab wan2.5 generieren standardmäßig Videos mit Ton (automatische Vertonung), chinesische Prompts liefern bessere Ergebnisse.

Doubao Seedance

Von extra_body.content unterstützte Referenztypen Beispiel
Seedance 2.0 / 2.0 Fast

Kling

Diese Übersicht zeigt aktuell verfügbare Modelle. Sie bedeutet nicht, dass alle Modelle dieselben Felder akzeptieren. Wählen Sie den Endpunkt über path im Modell-Schema und lesen Sie dessen request.schema.

Vollständiges Aufrufbeispiel

FAQ

Wie lange dauert die Videogenerierung?

Die Videogenerierung dauert in der Regel 1–5 Minuten, die genaue Zeit hängt von Modell, Auflösung und Dauer ab. Empfohlen wird ein Abfrageintervall von 15 Sekunden.

Wie verwendet man den Parameter input_reference?

input_reference wird im Bild-zu-Video-Szenario verwendet und unterstützt drei Übergabemethoden:
Der Downloadlink des generierten Videos ist in der Regel 24 Stunden gültig. Bitte zeitnah herunterladen und speichern.

Worin unterscheidet sich der Parameter seconds bei den einzelnen Modellen?

> Hinweis: Der Parameter seconds wird bei allen Modellen einheitlich als String-Typ übergeben (z. B. "8"), die API verarbeitet dies automatisch.

Worin unterscheidet sich das Format des Parameters size bei den verschiedenen Modellen?

Worin unterscheiden sich seconds und duration?

Beide haben dieselbe Bedeutung und stehen für die Videodauer. Die API unterstützt beide Parameternamen (außer Sora, das nur seconds akzeptiert). Empfohlen wird die einheitliche Verwendung von seconds.

Wie schreibt man bessere Prompts?

  • Konkrete Szene beschreiben: enthält Subjekt, Aktion, Umgebung, Licht, Atmosphäre
  • Kamerasprache angeben: z. B. „Nahaufnahme”, „Luftaufnahme”, „Heranfahren”, „Zeitlupe”
  • Stil beschreiben: z. B. „filmisch”, „Dokumentarstil”, „Animationsstil”
  • Bei chinesischen Modellen liefern chinesische Prompts bessere Ergebnisse: Tongyi Wanxiang ist für Chinesisch optimiert
  • Veo unterstützt Audiobeschreibungen: Klänge können im Prompt beschrieben werden, z. B. „Vogelgezwitscher”, „Klaviermelodie”

Was tun, wenn eine Aufgabe fehlschlägt?

Wenn status auf failed steht, enthält das Feld error in der Antwort die Fehlerinformation:

Häufige Fehlerursachen sind: Inhaltsverstoß, zu langer Prompt, nicht unterstütztes Bildformat usw. Bitte anhand der Fehlerinformation anpassen und erneut versuchen.

Zuletzt aktualisiert: 2026-06-01