Veo 3.1 API
Google Veo 3.1 – Text-to-Video mit synchronisiertem nativem Audio in 1080p. Drei Stufen (Standard, Fast, Lite) mit Text-to-Video, Image-to-Video, Reference-to-Video und Video-Extend, in der Lite-Stufe zusätzlich Start-End-to-Video.
Die Standard-Stufe liefert die volle Qualität von Veo; die Fast-Stufe ist für Iteration, die Lite-Stufe für Previz und Arbeit in großen Mengen. Reference-to-Video akzeptiert Referenzbilder für identitätserhaltende Generierung; Video-Extend arbeitet in 7-Sekunden-Schritten und liefert einen einzigen zusammengeführten Clip.
Überblick
Über Veo 3.1 API
Was Veo 3.1 leistet, wie es in die Modellpalette von Google passt und warum Teams darauf zurückgreifen.
Veo 3.1 ist ein Modell von Google für Videogenerierung, verfügbar über die WaveSpeedAI-REST-API. Google Veo 3.1 – Text-to-Video mit synchronisiertem nativem Audio in 1080p. Drei Stufen (Standard, Fast, Lite) mit Text-to-Video, Image-to-Video, Reference-to-Video und Video-Extend, in der Lite-Stufe zusätzlich Start-End-to-Video.
Die Standard-Stufe liefert die volle Qualität von Veo; die Fast-Stufe ist für Iteration, die Lite-Stufe für Previz und Arbeit in großen Mengen. Reference-to-Video akzeptiert Referenzbilder für identitätserhaltende Generierung; Video-Extend arbeitet in 7-Sekunden-Schritten und liefert einen einzigen zusammengeführten Clip.
Die Familie Veo 3.1 auf WaveSpeedAI umfasst 11 REST-Endpunkte für die Workflows Text-To-Video, Video-Extend, Reference-To-Video, Image-To-Video. Jede Variante hat eigene Preise, Parameter und Beispielausgaben – wählen Sie die, die zu Ihrer Eingabemodalität und Ihren Produktionsanforderungen passt, oder rufen Sie mit demselben API-Schlüssel mehrere auf, um mehrstufige Pipelines zu bauen.
Nutzen Sie Veo 3.1 mit demselben API-Schlüssel, demselben Abrechnungskonto und denselben Rate Limits wie die über 1.000 weiteren KI-Modelle auf WaveSpeedAI. Keine separate Einrichtung bei Anbietern, keine SDKs pro Anbieter, keine Rate Limits pro Anbieter – eine Integration deckt alles ab, von Text-zu-Bild und Text-zu-Video über Audiosynthese, 3D-Generierung und Hochskalierung bis zur Bearbeitung.
Endpunkte
Alle Veo 3.1-API-Endpunkte
11 Veo 3.1-Endpunkte jetzt auf WaveSpeedAI verfügbar – wählen Sie die Variante, die zu Ihrem Workflow passt.
/filters:quality(82)/media/images/20260408104718_8uxbq2i4.webp)
Veo3.1 Lite Text To Video
Google Veo 3.1 Lite Text-to-Video generates high-fidelity 720p or 1080p videos with natively generated audio from text prompts. Lightweight variant optimized for cost efficiency. Supports landscape and portrait aspect ratios, dialogue with lip-sync, and customizable duration. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408104740_drl8tu9l.webp)
Veo3.1 Video Extend
Extend and continue Veo 3.1 videos with smooth motion, preserved style, and strong scene coherence. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/1778749312530573096_makufpyI.webp)
Veo3.1 Fast Reference To Video
Google Veo 3.1 Fast Reference to Video is a fast AI reference-to-video generation model that creates 8-second videos from up to three reference images using the official Veo predictLongRunning endpoint with referenceImages assets. Ready-to-use REST inference API for product videos, character consistency, branded visual storytelling, social media clips, advertising creatives, and professional reference-based video generation workflows with simple integration, no coldstarts, and affordable pricing.
/filters:quality(82)/media/images/20260408104757_ct9o5p9o.webp)
Veo3.1 Fast Video Extend
Extend Veo 3.1 videos in 7-second steps with the Fast endpoint—quick, coherent continuation that preserves style and motion, output as a single merged clip. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408104805_tr00kyv7.webp)
Veo3.1 Fast Text To Video
Google Veo 3.1 Fast creates text-to-video with native 1080p and synchronized audio, delivering high-quality videos for creators. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408104748_nwaixdpw.webp)
Veo3.1 Reference To Video
Google Veo3.1 Reference-to-Video performs image-to-video generation that preserves a specific subject's appearance and identity from provided reference images, enabling consistent character or product motion across frames. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408104714_ut4h5kku.webp)
Veo3.1 Lite Start End To Video
Google Veo 3.1 Lite Start-End-to-Video generates high-fidelity videos by interpolating between a start image and an optional end image. Supports 720p and 1080p resolutions, landscape and portrait aspect ratios, and native audio generation. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408104752_1voe0l4b.webp)
Veo3.1 Text To Video
Google Veo 3.1 converts text prompts into videos with synchronized audio at native 1080p for high-quality outputs. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408104708_dmnbefn0.webp)
Veo3.1 Lite Image To Video
Google Veo 3.1 Lite Image-to-Video transforms static images into high-fidelity 720p or 1080p videos with natively generated audio. Supports many interpolation use cases, landscape and portrait aspect ratios, and customizable duration. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408104802_aaez2mmf.webp)
Veo3.1 Fast Image To Video
Google Veo 3.1 Fast is an Image-to-Video model with native 1080p output for high-detail videos from images and fast performance. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408104744_xfvl07s5.webp)
Veo3.1 Image To Video
Google Veo 3.1 is an Image-to-Video model that converts images into high-quality videos with native 1080P output for enhanced detail and creative flexibility. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
Beispiele
Veo 3.1 in Aktion
Echte Ausgaben der Veo 3.1-API. Fahren Sie über ein Video für eine Vorschau und klicken Sie, um den Viewer in voller Größe zu öffnen.
Anleitung
So verwenden Sie die Veo 3.1-API
Vier Schritte von der Registrierung bis zur fertigen Generierung. Vollständige Beispiele in Python, Node.js und cURL finden Sie unten im Abschnitt „API“.
- 01
API-Schlüssel holen
Registrieren Sie ein WaveSpeedAI-Konto und kopieren Sie Ihren API-Schlüssel aus dem Dashboard. Neue Konten erhalten kostenlose Start-Credits – genug, um den Playground einige Dutzend Mal zu nutzen, bevor die Abrechnung beginnt.
- 02
Prediction senden
Senden Sie Ihre Eingabe als JSON per POST an https://api.wavespeed.ai/api/v3/google/veo3.1/text-to-video. Der Endpunkt gibt sofort eine Prediction-ID zurück – Generierungen laufen asynchron, sodass Sie während der Inferenz keine Verbindung offen halten.
- 03
Auf Abschluss prüfen
GET https://api.wavespeed.ai/api/v3/predictions/{request_id}/result. Geben Sie bei „completed“ die Ausgaben zurück; brechen Sie bei „failed“, „cancelled“, „timeout“ oder „deleted“ mit einem Fehler ab; fragen Sie bei allen anderen Status weiter ab.
- 04
Ausgabe-URL lesen
Sobald der Status „completed“ ist, lesen Sie die URL aus data.outputs[0]. Die URL verweist auf Ihre generierten Medien im WaveSpeedAI-CDN – Bild, Video, Audio oder 3D-Datei, je nach aufgerufener Variante von Veo 3.1.
Anwendungsfälle
Was Sie mit Veo 3.1 bauen können
Gängige Workflows, für die Entwickler und Kreative die Veo 3.1-API nutzen.
Text-to-Video mit nativem 1080p-Audio
google/veo3.1/text-to-video wandelt Text-Prompts in Videos mit synchronisiertem Audio in nativem 1080p um – auslieferungsreife Auflösung ohne Upscaling-Durchgang. Dasselbe Prompt-Format funktioniert in den Stufen Standard, Fast und Lite.
Reference-to-Video für Identitätserhalt
google/veo3.1/reference-to-video führt Image-to-Video aus und bewahrt dabei das Aussehen eines bestimmten Motivs aus den bereitgestellten Referenzbildern. Reference-to-Video der Fast-Stufe nutzt den offiziellen predictLongRunning-Endpunkt von Veo und unterstützt bis zu drei Referenzbilder für Ausgaben von 8 Sekunden.
Gestufte Preise: Standard / Fast / Lite
Standard für die Auslieferung, Fast für Iteration, Lite für Previz und Arbeit in großen Mengen. Lite geht mit Abstrichen bei der Qualität einher; die Stufe wechseln Sie über die Endpunkt-URL, ohne Prompts umzuschreiben.
Video-Extend in 7-Sekunden-Schritten
google/veo3.1/video-extend setzt vorhandene Veo-Clips mit flüssiger Bewegung und erhaltenem Stil fort – die Ausgabe ist ein einzelner zusammengeführter Clip statt getrennter Segmente, die Sie aneinanderfügen müssten. Video-Extend der Fast-Stufe (/extension) ist die günstigere Option für iterative Verlängerung.
Start-End-Interpolation (Lite-Stufe)
google/veo3.1-lite/start-end-to-video interpoliert zwischen einem Startbild und einem optionalen Endbild und erzeugt die verbindende Bewegung. Unterstützt 720p und 1080p sowie Quer- und Hochformat. Nützlich für Animatics und keyframegesteuerte Workflows zum Preis der Lite-Stufe.
Image-to-Video in nativem 1080p
google/veo3.1/image-to-video wandelt Bilder in 1080p-Videos mit verbesserten Details und kreativer Flexibilität um – die richtige Wahl, wenn Sie von einem Key-Standbild statt von einem reinen Textbriefing ausgehen.
Tipps
Tipps zum Prompting von Veo 3.1
Praktische Ratschläge für bessere Ausgaben von Veo 3.1 – abgeleitet aus Mustern, die bei Video-Modellen in Produktions-Pipelines funktionieren.
- 01
Native 1080p-Ausgabe in allen Stufen
Katalogangabe: „natives 1080p für hochwertige Ausgaben“. Alle Veo 3.1-Varianten generieren direkt in 1080p – vor der Auslieferung ist kein Upscaling-Durchgang nötig. Die Lite-Stufe unterstützt auch 720p, wenn die Bandbreite wichtiger ist.
- 02
Auf Lite iterieren, auf Fast verfeinern, auf Standard ausliefern
Dasselbe Prompt-Format funktioniert in Standard, Fast und Lite – wechseln Sie die Endpunkt-URL, ohne umzuschreiben. Iterieren Sie auf Lite an der Prompt-Richtung, verfeinern Sie auf Fast für höhere Qualität und liefern Sie auf Standard aus, wenn höchste Detailtreue zählt.
- 03
Reference-to-Video für Identitätserhalt
google/veo3.1/reference-to-video bewahrt das Aussehen eines bestimmten Motivs aus Referenzbildern. Die Version der Fast-Stufe unterstützt bis zu 3 Referenzbilder pro Generierung. Nützlich für Moderationsvideos, Markenfiguren und Serieninhalte.
- 04
Video-Extend arbeitet in 7-Sekunden-Schritten
google/veo3.1-fast/video-extend verlängert Veo 3.1-Videos in 7-Sekunden-Schritten mit kohärenter Bewegung und erhaltenem Stil – die Ausgabe ist ein einzelner zusammengeführter Clip statt getrennter Segmente, die Sie in der Postproduktion aneinanderfügen müssten.
- 05
Start-End-Interpolation nur bei Lite
google/veo3.1-lite/start-end-to-video interpoliert zwischen einem Startbild und einem optionalen Endbild. Unterstützt 720p / 1080p, Quer- und Hochformat. Nur bei Lite – nicht bei Standard oder Fast verfügbar.
- 06
Audio für stumme Aufnahmen ausschalten
Der Parameter generate_audio steht beim Standard-Endpunkt für Text-to-Video zur Verfügung. Schalten Sie ihn für B-Roll, Social Posts und Clips aus, deren Audio Sie ohnehin in der Postproduktion ersetzen.
Preise
Veo 3.1-API-Preise
Die Abrechnung erfolgt pro Ausgabe. Der Endpreis richtet sich nach den Parametern, die Sie im Playground jeder Variante setzen (Auflösung, Dauer, Anzahl der Ausgaben, Referenzen).
| Endpunkt | Typ | Startpreis |
|---|---|---|
| google/ | text-to-video | $0.30 |
| google/ | video-extend | $3.20 |
| google/ | reference-to-video | $0.64 |
| google/ | video-extend | $1.20 |
| google/ | text-to-video | $1.20 |
| google/ | reference-to-video | $3.20 |
| google/ | image-to-video | $0.40 |
| google/ | text-to-video | $3.20 |
| google/ | image-to-video | $0.30 |
| google/ | image-to-video | $1.20 |
| google/ | image-to-video | $3.20 |
API
Die Veo 3.1-API aufrufen
Holen Sie sich unter wavespeed.ai/accesskey einen API-Schlüssel und senden Sie dann eine Prediction per REST. Der Playground erzeugt einfügefertige Beispiele für jede Kombination von Eingaben.
POSThttps://api.wavespeed.ai/api/v3/google/veo3.1/text-to-video
# 1. Submit the prediction.
SUBMIT_RESPONSE=$(curl --silent --show-error --fail-with-body \
-X POST "https://api.wavespeed.ai/api/v3/google/veo3.1/text-to-video" \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $WAVESPEED_API_KEY" \
-d '{
"prompt": "A cinematic shot of a city at sunset, soft golden light",
"aspect_ratio": "16:9",
"duration": 8,
"resolution": "1080p",
"generate_audio": true
}')
TASK=$(printf '%s' "$SUBMIT_RESPONSE" | jq 'if has("data") then .data else . end')
PREDICTION_ID=$(printf '%s' "$TASK" | jq -r '.id')
if [ -z "$PREDICTION_ID" ] || [ "$PREDICTION_ID" = "null" ]; then
printf 'Submission response did not contain a prediction id
' >&2
exit 1
fi
RESULT_URL="https://api.wavespeed.ai/api/v3/predictions/$PREDICTION_ID/result"
# 2. Poll until the prediction finishes.
while true; do
RESPONSE=$(curl --silent --show-error --fail-with-body "$RESULT_URL" \
-H "Authorization: Bearer $WAVESPEED_API_KEY")
RESULT=$(printf '%s' "$RESPONSE" | jq 'if has("data") then .data else . end')
STATUS=$(printf '%s' "$RESULT" | jq -r '.status')
case "$STATUS" in
completed) printf '%s\n' "$RESULT" | jq '.outputs'; break ;;
failed|cancelled|timeout|deleted) printf '%s\n' "$RESULT" | jq . >&2; exit 1 ;;
*) sleep 2 ;;
esac
doneconst submitUrl = "https://api.wavespeed.ai/api/v3/google/veo3.1/text-to-video";
const apiKey = process.env.WAVESPEED_API_KEY;
if (!apiKey) throw new Error('Set WAVESPEED_API_KEY');
async function requestJson(url, options = {}) {
const response = await fetch(url, options);
if (!response.ok) throw new Error(await response.text());
return response.json();
}
// 1. Submit the prediction.
const body = await requestJson(submitUrl, {
method: "POST",
headers: {
"Authorization": `Bearer ${apiKey}`,
"Content-Type": "application/json",
},
body: JSON.stringify({
"prompt": "A cinematic shot of a city at sunset, soft golden light",
"aspect_ratio": "16:9",
"duration": 8,
"resolution": "1080p",
"generate_audio": true
}),
});
const task = body.data ?? body;
const resultUrl = `https://api.wavespeed.ai/api/v3/predictions/${task.id}/result`;
// 2. Poll until the prediction finishes.
while (true) {
const resultBody = await requestJson(resultUrl, {
headers: { "Authorization": `Bearer ${apiKey}` },
});
const result = resultBody.data ?? resultBody;
if (result.status === "completed") {
console.log(result.outputs);
break;
}
if (["failed", "cancelled", "timeout", "deleted"].includes(result.status)) throw new Error(JSON.stringify(result));
await new Promise(resolve => setTimeout(resolve, 2000));
}import json
import os
import time
from urllib.request import Request, urlopen
api_key = os.environ["WAVESPEED_API_KEY"]
headers = {"Authorization": f"Bearer {api_key}", "Content-Type": "application/json"}
payload = {
"prompt": "A cinematic shot of a city at sunset, soft golden light",
"aspect_ratio": "16:9",
"duration": 8,
"resolution": "1080p",
"generate_audio": True
}
def request_json(url, data=None):
request = Request(url, data=data, headers=headers, method="POST" if data else "GET")
with urlopen(request) as response:
return json.load(response)
# 1. Submit the prediction.
body = request_json("https://api.wavespeed.ai/api/v3/google/veo3.1/text-to-video", json.dumps(payload).encode())
task = body.get("data", body)
result_url = f"https://api.wavespeed.ai/api/v3/predictions/{task['id']}/result"
# 2. Poll until the prediction finishes.
while True:
result_body = request_json(result_url)
result = result_body.get("data", result_body)
status = result.get("status")
if status == "completed":
print(result.get("outputs", []))
break
if status in {"failed", "cancelled", "timeout", "deleted"}:
raise RuntimeError(result)
time.sleep(2)Vergleich
Veo 3.1 im Vergleich zu Alternativen
Wann Sie Veo 3.1 ähnlichen Modellen auf WaveSpeedAI vorziehen sollten.
Veo 3.1 vs. Seedance 2.0
Seedance 2.0 bietet natives Audio in jeder Stufe und eine schnelle Turbo-Stufe. Veo 3.1 ist in der obersten Stufe teurer, aber die Lite-Stufe ist preislich konkurrenzfähig, und Veos Ruf für Fotorealismus ist bei menschlichen Gesichtern stärker.
Veo 3.1 vs. Kling 3.0
Kling 3.0 hat Pro- und 4K-Stufen plus einen Motion-Control-Endpunkt. Veo 3.1 bietet drei Preisstufen (Standard / Fast / Lite) mit Reference-to-Video und Start-End-Interpolation als vollwertigen Endpunkten – ein anderer Funktionsumfang.
Veo 3.1 vs. Wan 2.7
Wan 2.7 vereint Reference-to-Video, Bildbearbeitung und Text-to-Image in einer Familie – ein breiteres modalitätsübergreifendes Toolkit. Die Standard-Stufe von Veo 3.1 deckt die gestufte Kostenoptimierung (von Lite bis Standard) und ein 7-Sekunden-Video-Extend ab, das Wan anders löst.
FAQ
Veo 3.1 API — Häufig gestellte Fragen
Preise, Lizenz, Integration – häufige Fragen zur Nutzung von Veo 3.1 auf WaveSpeedAI.
Was ist die Veo 3.1-API?
Veo 3.1 ist ein Google-Modell für Videogenerierung, das auf WaveSpeedAI als REST-API bereitgestellt wird. Google Veo 3.1 – Text-to-Video mit synchronisiertem nativem Audio in 1080p. Drei Stufen (Standard, Fast, Lite) mit Text-to-Video, Image-to-Video, Reference-to-Video und Video-Extend, in der Lite-Stufe zusätzlich Start-End-to-Video. Sie können es programmatisch aufrufen oder im oben verlinkten Playground ausprobieren.
Wie rufe ich die Veo 3.1-API auf?
Registrieren Sie ein WaveSpeedAI-Konto, kopieren Sie Ihren API-Schlüssel von /accesskey und senden Sie dann per POST an https://api.wavespeed.ai/api/v3/google/veo3.1/text-to-video Ihre Eingabe als JSON. Der Endpunkt gibt eine Prediction-ID zurück. Fragen Sie den Ergebnis-Endpunkt etwa alle 2 Sekunden ab, verlängern Sie das Intervall bei lang laufenden Aufgaben und hören Sie bei jedem Endstatus auf. Produktionsnahe Beispiele in Python / Node.js / cURL finden Sie oben.
Was kostet die Veo 3.1-API?
Veo 3.1 beginnt bei $0.30 pro Aufruf. Die genauen Kosten richten sich nach den Parametern, die Sie setzen (Auflösung, Dauer, Anzahl der Ausgaben, Referenzen). Die Live-Kostenvorschau neben der Schaltfläche „Generieren“ im Playground zeigt den genauen Preis für Ihre aktuelle Eingabe.
Welche Varianten von Veo 3.1 sind verfügbar?
WaveSpeedAI stellt 11 aktive Veo 3.1-Endpunkte bereit: google/veo3.1-lite/text-to-video, google/veo3.1/video-extend, google/veo3.1-fast/reference-to-video, google/veo3.1-fast/video-extend, google/veo3.1-fast/text-to-video, google/veo3.1/reference-to-video, google/veo3.1-lite/start-end-to-video, google/veo3.1/text-to-video und weitere. Jede Variante hat eine eigene Playground-Seite und eigene Preise.
Kann ich die Ausgaben von Veo 3.1 kommerziell nutzen?
Die kommerziellen Nutzungsrechte richten sich nach der Modelllizenz von Google. Die meisten Modelle von Google erlauben die kommerzielle Nutzung der Ausgaben; die konkrete Lizenzzusammenfassung finden Sie auf der Playground-Seite des jeweiligen Modells, die Bedingungen auf Plattformebene in den Nutzungsbedingungen von WaveSpeedAI.
Warum Veo 3.1 auf WaveSpeedAI nutzen statt direkt?
Ein API-Schlüssel und ein Abrechnungskonto für Veo 3.1 UND über 1.000 weitere KI-Modelle anderer Anbieter. Keine SDK-Einrichtung pro Anbieter, keine separaten Rate Limits, kein Neuschreiben von Integrationscode pro Anbieter. Die Preise liegen in der Regel auf dem Niveau der direkten API von Google oder darunter.
Anbieter
Über Google
Das Team hinter Veo 3.1 und der übrigen Modellpalette von Google auf WaveSpeedAI.
Googles KI-Arbeit findet vor allem bei Google DeepMind und Google Research statt. Die Bild- und Videomodelle – Imagen, Veo und multimodale Modelle der Gemini-Familie wie Nano Banana (Gemini 3 Image) – teilen Architektur und Trainingsinfrastruktur mit der übrigen Gemini-Reihe. Die Ausgaben zeichnen sich durch präzise Textdarstellung, breite Stilabdeckung und Lizenzierung in kommerzieller Qualität aus.
Starten Sie mit Veo 3.1 auf WaveSpeedAI
Kostenlose Start-Credits bei der Registrierung. Ein API-Schlüssel für über 1.000 KI-Modelle von Google und allen anderen Anbietern.