Veo 3.1 API
Google Veo 3.1 — tekst na wideo z zsynchronizowanym natywnym dźwiękiem w 1080p. Trzy poziomy (Standard, Fast, Lite) z tekstem na wideo, obrazem na wideo, referencją na wideo i video-extend, a w poziomie Lite także start-end-to-video.
Poziom Standard daje pełną jakość Veo; Fast służy do iteracji; Lite do previzualizacji i pracy na dużą skalę. Referencja na wideo przyjmuje obrazy referencyjne do generowania z zachowaniem tożsamości; video-extend działa w krokach po 7 sekund i tworzy jeden połączony klip.
Przegląd
O modelu Veo 3.1 API
Co robi Veo 3.1, jakie miejsce zajmuje w linii modeli Google i dlaczego zespoły po niego sięgają.
Veo 3.1 to model generowania wideo od Google, dostępny przez REST API WaveSpeedAI. Google Veo 3.1 — tekst na wideo z zsynchronizowanym natywnym dźwiękiem w 1080p. Trzy poziomy (Standard, Fast, Lite) z tekstem na wideo, obrazem na wideo, referencją na wideo i video-extend, a w poziomie Lite także start-end-to-video.
Poziom Standard daje pełną jakość Veo; Fast służy do iteracji; Lite do previzualizacji i pracy na dużą skalę. Referencja na wideo przyjmuje obrazy referencyjne do generowania z zachowaniem tożsamości; video-extend działa w krokach po 7 sekund i tworzy jeden połączony klip.
Rodzina Veo 3.1 w WaveSpeedAI zawiera 11 endpointów REST obejmujące workflowy: Text-To-Video, Video-Extend, Reference-To-Video, Image-To-Video. Każdy wariant ma własny cennik, parametry i przykładowe wyniki — wybierz ten, który pasuje do Twoich danych wejściowych i wymagań produkcyjnych, albo wywołuj kilka z jednego klucza API, aby składać wieloetapowe pipeline'y.
Uruchamiaj Veo 3.1 z tym samym kluczem API, kontem rozliczeniowym i limitami, których używasz dla ponad 1000 innych modeli AI w WaveSpeedAI. Bez osobnej konfiguracji u dostawcy, bez osobnych SDK, bez osobnych limitów — jedna integracja obejmuje wszystko: od tekstu na obraz i tekstu na wideo, przez syntezę dźwięku i generowanie 3D, po upscaling i edycję.
Endpointy
Wszystkie endpointy API Veo 3.1
11 endpointów Veo 3.1 dostępnych teraz w WaveSpeedAI — wybierz wariant pasujący do Twojego workflow.
/filters:quality(82)/media/images/20260408104718_8uxbq2i4.webp)
Veo3.1 Lite Text To Video
Google Veo 3.1 Lite Text-to-Video generates high-fidelity 720p or 1080p videos with natively generated audio from text prompts. Lightweight variant optimized for cost efficiency. Supports landscape and portrait aspect ratios, dialogue with lip-sync, and customizable duration. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408104740_drl8tu9l.webp)
Veo3.1 Video Extend
Extend and continue Veo 3.1 videos with smooth motion, preserved style, and strong scene coherence. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/1778749312530573096_makufpyI.webp)
Veo3.1 Fast Reference To Video
Google Veo 3.1 Fast Reference to Video is a fast AI reference-to-video generation model that creates 8-second videos from up to three reference images using the official Veo predictLongRunning endpoint with referenceImages assets. Ready-to-use REST inference API for product videos, character consistency, branded visual storytelling, social media clips, advertising creatives, and professional reference-based video generation workflows with simple integration, no coldstarts, and affordable pricing.
/filters:quality(82)/media/images/20260408104757_ct9o5p9o.webp)
Veo3.1 Fast Video Extend
Extend Veo 3.1 videos in 7-second steps with the Fast endpoint—quick, coherent continuation that preserves style and motion, output as a single merged clip. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408104805_tr00kyv7.webp)
Veo3.1 Fast Text To Video
Google Veo 3.1 Fast creates text-to-video with native 1080p and synchronized audio, delivering high-quality videos for creators. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408104748_nwaixdpw.webp)
Veo3.1 Reference To Video
Google Veo3.1 Reference-to-Video performs image-to-video generation that preserves a specific subject's appearance and identity from provided reference images, enabling consistent character or product motion across frames. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408104714_ut4h5kku.webp)
Veo3.1 Lite Start End To Video
Google Veo 3.1 Lite Start-End-to-Video generates high-fidelity videos by interpolating between a start image and an optional end image. Supports 720p and 1080p resolutions, landscape and portrait aspect ratios, and native audio generation. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408104752_1voe0l4b.webp)
Veo3.1 Text To Video
Google Veo 3.1 converts text prompts into videos with synchronized audio at native 1080p for high-quality outputs. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408104708_dmnbefn0.webp)
Veo3.1 Lite Image To Video
Google Veo 3.1 Lite Image-to-Video transforms static images into high-fidelity 720p or 1080p videos with natively generated audio. Supports many interpolation use cases, landscape and portrait aspect ratios, and customizable duration. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408104802_aaez2mmf.webp)
Veo3.1 Fast Image To Video
Google Veo 3.1 Fast is an Image-to-Video model with native 1080p output for high-detail videos from images and fast performance. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408104744_xfvl07s5.webp)
Veo3.1 Image To Video
Google Veo 3.1 is an Image-to-Video model that converts images into high-quality videos with native 1080P output for enhanced detail and creative flexibility. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
Przykłady
Veo 3.1 w akcji
Prawdziwe wyniki wygenerowane przez API Veo 3.1. Najedź na wideo, aby zobaczyć podgląd, kliknij, aby otworzyć pełnowymiarowy podgląd.
Jak zacząć
Jak korzystać z API Veo 3.1
Cztery kroki od rejestracji do gotowego wyniku. Pełne przykłady w Pythonie, Node.js i cURL znajdziesz w sekcji API poniżej.
- 01
Uzyskaj klucz API
Załóż konto WaveSpeedAI i skopiuj klucz API z panelu. Nowe konta otrzymują darmowe kredyty na start — wystarczy na kilkadziesiąt uruchomień w playground, zanim zaczną się opłaty.
- 02
Wyślij predykcję
Wyślij dane wejściowe jako JSON metodą POST na https://api.wavespeed.ai/api/v3/google/veo3.1/text-to-video. Endpoint od razu zwraca identyfikator predykcji — generowanie jest asynchroniczne, więc nie trzymasz otwartego połączenia na czas inferencji.
- 03
Sprawdzaj ukończenie
Wywołaj GET https://api.wavespeed.ai/api/v3/predictions/{request_id}/result. Przy statusie completed odbierz wyniki; przy failed, cancelled, timeout lub deleted zakończ z błędem; przy każdym innym statusie odpytuj dalej.
- 04
Odczytaj adres wyniku
Gdy status to "completed", odczytaj adres URL z data.outputs[0]. Wskazuje on wygenerowane media w CDN WaveSpeedAI — obraz, wideo, dźwięk lub plik 3D, zależnie od wywołanego wariantu Veo 3.1.
Zastosowania
Co możesz zbudować z Veo 3.1
Typowe workflowy, do których deweloperzy i twórcy używają API Veo 3.1.
Tekst na wideo z natywnym dźwiękiem w 1080p
google/veo3.1/text-to-video zamienia prompty tekstowe w wideo z zsynchronizowanym dźwiękiem w natywnym 1080p — rozdzielczość gotowa do dostawy bez etapu upscalingu. Ten sam format promptu działa na poziomach Standard, Fast i Lite.
Referencja na wideo z zachowaniem tożsamości
google/veo3.1/reference-to-video wykonuje obraz na wideo, zachowując wygląd konkretnego bohatera z dostarczonych obrazów referencyjnych. Referencja na wideo na poziomie Fast korzysta z oficjalnego endpointu predictLongRunning Veo i obsługuje do trzech obrazów referencyjnych dla wyników 8-sekundowych.
Cennik warstwowy: Standard / Fast / Lite
Standard do dostawy, Fast do iteracji, Lite do previzualizacji i pracy na dużą skalę. Lite wiąże się z kompromisami jakościowymi; poziomy zmieniasz przez adres endpointu bez przepisywania promptów.
Video-extend w krokach po 7 sekund
google/veo3.1/video-extend kontynuuje istniejące klipy Veo z płynnym ruchem i zachowanym stylem — wynikiem jest jeden połączony klip, a nie osobne segmenty do sklejania. Video-extend na poziomie Fast (/extension) to tańsza opcja dla iteracyjnego rozszerzania.
Interpolacja początek–koniec (poziom Lite)
google/veo3.1-lite/start-end-to-video interpoluje między obrazem początkowym a opcjonalnym obrazem końcowym, aby wygenerować łączący ruch. Obsługuje 720p i 1080p oraz proporcje poziome i pionowe. Przydatne w animatikach i workflow opartych na klatkach kluczowych w cenie poziomu Lite.
Obraz na wideo w natywnym 1080p
google/veo3.1/image-to-video zamienia obrazy w wideo 1080p z większą ilością detali i swobodą kreatywną — dobry wybór, gdy zaczynasz od kluczowego kadru, a nie od samego briefu tekstowego.
Wskazówki
Wskazówki do promptów dla Veo 3.1
Praktyczne rady, jak uzyskiwać lepsze wyniki z Veo 3.1 — oparte na wzorcach, które sprawdzają się w produkcyjnych pipeline'ach dla modeli wideo.
- 01
Natywne wyjście 1080p na wszystkich poziomach
Deklaracja z katalogu: „natywne 1080p dla wyników wysokiej jakości”. Wszystkie warianty Veo 3.1 generują bezpośrednio w 1080p — przed dostawą nie jest potrzebny etap upscalingu. Poziom Lite obsługuje też 720p, gdy ważniejsza jest przepustowość.
- 02
Iteruj na Lite, dopracowuj na Fast, dostarczaj na Standard
Ten sam format promptu działa na Standard, Fast i Lite — zmieniasz adres endpointu bez przepisywania. Iteruj na Lite dla kierunku promptu, dopracowuj na Fast dla wyższej jakości, dostarczaj na Standard, gdy liczy się maksymalna wierność.
- 03
Referencja na wideo dla zachowania tożsamości
google/veo3.1/reference-to-video zachowuje wygląd konkretnego bohatera z obrazów referencyjnych. Wersja na poziomie Fast obsługuje do 3 obrazów referencyjnych na generowanie. Przydatne w wideo z prezenterem, postaciach marek i treściach seryjnych.
- 04
Video-extend działa w krokach po 7 sekund
google/veo3.1-fast/video-extend przedłuża wideo Veo 3.1 w krokach po 7 sekund ze spójnym ruchem i zachowanym stylem — wynikiem jest jeden połączony klip, a nie osobne segmenty, które trzeba by sklejać w postprodukcji.
- 05
Interpolacja początek–koniec tylko na Lite
google/veo3.1-lite/start-end-to-video interpoluje między obrazem początkowym a opcjonalnym obrazem końcowym. Obsługuje 720p / 1080p, poziomo i pionowo. Tylko Lite — niedostępne na Standard ani Fast.
- 06
Wyłącz dźwięk dla niemego materiału
Parametr generate_audio jest dostępny w standardowym endpoincie tekst na wideo. Wyłącz go dla B-roll, postów w mediach społecznościowych i klipów, w których i tak podmienisz dźwięk w postprodukcji.
Cennik
Cennik API Veo 3.1
Cena jest naliczana za wynik. Końcowa opłata zależy od parametrów ustawionych w playground każdego wariantu (rozdzielczość, czas trwania, liczba wyników, referencje).
| Endpoint | Typ | Cena początkowa |
|---|---|---|
| google/ | text-to-video | $0.30 |
| google/ | video-extend | $3.20 |
| google/ | reference-to-video | $0.64 |
| google/ | video-extend | $1.20 |
| google/ | text-to-video | $1.20 |
| google/ | reference-to-video | $3.20 |
| google/ | image-to-video | $0.40 |
| google/ | text-to-video | $3.20 |
| google/ | image-to-video | $0.30 |
| google/ | image-to-video | $1.20 |
| google/ | image-to-video | $3.20 |
API
Wywołaj API Veo 3.1
Uzyskaj klucz API na wavespeed.ai/accesskey, a następnie wyślij predykcję przez REST. Playground generuje gotowe do wklejenia przykłady dla dowolnej kombinacji danych wejściowych.
POSThttps://api.wavespeed.ai/api/v3/google/veo3.1/text-to-video
# 1. Submit the prediction.
SUBMIT_RESPONSE=$(curl --silent --show-error --fail-with-body \
-X POST "https://api.wavespeed.ai/api/v3/google/veo3.1/text-to-video" \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $WAVESPEED_API_KEY" \
-d '{
"prompt": "A cinematic shot of a city at sunset, soft golden light",
"aspect_ratio": "16:9",
"duration": 8,
"resolution": "1080p",
"generate_audio": true
}')
TASK=$(printf '%s' "$SUBMIT_RESPONSE" | jq 'if has("data") then .data else . end')
PREDICTION_ID=$(printf '%s' "$TASK" | jq -r '.id')
if [ -z "$PREDICTION_ID" ] || [ "$PREDICTION_ID" = "null" ]; then
printf 'Submission response did not contain a prediction id
' >&2
exit 1
fi
RESULT_URL="https://api.wavespeed.ai/api/v3/predictions/$PREDICTION_ID/result"
# 2. Poll until the prediction finishes.
while true; do
RESPONSE=$(curl --silent --show-error --fail-with-body "$RESULT_URL" \
-H "Authorization: Bearer $WAVESPEED_API_KEY")
RESULT=$(printf '%s' "$RESPONSE" | jq 'if has("data") then .data else . end')
STATUS=$(printf '%s' "$RESULT" | jq -r '.status')
case "$STATUS" in
completed) printf '%s\n' "$RESULT" | jq '.outputs'; break ;;
failed|cancelled|timeout|deleted) printf '%s\n' "$RESULT" | jq . >&2; exit 1 ;;
*) sleep 2 ;;
esac
doneconst submitUrl = "https://api.wavespeed.ai/api/v3/google/veo3.1/text-to-video";
const apiKey = process.env.WAVESPEED_API_KEY;
if (!apiKey) throw new Error('Set WAVESPEED_API_KEY');
async function requestJson(url, options = {}) {
const response = await fetch(url, options);
if (!response.ok) throw new Error(await response.text());
return response.json();
}
// 1. Submit the prediction.
const body = await requestJson(submitUrl, {
method: "POST",
headers: {
"Authorization": `Bearer ${apiKey}`,
"Content-Type": "application/json",
},
body: JSON.stringify({
"prompt": "A cinematic shot of a city at sunset, soft golden light",
"aspect_ratio": "16:9",
"duration": 8,
"resolution": "1080p",
"generate_audio": true
}),
});
const task = body.data ?? body;
const resultUrl = `https://api.wavespeed.ai/api/v3/predictions/${task.id}/result`;
// 2. Poll until the prediction finishes.
while (true) {
const resultBody = await requestJson(resultUrl, {
headers: { "Authorization": `Bearer ${apiKey}` },
});
const result = resultBody.data ?? resultBody;
if (result.status === "completed") {
console.log(result.outputs);
break;
}
if (["failed", "cancelled", "timeout", "deleted"].includes(result.status)) throw new Error(JSON.stringify(result));
await new Promise(resolve => setTimeout(resolve, 2000));
}import json
import os
import time
from urllib.request import Request, urlopen
api_key = os.environ["WAVESPEED_API_KEY"]
headers = {"Authorization": f"Bearer {api_key}", "Content-Type": "application/json"}
payload = {
"prompt": "A cinematic shot of a city at sunset, soft golden light",
"aspect_ratio": "16:9",
"duration": 8,
"resolution": "1080p",
"generate_audio": True
}
def request_json(url, data=None):
request = Request(url, data=data, headers=headers, method="POST" if data else "GET")
with urlopen(request) as response:
return json.load(response)
# 1. Submit the prediction.
body = request_json("https://api.wavespeed.ai/api/v3/google/veo3.1/text-to-video", json.dumps(payload).encode())
task = body.get("data", body)
result_url = f"https://api.wavespeed.ai/api/v3/predictions/{task['id']}/result"
# 2. Poll until the prediction finishes.
while True:
result_body = request_json(result_url)
result = result_body.get("data", result_body)
status = result.get("status")
if status == "completed":
print(result.get("outputs", []))
break
if status in {"failed", "cancelled", "timeout", "deleted"}:
raise RuntimeError(result)
time.sleep(2)Porównanie
Veo 3.1 a alternatywy
Kiedy wybrać Veo 3.1 zamiast podobnych modeli w WaveSpeedAI.
Veo 3.1 a Seedance 2.0
Seedance 2.0 oferuje natywny dźwięk na każdym poziomie i szybki poziom Turbo. Veo 3.1 jest droższy na najwyższym poziomie, ale poziom Lite jest konkurencyjny cenowo, a renoma fotorealizmu Veo jest silniejsza w przypadku twarzy ludzi.
Veo 3.1 a Kling 3.0
Kling 3.0 ma poziomy Pro i 4K oraz endpoint motion control. Veo 3.1 oferuje trzy poziomy cenowe (Standard / Fast / Lite) z referencją na wideo i interpolacją początek–koniec jako pełnoprawnymi endpointami — inny zakres funkcji, inne możliwości.
Veo 3.1 a Wan 2.7
Wan 2.7 ma w jednej rodzinie referencję na wideo, edycję obrazu i tekst na obraz — szerszy zestaw narzędzi między modalnościami. Poziom Standard Veo 3.1 pozwala optymalizować koszty warstwowo (od Lite do Standard) i oferuje 7-sekundowe video-extend, które Wan realizuje inaczej.
FAQ
Veo 3.1 API — najczęściej zadawane pytania
Cennik, licencja, integracja — typowe pytania o uruchamianie Veo 3.1 w WaveSpeedAI.
Czym jest API Veo 3.1?
Veo 3.1 to model generowania wideo od Google, udostępniony jako REST API w WaveSpeedAI. Google Veo 3.1 — tekst na wideo z zsynchronizowanym natywnym dźwiękiem w 1080p. Trzy poziomy (Standard, Fast, Lite) z tekstem na wideo, obrazem na wideo, referencją na wideo i video-extend, a w poziomie Lite także start-end-to-video. Możesz wywoływać go programowo lub wypróbować w playground, do którego prowadzi link powyżej.
Jak wywołać API Veo 3.1?
Załóż konto WaveSpeedAI, skopiuj klucz API z /accesskey, a następnie wyślij POST na https://api.wavespeed.ai/api/v3/google/veo3.1/text-to-video z danymi wejściowymi w JSON. Endpoint zwraca identyfikator predykcji. Odpytuj endpoint wyniku mniej więcej co 2 sekundy, wydłużaj odstęp przy długich zadaniach i zatrzymaj się przy dowolnym statusie końcowym. Produkcyjne przykłady w Pythonie / Node.js / cURL znajdziesz powyżej.
Ile kosztuje API Veo 3.1?
Veo 3.1 zaczyna się od $0.30 za uruchomienie. Dokładny koszt zależy od ustawionych parametrów (rozdzielczość, czas trwania, liczba wyników, referencje). Podgląd kosztu na żywo obok przycisku Generuj w playground pokazuje dokładną cenę dla bieżących danych.
Jakie warianty Veo 3.1 są dostępne?
WaveSpeedAI udostępnia 11 aktywnych endpointów Veo 3.1: google/veo3.1-lite/text-to-video, google/veo3.1/video-extend, google/veo3.1-fast/reference-to-video, google/veo3.1-fast/video-extend, google/veo3.1-fast/text-to-video, google/veo3.1/reference-to-video, google/veo3.1-lite/start-end-to-video, google/veo3.1/text-to-video, i inne. Każdy wariant ma własną stronę playground i cennik.
Czy mogę używać wyników Veo 3.1 komercyjnie?
Prawa do komercyjnego użycia wynikają z licencji modelu Google. Większość modeli Google zezwala na komercyjne wykorzystanie wyników; skrót licencji znajdziesz na stronie playground każdego modelu, a warunki na poziomie platformy w Warunkach świadczenia usług WaveSpeedAI.
Dlaczego korzystać z Veo 3.1 w WaveSpeedAI zamiast bezpośrednio?
Jeden klucz API i jedno konto rozliczeniowe dla Veo 3.1 ORAZ ponad 1000 innych modeli AI od innych dostawców. Bez osobnej konfiguracji SDK, bez osobnych limitów, bez przepisywania kodu integracji pod każdego dostawcę. Ceny są zazwyczaj na poziomie bezpośredniego API Google lub niższe.
Dostawca
O Google
Zespół stojący za Veo 3.1 i szerszą linią modeli Google w WaveSpeedAI.
Prace Google nad AI toczą się głównie w Google DeepMind i Google Research. Jego modele obrazu i wideo — Imagen, Veo oraz multimodalne modele z rodziny Gemini, takie jak Nano Banana (Gemini 3 Image) — dzielą architekturę i infrastrukturę treningową z szerszą linią Gemini. Wyniki wyróżniają się dokładnym renderowaniem tekstu, szerokim zakresem stylów i licencjonowaniem klasy komercyjnej.
Zacznij budować z Veo 3.1 w WaveSpeedAI
Darmowe kredyty na start po rejestracji. Jeden klucz API do ponad 1000 modeli AI od Google i wszystkich innych dostawców.