Veo 3.1 API
Google Veo 3.1 — text-to-video con audio nativo sincronizzato in 1080p. Tre livelli (Standard, Fast, Lite) con text-to-video, image-to-video, reference-to-video e video-extend, più start-end-to-video sul livello Lite.
Il livello Standard offre la piena qualità di Veo; il livello Fast serve per iterare; il livello Lite per previz e lavori ad alto volume. Reference-to-video accetta immagini di riferimento per una generazione che preserva l'identità; video-extend procede a passi di 7 secondi producendo un'unica clip unita.
Panoramica
Informazioni su Veo 3.1 API
Cosa fa Veo 3.1, come si inserisce nella gamma di modelli di Google e perché i team lo scelgono.
Veo 3.1 è un modello di generazione video di Google, disponibile tramite l'API REST di WaveSpeedAI. Google Veo 3.1 — text-to-video con audio nativo sincronizzato in 1080p. Tre livelli (Standard, Fast, Lite) con text-to-video, image-to-video, reference-to-video e video-extend, più start-end-to-video sul livello Lite.
Il livello Standard offre la piena qualità di Veo; il livello Fast serve per iterare; il livello Lite per previz e lavori ad alto volume. Reference-to-video accetta immagini di riferimento per una generazione che preserva l'identità; video-extend procede a passi di 7 secondi producendo un'unica clip unita.
La famiglia Veo 3.1 su WaveSpeedAI offre 11 endpoint REST che coprono i flussi di lavoro Text-To-Video, Video-Extend, Reference-To-Video, Image-To-Video. Ogni variante ha il suo prezzo, i suoi parametri e i suoi esempi di output: scegli quella più adatta alla tua modalità di input e ai tuoi vincoli di produzione, oppure richiamane diverse con la stessa chiave API per comporre pipeline in più passaggi.
Usa Veo 3.1 con la stessa chiave API, lo stesso account di fatturazione e gli stessi limiti di frequenza che usi per gli altri oltre 1.000 modelli AI di WaveSpeedAI. Nessuna configurazione separata per fornitore, nessun SDK per provider, nessun limite di frequenza per fornitore: un'unica integrazione copre tutto, dal text-to-image e text-to-video alla sintesi audio, alla generazione 3D, all'upscaling e all'editing.
Endpoint
Tutti gli endpoint API Veo 3.1
11 endpoint Veo 3.1 disponibili ora su WaveSpeedAI: scegli la variante più adatta al tuo flusso di lavoro.
/filters:quality(82)/media/images/20260408104718_8uxbq2i4.webp)
Veo3.1 Lite Text To Video
Google Veo 3.1 Lite Text-to-Video generates high-fidelity 720p or 1080p videos with natively generated audio from text prompts. Lightweight variant optimized for cost efficiency. Supports landscape and portrait aspect ratios, dialogue with lip-sync, and customizable duration. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408104740_drl8tu9l.webp)
Veo3.1 Video Extend
Extend and continue Veo 3.1 videos with smooth motion, preserved style, and strong scene coherence. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/1778749312530573096_makufpyI.webp)
Veo3.1 Fast Reference To Video
Google Veo 3.1 Fast Reference to Video is a fast AI reference-to-video generation model that creates 8-second videos from up to three reference images using the official Veo predictLongRunning endpoint with referenceImages assets. Ready-to-use REST inference API for product videos, character consistency, branded visual storytelling, social media clips, advertising creatives, and professional reference-based video generation workflows with simple integration, no coldstarts, and affordable pricing.
/filters:quality(82)/media/images/20260408104757_ct9o5p9o.webp)
Veo3.1 Fast Video Extend
Extend Veo 3.1 videos in 7-second steps with the Fast endpoint—quick, coherent continuation that preserves style and motion, output as a single merged clip. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408104805_tr00kyv7.webp)
Veo3.1 Fast Text To Video
Google Veo 3.1 Fast creates text-to-video with native 1080p and synchronized audio, delivering high-quality videos for creators. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408104748_nwaixdpw.webp)
Veo3.1 Reference To Video
Google Veo3.1 Reference-to-Video performs image-to-video generation that preserves a specific subject's appearance and identity from provided reference images, enabling consistent character or product motion across frames. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408104714_ut4h5kku.webp)
Veo3.1 Lite Start End To Video
Google Veo 3.1 Lite Start-End-to-Video generates high-fidelity videos by interpolating between a start image and an optional end image. Supports 720p and 1080p resolutions, landscape and portrait aspect ratios, and native audio generation. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408104752_1voe0l4b.webp)
Veo3.1 Text To Video
Google Veo 3.1 converts text prompts into videos with synchronized audio at native 1080p for high-quality outputs. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408104708_dmnbefn0.webp)
Veo3.1 Lite Image To Video
Google Veo 3.1 Lite Image-to-Video transforms static images into high-fidelity 720p or 1080p videos with natively generated audio. Supports many interpolation use cases, landscape and portrait aspect ratios, and customizable duration. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408104802_aaez2mmf.webp)
Veo3.1 Fast Image To Video
Google Veo 3.1 Fast is an Image-to-Video model with native 1080p output for high-detail videos from images and fast performance. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408104744_xfvl07s5.webp)
Veo3.1 Image To Video
Google Veo 3.1 is an Image-to-Video model that converts images into high-quality videos with native 1080P output for enhanced detail and creative flexibility. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
Esempi
Veo 3.1 in azione
Output reali generati dall'API Veo 3.1. Passa il mouse su un video per l'anteprima, clicca per aprire il visualizzatore a schermo intero.
Guida
Come usare l'API Veo 3.1
Quattro passaggi dalla registrazione alla generazione completata. Esempi completi in Python, Node.js e cURL sono nella sezione API qui sotto.
- 01
Ottieni una chiave API
Registrati su WaveSpeedAI e copia la tua chiave API dalla dashboard. I nuovi account includono crediti gratuiti di benvenuto: bastano per usare il playground qualche decina di volte prima che inizi la fatturazione.
- 02
Invia una predizione
Invia con POST il tuo input in formato JSON a https://api.wavespeed.ai/api/v3/google/veo3.1/text-to-video. L'endpoint restituisce subito un id di predizione: le generazioni sono asincrone, quindi non devi tenere una connessione aperta durante l'inferenza.
- 03
Controlla il completamento
Fai GET su https://api.wavespeed.ai/api/v3/predictions/{request_id}/result. Restituisci gli output con completed; interrompi con un errore con failed, cancelled, timeout o deleted; continua il polling per ogni altro stato.
- 04
Leggi l'URL dell'output
Quando lo stato è "completed", leggi l'URL da data.outputs[0]. L'URL punta al tuo contenuto generato sulla CDN di WaveSpeedAI: immagine, video, audio o file 3D a seconda della variante di Veo 3.1 che hai richiamato.
Casi d'uso
Cosa puoi creare con Veo 3.1
I flussi di lavoro più comuni per cui sviluppatori e creator usano l'API Veo 3.1.
Text-to-video con audio nativo in 1080p
google/veo3.1/text-to-video converte i prompt testuali in video con audio sincronizzato in 1080p nativo — risoluzione pronta per la consegna, senza passaggio di upscaling. Lo stesso formato di prompt funziona sui livelli Standard, Fast e Lite.
Reference-to-video per preservare l'identità
google/veo3.1/reference-to-video esegue un image-to-video preservando l'aspetto di un soggetto specifico a partire dalle immagini di riferimento fornite. Il reference-to-video del livello Fast usa l'endpoint ufficiale predictLongRunning di Veo e supporta fino a tre immagini di riferimento per output di 8 secondi.
Prezzi a livelli: Standard / Fast / Lite
Standard per la consegna, Fast per l'iterazione, Lite per previz e lavori ad alto volume. Lite comporta compromessi sulla qualità; cambia livello modificando l'URL dell'endpoint, senza riscrivere i prompt.
Video-extend a passi di 7 secondi
google/veo3.1/video-extend prosegue le clip Veo esistenti con movimento fluido e stile preservato — l'output è un'unica clip unita, anziché segmenti separati da assemblare. Il video-extend del livello Fast (/extension) è l'opzione più economica per l'estensione iterativa.
Interpolazione tra frame iniziale e finale (livello Lite)
google/veo3.1-lite/start-end-to-video interpola tra un'immagine iniziale e un'immagine finale facoltativa per generare il movimento di raccordo. Supporta 720p e 1080p, proporzioni orizzontali e verticali. Utile per animatic e workflow basati su keyframe al prezzo del livello Lite.
Image-to-video in 1080p nativo
google/veo3.1/image-to-video converte le immagini in video 1080p con dettaglio migliorato e maggiore flessibilità creativa — la scelta giusta quando si parte da uno still chiave anziché da un brief solo testuale.
Consigli
Consigli per scrivere i prompt per Veo 3.1
Consigli pratici per ottenere output migliori da Veo 3.1, ricavati dagli schemi che funzionano con i modelli video nelle pipeline di produzione.
- 01
Output 1080p nativo in tutti i livelli
Dichiarazione a catalogo: «1080p nativo per output di alta qualità». Tutte le varianti di Veo 3.1 generano direttamente in 1080p — nessun passaggio di upscaling prima della consegna. Il livello Lite supporta anche 720p quando la banda conta di più.
- 02
Itera su Lite, rifinisci su Fast, consegna su Standard
Lo stesso formato di prompt funziona su Standard, Fast e Lite — cambia l'URL dell'endpoint senza riscrivere nulla. Itera su Lite per la direzione del prompt, rifinisci su Fast per una qualità più alta, consegna su Standard quando conta la massima fedeltà.
- 03
Reference-to-video per preservare l'identità
google/veo3.1/reference-to-video preserva l'aspetto di un soggetto specifico dalle immagini di riferimento. La versione del livello Fast supporta fino a 3 immagini di riferimento per generazione. Utile per video con presentatori, personaggi di brand e contenuti seriali.
- 04
Video-extend procede a passi di 7 secondi
google/veo3.1-fast/video-extend estende i video Veo 3.1 a passi di 7 secondi con movimento coerente e stile preservato — l'output è un'unica clip unita anziché segmenti separati da assemblare in post-produzione.
- 05
Interpolazione tra frame iniziale e finale solo su Lite
google/veo3.1-lite/start-end-to-video interpola tra un'immagine iniziale e un'immagine finale facoltativa. Supporta 720p / 1080p, orizzontale e verticale. Solo Lite — non disponibile su Standard o Fast.
- 06
Disattiva l'audio per i filmati senza sonoro
Il parametro generate_audio è esposto sull'endpoint text-to-video Standard. Disattivalo per B-roll, post social e clip in cui sostituiresti comunque l'audio in post-produzione.
Prezzi
Prezzi dell'API Veo 3.1
Il prezzo è per output. L'addebito finale dipende dai parametri impostati nel playground di ciascuna variante (risoluzione, durata, numero di output, riferimenti).
| Endpoint | Tipo | Prezzo di partenza |
|---|---|---|
| google/ | text-to-video | $0.30 |
| google/ | video-extend | $3.20 |
| google/ | reference-to-video | $0.64 |
| google/ | video-extend | $1.20 |
| google/ | text-to-video | $1.20 |
| google/ | reference-to-video | $3.20 |
| google/ | image-to-video | $0.40 |
| google/ | text-to-video | $3.20 |
| google/ | image-to-video | $0.30 |
| google/ | image-to-video | $1.20 |
| google/ | image-to-video | $3.20 |
API
Richiama l'API Veo 3.1
Ottieni una chiave API su wavespeed.ai/accesskey, poi invia una predizione tramite REST. Il playground genera esempi pronti da incollare per qualsiasi combinazione di input.
POSThttps://api.wavespeed.ai/api/v3/google/veo3.1/text-to-video
# 1. Submit the prediction.
SUBMIT_RESPONSE=$(curl --silent --show-error --fail-with-body \
-X POST "https://api.wavespeed.ai/api/v3/google/veo3.1/text-to-video" \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $WAVESPEED_API_KEY" \
-d '{
"prompt": "A cinematic shot of a city at sunset, soft golden light",
"aspect_ratio": "16:9",
"duration": 8,
"resolution": "1080p",
"generate_audio": true
}')
TASK=$(printf '%s' "$SUBMIT_RESPONSE" | jq 'if has("data") then .data else . end')
PREDICTION_ID=$(printf '%s' "$TASK" | jq -r '.id')
if [ -z "$PREDICTION_ID" ] || [ "$PREDICTION_ID" = "null" ]; then
printf 'Submission response did not contain a prediction id
' >&2
exit 1
fi
RESULT_URL="https://api.wavespeed.ai/api/v3/predictions/$PREDICTION_ID/result"
# 2. Poll until the prediction finishes.
while true; do
RESPONSE=$(curl --silent --show-error --fail-with-body "$RESULT_URL" \
-H "Authorization: Bearer $WAVESPEED_API_KEY")
RESULT=$(printf '%s' "$RESPONSE" | jq 'if has("data") then .data else . end')
STATUS=$(printf '%s' "$RESULT" | jq -r '.status')
case "$STATUS" in
completed) printf '%s\n' "$RESULT" | jq '.outputs'; break ;;
failed|cancelled|timeout|deleted) printf '%s\n' "$RESULT" | jq . >&2; exit 1 ;;
*) sleep 2 ;;
esac
doneconst submitUrl = "https://api.wavespeed.ai/api/v3/google/veo3.1/text-to-video";
const apiKey = process.env.WAVESPEED_API_KEY;
if (!apiKey) throw new Error('Set WAVESPEED_API_KEY');
async function requestJson(url, options = {}) {
const response = await fetch(url, options);
if (!response.ok) throw new Error(await response.text());
return response.json();
}
// 1. Submit the prediction.
const body = await requestJson(submitUrl, {
method: "POST",
headers: {
"Authorization": `Bearer ${apiKey}`,
"Content-Type": "application/json",
},
body: JSON.stringify({
"prompt": "A cinematic shot of a city at sunset, soft golden light",
"aspect_ratio": "16:9",
"duration": 8,
"resolution": "1080p",
"generate_audio": true
}),
});
const task = body.data ?? body;
const resultUrl = `https://api.wavespeed.ai/api/v3/predictions/${task.id}/result`;
// 2. Poll until the prediction finishes.
while (true) {
const resultBody = await requestJson(resultUrl, {
headers: { "Authorization": `Bearer ${apiKey}` },
});
const result = resultBody.data ?? resultBody;
if (result.status === "completed") {
console.log(result.outputs);
break;
}
if (["failed", "cancelled", "timeout", "deleted"].includes(result.status)) throw new Error(JSON.stringify(result));
await new Promise(resolve => setTimeout(resolve, 2000));
}import json
import os
import time
from urllib.request import Request, urlopen
api_key = os.environ["WAVESPEED_API_KEY"]
headers = {"Authorization": f"Bearer {api_key}", "Content-Type": "application/json"}
payload = {
"prompt": "A cinematic shot of a city at sunset, soft golden light",
"aspect_ratio": "16:9",
"duration": 8,
"resolution": "1080p",
"generate_audio": True
}
def request_json(url, data=None):
request = Request(url, data=data, headers=headers, method="POST" if data else "GET")
with urlopen(request) as response:
return json.load(response)
# 1. Submit the prediction.
body = request_json("https://api.wavespeed.ai/api/v3/google/veo3.1/text-to-video", json.dumps(payload).encode())
task = body.get("data", body)
result_url = f"https://api.wavespeed.ai/api/v3/predictions/{task['id']}/result"
# 2. Poll until the prediction finishes.
while True:
result_body = request_json(result_url)
result = result_body.get("data", result_body)
status = result.get("status")
if status == "completed":
print(result.get("outputs", []))
break
if status in {"failed", "cancelled", "timeout", "deleted"}:
raise RuntimeError(result)
time.sleep(2)Confronto
Veo 3.1 a confronto con le alternative
Quando scegliere Veo 3.1 rispetto a modelli simili su WaveSpeedAI.
Veo 3.1 vs Seedance 2.0
Seedance 2.0 offre audio nativo in ogni livello e un veloce livello Turbo. Veo 3.1 costa di più al livello più alto, ma il livello Lite è competitivo sul costo e la fama di fotorealismo di Veo è più solida per i volti umani.
Veo 3.1 vs Kling 3.0
Kling 3.0 ha livelli Pro e 4K più un endpoint per il controllo del movimento. Veo 3.1 offre tre livelli di prezzo (Standard / Fast / Lite) con reference-to-video e interpolazione tra frame iniziale e finale come endpoint di prima classe — gamma di funzioni diversa, approccio diverso.
Veo 3.1 vs Wan 2.7
Wan 2.7 ha varianti reference-to-video, image-edit e text-to-image in un'unica famiglia — un toolkit cross-modale più ampio. Il livello Standard di Veo 3.1 copre l'ottimizzazione dei costi a livelli (da Lite a Standard) e un video-extend a 7 secondi che Wan gestisce in modo diverso.
FAQ
Veo 3.1 API — Domande frequenti
Prezzi, licenza, integrazione: le domande più comuni sull'uso di Veo 3.1 su WaveSpeedAI.
Che cos'è l'API Veo 3.1?
Veo 3.1 è un modello di generazione video di Google reso disponibile come API REST su WaveSpeedAI. Google Veo 3.1 — text-to-video con audio nativo sincronizzato in 1080p. Tre livelli (Standard, Fast, Lite) con text-to-video, image-to-video, reference-to-video e video-extend, più start-end-to-video sul livello Lite. Puoi richiamarlo da codice o provarlo dal playground collegato qui sopra.
Come richiamo l'API Veo 3.1?
Registrati su WaveSpeedAI, copia la tua chiave API da /accesskey, poi invia con POST a https://api.wavespeed.ai/api/v3/google/veo3.1/text-to-video il tuo input in formato JSON. L'endpoint restituisce un id di predizione. Fai polling sull'endpoint dei risultati circa ogni 2 secondi, aumenta l'intervallo per le attività di lunga durata e fermati a qualsiasi stato terminale. Gli esempi in Python / Node.js / cURL orientati alla produzione sono qui sopra.
Quanto costa l'API Veo 3.1?
Veo 3.1 parte da $0.30 per esecuzione. Il costo esatto dipende dai parametri impostati (risoluzione, durata, numero di output, riferimenti). L'anteprima del costo in tempo reale accanto al pulsante Genera nel playground mostra il prezzo esatto per il tuo input attuale.
Quali varianti di Veo 3.1 sono disponibili?
WaveSpeedAI offre 11 endpoint Veo 3.1 attivi: google/veo3.1-lite/text-to-video, google/veo3.1/video-extend, google/veo3.1-fast/reference-to-video, google/veo3.1-fast/video-extend, google/veo3.1-fast/text-to-video, google/veo3.1/reference-to-video, google/veo3.1-lite/start-end-to-video, google/veo3.1/text-to-video, e altri. Ogni variante ha la sua pagina playground e i suoi prezzi.
Posso usare gli output di Veo 3.1 a fini commerciali?
I diritti di uso commerciale seguono la licenza del modello di Google. La maggior parte dei modelli di Google consente l'uso commerciale degli output; consulta la pagina playground di ciascun modello per il riepilogo della licenza e i Termini di servizio di WaveSpeedAI per le condizioni a livello di piattaforma.
Perché usare Veo 3.1 su WaveSpeedAI invece di rivolgersi direttamente al fornitore?
Una sola chiave API e un solo account di fatturazione per Veo 3.1 E per oltre 1.000 altri modelli AI di altri provider. Nessuna configurazione di SDK per fornitore, nessun limite di frequenza separato, nessun codice di integrazione da riscrivere per ogni fornitore. I prezzi sono in genere in linea o inferiori a quelli dell'API diretta di Google.
Provider
Informazioni su Google
Il team dietro Veo 3.1 e dietro l'intera gamma di modelli di Google su WaveSpeedAI.
Il lavoro di Google sull'AI si svolge principalmente in Google DeepMind e Google Research. I suoi modelli di immagini e video — Imagen, Veo e modelli multimodali della famiglia Gemini come Nano Banana (Gemini 3 Image) — condividono architettura e infrastruttura di addestramento con la più ampia linea Gemini. Gli output sono noti per l'accurata resa del testo, l'ampia copertura stilistica e le licenze di livello commerciale.
Inizia a creare con Veo 3.1 su WaveSpeedAI
Crediti gratuiti di benvenuto alla registrazione. Una sola chiave API per oltre 1.000 modelli AI di Google e di ogni altro provider.