Veo 3.1 API
Google Veo 3.1 — texto para vídeo com áudio nativo sincronizado em 1080p. Três níveis (Standard, Fast, Lite) com texto para vídeo, imagem para vídeo, referência para vídeo e video-extend, além de start-end-to-video no nível Lite.
O nível Standard entrega a qualidade total do Veo; o Fast serve para iteração; o Lite, para previz e trabalho em alto volume. Referência para vídeo aceita imagens de referência para geração que preserva a identidade; o video-extend funciona em passos de 7 segundos e produz um único clipe unificado.
Visão geral
Sobre o Veo 3.1 API
O que o Veo 3.1 faz, como ele se encaixa na linha de modelos da Google e por que as equipes o escolhem.
Veo 3.1 é um modelo de geração de vídeo da Google, disponível pela API REST da WaveSpeedAI. Google Veo 3.1 — texto para vídeo com áudio nativo sincronizado em 1080p. Três níveis (Standard, Fast, Lite) com texto para vídeo, imagem para vídeo, referência para vídeo e video-extend, além de start-end-to-video no nível Lite.
O nível Standard entrega a qualidade total do Veo; o Fast serve para iteração; o Lite, para previz e trabalho em alto volume. Referência para vídeo aceita imagens de referência para geração que preserva a identidade; o video-extend funciona em passos de 7 segundos e produz um único clipe unificado.
A família Veo 3.1 na WaveSpeedAI traz 11 endpoints REST cobrindo os fluxos de Text-To-Video, Video-Extend, Reference-To-Video, Image-To-Video. Cada variante tem seu próprio preço, parâmetros e exemplos de resultado — escolha a que combina com sua modalidade de entrada e suas restrições de produção, ou chame várias com a mesma chave de API para montar pipelines de várias etapas.
Execute o Veo 3.1 com a mesma chave de API, a mesma conta de cobrança e os mesmos limites de taxa que você usa nos outros mais de 1.000 modelos de IA da WaveSpeedAI. Sem configuração separada por fornecedor, sem SDKs por provedor, sem limites de taxa por fornecedor — uma única integração cobre tudo, de texto para imagem e texto para vídeo até síntese de áudio, geração 3D, ampliação e edição.
Endpoints
Todos os endpoints da API de Veo 3.1
11 endpoints de Veo 3.1 disponíveis agora na WaveSpeedAI — escolha a variante que combina com seu fluxo de trabalho.
/filters:quality(82)/media/images/20260408104718_8uxbq2i4.webp)
Veo3.1 Lite Text To Video
Google Veo 3.1 Lite Text-to-Video generates high-fidelity 720p or 1080p videos with natively generated audio from text prompts. Lightweight variant optimized for cost efficiency. Supports landscape and portrait aspect ratios, dialogue with lip-sync, and customizable duration. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408104740_drl8tu9l.webp)
Veo3.1 Video Extend
Extend and continue Veo 3.1 videos with smooth motion, preserved style, and strong scene coherence. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/1778749312530573096_makufpyI.webp)
Veo3.1 Fast Reference To Video
Google Veo 3.1 Fast Reference to Video is a fast AI reference-to-video generation model that creates 8-second videos from up to three reference images using the official Veo predictLongRunning endpoint with referenceImages assets. Ready-to-use REST inference API for product videos, character consistency, branded visual storytelling, social media clips, advertising creatives, and professional reference-based video generation workflows with simple integration, no coldstarts, and affordable pricing.
/filters:quality(82)/media/images/20260408104757_ct9o5p9o.webp)
Veo3.1 Fast Video Extend
Extend Veo 3.1 videos in 7-second steps with the Fast endpoint—quick, coherent continuation that preserves style and motion, output as a single merged clip. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408104805_tr00kyv7.webp)
Veo3.1 Fast Text To Video
Google Veo 3.1 Fast creates text-to-video with native 1080p and synchronized audio, delivering high-quality videos for creators. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408104748_nwaixdpw.webp)
Veo3.1 Reference To Video
Google Veo3.1 Reference-to-Video performs image-to-video generation that preserves a specific subject's appearance and identity from provided reference images, enabling consistent character or product motion across frames. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408104714_ut4h5kku.webp)
Veo3.1 Lite Start End To Video
Google Veo 3.1 Lite Start-End-to-Video generates high-fidelity videos by interpolating between a start image and an optional end image. Supports 720p and 1080p resolutions, landscape and portrait aspect ratios, and native audio generation. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408104752_1voe0l4b.webp)
Veo3.1 Text To Video
Google Veo 3.1 converts text prompts into videos with synchronized audio at native 1080p for high-quality outputs. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408104708_dmnbefn0.webp)
Veo3.1 Lite Image To Video
Google Veo 3.1 Lite Image-to-Video transforms static images into high-fidelity 720p or 1080p videos with natively generated audio. Supports many interpolation use cases, landscape and portrait aspect ratios, and customizable duration. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408104802_aaez2mmf.webp)
Veo3.1 Fast Image To Video
Google Veo 3.1 Fast is an Image-to-Video model with native 1080p output for high-detail videos from images and fast performance. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408104744_xfvl07s5.webp)
Veo3.1 Image To Video
Google Veo 3.1 is an Image-to-Video model that converts images into high-quality videos with native 1080P output for enhanced detail and creative flexibility. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
Exemplos
Veja o Veo 3.1 em ação
Resultados reais gerados pela API do Veo 3.1. Passe o mouse sobre qualquer vídeo para pré-visualizar e clique para abrir o visualizador em tamanho real.
Como usar
Como usar a API do Veo 3.1
Quatro passos do cadastro até uma geração concluída. Exemplos completos em Python, Node.js e cURL estão na seção de API abaixo.
- 01
Obtenha uma chave de API
Crie uma conta na WaveSpeedAI e copie sua chave de API no painel. Contas novas recebem créditos iniciais grátis — o suficiente para usar o playground algumas dezenas de vezes antes de a cobrança começar.
- 02
Envie uma predição
Faça POST da sua entrada em JSON para https://api.wavespeed.ai/api/v3/google/veo3.1/text-to-video. O endpoint devolve um id de predição imediatamente — as gerações são assíncronas, então você não mantém uma conexão aberta durante a inferência.
- 03
Consulte até concluir
Faça GET em https://api.wavespeed.ai/api/v3/predictions/{request_id}/result. Retorne os resultados quando o status for completed; pare com erro em failed, cancelled, timeout ou deleted; continue consultando em qualquer outro status.
- 04
Leia a URL do resultado
Quando o status for "completed", leia a URL em data.outputs[0]. A URL aponta para a mídia gerada na CDN da WaveSpeedAI — imagem, vídeo, áudio ou arquivo 3D, conforme a variante do Veo 3.1 que você chamou.
Casos de uso
O que você pode criar com o Veo 3.1
Fluxos de trabalho comuns para os quais desenvolvedores e criadores usam a API do Veo 3.1.
Texto para vídeo com áudio em 1080p nativo
google/veo3.1/text-to-video converte prompts de texto em vídeos com áudio sincronizado em 1080p nativo — resolução pronta para entrega, sem passada de upscale. O mesmo formato de prompt funciona nos níveis Standard, Fast e Lite.
Referência para vídeo para preservar identidade
google/veo3.1/reference-to-video faz imagem para vídeo preservando a aparência de um sujeito específico a partir das imagens de referência fornecidas. O reference-to-video do nível Fast usa o endpoint oficial predictLongRunning do Veo e suporta até três imagens de referência para saídas de 8 segundos.
Preços escalonados: Standard / Fast / Lite
Standard para entrega, Fast para iteração, Lite para previz e trabalho em alto volume. O Lite tem concessões de qualidade; troque de nível pela URL do endpoint sem reescrever os prompts.
Video-extend em passos de 7 segundos
google/veo3.1/video-extend continua clipes Veo existentes com movimento suave e estilo preservado — a saída é um único clipe unificado, em vez de segmentos separados para unir. O video-extend do nível Fast (/extension) é a opção mais barata para extensão iterativa.
Interpolação inicial-final (nível Lite)
google/veo3.1-lite/start-end-to-video interpola entre uma imagem inicial e uma imagem final opcional para gerar o movimento de ligação. Suporta 720p e 1080p, nas proporções paisagem e retrato. Útil para animatics e workflows orientados por keyframes pelo preço do nível Lite.
Imagem para vídeo em 1080p nativo
google/veo3.1/image-to-video converte imagens em vídeos 1080p com mais detalhe e flexibilidade criativa — a escolha certa ao partir de uma imagem-chave em vez de um briefing só de texto.
Dicas
Dicas de prompt para o Veo 3.1
Conselhos práticos para obter melhores resultados com o Veo 3.1 — extraídos dos padrões que funcionam em modelos de vídeo em pipelines de produção.
- 01
Saída em 1080p nativo em todos os níveis
Afirmação do catálogo: "1080p nativo para saídas de alta qualidade". Todas as variantes do Veo 3.1 geram diretamente em 1080p — sem passada de upscale antes da entrega. O nível Lite também suporta 720p quando a largura de banda importa mais.
- 02
Itere no Lite, refine no Fast e entregue no Standard
O mesmo formato de prompt funciona no Standard, no Fast e no Lite — troque a URL do endpoint sem reescrever nada. Itere no Lite para definir a direção do prompt, refine no Fast para obter mais qualidade e entregue no Standard quando a fidelidade máxima importar.
- 03
Referência para vídeo para preservar identidade
google/veo3.1/reference-to-video preserva a aparência de um sujeito específico a partir de imagens de referência. A versão do nível Fast suporta até 3 imagens de referência por geração. Útil para vídeos de apresentadores, personagens de marca e conteúdo seriado.
- 04
O video-extend funciona em passos de 7 segundos
google/veo3.1-fast/video-extend estende vídeos do Veo 3.1 em passos de 7 segundos, com movimento coerente e estilo preservado — a saída é um único clipe unificado, em vez de segmentos separados que você teria de unir na pós-produção.
- 05
Interpolação inicial-final apenas no Lite
google/veo3.1-lite/start-end-to-video interpola entre uma imagem inicial e uma imagem final opcional. Suporta 720p / 1080p, paisagem e retrato. Exclusivo do Lite — não disponível no Standard nem no Fast.
- 06
Desative o áudio para filmagens sem som
O parâmetro generate_audio é exposto no endpoint text-to-video Standard. Desative-o para B-roll, posts sociais e clipes em que você trocaria o áudio na pós-produção de qualquer forma.
Preços
Preços da API de Veo 3.1
O preço é por resultado. O valor final varia conforme os parâmetros definidos no playground de cada variante (resolução, duração, quantidade de resultados, referências).
| Endpoint | Tipo | Preço inicial |
|---|---|---|
| google/ | text-to-video | $0.30 |
| google/ | video-extend | $3.20 |
| google/ | reference-to-video | $0.64 |
| google/ | video-extend | $1.20 |
| google/ | text-to-video | $1.20 |
| google/ | reference-to-video | $3.20 |
| google/ | image-to-video | $0.40 |
| google/ | text-to-video | $3.20 |
| google/ | image-to-video | $0.30 |
| google/ | image-to-video | $1.20 |
| google/ | image-to-video | $3.20 |
API
Chame a API de Veo 3.1
Crie uma chave de API em wavespeed.ai/accesskey e envie uma predição via REST. O playground gera exemplos prontos para colar para qualquer combinação de entradas.
POSThttps://api.wavespeed.ai/api/v3/google/veo3.1/text-to-video
# 1. Submit the prediction.
SUBMIT_RESPONSE=$(curl --silent --show-error --fail-with-body \
-X POST "https://api.wavespeed.ai/api/v3/google/veo3.1/text-to-video" \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $WAVESPEED_API_KEY" \
-d '{
"prompt": "A cinematic shot of a city at sunset, soft golden light",
"aspect_ratio": "16:9",
"duration": 8,
"resolution": "1080p",
"generate_audio": true
}')
TASK=$(printf '%s' "$SUBMIT_RESPONSE" | jq 'if has("data") then .data else . end')
PREDICTION_ID=$(printf '%s' "$TASK" | jq -r '.id')
if [ -z "$PREDICTION_ID" ] || [ "$PREDICTION_ID" = "null" ]; then
printf 'Submission response did not contain a prediction id
' >&2
exit 1
fi
RESULT_URL="https://api.wavespeed.ai/api/v3/predictions/$PREDICTION_ID/result"
# 2. Poll until the prediction finishes.
while true; do
RESPONSE=$(curl --silent --show-error --fail-with-body "$RESULT_URL" \
-H "Authorization: Bearer $WAVESPEED_API_KEY")
RESULT=$(printf '%s' "$RESPONSE" | jq 'if has("data") then .data else . end')
STATUS=$(printf '%s' "$RESULT" | jq -r '.status')
case "$STATUS" in
completed) printf '%s\n' "$RESULT" | jq '.outputs'; break ;;
failed|cancelled|timeout|deleted) printf '%s\n' "$RESULT" | jq . >&2; exit 1 ;;
*) sleep 2 ;;
esac
doneconst submitUrl = "https://api.wavespeed.ai/api/v3/google/veo3.1/text-to-video";
const apiKey = process.env.WAVESPEED_API_KEY;
if (!apiKey) throw new Error('Set WAVESPEED_API_KEY');
async function requestJson(url, options = {}) {
const response = await fetch(url, options);
if (!response.ok) throw new Error(await response.text());
return response.json();
}
// 1. Submit the prediction.
const body = await requestJson(submitUrl, {
method: "POST",
headers: {
"Authorization": `Bearer ${apiKey}`,
"Content-Type": "application/json",
},
body: JSON.stringify({
"prompt": "A cinematic shot of a city at sunset, soft golden light",
"aspect_ratio": "16:9",
"duration": 8,
"resolution": "1080p",
"generate_audio": true
}),
});
const task = body.data ?? body;
const resultUrl = `https://api.wavespeed.ai/api/v3/predictions/${task.id}/result`;
// 2. Poll until the prediction finishes.
while (true) {
const resultBody = await requestJson(resultUrl, {
headers: { "Authorization": `Bearer ${apiKey}` },
});
const result = resultBody.data ?? resultBody;
if (result.status === "completed") {
console.log(result.outputs);
break;
}
if (["failed", "cancelled", "timeout", "deleted"].includes(result.status)) throw new Error(JSON.stringify(result));
await new Promise(resolve => setTimeout(resolve, 2000));
}import json
import os
import time
from urllib.request import Request, urlopen
api_key = os.environ["WAVESPEED_API_KEY"]
headers = {"Authorization": f"Bearer {api_key}", "Content-Type": "application/json"}
payload = {
"prompt": "A cinematic shot of a city at sunset, soft golden light",
"aspect_ratio": "16:9",
"duration": 8,
"resolution": "1080p",
"generate_audio": True
}
def request_json(url, data=None):
request = Request(url, data=data, headers=headers, method="POST" if data else "GET")
with urlopen(request) as response:
return json.load(response)
# 1. Submit the prediction.
body = request_json("https://api.wavespeed.ai/api/v3/google/veo3.1/text-to-video", json.dumps(payload).encode())
task = body.get("data", body)
result_url = f"https://api.wavespeed.ai/api/v3/predictions/{task['id']}/result"
# 2. Poll until the prediction finishes.
while True:
result_body = request_json(result_url)
result = result_body.get("data", result_body)
status = result.get("status")
if status == "completed":
print(result.get("outputs", []))
break
if status in {"failed", "cancelled", "timeout", "deleted"}:
raise RuntimeError(result)
time.sleep(2)Comparar
Veo 3.1 vs alternativas
Quando escolher o Veo 3.1 em vez de modelos semelhantes na WaveSpeedAI.
Veo 3.1 vs Seedance 2.0
O Seedance 2.0 traz áudio nativo em todos os níveis e um nível Turbo rápido. O Veo 3.1 é mais caro no nível superior, mas o nível Lite é competitivo em custo, e a reputação de fotorrealismo do Veo é mais forte em rostos humanos.
Veo 3.1 vs Kling 3.0
O Kling 3.0 tem níveis Pro e 4K, além de um endpoint de controle de movimento. O Veo 3.1 traz três níveis de preço (Standard / Fast / Lite), com referência para vídeo e interpolação inicial-final como endpoints de primeira classe — conjuntos de recursos diferentes.
Veo 3.1 vs Wan 2.7
O Wan 2.7 tem variantes de referência para vídeo, edição de imagem e texto para imagem em uma só família — um kit multimodal mais amplo. O nível Standard do Veo 3.1 cobre a otimização de custo por níveis (do Lite ao Standard) e o video-extend de 7 segundos, que o Wan trata de outra forma.
FAQ
Veo 3.1 API — Perguntas frequentes
Preços, licença, integração — perguntas comuns sobre executar o Veo 3.1 na WaveSpeedAI.
O que é a API do Veo 3.1?
Veo 3.1 é um modelo de geração de vídeo da Google disponibilizado como API REST na WaveSpeedAI. Google Veo 3.1 — texto para vídeo com áudio nativo sincronizado em 1080p. Três níveis (Standard, Fast, Lite) com texto para vídeo, imagem para vídeo, referência para vídeo e video-extend, além de start-end-to-video no nível Lite. Você pode chamá-lo por código ou testá-lo no playground indicado acima.
Como chamo a API do Veo 3.1?
Crie uma conta na WaveSpeedAI, copie sua chave de API em /accesskey e faça POST para https://api.wavespeed.ai/api/v3/google/veo3.1/text-to-video com sua entrada em JSON. O endpoint devolve um id de predição. Consulte o endpoint de resultado a cada 2 segundos, aproximadamente, aumente o intervalo em tarefas longas e pare em qualquer status final. Exemplos prontos para produção em Python / Node.js / cURL estão acima.
Quanto custa a API do Veo 3.1?
O Veo 3.1 começa em $0.30 por execução. O custo exato varia conforme os parâmetros definidos (resolução, duração, quantidade de resultados, referências). A prévia de custo ao vivo ao lado do botão Gerar no playground mostra o preço exato da sua entrada atual.
Quais variantes do Veo 3.1 estão disponíveis?
A WaveSpeedAI hospeda 11 endpoints de Veo 3.1 ativos: google/veo3.1-lite/text-to-video, google/veo3.1/video-extend, google/veo3.1-fast/reference-to-video, google/veo3.1-fast/video-extend, google/veo3.1-fast/text-to-video, google/veo3.1/reference-to-video, google/veo3.1-lite/start-end-to-video, google/veo3.1/text-to-video, e mais. Cada variante tem sua própria página de playground e seu preço.
Posso usar os resultados do Veo 3.1 comercialmente?
Os direitos de uso comercial seguem a licença do modelo da Google. A maioria dos modelos da Google permite o uso comercial dos resultados; veja o resumo da licença na página do playground de cada modelo e os Termos de Serviço da WaveSpeedAI para as condições da plataforma.
Por que usar o Veo 3.1 na WaveSpeedAI em vez de ir direto à fonte?
Uma chave de API e uma conta de cobrança para o Veo 3.1 E mais de 1.000 outros modelos de IA de outros provedores. Sem configuração de SDK por fornecedor, sem limites de taxa separados, sem reescrever o código de integração a cada fornecedor. Os preços costumam ser iguais ou menores que os da API direta da Google.
Provedor
Sobre a Google
A equipe por trás do Veo 3.1 e de toda a linha de modelos da Google na WaveSpeedAI.
O trabalho de IA do Google acontece principalmente no Google DeepMind e no Google Research. Seus modelos de imagem e vídeo — Imagen, Veo e modelos multimodais da família Gemini, como o Nano Banana (Gemini 3 Image) — compartilham arquitetura e infraestrutura de treinamento com a linha Gemini em geral. As saídas se destacam pela renderização precisa de texto, ampla cobertura de estilos e licenciamento de nível comercial.
Comece a criar com o Veo 3.1 na WaveSpeedAI
Créditos iniciais grátis no cadastro. Uma chave de API para mais de 1.000 modelos de IA da Google e de todos os outros provedores.