Veo 3.1 API
Veo 3.1 de Google: texto a vídeo con audio nativo sincronizado en 1080p. Tres niveles (Standard, Fast, Lite) con texto a vídeo, imagen a vídeo, referencia a vídeo y extensión de vídeo, además de start-end-to-video en el nivel Lite.
El nivel Standard ofrece la calidad completa de Veo; el nivel Fast sirve para iterar; el nivel Lite, para previsualización y trabajo en volumen. Referencia a vídeo acepta imágenes de referencia para generar conservando la identidad; la extensión de vídeo funciona en pasos de 7 segundos y produce un único clip combinado.
Resumen
Acerca de Veo 3.1 API
Qué hace Veo 3.1, cómo encaja en la gama de modelos de Google y por qué los equipos lo eligen.
Veo 3.1 es un modelo de generación de vídeo de Google, disponible a través de la API REST de WaveSpeedAI. Veo 3.1 de Google: texto a vídeo con audio nativo sincronizado en 1080p. Tres niveles (Standard, Fast, Lite) con texto a vídeo, imagen a vídeo, referencia a vídeo y extensión de vídeo, además de start-end-to-video en el nivel Lite.
El nivel Standard ofrece la calidad completa de Veo; el nivel Fast sirve para iterar; el nivel Lite, para previsualización y trabajo en volumen. Referencia a vídeo acepta imágenes de referencia para generar conservando la identidad; la extensión de vídeo funciona en pasos de 7 segundos y produce un único clip combinado.
La familia Veo 3.1 en WaveSpeedAI incluye 11 endpoints REST que cubren los flujos de trabajo de Text-To-Video, Video-Extend, Reference-To-Video, Image-To-Video. Cada variante tiene su propio precio, parámetros y ejemplos de resultados: elige la que se ajuste a tu modalidad de entrada y a tus requisitos de producción, o llama a varias con la misma clave de API para componer flujos de varios pasos.
Ejecuta Veo 3.1 con la misma clave de API, la misma cuenta de facturación y los mismos límites de uso que ya usas para los demás más de 1.000 modelos de IA de WaveSpeedAI. Sin configuración aparte por proveedor, sin SDK por proveedor, sin límites de uso distintos por proveedor: una sola integración lo cubre todo, desde texto a imagen y texto a vídeo hasta síntesis de audio, generación 3D, escalado y edición.
Endpoints
Todos los endpoints de la API de Veo 3.1
11 endpoints de Veo 3.1 disponibles ahora en WaveSpeedAI: elige la variante que se ajuste a tu flujo de trabajo.
/filters:quality(82)/media/images/20260408104718_8uxbq2i4.webp)
Veo3.1 Lite Text To Video
Google Veo 3.1 Lite Text-to-Video generates high-fidelity 720p or 1080p videos with natively generated audio from text prompts. Lightweight variant optimized for cost efficiency. Supports landscape and portrait aspect ratios, dialogue with lip-sync, and customizable duration. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408104740_drl8tu9l.webp)
Veo3.1 Video Extend
Extend and continue Veo 3.1 videos with smooth motion, preserved style, and strong scene coherence. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/1778749312530573096_makufpyI.webp)
Veo3.1 Fast Reference To Video
Google Veo 3.1 Fast Reference to Video is a fast AI reference-to-video generation model that creates 8-second videos from up to three reference images using the official Veo predictLongRunning endpoint with referenceImages assets. Ready-to-use REST inference API for product videos, character consistency, branded visual storytelling, social media clips, advertising creatives, and professional reference-based video generation workflows with simple integration, no coldstarts, and affordable pricing.
/filters:quality(82)/media/images/20260408104757_ct9o5p9o.webp)
Veo3.1 Fast Video Extend
Extend Veo 3.1 videos in 7-second steps with the Fast endpoint—quick, coherent continuation that preserves style and motion, output as a single merged clip. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408104805_tr00kyv7.webp)
Veo3.1 Fast Text To Video
Google Veo 3.1 Fast creates text-to-video with native 1080p and synchronized audio, delivering high-quality videos for creators. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408104748_nwaixdpw.webp)
Veo3.1 Reference To Video
Google Veo3.1 Reference-to-Video performs image-to-video generation that preserves a specific subject's appearance and identity from provided reference images, enabling consistent character or product motion across frames. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408104714_ut4h5kku.webp)
Veo3.1 Lite Start End To Video
Google Veo 3.1 Lite Start-End-to-Video generates high-fidelity videos by interpolating between a start image and an optional end image. Supports 720p and 1080p resolutions, landscape and portrait aspect ratios, and native audio generation. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408104752_1voe0l4b.webp)
Veo3.1 Text To Video
Google Veo 3.1 converts text prompts into videos with synchronized audio at native 1080p for high-quality outputs. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408104708_dmnbefn0.webp)
Veo3.1 Lite Image To Video
Google Veo 3.1 Lite Image-to-Video transforms static images into high-fidelity 720p or 1080p videos with natively generated audio. Supports many interpolation use cases, landscape and portrait aspect ratios, and customizable duration. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408104802_aaez2mmf.webp)
Veo3.1 Fast Image To Video
Google Veo 3.1 Fast is an Image-to-Video model with native 1080p output for high-detail videos from images and fast performance. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408104744_xfvl07s5.webp)
Veo3.1 Image To Video
Google Veo 3.1 is an Image-to-Video model that converts images into high-quality videos with native 1080P output for enhanced detail and creative flexibility. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
Ejemplos
Mira Veo 3.1 en acción
Resultados reales generados con la API de Veo 3.1. Pasa el cursor sobre cualquier vídeo para previsualizarlo y haz clic para abrir el visor a tamaño completo.
Cómo empezar
Cómo usar la API de Veo 3.1
Cuatro pasos desde el registro hasta una generación terminada. Encontrarás ejemplos completos en Python, Node.js y cURL en la sección de API más abajo.
- 01
Obtén una clave de API
Regístrate en WaveSpeedAI y copia tu clave de API desde el panel. Las cuentas nuevas incluyen créditos gratuitos para empezar: suficientes para usar el playground unas decenas de veces antes de que empiece la facturación.
- 02
Envía una predicción
Haz POST de tu entrada como JSON a https://api.wavespeed.ai/api/v3/google/veo3.1/text-to-video. El endpoint devuelve un id de predicción de inmediato: las generaciones son asíncronas, así que no mantienes una conexión abierta durante la inferencia.
- 03
Consulta hasta que termine
Haz GET a https://api.wavespeed.ai/api/v3/predictions/{request_id}/result. Devuelve los resultados con completed; detente con un error en failed, cancelled, timeout o deleted; sigue consultando con cualquier otro estado.
- 04
Lee la URL del resultado
Cuando status sea "completed", lee la URL de data.outputs[0]. La URL apunta a tu contenido generado en la CDN de WaveSpeedAI: imagen, vídeo, audio o archivo 3D según la variante de Veo 3.1 que hayas llamado.
Casos de uso
Qué puedes crear con Veo 3.1
Flujos de trabajo habituales para los que desarrolladores y creadores usan la API de Veo 3.1.
Texto a vídeo con audio en 1080p nativo
google/veo3.1/text-to-video convierte prompts de texto en vídeos con audio sincronizado en 1080p nativo: una resolución lista para entregar, sin pasar por un escalado. El mismo formato de prompt funciona en los niveles Standard, Fast y Lite.
Referencia a vídeo para conservar la identidad
google/veo3.1/reference-to-video hace imagen a vídeo conservando la apariencia de un sujeto concreto a partir de las imágenes de referencia aportadas. Referencia a vídeo en el nivel Fast usa el endpoint oficial predictLongRunning de Veo y admite hasta tres imágenes de referencia para salidas de 8 segundos.
Precios por niveles: Standard / Fast / Lite
Standard para la entrega, Fast para iterar, Lite para previsualización y trabajo en volumen. Lite implica concesiones de calidad; cambia de nivel mediante la URL del endpoint sin reescribir los prompts.
Extensión de vídeo en pasos de 7 segundos
google/veo3.1/video-extend continúa clips de Veo existentes con un movimiento fluido y el estilo conservado; el resultado es un único clip combinado, no segmentos separados que haya que unir. La extensión de vídeo del nivel Fast (/extension) es la opción más económica para extender de forma iterativa.
Interpolación entre inicio y fin (nivel Lite)
google/veo3.1-lite/start-end-to-video interpola entre una imagen inicial y una imagen final opcional para generar el movimiento que las une. Admite 720p y 1080p, y relaciones de aspecto horizontal y vertical. Útil para animáticas y flujos basados en fotogramas clave al precio del nivel Lite.
Imagen a vídeo en 1080p nativo
google/veo3.1/image-to-video convierte imágenes en vídeos 1080p con más detalle y flexibilidad creativa: la mejor opción cuando partes de una imagen clave y no de un brief solo de texto.
Consejos
Consejos para escribir prompts en Veo 3.1
Consejos prácticos para obtener mejores resultados con Veo 3.1, basados en los patrones que funcionan en modelos de vídeo en flujos de producción.
- 01
Salida 1080p nativa en todos los niveles
Afirmación del catálogo: «1080p nativo para salidas de alta calidad». Todas las variantes de Veo 3.1 generan directamente en 1080p, sin necesidad de un escalado antes de la entrega. El nivel Lite también admite 720p cuando el ancho de banda importa más.
- 02
Itera en Lite, refina en Fast y entrega en Standard
El mismo formato de prompt funciona en Standard, Fast y Lite: cambia la URL del endpoint sin reescribirlo. Itera en Lite para la dirección del prompt, refina en Fast para mayor calidad y entrega en Standard cuando importa la máxima fidelidad.
- 03
Referencia a vídeo para conservar la identidad
google/veo3.1/reference-to-video conserva la apariencia de un sujeto concreto a partir de imágenes de referencia. La versión del nivel Fast admite hasta 3 imágenes de referencia por generación. Útil para vídeos con presentador, personajes de marca y contenido seriado.
- 04
La extensión de vídeo funciona en pasos de 7 segundos
google/veo3.1-fast/video-extend extiende vídeos de Veo 3.1 en pasos de 7 segundos con movimiento coherente y estilo conservado; el resultado es un único clip combinado, no segmentos separados que haya que unir en posproducción.
- 05
Interpolación inicio-fin solo en Lite
google/veo3.1-lite/start-end-to-video interpola entre una imagen inicial y una imagen final opcional. Admite 720p / 1080p, en horizontal y vertical. Solo en Lite: no está disponible en Standard ni en Fast.
- 06
Desactiva el audio para metraje sin sonido
El parámetro generate_audio está expuesto en el endpoint de texto a vídeo Standard. Desactívalo para B-roll, publicaciones sociales y clips en los que vas a sustituir el audio en posproducción de todos modos.
Precios
Precios de la API de Veo 3.1
El precio es por resultado. El cargo final depende de los parámetros que definas en el playground de cada variante (resolución, duración, número de resultados, referencias).
| Endpoint | Tipo | Precio inicial |
|---|---|---|
| google/ | text-to-video | $0.30 |
| google/ | video-extend | $3.20 |
| google/ | reference-to-video | $0.64 |
| google/ | video-extend | $1.20 |
| google/ | text-to-video | $1.20 |
| google/ | reference-to-video | $3.20 |
| google/ | image-to-video | $0.40 |
| google/ | text-to-video | $3.20 |
| google/ | image-to-video | $0.30 |
| google/ | image-to-video | $1.20 |
| google/ | image-to-video | $3.20 |
API
Llama a la API de Veo 3.1
Obtén una clave de API en wavespeed.ai/accesskey y envía una predicción por REST. El playground genera ejemplos listos para pegar con cualquier combinación de entradas.
POSThttps://api.wavespeed.ai/api/v3/google/veo3.1/text-to-video
# 1. Submit the prediction.
SUBMIT_RESPONSE=$(curl --silent --show-error --fail-with-body \
-X POST "https://api.wavespeed.ai/api/v3/google/veo3.1/text-to-video" \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $WAVESPEED_API_KEY" \
-d '{
"prompt": "A cinematic shot of a city at sunset, soft golden light",
"aspect_ratio": "16:9",
"duration": 8,
"resolution": "1080p",
"generate_audio": true
}')
TASK=$(printf '%s' "$SUBMIT_RESPONSE" | jq 'if has("data") then .data else . end')
PREDICTION_ID=$(printf '%s' "$TASK" | jq -r '.id')
if [ -z "$PREDICTION_ID" ] || [ "$PREDICTION_ID" = "null" ]; then
printf 'Submission response did not contain a prediction id
' >&2
exit 1
fi
RESULT_URL="https://api.wavespeed.ai/api/v3/predictions/$PREDICTION_ID/result"
# 2. Poll until the prediction finishes.
while true; do
RESPONSE=$(curl --silent --show-error --fail-with-body "$RESULT_URL" \
-H "Authorization: Bearer $WAVESPEED_API_KEY")
RESULT=$(printf '%s' "$RESPONSE" | jq 'if has("data") then .data else . end')
STATUS=$(printf '%s' "$RESULT" | jq -r '.status')
case "$STATUS" in
completed) printf '%s\n' "$RESULT" | jq '.outputs'; break ;;
failed|cancelled|timeout|deleted) printf '%s\n' "$RESULT" | jq . >&2; exit 1 ;;
*) sleep 2 ;;
esac
doneconst submitUrl = "https://api.wavespeed.ai/api/v3/google/veo3.1/text-to-video";
const apiKey = process.env.WAVESPEED_API_KEY;
if (!apiKey) throw new Error('Set WAVESPEED_API_KEY');
async function requestJson(url, options = {}) {
const response = await fetch(url, options);
if (!response.ok) throw new Error(await response.text());
return response.json();
}
// 1. Submit the prediction.
const body = await requestJson(submitUrl, {
method: "POST",
headers: {
"Authorization": `Bearer ${apiKey}`,
"Content-Type": "application/json",
},
body: JSON.stringify({
"prompt": "A cinematic shot of a city at sunset, soft golden light",
"aspect_ratio": "16:9",
"duration": 8,
"resolution": "1080p",
"generate_audio": true
}),
});
const task = body.data ?? body;
const resultUrl = `https://api.wavespeed.ai/api/v3/predictions/${task.id}/result`;
// 2. Poll until the prediction finishes.
while (true) {
const resultBody = await requestJson(resultUrl, {
headers: { "Authorization": `Bearer ${apiKey}` },
});
const result = resultBody.data ?? resultBody;
if (result.status === "completed") {
console.log(result.outputs);
break;
}
if (["failed", "cancelled", "timeout", "deleted"].includes(result.status)) throw new Error(JSON.stringify(result));
await new Promise(resolve => setTimeout(resolve, 2000));
}import json
import os
import time
from urllib.request import Request, urlopen
api_key = os.environ["WAVESPEED_API_KEY"]
headers = {"Authorization": f"Bearer {api_key}", "Content-Type": "application/json"}
payload = {
"prompt": "A cinematic shot of a city at sunset, soft golden light",
"aspect_ratio": "16:9",
"duration": 8,
"resolution": "1080p",
"generate_audio": True
}
def request_json(url, data=None):
request = Request(url, data=data, headers=headers, method="POST" if data else "GET")
with urlopen(request) as response:
return json.load(response)
# 1. Submit the prediction.
body = request_json("https://api.wavespeed.ai/api/v3/google/veo3.1/text-to-video", json.dumps(payload).encode())
task = body.get("data", body)
result_url = f"https://api.wavespeed.ai/api/v3/predictions/{task['id']}/result"
# 2. Poll until the prediction finishes.
while True:
result_body = request_json(result_url)
result = result_body.get("data", result_body)
status = result.get("status")
if status == "completed":
print(result.get("outputs", []))
break
if status in {"failed", "cancelled", "timeout", "deleted"}:
raise RuntimeError(result)
time.sleep(2)Comparar
Veo 3.1 frente a las alternativas
Cuándo elegir Veo 3.1 en lugar de modelos similares en WaveSpeedAI.
Veo 3.1 frente a Seedance 2.0
Seedance 2.0 incluye audio nativo en todos los niveles y un nivel Turbo rápido. Veo 3.1 es más caro en el nivel superior, pero el nivel Lite es competitivo en coste y la reputación de fotorrealismo de Veo es mayor en rostros humanos.
Veo 3.1 frente a Kling 3.0
Kling 3.0 tiene niveles Pro y 4K, además de un endpoint de control de movimiento. Veo 3.1 ofrece tres niveles de precio (Standard / Fast / Lite) con referencia a vídeo e interpolación entre inicio y fin como endpoints de primer nivel: un conjunto de funciones distinto.
Veo 3.1 frente a Wan 2.7
Wan 2.7 reúne referencia a vídeo, edición de imagen y texto a imagen en una familia, un conjunto de herramientas multimodal más amplio. El nivel Standard de Veo 3.1 cubre la optimización de costes por niveles (de Lite a Standard) y una extensión de vídeo de 7 segundos que Wan resuelve de otra manera.
Preguntas frecuentes
Veo 3.1 API — Preguntas frecuentes
Precios, licencia, integración: preguntas habituales sobre cómo ejecutar Veo 3.1 en WaveSpeedAI.
¿Qué es la API de Veo 3.1?
Veo 3.1 es un modelo de generación de vídeo de Google expuesto como API REST en WaveSpeedAI. Veo 3.1 de Google: texto a vídeo con audio nativo sincronizado en 1080p. Tres niveles (Standard, Fast, Lite) con texto a vídeo, imagen a vídeo, referencia a vídeo y extensión de vídeo, además de start-end-to-video en el nivel Lite. Puedes llamarlo por programación o probarlo desde el playground enlazado arriba.
¿Cómo llamo a la API de Veo 3.1?
Regístrate en WaveSpeedAI, copia tu clave de API desde /accesskey y haz POST a https://api.wavespeed.ai/api/v3/google/veo3.1/text-to-video con tu entrada como JSON. El endpoint devuelve un id de predicción. Consulta el endpoint de resultados aproximadamente cada 2 segundos, aumenta el intervalo en las tareas largas y detente ante cualquier estado final. Arriba tienes ejemplos en Python / Node.js / cURL orientados a producción.
¿Cuánto cuesta la API de Veo 3.1?
Veo 3.1 empieza en $0.30 por ejecución. El coste exacto depende de los parámetros que definas (resolución, duración, número de resultados, referencias). La vista previa del coste en tiempo real junto al botón Generar del playground muestra el precio exacto de tu entrada actual.
¿Qué variantes de Veo 3.1 hay disponibles?
WaveSpeedAI aloja 11 endpoints de Veo 3.1 en producción: google/veo3.1-lite/text-to-video, google/veo3.1/video-extend, google/veo3.1-fast/reference-to-video, google/veo3.1-fast/video-extend, google/veo3.1-fast/text-to-video, google/veo3.1/reference-to-video, google/veo3.1-lite/start-end-to-video, google/veo3.1/text-to-video y más. Cada variante tiene su propia página de playground y sus propios precios.
¿Puedo usar comercialmente los resultados de Veo 3.1?
Los derechos de uso comercial dependen de la licencia del modelo de Google. La mayoría de los modelos de Google permiten el uso comercial de los resultados; consulta la página del playground de cada modelo para ver el resumen de su licencia y los Términos del servicio de WaveSpeedAI para las condiciones de la plataforma.
¿Por qué usar Veo 3.1 en WaveSpeedAI en lugar de ir directamente al proveedor?
Una sola clave de API y una sola cuenta de facturación para Veo 3.1 Y más de 1.000 modelos de IA de otros proveedores. Sin configurar un SDK por proveedor, sin límites de uso aparte y sin reescribir el código de integración para cada proveedor. Los precios suelen ser iguales o inferiores a los de la API directa de Google.
Proveedor
Acerca de Google
El equipo detrás de Veo 3.1 y de la gama más amplia de modelos de Google en WaveSpeedAI.
El trabajo de IA de Google se desarrolla principalmente en Google DeepMind y Google Research. Sus modelos de imagen y vídeo (Imagen, Veo y modelos multimodales de la familia Gemini como Nano Banana, Gemini 3 Image) comparten arquitectura e infraestructura de entrenamiento con el resto de la línea Gemini. Sus resultados destacan por el renderizado preciso de texto, la amplia cobertura de estilos y una licencia de calidad comercial.
Empieza a crear con Veo 3.1 en WaveSpeedAI
Créditos gratuitos al registrarte. Una sola clave de API para más de 1.000 modelos de IA de Google y de todos los demás proveedores.