Veo 3.1 API
Veo 3.1 от Google — text-to-video с синхронизированным нативным звуком в 1080p. Три уровня (Standard, Fast, Lite) с text-to-video, image-to-video, reference-to-video и video-extend, а на уровне Lite ещё и start-end-to-video.
Уровень Standard даёт полное качество Veo; Fast — для итераций; Lite — для превизуализации и больших объёмов. Reference-to-video принимает референсные изображения для генерации с сохранением облика героя; video-extend работает шагами по 7 секунд и выдаёт один склеенный клип.
Обзор
О модели Veo 3.1 API
Что делает Veo 3.1, какое место занимает в линейке моделей Google и почему её выбирают команды.
Veo 3.1 — модель генерации видео от Google, доступная через REST API WaveSpeedAI. Veo 3.1 от Google — text-to-video с синхронизированным нативным звуком в 1080p. Три уровня (Standard, Fast, Lite) с text-to-video, image-to-video, reference-to-video и video-extend, а на уровне Lite ещё и start-end-to-video.
Уровень Standard даёт полное качество Veo; Fast — для итераций; Lite — для превизуализации и больших объёмов. Reference-to-video принимает референсные изображения для генерации с сохранением облика героя; video-extend работает шагами по 7 секунд и выдаёт один склеенный клип.
Семейство Veo 3.1 в WaveSpeedAI включает 11 REST-эндпоинтов для сценариев: Text-To-Video, Video-Extend, Reference-To-Video, Image-To-Video. У каждого варианта свои цены, параметры и примеры результатов — выберите тот, что подходит под ваш тип входных данных и требования продакшена, или вызывайте несколько с одним API-ключом и собирайте многошаговые пайплайны.
Запускайте Veo 3.1 с тем же API-ключом, платёжным аккаунтом и лимитами, что и остальные 1000+ ИИ-моделей WaveSpeedAI. Без отдельной регистрации у вендора, без SDK для каждого провайдера, без разных лимитов у каждого поставщика — одна интеграция охватывает всё: от текста в изображение и текста в видео до синтеза аудио, 3D-генерации, апскейлинга и редактирования.
Эндпоинты
Все эндпоинты API Veo 3.1
Сейчас в WaveSpeedAI доступно эндпоинтов Veo 3.1: 11 — выберите вариант под ваш сценарий.
/filters:quality(82)/media/images/20260408104718_8uxbq2i4.webp)
Veo3.1 Lite Text To Video
Google Veo 3.1 Lite Text-to-Video generates high-fidelity 720p or 1080p videos with natively generated audio from text prompts. Lightweight variant optimized for cost efficiency. Supports landscape and portrait aspect ratios, dialogue with lip-sync, and customizable duration. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408104740_drl8tu9l.webp)
Veo3.1 Video Extend
Extend and continue Veo 3.1 videos with smooth motion, preserved style, and strong scene coherence. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/1778749312530573096_makufpyI.webp)
Veo3.1 Fast Reference To Video
Google Veo 3.1 Fast Reference to Video is a fast AI reference-to-video generation model that creates 8-second videos from up to three reference images using the official Veo predictLongRunning endpoint with referenceImages assets. Ready-to-use REST inference API for product videos, character consistency, branded visual storytelling, social media clips, advertising creatives, and professional reference-based video generation workflows with simple integration, no coldstarts, and affordable pricing.
/filters:quality(82)/media/images/20260408104757_ct9o5p9o.webp)
Veo3.1 Fast Video Extend
Extend Veo 3.1 videos in 7-second steps with the Fast endpoint—quick, coherent continuation that preserves style and motion, output as a single merged clip. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408104805_tr00kyv7.webp)
Veo3.1 Fast Text To Video
Google Veo 3.1 Fast creates text-to-video with native 1080p and synchronized audio, delivering high-quality videos for creators. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408104748_nwaixdpw.webp)
Veo3.1 Reference To Video
Google Veo3.1 Reference-to-Video performs image-to-video generation that preserves a specific subject's appearance and identity from provided reference images, enabling consistent character or product motion across frames. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408104714_ut4h5kku.webp)
Veo3.1 Lite Start End To Video
Google Veo 3.1 Lite Start-End-to-Video generates high-fidelity videos by interpolating between a start image and an optional end image. Supports 720p and 1080p resolutions, landscape and portrait aspect ratios, and native audio generation. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408104752_1voe0l4b.webp)
Veo3.1 Text To Video
Google Veo 3.1 converts text prompts into videos with synchronized audio at native 1080p for high-quality outputs. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408104708_dmnbefn0.webp)
Veo3.1 Lite Image To Video
Google Veo 3.1 Lite Image-to-Video transforms static images into high-fidelity 720p or 1080p videos with natively generated audio. Supports many interpolation use cases, landscape and portrait aspect ratios, and customizable duration. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408104802_aaez2mmf.webp)
Veo3.1 Fast Image To Video
Google Veo 3.1 Fast is an Image-to-Video model with native 1080p output for high-detail videos from images and fast performance. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408104744_xfvl07s5.webp)
Veo3.1 Image To Video
Google Veo 3.1 is an Image-to-Video model that converts images into high-quality videos with native 1080P output for enhanced detail and creative flexibility. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
Примеры
Veo 3.1 в деле
Реальные результаты, созданные через API Veo 3.1. Наведите курсор на видео для предпросмотра, нажмите, чтобы открыть в полном размере.
Как использовать
Как использовать API Veo 3.1
Четыре шага от регистрации до готовой генерации. Полные примеры на Python, Node.js и cURL — в разделе API ниже.
- 01
Получите API-ключ
Создайте аккаунт WaveSpeedAI и скопируйте API-ключ на панели управления. Новые аккаунты получают бесплатные стартовые кредиты — их хватит, чтобы несколько десятков раз запустить playground до начала списаний.
- 02
Отправьте предсказание
Отправьте входные данные в формате JSON методом POST на https://api.wavespeed.ai/api/v3/google/veo3.1/text-to-video. Эндпоинт сразу возвращает id предсказания — генерация асинхронная, поэтому соединение не нужно держать открытым на время инференса.
- 03
Опрашивайте до завершения
Выполняйте GET https://api.wavespeed.ai/api/v3/predictions/{request_id}/result. При статусе completed забирайте результат; при failed, cancelled, timeout или deleted остановитесь с ошибкой; при любом другом статусе продолжайте опрос.
- 04
Получите URL результата
Когда статус станет "completed", возьмите URL из data.outputs[0]. Он указывает на созданный файл в CDN WaveSpeedAI — изображение, видео, аудио или 3D-файл, в зависимости от вызванного варианта Veo 3.1.
Сценарии применения
Что можно создать с Veo 3.1
Типичные сценарии, для которых разработчики и авторы используют API Veo 3.1.
Text-to-video с нативным звуком в 1080p
google/veo3.1/text-to-video превращает текстовые промпты в видео с синхронизированным звуком в нативном 1080p — разрешение, готовое к выдаче, без прохода апскейла. Один и тот же формат промпта работает на уровнях Standard, Fast и Lite.
Reference-to-video для сохранения облика героя
google/veo3.1/reference-to-video выполняет image-to-video, сохраняя внешность конкретного героя по переданным референсным изображениям. Reference-to-video на уровне Fast использует официальную конечную точку Veo predictLongRunning и поддерживает до трёх референсных изображений для результатов по 8 секунд.
Уровни цен: Standard / Fast / Lite
Standard — для финальной выдачи, Fast — для итераций, Lite — для превизуализации и больших объёмов. У Lite есть компромиссы по качеству; уровни переключаются через URL конечной точки без переписывания промптов.
Video-extend шагами по 7 секунд
google/veo3.1/video-extend продолжает существующие клипы Veo с плавным движением и сохранённым стилем — на выходе один склеенный клип, а не отдельные сегменты, которые нужно сшивать. Video-extend уровня Fast (/extension) — более дешёвый вариант для пошаговых продлений.
Интерполяция между начальным и конечным кадром (уровень Lite)
google/veo3.1-lite/start-end-to-video интерполирует движение между начальным и необязательным конечным изображением. Поддерживает 720p и 1080p, горизонтальные и вертикальные соотношения сторон. Полезно для аниматиков и процессов на основе ключевых кадров по цене уровня Lite.
Image-to-video в нативном 1080p
google/veo3.1/image-to-video превращает изображения в видео 1080p с повышенной детализацией и творческой гибкостью — лучший выбор, когда вы отталкиваетесь от ключевого кадра, а не только от текстового брифа.
Советы
Советы по написанию запросов для Veo 3.1
Практические советы, как получать лучшие результаты от Veo 3.1, — на основе приёмов, которые работают в продакшен-пайплайнах для моделей видео.
- 01
Нативный 1080p на всех уровнях
Заявление из каталога: «нативный 1080p для результатов высокого качества». Все варианты Veo 3.1 создают видео сразу в 1080p — проход апскейла перед выдачей не нужен. Уровень Lite также поддерживает 720p, когда важнее пропускная способность.
- 02
Итерации на Lite, доработка на Fast, выдача на Standard
Один и тот же формат промпта работает на Standard, Fast и Lite — меняйте URL конечной точки, не переписывая промпт. Подбирайте направление на Lite, дорабатывайте качество на Fast, а на Standard выдавайте результат, когда важна максимальная детализация.
- 03
Reference-to-video для сохранения облика
google/veo3.1/reference-to-video сохраняет внешность конкретного героя по референсным изображениям. Версия уровня Fast поддерживает до 3 референсных изображений на генерацию. Полезно для видео с ведущими, фирменных персонажей и серийного контента.
- 04
Video-extend работает шагами по 7 секунд
google/veo3.1-fast/video-extend продлевает видео Veo 3.1 шагами по 7 секунд со связным движением и сохранённым стилем — на выходе один склеенный клип, а не отдельные сегменты, которые пришлось бы сшивать в постобработке.
- 05
Интерполяция начального и конечного кадра — только на Lite
google/veo3.1-lite/start-end-to-video интерполирует движение между начальным и необязательным конечным изображением. Поддерживает 720p / 1080p, горизонтальную и вертикальную ориентацию. Только на уровне Lite — на Standard и Fast недоступно.
- 06
Отключайте звук для немого материала
Параметр generate_audio доступен в стандартной конечной точке text-to-video. Отключайте его для B-roll, постов в соцсетях и клипов, где звук всё равно заменяется при постобработке.
Цены
Цены на API Veo 3.1
Оплата — за каждый результат. Итоговая стоимость зависит от параметров, заданных в playground каждого варианта (разрешение, длительность, количество результатов, референсы).
| Эндпоинт | Тип | Цена от |
|---|---|---|
| google/ | text-to-video | $0.30 |
| google/ | video-extend | $3.20 |
| google/ | reference-to-video | $0.64 |
| google/ | video-extend | $1.20 |
| google/ | text-to-video | $1.20 |
| google/ | reference-to-video | $3.20 |
| google/ | image-to-video | $0.40 |
| google/ | text-to-video | $3.20 |
| google/ | image-to-video | $0.30 |
| google/ | image-to-video | $1.20 |
| google/ | image-to-video | $3.20 |
API
Вызов API Veo 3.1
Получите API-ключ на wavespeed.ai/accesskey, затем отправьте предсказание через REST. Playground генерирует готовые к вставке примеры для любой комбинации входных данных.
POSThttps://api.wavespeed.ai/api/v3/google/veo3.1/text-to-video
# 1. Submit the prediction.
SUBMIT_RESPONSE=$(curl --silent --show-error --fail-with-body \
-X POST "https://api.wavespeed.ai/api/v3/google/veo3.1/text-to-video" \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $WAVESPEED_API_KEY" \
-d '{
"prompt": "A cinematic shot of a city at sunset, soft golden light",
"aspect_ratio": "16:9",
"duration": 8,
"resolution": "1080p",
"generate_audio": true
}')
TASK=$(printf '%s' "$SUBMIT_RESPONSE" | jq 'if has("data") then .data else . end')
PREDICTION_ID=$(printf '%s' "$TASK" | jq -r '.id')
if [ -z "$PREDICTION_ID" ] || [ "$PREDICTION_ID" = "null" ]; then
printf 'Submission response did not contain a prediction id
' >&2
exit 1
fi
RESULT_URL="https://api.wavespeed.ai/api/v3/predictions/$PREDICTION_ID/result"
# 2. Poll until the prediction finishes.
while true; do
RESPONSE=$(curl --silent --show-error --fail-with-body "$RESULT_URL" \
-H "Authorization: Bearer $WAVESPEED_API_KEY")
RESULT=$(printf '%s' "$RESPONSE" | jq 'if has("data") then .data else . end')
STATUS=$(printf '%s' "$RESULT" | jq -r '.status')
case "$STATUS" in
completed) printf '%s\n' "$RESULT" | jq '.outputs'; break ;;
failed|cancelled|timeout|deleted) printf '%s\n' "$RESULT" | jq . >&2; exit 1 ;;
*) sleep 2 ;;
esac
doneconst submitUrl = "https://api.wavespeed.ai/api/v3/google/veo3.1/text-to-video";
const apiKey = process.env.WAVESPEED_API_KEY;
if (!apiKey) throw new Error('Set WAVESPEED_API_KEY');
async function requestJson(url, options = {}) {
const response = await fetch(url, options);
if (!response.ok) throw new Error(await response.text());
return response.json();
}
// 1. Submit the prediction.
const body = await requestJson(submitUrl, {
method: "POST",
headers: {
"Authorization": `Bearer ${apiKey}`,
"Content-Type": "application/json",
},
body: JSON.stringify({
"prompt": "A cinematic shot of a city at sunset, soft golden light",
"aspect_ratio": "16:9",
"duration": 8,
"resolution": "1080p",
"generate_audio": true
}),
});
const task = body.data ?? body;
const resultUrl = `https://api.wavespeed.ai/api/v3/predictions/${task.id}/result`;
// 2. Poll until the prediction finishes.
while (true) {
const resultBody = await requestJson(resultUrl, {
headers: { "Authorization": `Bearer ${apiKey}` },
});
const result = resultBody.data ?? resultBody;
if (result.status === "completed") {
console.log(result.outputs);
break;
}
if (["failed", "cancelled", "timeout", "deleted"].includes(result.status)) throw new Error(JSON.stringify(result));
await new Promise(resolve => setTimeout(resolve, 2000));
}import json
import os
import time
from urllib.request import Request, urlopen
api_key = os.environ["WAVESPEED_API_KEY"]
headers = {"Authorization": f"Bearer {api_key}", "Content-Type": "application/json"}
payload = {
"prompt": "A cinematic shot of a city at sunset, soft golden light",
"aspect_ratio": "16:9",
"duration": 8,
"resolution": "1080p",
"generate_audio": True
}
def request_json(url, data=None):
request = Request(url, data=data, headers=headers, method="POST" if data else "GET")
with urlopen(request) as response:
return json.load(response)
# 1. Submit the prediction.
body = request_json("https://api.wavespeed.ai/api/v3/google/veo3.1/text-to-video", json.dumps(payload).encode())
task = body.get("data", body)
result_url = f"https://api.wavespeed.ai/api/v3/predictions/{task['id']}/result"
# 2. Poll until the prediction finishes.
while True:
result_body = request_json(result_url)
result = result_body.get("data", result_body)
status = result.get("status")
if status == "completed":
print(result.get("outputs", []))
break
if status in {"failed", "cancelled", "timeout", "deleted"}:
raise RuntimeError(result)
time.sleep(2)Сравнение
Veo 3.1 и альтернативы
Когда стоит выбрать Veo 3.1, а не похожие модели в WaveSpeedAI.
Veo 3.1 и Seedance 2.0
Seedance 2.0 даёт нативный звук на всех уровнях и быстрый уровень Turbo. Veo 3.1 дороже на верхнем уровне, но уровень Lite конкурентоспособен по цене, а репутация Veo в фотореализме сильнее для лиц людей.
Veo 3.1 и Kling 3.0
У Kling 3.0 есть уровни Pro и 4K и конечная точка управления движением. У Veo 3.1 три ценовых уровня (Standard / Fast / Lite), а reference-to-video и интерполяция между начальным и конечным кадром — полноценные конечные точки: набор возможностей другой.
Veo 3.1 и Wan 2.7
У Wan 2.7 в одном семействе есть reference-to-video, редактирование изображений и text-to-image — более широкий кросс-модальный набор. Уровень Standard у Veo 3.1 позволяет оптимизировать расходы по уровням (от Lite до Standard), а video-extend шагами по 7 секунд Wan решает иначе.
FAQ
Veo 3.1 API — часто задаваемые вопросы
Цены, лицензия, интеграция — частые вопросы о запуске Veo 3.1 в WaveSpeedAI.
Что такое API Veo 3.1?
Veo 3.1 — модель генерации видео от Google, доступная как REST API в WaveSpeedAI. Veo 3.1 от Google — text-to-video с синхронизированным нативным звуком в 1080p. Три уровня (Standard, Fast, Lite) с text-to-video, image-to-video, reference-to-video и video-extend, а на уровне Lite ещё и start-end-to-video. Её можно вызывать программно или попробовать в playground по ссылке выше.
Как вызывать API Veo 3.1?
Создайте аккаунт WaveSpeedAI, скопируйте API-ключ на странице /accesskey и отправьте POST на https://api.wavespeed.ai/api/v3/google/veo3.1/text-to-video с входными данными в JSON. Эндпоинт вернёт id предсказания. Опрашивайте эндпоинт результата примерно раз в 2 секунды, для долгих задач увеличивайте интервал и останавливайтесь на любом финальном статусе. Примеры для продакшена на Python / Node.js / cURL — выше.
Сколько стоит API Veo 3.1?
Veo 3.1 стоит от $0.30 за запуск. Точная стоимость зависит от заданных параметров (разрешение, длительность, количество результатов, референсы). Предпросмотр стоимости рядом с кнопкой «Сгенерировать» в playground показывает точную цену для ваших текущих данных.
Какие варианты Veo 3.1 доступны?
В WaveSpeedAI доступно рабочих эндпоинтов Veo 3.1: 11 — google/veo3.1-lite/text-to-video, google/veo3.1/video-extend, google/veo3.1-fast/reference-to-video, google/veo3.1-fast/video-extend, google/veo3.1-fast/text-to-video, google/veo3.1/reference-to-video, google/veo3.1-lite/start-end-to-video, google/veo3.1/text-to-video, и другие. У каждого варианта своя страница playground и свои цены.
Можно ли использовать результаты Veo 3.1 в коммерческих целях?
Права на коммерческое использование определяются лицензией модели Google. Большинство моделей Google разрешают коммерческое использование результатов; краткое описание лицензии смотрите на странице playground каждой модели, а условия платформы — в Условиях использования WaveSpeedAI.
Зачем использовать Veo 3.1 в WaveSpeedAI, а не напрямую?
Один API-ключ и один платёжный аккаунт для Veo 3.1 И для 1000+ других ИИ-моделей от разных провайдеров. Без настройки SDK для каждого вендора, без отдельных лимитов, без переписывания интеграционного кода под каждого поставщика. Цены, как правило, на уровне прямого API Google или ниже.
Разработчик
О Google
Команда, стоящая за Veo 3.1 и всей линейкой моделей Google в WaveSpeedAI.
Работа Google над ИИ ведётся в основном в Google DeepMind и Google Research. Её модели изображений и видео — Imagen, Veo и мультимодальные модели семейства Gemini, такие как Nano Banana (Gemini 3 Image), — используют общую архитектуру и инфраструктуру обучения с остальной линейкой Gemini. Результаты отмечают за точную отрисовку текста, широкий охват стилей и лицензирование коммерческого уровня.
Начните создавать с Veo 3.1 в WaveSpeedAI
Бесплатные стартовые кредиты при регистрации. Один API-ключ для 1000+ ИИ-моделей от Google и всех остальных провайдеров.