Veo 3.1 API
Veo 3.1 của Google — text-to-video với âm thanh gốc đồng bộ ở 1080p. Ba bậc (Standard, Fast, Lite) với text-to-video, image-to-video, reference-to-video và video-extend, cùng start-end-to-video ở bậc Lite.
Bậc Standard cho chất lượng đầy đủ của Veo; bậc Fast để lặp thử; bậc Lite cho previz và công việc khối lượng lớn. Reference-to-video nhận ảnh tham chiếu để tạo video giữ nguyên danh tính; video-extend hoạt động theo bước 7 giây và cho ra một clip đã gộp.
Tổng quan
Giới thiệu về Veo 3.1 API
Veo 3.1 làm được gì, nằm ở đâu trong dòng mô hình của Google, và vì sao các đội ngũ chọn nó.
Veo 3.1 là mô hình tạo video từ Google, có sẵn qua REST API của WaveSpeedAI. Veo 3.1 của Google — text-to-video với âm thanh gốc đồng bộ ở 1080p. Ba bậc (Standard, Fast, Lite) với text-to-video, image-to-video, reference-to-video và video-extend, cùng start-end-to-video ở bậc Lite.
Bậc Standard cho chất lượng đầy đủ của Veo; bậc Fast để lặp thử; bậc Lite cho previz và công việc khối lượng lớn. Reference-to-video nhận ảnh tham chiếu để tạo video giữ nguyên danh tính; video-extend hoạt động theo bước 7 giây và cho ra một clip đã gộp.
Họ Veo 3.1 trên WaveSpeedAI cung cấp 11 endpoint REST bao gồm 4 quy trình Text-To-Video, Video-Extend, Reference-To-Video, Image-To-Video. Mỗi biến thể có giá, các tham số điều chỉnh và kết quả mẫu riêng — hãy chọn biến thể phù hợp với dạng đầu vào và ràng buộc sản xuất của bạn, hoặc gọi nhiều biến thể từ cùng một API key để ghép các pipeline nhiều bước.
Chạy Veo 3.1 bằng cùng API key, tài khoản thanh toán và hạn mức tốc độ bạn dùng cho hơn 1.000 mô hình AI khác trên WaveSpeedAI. Không cần thiết lập nhà cung cấp riêng, không cần SDK cho từng nhà cung cấp, không có hạn mức tốc độ riêng của từng hãng — một lần tích hợp bao quát mọi thứ, từ text-to-image và text-to-video đến tổng hợp âm thanh, tạo 3D, nâng cấp và chỉnh sửa.
Endpoint
Tất cả endpoint API Veo 3.1
11 endpoint Veo 3.1 hiện có sẵn trên WaveSpeedAI — hãy chọn biến thể phù hợp với quy trình của bạn.
/filters:quality(82)/media/images/20260408104718_8uxbq2i4.webp)
Veo3.1 Lite Text To Video
Google Veo 3.1 Lite Text-to-Video generates high-fidelity 720p or 1080p videos with natively generated audio from text prompts. Lightweight variant optimized for cost efficiency. Supports landscape and portrait aspect ratios, dialogue with lip-sync, and customizable duration. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408104740_drl8tu9l.webp)
Veo3.1 Video Extend
Extend and continue Veo 3.1 videos with smooth motion, preserved style, and strong scene coherence. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/1778749312530573096_makufpyI.webp)
Veo3.1 Fast Reference To Video
Google Veo 3.1 Fast Reference to Video is a fast AI reference-to-video generation model that creates 8-second videos from up to three reference images using the official Veo predictLongRunning endpoint with referenceImages assets. Ready-to-use REST inference API for product videos, character consistency, branded visual storytelling, social media clips, advertising creatives, and professional reference-based video generation workflows with simple integration, no coldstarts, and affordable pricing.
/filters:quality(82)/media/images/20260408104757_ct9o5p9o.webp)
Veo3.1 Fast Video Extend
Extend Veo 3.1 videos in 7-second steps with the Fast endpoint—quick, coherent continuation that preserves style and motion, output as a single merged clip. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408104805_tr00kyv7.webp)
Veo3.1 Fast Text To Video
Google Veo 3.1 Fast creates text-to-video with native 1080p and synchronized audio, delivering high-quality videos for creators. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408104748_nwaixdpw.webp)
Veo3.1 Reference To Video
Google Veo3.1 Reference-to-Video performs image-to-video generation that preserves a specific subject's appearance and identity from provided reference images, enabling consistent character or product motion across frames. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408104714_ut4h5kku.webp)
Veo3.1 Lite Start End To Video
Google Veo 3.1 Lite Start-End-to-Video generates high-fidelity videos by interpolating between a start image and an optional end image. Supports 720p and 1080p resolutions, landscape and portrait aspect ratios, and native audio generation. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408104752_1voe0l4b.webp)
Veo3.1 Text To Video
Google Veo 3.1 converts text prompts into videos with synchronized audio at native 1080p for high-quality outputs. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408104708_dmnbefn0.webp)
Veo3.1 Lite Image To Video
Google Veo 3.1 Lite Image-to-Video transforms static images into high-fidelity 720p or 1080p videos with natively generated audio. Supports many interpolation use cases, landscape and portrait aspect ratios, and customizable duration. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408104802_aaez2mmf.webp)
Veo3.1 Fast Image To Video
Google Veo 3.1 Fast is an Image-to-Video model with native 1080p output for high-detail videos from images and fast performance. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408104744_xfvl07s5.webp)
Veo3.1 Image To Video
Google Veo 3.1 is an Image-to-Video model that converts images into high-quality videos with native 1080P output for enhanced detail and creative flexibility. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
Ví dụ
Xem Veo 3.1 hoạt động
Kết quả thật do API Veo 3.1 tạo ra. Rê chuột lên video để xem trước, nhấp để mở trình xem kích thước đầy đủ.
Hướng dẫn
Cách dùng API Veo 3.1
Bốn bước từ đăng ký đến khi có kết quả. Ví dụ đầy đủ bằng Python, Node.js và cURL nằm ở phần API bên dưới.
- 01
Lấy API key
Đăng ký tài khoản WaveSpeedAI và sao chép API key từ bảng điều khiển. Tài khoản mới được tặng credit dùng thử miễn phí — đủ để chạy playground vài chục lần trước khi bắt đầu tính phí.
- 02
Gửi một prediction
POST đầu vào của bạn dưới dạng JSON tới https://api.wavespeed.ai/api/v3/google/veo3.1/text-to-video. Endpoint trả về prediction id ngay lập tức — việc tạo là bất đồng bộ nên bạn không phải giữ kết nối mở trong lúc suy luận.
- 03
Poll để chờ hoàn tất
GET https://api.wavespeed.ai/api/v3/predictions/{request_id}/result. Trả về kết quả khi completed; dừng và báo lỗi khi failed, cancelled, timeout hoặc deleted; tiếp tục poll với mọi trạng thái khác.
- 04
Đọc URL kết quả
Khi status là "completed", đọc URL từ data.outputs[0]. URL trỏ tới media bạn đã tạo trên CDN của WaveSpeedAI — ảnh, video, âm thanh hoặc tệp 3D tùy biến thể Veo 3.1 bạn đã gọi.
Trường hợp sử dụng
Bạn có thể xây dựng gì với Veo 3.1
Các quy trình phổ biến mà nhà phát triển và người sáng tạo dùng API Veo 3.1 cho.
Text-to-video với âm thanh 1080p gốc
google/veo3.1/text-to-video chuyển prompt văn bản thành video có âm thanh đồng bộ ở 1080p gốc — độ phân giải sẵn sàng bàn giao, không cần lượt nâng cấp. Cùng một định dạng prompt dùng được trên các bậc Standard, Fast và Lite.
Reference-to-video để giữ nguyên danh tính
google/veo3.1/reference-to-video thực hiện image-to-video trong khi giữ nguyên diện mạo của một chủ thể cụ thể từ các ảnh tham chiếu được cung cấp. Reference-to-video ở bậc Fast dùng endpoint predictLongRunning chính thức của Veo và hỗ trợ tối đa ba ảnh tham chiếu cho đầu ra 8 giây.
Giá theo bậc: Standard / Fast / Lite
Standard để giao bản cuối, Fast để lặp thử, Lite cho previz và công việc khối lượng lớn. Lite đánh đổi bằng chất lượng; đổi bậc qua URL endpoint mà không cần viết lại prompt.
Video-extend theo bước 7 giây
google/veo3.1/video-extend tiếp nối các clip Veo có sẵn với chuyển động mượt và giữ nguyên phong cách — đầu ra là một clip đã gộp thay vì các đoạn rời phải tự ghép. Video-extend bậc Fast (/extension) là lựa chọn rẻ hơn để kéo dài lặp đi lặp lại.
Nội suy đầu-cuối (bậc Lite)
google/veo3.1-lite/start-end-to-video nội suy giữa ảnh đầu và một ảnh cuối tùy chọn để tạo chuyển động nối giữa hai khung. Hỗ trợ 720p và 1080p, tỷ lệ khung hình ngang và dọc. Hữu ích cho animatic và quy trình dựa trên keyframe ở mức giá Lite.
Image-to-video ở 1080p gốc
google/veo3.1/image-to-video chuyển ảnh thành video 1080p với chi tiết nâng cao và sự linh hoạt sáng tạo — lựa chọn đúng khi bắt đầu từ một ảnh chủ đạo thay vì brief chỉ có văn bản.
Mẹo
Mẹo viết prompt cho Veo 3.1
Lời khuyên thực tế để có kết quả tốt hơn từ Veo 3.1 — rút ra từ các mẫu hiệu quả trên các mô hình video trong các pipeline sản xuất.
- 01
Đầu ra 1080p gốc ở mọi bậc
Theo danh mục: "1080p gốc cho đầu ra chất lượng cao." Mọi biến thể Veo 3.1 tạo trực tiếp ở 1080p — không cần bước nâng cấp trước khi phân phối. Bậc Lite cũng hỗ trợ 720p khi băng thông quan trọng hơn.
- 02
Lặp trên Lite, tinh chỉnh trên Fast, phân phối trên Standard
Cùng định dạng prompt dùng được cho Standard, Fast và Lite — đổi URL endpoint mà không cần viết lại. Lặp trên Lite để chọn hướng prompt, tinh chỉnh trên Fast cho chất lượng cao hơn, phân phối trên Standard khi cần độ trung thực tối đa.
- 03
Reference-to-video để giữ danh tính
google/veo3.1/reference-to-video giữ diện mạo của một chủ thể cụ thể từ ảnh tham chiếu. Phiên bản bậc Fast hỗ trợ tối đa 3 ảnh tham chiếu mỗi lần tạo. Hữu ích cho video người dẫn, nhân vật thương hiệu và nội dung nhiều tập.
- 04
Video-extend hoạt động theo bước 7 giây
google/veo3.1-fast/video-extend kéo dài video Veo 3.1 theo bước 7 giây với chuyển động mạch lạc và phong cách được giữ nguyên — đầu ra là một clip đã ghép thay vì các đoạn riêng mà bạn phải ghép ở khâu hậu kỳ.
- 05
Nội suy đầu-cuối chỉ có trên Lite
google/veo3.1-lite/start-end-to-video nội suy giữa ảnh đầu và một ảnh cuối tùy chọn. Hỗ trợ 720p / 1080p, ngang và dọc. Chỉ có trên Lite — không có ở Standard hay Fast.
- 06
Tắt âm thanh cho cảnh quay không tiếng
Tham số generate_audio được cung cấp trên endpoint text-to-video Standard. Hãy tắt nó cho B-roll, bài đăng mạng xã hội và các clip mà bạn sẽ thay âm thanh ở hậu kỳ.
Giá
Giá API Veo 3.1
Giá tính theo từng kết quả đầu ra. Khoản phí cuối cùng thay đổi theo các tham số bạn đặt trong playground của từng biến thể (độ phân giải, thời lượng, số kết quả, tham chiếu).
| Endpoint | Loại | Giá khởi điểm |
|---|---|---|
| google/ | text-to-video | $0.30 |
| google/ | video-extend | $3.20 |
| google/ | reference-to-video | $0.64 |
| google/ | video-extend | $1.20 |
| google/ | text-to-video | $1.20 |
| google/ | reference-to-video | $3.20 |
| google/ | image-to-video | $0.40 |
| google/ | text-to-video | $3.20 |
| google/ | image-to-video | $0.30 |
| google/ | image-to-video | $1.20 |
| google/ | image-to-video | $3.20 |
API
Gọi API Veo 3.1
Đăng ký API key tại wavespeed.ai/accesskey, rồi gửi prediction qua REST. Playground tạo sẵn mã mẫu có thể dán ngay cho mọi tổ hợp đầu vào.
POSThttps://api.wavespeed.ai/api/v3/google/veo3.1/text-to-video
# 1. Submit the prediction.
SUBMIT_RESPONSE=$(curl --silent --show-error --fail-with-body \
-X POST "https://api.wavespeed.ai/api/v3/google/veo3.1/text-to-video" \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $WAVESPEED_API_KEY" \
-d '{
"prompt": "A cinematic shot of a city at sunset, soft golden light",
"aspect_ratio": "16:9",
"duration": 8,
"resolution": "1080p",
"generate_audio": true
}')
TASK=$(printf '%s' "$SUBMIT_RESPONSE" | jq 'if has("data") then .data else . end')
PREDICTION_ID=$(printf '%s' "$TASK" | jq -r '.id')
if [ -z "$PREDICTION_ID" ] || [ "$PREDICTION_ID" = "null" ]; then
printf 'Submission response did not contain a prediction id
' >&2
exit 1
fi
RESULT_URL="https://api.wavespeed.ai/api/v3/predictions/$PREDICTION_ID/result"
# 2. Poll until the prediction finishes.
while true; do
RESPONSE=$(curl --silent --show-error --fail-with-body "$RESULT_URL" \
-H "Authorization: Bearer $WAVESPEED_API_KEY")
RESULT=$(printf '%s' "$RESPONSE" | jq 'if has("data") then .data else . end')
STATUS=$(printf '%s' "$RESULT" | jq -r '.status')
case "$STATUS" in
completed) printf '%s\n' "$RESULT" | jq '.outputs'; break ;;
failed|cancelled|timeout|deleted) printf '%s\n' "$RESULT" | jq . >&2; exit 1 ;;
*) sleep 2 ;;
esac
doneconst submitUrl = "https://api.wavespeed.ai/api/v3/google/veo3.1/text-to-video";
const apiKey = process.env.WAVESPEED_API_KEY;
if (!apiKey) throw new Error('Set WAVESPEED_API_KEY');
async function requestJson(url, options = {}) {
const response = await fetch(url, options);
if (!response.ok) throw new Error(await response.text());
return response.json();
}
// 1. Submit the prediction.
const body = await requestJson(submitUrl, {
method: "POST",
headers: {
"Authorization": `Bearer ${apiKey}`,
"Content-Type": "application/json",
},
body: JSON.stringify({
"prompt": "A cinematic shot of a city at sunset, soft golden light",
"aspect_ratio": "16:9",
"duration": 8,
"resolution": "1080p",
"generate_audio": true
}),
});
const task = body.data ?? body;
const resultUrl = `https://api.wavespeed.ai/api/v3/predictions/${task.id}/result`;
// 2. Poll until the prediction finishes.
while (true) {
const resultBody = await requestJson(resultUrl, {
headers: { "Authorization": `Bearer ${apiKey}` },
});
const result = resultBody.data ?? resultBody;
if (result.status === "completed") {
console.log(result.outputs);
break;
}
if (["failed", "cancelled", "timeout", "deleted"].includes(result.status)) throw new Error(JSON.stringify(result));
await new Promise(resolve => setTimeout(resolve, 2000));
}import json
import os
import time
from urllib.request import Request, urlopen
api_key = os.environ["WAVESPEED_API_KEY"]
headers = {"Authorization": f"Bearer {api_key}", "Content-Type": "application/json"}
payload = {
"prompt": "A cinematic shot of a city at sunset, soft golden light",
"aspect_ratio": "16:9",
"duration": 8,
"resolution": "1080p",
"generate_audio": True
}
def request_json(url, data=None):
request = Request(url, data=data, headers=headers, method="POST" if data else "GET")
with urlopen(request) as response:
return json.load(response)
# 1. Submit the prediction.
body = request_json("https://api.wavespeed.ai/api/v3/google/veo3.1/text-to-video", json.dumps(payload).encode())
task = body.get("data", body)
result_url = f"https://api.wavespeed.ai/api/v3/predictions/{task['id']}/result"
# 2. Poll until the prediction finishes.
while True:
result_body = request_json(result_url)
result = result_body.get("data", result_body)
status = result.get("status")
if status == "completed":
print(result.get("outputs", []))
break
if status in {"failed", "cancelled", "timeout", "deleted"}:
raise RuntimeError(result)
time.sleep(2)So sánh
Veo 3.1 so với các lựa chọn khác
Khi nào nên chọn Veo 3.1 thay vì các mô hình tương tự trên WaveSpeedAI.
Veo 3.1 so với Seedance 2.0
Seedance 2.0 có âm thanh gốc trên mọi bậc và bậc Turbo nhanh. Veo 3.1 đắt hơn ở bậc cao nhất, nhưng bậc Lite cạnh tranh về chi phí, và danh tiếng chân thực của Veo mạnh hơn ở khuôn mặt người.
Veo 3.1 so với Kling 3.0
Kling 3.0 có các bậc Pro và 4K cùng endpoint điều khiển chuyển động. Veo 3.1 có ba bậc giá (Standard / Fast / Lite) với reference-to-video và nội suy đầu-cuối là endpoint chính thức — bộ tính năng khác, cách tiếp cận khác.
Veo 3.1 so với Wan 2.7
Wan 2.7 có reference-to-video, image-edit và text-to-image trong một dòng — bộ công cụ đa phương thức rộng hơn. Bậc Standard của Veo 3.1 hỗ trợ tối ưu chi phí theo bậc (từ Lite đến Standard) và video-extend 7 giây mà Wan xử lý theo cách khác.
Câu hỏi thường gặp
Veo 3.1 API — Câu hỏi thường gặp
Giá, giấy phép, tích hợp — những câu hỏi phổ biến về việc chạy Veo 3.1 trên WaveSpeedAI.
API Veo 3.1 là gì?
Veo 3.1 là mô hình tạo video của Google, được cung cấp dưới dạng REST API trên WaveSpeedAI. Veo 3.1 của Google — text-to-video với âm thanh gốc đồng bộ ở 1080p. Ba bậc (Standard, Fast, Lite) với text-to-video, image-to-video, reference-to-video và video-extend, cùng start-end-to-video ở bậc Lite. Bạn có thể gọi bằng lập trình hoặc thử từ playground ở liên kết phía trên.
Làm sao để gọi API Veo 3.1?
Đăng ký tài khoản WaveSpeedAI, sao chép API key từ /accesskey, rồi POST tới https://api.wavespeed.ai/api/v3/google/veo3.1/text-to-video với đầu vào dưới dạng JSON. Endpoint trả về prediction id. Hãy poll endpoint kết quả khoảng mỗi 2 giây, tăng khoảng cách với các tác vụ chạy lâu, và dừng ở bất kỳ trạng thái kết thúc nào. Ví dụ Python / Node.js / cURL hướng tới môi trường production ở phía trên.
API Veo 3.1 có giá bao nhiêu?
Veo 3.1 bắt đầu từ $0.30 mỗi lượt chạy. Chi phí chính xác thay đổi theo các tham số bạn đặt (độ phân giải, thời lượng, số kết quả, tham chiếu). Phần xem trước chi phí trực tiếp cạnh nút Tạo trong playground hiển thị giá chính xác cho đầu vào hiện tại của bạn.
Có những biến thể Veo 3.1 nào?
WaveSpeedAI cung cấp 11 endpoint Veo 3.1 đang hoạt động: google/veo3.1-lite/text-to-video, google/veo3.1/video-extend, google/veo3.1-fast/reference-to-video, google/veo3.1-fast/video-extend, google/veo3.1-fast/text-to-video, google/veo3.1/reference-to-video, google/veo3.1-lite/start-end-to-video, google/veo3.1/text-to-video, và nhiều hơn nữa. Mỗi biến thể có trang playground và giá riêng.
Tôi có thể dùng kết quả của Veo 3.1 cho mục đích thương mại không?
Quyền sử dụng thương mại tuân theo giấy phép mô hình của Google. Hầu hết mô hình của Google cho phép dùng kết quả đầu ra cho mục đích thương mại; hãy xem trang playground của từng mô hình để biết tóm tắt giấy phép cụ thể, và Điều khoản dịch vụ của WaveSpeedAI cho các điều kiện cấp nền tảng.
Tại sao dùng Veo 3.1 trên WaveSpeedAI thay vì gọi trực tiếp?
Một API key + một tài khoản thanh toán cho Veo 3.1 VÀ hơn 1.000 mô hình AI khác từ các nhà cung cấp khác. Không cần thiết lập SDK cho từng hãng, không có hạn mức tốc độ riêng, không phải viết lại mã tích hợp cho từng hãng. Giá thường ngang bằng hoặc thấp hơn API trực tiếp của Google.
Nhà cung cấp
Giới thiệu về Google
Đội ngũ đứng sau Veo 3.1 và dòng mô hình Google rộng hơn trên WaveSpeedAI.
Công việc AI của Google chủ yếu diễn ra tại Google DeepMind và Google Research. Các mô hình ảnh và video của hãng — Imagen, Veo và các mô hình đa phương thức dòng Gemini như Nano Banana (Gemini 3 Image) — dùng chung kiến trúc và hạ tầng huấn luyện với dòng Gemini nói chung. Đầu ra nổi bật nhờ kết xuất chữ chính xác, phủ rộng nhiều phong cách và giấy phép cấp thương mại.
Bắt đầu xây dựng với Veo 3.1 trên WaveSpeedAI
Tặng credit dùng thử miễn phí khi đăng ký. Một API key cho hơn 1.000 mô hình AI từ Google và mọi nhà cung cấp khác.