InfiniteTalk API
WaveSpeedAI InfiniteTalk — biến một ảnh + âm thanh thành video avatar nói HOẶC hát, dài tới 10 phút. Phân khúc Standard và Fast, cùng các biến thể Multi (một ảnh + hai đầu vào âm thanh cho đầu ra nhiều nhân vật) và Video-to-Video (điều khiển video có sẵn bằng âm thanh mới).
Phân khúc Standard và Fast, cùng đầu ra 720p. Các biến thể Multi nhận một ảnh + hai đầu vào âm thanh để tạo video nhiều nhân vật nói/hát. Các biến thể Video-to-Video điều khiển video có sẵn bằng âm thanh mới để thay thế khớp khẩu hình. Đầu ra dài tới 10 phút.
Tổng quan
Giới thiệu về InfiniteTalk API
InfiniteTalk làm được gì, nằm ở đâu trong dòng mô hình của WaveSpeedAI, và vì sao các đội ngũ chọn nó.
InfiniteTalk là mô hình tạo video từ WaveSpeedAI, có sẵn qua REST API của WaveSpeedAI. WaveSpeedAI InfiniteTalk — biến một ảnh + âm thanh thành video avatar nói HOẶC hát, dài tới 10 phút. Phân khúc Standard và Fast, cùng các biến thể Multi (một ảnh + hai đầu vào âm thanh cho đầu ra nhiều nhân vật) và Video-to-Video (điều khiển video có sẵn bằng âm thanh mới).
Phân khúc Standard và Fast, cùng đầu ra 720p. Các biến thể Multi nhận một ảnh + hai đầu vào âm thanh để tạo video nhiều nhân vật nói/hát. Các biến thể Video-to-Video điều khiển video có sẵn bằng âm thanh mới để thay thế khớp khẩu hình. Đầu ra dài tới 10 phút.
Họ InfiniteTalk trên WaveSpeedAI cung cấp 8 endpoint REST bao gồm 1 quy trình Digital-Human. Mỗi biến thể có giá, các tham số điều chỉnh và kết quả mẫu riêng — hãy chọn biến thể phù hợp với dạng đầu vào và ràng buộc sản xuất của bạn, hoặc gọi nhiều biến thể từ cùng một API key để ghép các pipeline nhiều bước.
Chạy InfiniteTalk bằng cùng API key, tài khoản thanh toán và hạn mức tốc độ bạn dùng cho hơn 1.000 mô hình AI khác trên WaveSpeedAI. Không cần thiết lập nhà cung cấp riêng, không cần SDK cho từng nhà cung cấp, không có hạn mức tốc độ riêng của từng hãng — một lần tích hợp bao quát mọi thứ, từ text-to-image và text-to-video đến tổng hợp âm thanh, tạo 3D, nâng cấp và chỉnh sửa.
Endpoint
Tất cả endpoint API InfiniteTalk
8 endpoint InfiniteTalk hiện có sẵn trên WaveSpeedAI — hãy chọn biến thể phù hợp với quy trình của bạn.
/filters:quality(82)/media/images/20260408110527_g86tqkpw.webp)
Infinitetalk Fast Video To Video Multi
InfiniteTalk fast video-to-video multi converts a video and two audio inputs into multi-character talking or singing videos. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408110532_2m95tzbp.webp)
Infinitetalk Fast Video To Video
Audio-driven infinitetalk-fast turns one video plus audio into realistic talking or singing videos with lip-sync. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408111359_7pt74rzh.webp)
Infinitetalk Video To Video Multi
InfiniteTalk Video-to-Video Multi converts a video and two audio inputs into multi-character talking or singing videos at up to 720p. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408110534_dl097qgv.webp)
Infinitetalk Fast Multi
InfiniteTalk fast multi converts a single image and two audio inputs into multi-character talking or singing videos. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408110525_m58v6n7u.webp)
Infinitetalk Fast
InfiniteTalk fast converts one photo + audio into audio-driven talking or singing avatar videos (Image-to-Video), up to 10 minutes. Ready-to-use REST API, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408111403_q1ar1bex.webp)
Infinitetalk Video To Video
Audio-driven InfiniteTalk turns one video plus audio into realistic talking or singing videos with lip-sync in 480p or 720p. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/1790561759067766019_QVeeWlOj.webp)
Infinitetalk
InfiniteTalk Image-to-Video converts a single photo and audio track into long-form audio-driven talking or singing avatar videos, supporting up to 10 minutes, 720P output, natural lip sync, expressive motion, and digital human video workflows. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408111406_upu4dbpi.webp)
Infinitetalk Multi
InfiniteTalk Multi converts a single image and two audio inputs into multi-character talking or singing videos at up to 720p. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
Ví dụ
Xem InfiniteTalk hoạt động
Kết quả thật do API InfiniteTalk tạo ra. Rê chuột lên video để xem trước, nhấp để mở trình xem kích thước đầy đủ.
Hướng dẫn
Cách dùng API InfiniteTalk
Bốn bước từ đăng ký đến khi có kết quả. Ví dụ đầy đủ bằng Python, Node.js và cURL nằm ở phần API bên dưới.
- 01
Lấy API key
Đăng ký tài khoản WaveSpeedAI và sao chép API key từ bảng điều khiển. Tài khoản mới được tặng credit dùng thử miễn phí — đủ để chạy playground vài chục lần trước khi bắt đầu tính phí.
- 02
Gửi một prediction
POST đầu vào của bạn dưới dạng JSON tới https://api.wavespeed.ai/api/v3/wavespeed-ai/infinitetalk. Endpoint trả về prediction id ngay lập tức — việc tạo là bất đồng bộ nên bạn không phải giữ kết nối mở trong lúc suy luận.
- 03
Poll để chờ hoàn tất
GET https://api.wavespeed.ai/api/v3/predictions/{request_id}/result. Trả về kết quả khi completed; dừng và báo lỗi khi failed, cancelled, timeout hoặc deleted; tiếp tục poll với mọi trạng thái khác.
- 04
Đọc URL kết quả
Khi status là "completed", đọc URL từ data.outputs[0]. URL trỏ tới media bạn đã tạo trên CDN của WaveSpeedAI — ảnh, video, âm thanh hoặc tệp 3D tùy biến thể InfiniteTalk bạn đã gọi.
Trường hợp sử dụng
Bạn có thể xây dựng gì với InfiniteTalk
Các quy trình phổ biến mà nhà phát triển và người sáng tạo dùng API InfiniteTalk cho.
Avatar nói HOẶC hát từ một bức ảnh
wavespeed-ai/infinitetalk biến một ảnh + âm thanh thành video avatar nói hoặc hát. Theo danh mục: “Image-to-Video, tới 10 phút, phân khúc 720p.” Hỗ trợ hát là điểm khác biệt.
Nhiều nhân vật với hai đầu vào âm thanh
wavespeed-ai/infinitetalk/multi nhận một ảnh + hai đầu vào âm thanh để tạo video nhiều nhân vật nói/hát tới 720p. Hữu ích cho cảnh đối thoại, song ca và thuyết trình hai người từ một thiết lập duy nhất.
Thay thế khớp khẩu hình video-to-video
wavespeed-ai/infinitetalk/video-to-video điều khiển video có sẵn bằng âm thanh mới, tạo cảnh nói hoặc hát chân thực với khớp khẩu hình (480p hoặc 720p). Hữu ích để lồng tiếng lại cho cảnh quay có sẵn bằng giọng đọc mới.
Đầu ra dài tới 10 phút
Theo danh mục ở biến thể cơ bản: tới 10 phút. Dài hơn đáng kể so với hầu hết mô hình video — dùng được cho podcast, bài giảng, thuyết minh dài và nội dung avatar nói chuyện trọn tập trong một lần tạo.
Phân khúc Fast
wavespeed-ai/infinitetalk-fast. Cùng quy trình image-to-video với suy luận được tối ưu — hữu ích cho công việc khối lượng lớn và lặp lại trong tiền sản xuất. Multi và video-to-video cũng có các biến thể Fast.
Video-to-video nhiều nhân vật
wavespeed-ai/infinitetalk/video-to-video-multi nhận một video và hai đầu vào âm thanh cho cảnh nhiều nhân vật nói/hát tới 720p. Kết hợp đầy đủ quy trình nhiều nhân vật và nguồn video trong một lần gọi.
Mẹo
Mẹo viết prompt cho InfiniteTalk
Lời khuyên thực tế để có kết quả tốt hơn từ InfiniteTalk — rút ra từ các mẫu hiệu quả trên các mô hình video trong các pipeline sản xuất.
- 01
Âm thanh sạch trước, đồng bộ sau
Chất lượng lip-sync bị nút thắt ở độ rõ của âm thanh. Hãy loại bỏ tạp âm nền, chuẩn hóa mức âm lượng và kiểm tra méo tiếng trước khi đưa âm thanh vào. Âm thanh sạch cải thiện lip-sync nhiều hơn bất kỳ biến số nào khác.
- 02
Khớp ảnh tham chiếu với ngôn ngữ/văn hóa của âm thanh
Âm thanh tiếng Anh đi với nhân vật mang nét phương Tây rõ ràng trông tự nhiên hơn so với sự lệch nhau. Tương tự với âm thanh tiếng Nhật / Trung / Hàn và ảnh tham chiếu nhân vật tương ứng.
- 03
Chân dung nhìn thẳng đồng bộ sạch nhất
Ảnh tham chiếu chân dung nhìn thẳng cho lip-sync tự nhiên nhất. Góc ba phần tư và nghiêng vẫn dùng được nhưng có lỗi nhỏ. Nếu bạn kiểm soát được ảnh nhân vật, hãy dùng tư thế gần chính diện.
- 04
Hỗ trợ cả hát, không chỉ nói
Tính năng trong danh mục: "video avatar nói hoặc hát." Dùng cho video ca nhạc, nội dung hợp xướng / solo, video lời bài hát có nhân vật chính — không chỉ nội dung lời nói.
- 05
Biến thể Multi nhận hai đầu vào âm thanh
wavespeed-ai/infinitetalk/multi nhận một ảnh + hai đầu vào âm thanh để tạo video nói/hát nhiều nhân vật tới 720p. Hữu ích cho cảnh hội thoại, song ca và bài thuyết trình hai người từ một thiết lập.
- 06
Video-to-video để lồng tiếng lại cảnh quay có sẵn
wavespeed-ai/infinitetalk/video-to-video điều khiển video có sẵn bằng âm thanh mới, tạo cảnh nói hoặc hát chân thực với lip-sync. Hữu ích để lồng tiếng lại clip bằng giọng mới mà giữ nguyên hình ảnh gốc.
Giá
Giá API InfiniteTalk
Giá tính theo từng kết quả đầu ra. Khoản phí cuối cùng thay đổi theo các tham số bạn đặt trong playground của từng biến thể (độ phân giải, thời lượng, số kết quả, tham chiếu).
| Endpoint | Loại | Giá khởi điểm |
|---|---|---|
| wavespeed-ai/ | digital-human | $0.075 |
| wavespeed-ai/ | digital-human | $0.075 |
| wavespeed-ai/ | digital-human | $0.15 |
| wavespeed-ai/ | digital-human | $0.075 |
| wavespeed-ai/ | digital-human | $0.075 |
| wavespeed-ai/ | digital-human | $0.15 |
| wavespeed-ai/ | digital-human | $0.15 |
| wavespeed-ai/ | digital-human | $0.15 |
API
Gọi API InfiniteTalk
Đăng ký API key tại wavespeed.ai/accesskey, rồi gửi prediction qua REST. Playground tạo sẵn mã mẫu có thể dán ngay cho mọi tổ hợp đầu vào.
POSThttps://api.wavespeed.ai/api/v3/wavespeed-ai/infinitetalk
# 1. Submit the prediction.
SUBMIT_RESPONSE=$(curl --silent --show-error --fail-with-body \
-X POST "https://api.wavespeed.ai/api/v3/wavespeed-ai/infinitetalk" \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $WAVESPEED_API_KEY" \
-d '{
"image": "https://interactive-examples.mdn.mozilla.net/media/cc0-images/painted-hand-298-332.jpg",
"audio": "https://interactive-examples.mdn.mozilla.net/media/cc0-audio/t-rex-roar.mp3",
"resolution": "480p"
}')
TASK=$(printf '%s' "$SUBMIT_RESPONSE" | jq 'if has("data") then .data else . end')
PREDICTION_ID=$(printf '%s' "$TASK" | jq -r '.id')
if [ -z "$PREDICTION_ID" ] || [ "$PREDICTION_ID" = "null" ]; then
printf 'Submission response did not contain a prediction id
' >&2
exit 1
fi
RESULT_URL="https://api.wavespeed.ai/api/v3/predictions/$PREDICTION_ID/result"
# 2. Poll until the prediction finishes.
while true; do
RESPONSE=$(curl --silent --show-error --fail-with-body "$RESULT_URL" \
-H "Authorization: Bearer $WAVESPEED_API_KEY")
RESULT=$(printf '%s' "$RESPONSE" | jq 'if has("data") then .data else . end')
STATUS=$(printf '%s' "$RESULT" | jq -r '.status')
case "$STATUS" in
completed) printf '%s\n' "$RESULT" | jq '.outputs'; break ;;
failed|cancelled|timeout|deleted) printf '%s\n' "$RESULT" | jq . >&2; exit 1 ;;
*) sleep 2 ;;
esac
doneconst submitUrl = "https://api.wavespeed.ai/api/v3/wavespeed-ai/infinitetalk";
const apiKey = process.env.WAVESPEED_API_KEY;
if (!apiKey) throw new Error('Set WAVESPEED_API_KEY');
async function requestJson(url, options = {}) {
const response = await fetch(url, options);
if (!response.ok) throw new Error(await response.text());
return response.json();
}
// 1. Submit the prediction.
const body = await requestJson(submitUrl, {
method: "POST",
headers: {
"Authorization": `Bearer ${apiKey}`,
"Content-Type": "application/json",
},
body: JSON.stringify({
"image": "https://interactive-examples.mdn.mozilla.net/media/cc0-images/painted-hand-298-332.jpg",
"audio": "https://interactive-examples.mdn.mozilla.net/media/cc0-audio/t-rex-roar.mp3",
"resolution": "480p"
}),
});
const task = body.data ?? body;
const resultUrl = `https://api.wavespeed.ai/api/v3/predictions/${task.id}/result`;
// 2. Poll until the prediction finishes.
while (true) {
const resultBody = await requestJson(resultUrl, {
headers: { "Authorization": `Bearer ${apiKey}` },
});
const result = resultBody.data ?? resultBody;
if (result.status === "completed") {
console.log(result.outputs);
break;
}
if (["failed", "cancelled", "timeout", "deleted"].includes(result.status)) throw new Error(JSON.stringify(result));
await new Promise(resolve => setTimeout(resolve, 2000));
}import json
import os
import time
from urllib.request import Request, urlopen
api_key = os.environ["WAVESPEED_API_KEY"]
headers = {"Authorization": f"Bearer {api_key}", "Content-Type": "application/json"}
payload = {
"image": "https://interactive-examples.mdn.mozilla.net/media/cc0-images/painted-hand-298-332.jpg",
"audio": "https://interactive-examples.mdn.mozilla.net/media/cc0-audio/t-rex-roar.mp3",
"resolution": "480p"
}
def request_json(url, data=None):
request = Request(url, data=data, headers=headers, method="POST" if data else "GET")
with urlopen(request) as response:
return json.load(response)
# 1. Submit the prediction.
body = request_json("https://api.wavespeed.ai/api/v3/wavespeed-ai/infinitetalk", json.dumps(payload).encode())
task = body.get("data", body)
result_url = f"https://api.wavespeed.ai/api/v3/predictions/{task['id']}/result"
# 2. Poll until the prediction finishes.
while True:
result_body = request_json(result_url)
result = result_body.get("data", result_body)
status = result.get("status")
if status == "completed":
print(result.get("outputs", []))
break
if status in {"failed", "cancelled", "timeout", "deleted"}:
raise RuntimeError(result)
time.sleep(2)So sánh
InfiniteTalk so với các lựa chọn khác
Khi nào nên chọn InfiniteTalk thay vì các mô hình tương tự trên WaveSpeedAI.
InfiniteTalk so với Wan 2.2 Speech-to-Video
Wan 2.2 Speech-to-Video (wavespeed-ai/wan-2.2/speech-to-video) hỗ trợ clip dài tới 10 phút ở 480p — cùng thời lượng tối đa với InfiniteTalk. InfiniteTalk bổ sung các biến thể Multi (hai đầu vào âm thanh), Video-to-Video và phân khúc Fast mà Wan 2.2 không có dưới dạng endpoint riêng.
InfiniteTalk so với Stock avatar tools
Các công cụ avatar dựng sẵn (kiểu HeyGen) giới hạn bạn trong một thư viện avatar được huấn luyện sẵn và tuyển chọn. InfiniteTalk nhận bất kỳ ảnh nhân vật nào — linh vật thương hiệu, nhân vật do AI tạo, người dẫn minh họa — mà không cần thiết lập riêng cho từng nhân vật, và hỗ trợ cả hát lẫn nói.
InfiniteTalk so với ElevenLabs voice tools
ElevenLabs lo phần giọng nói (tạo giọng, nhân bản giọng, TTS đa ngôn ngữ). InfiniteTalk là lớp video: ghép giọng đọc ElevenLabs với ảnh nhân vật (hoặc video có sẵn) để tạo video khớp khẩu hình hoàn chỉnh.
Câu hỏi thường gặp
InfiniteTalk API — Câu hỏi thường gặp
Giá, giấy phép, tích hợp — những câu hỏi phổ biến về việc chạy InfiniteTalk trên WaveSpeedAI.
API InfiniteTalk là gì?
InfiniteTalk là mô hình tạo video của WaveSpeedAI, được cung cấp dưới dạng REST API trên WaveSpeedAI. WaveSpeedAI InfiniteTalk — biến một ảnh + âm thanh thành video avatar nói HOẶC hát, dài tới 10 phút. Phân khúc Standard và Fast, cùng các biến thể Multi (một ảnh + hai đầu vào âm thanh cho đầu ra nhiều nhân vật) và Video-to-Video (điều khiển video có sẵn bằng âm thanh mới). Bạn có thể gọi bằng lập trình hoặc thử từ playground ở liên kết phía trên.
Làm sao để gọi API InfiniteTalk?
Đăng ký tài khoản WaveSpeedAI, sao chép API key từ /accesskey, rồi POST tới https://api.wavespeed.ai/api/v3/wavespeed-ai/infinitetalk với đầu vào dưới dạng JSON. Endpoint trả về prediction id. Hãy poll endpoint kết quả khoảng mỗi 2 giây, tăng khoảng cách với các tác vụ chạy lâu, và dừng ở bất kỳ trạng thái kết thúc nào. Ví dụ Python / Node.js / cURL hướng tới môi trường production ở phía trên.
API InfiniteTalk có giá bao nhiêu?
InfiniteTalk bắt đầu từ $0.075 mỗi lượt chạy. Chi phí chính xác thay đổi theo các tham số bạn đặt (độ phân giải, thời lượng, số kết quả, tham chiếu). Phần xem trước chi phí trực tiếp cạnh nút Tạo trong playground hiển thị giá chính xác cho đầu vào hiện tại của bạn.
Có những biến thể InfiniteTalk nào?
WaveSpeedAI cung cấp 8 endpoint InfiniteTalk đang hoạt động: wavespeed-ai/infinitetalk-fast/video-to-video-multi, wavespeed-ai/infinitetalk-fast/video-to-video, wavespeed-ai/infinitetalk/video-to-video-multi, wavespeed-ai/infinitetalk-fast/multi, wavespeed-ai/infinitetalk-fast, wavespeed-ai/infinitetalk/video-to-video, wavespeed-ai/infinitetalk, wavespeed-ai/infinitetalk/multi. Mỗi biến thể có trang playground và giá riêng.
Tôi có thể dùng kết quả của InfiniteTalk cho mục đích thương mại không?
Quyền sử dụng thương mại tuân theo giấy phép mô hình của WaveSpeedAI. Hầu hết mô hình của WaveSpeedAI cho phép dùng kết quả đầu ra cho mục đích thương mại; hãy xem trang playground của từng mô hình để biết tóm tắt giấy phép cụ thể, và Điều khoản dịch vụ của WaveSpeedAI cho các điều kiện cấp nền tảng.
Tại sao dùng InfiniteTalk trên WaveSpeedAI thay vì gọi trực tiếp?
Một API key + một tài khoản thanh toán cho InfiniteTalk VÀ hơn 1.000 mô hình AI khác từ các nhà cung cấp khác. Không cần thiết lập SDK cho từng hãng, không có hạn mức tốc độ riêng, không phải viết lại mã tích hợp cho từng hãng. Giá thường ngang bằng hoặc thấp hơn API trực tiếp của WaveSpeedAI.
Nhà cung cấp
Giới thiệu về WaveSpeedAI
Đội ngũ đứng sau InfiniteTalk và dòng mô hình WaveSpeedAI rộng hơn trên WaveSpeedAI.
WaveSpeedAI vận hành nền tảng suy luận lưu trữ hơn 1.000 mô hình AI từ mọi nhà cung cấp lớn — ByteDance, Google, OpenAI, Alibaba, Kuaishou, ElevenLabs và hàng chục phòng thí nghiệm độc lập — sau một API key, một tài khoản thanh toán và một khung giới hạn tốc độ. WaveSpeedAI cũng có các mô hình chính chủ (Image / Video Upscaler, Watermark Remover, Animate, InfiniteTalk) được tinh chỉnh cho pipeline sản xuất.
Bắt đầu xây dựng với InfiniteTalk trên WaveSpeedAI
Tặng credit dùng thử miễn phí khi đăng ký. Một API key cho hơn 1.000 mô hình AI từ WaveSpeedAI và mọi nhà cung cấp khác.