InfiniteTalk API
WaveSpeedAI InfiniteTalk 可將一張照片加上音訊,轉為會說話或會唱歌的虛擬人影片,最長 10 分鐘。提供 Standard 與 Fast 等級,另有 Multi 版本(單張圖片搭配兩段音訊,輸出多角色影片)與 Video-to-Video 版本(以新音訊驅動現有影片)。
提供 Standard 與 Fast 等級,並支援 720p 輸出。Multi 版本接受單張圖片加兩段音訊,生成多角色的說話/唱歌影片。Video-to-Video 版本以新音訊驅動現有影片,用於替換對嘴。輸出最長 10 分鐘。
概覽
關於 InfiniteTalk API
InfiniteTalk 的功能、它在 WaveSpeedAI 模型陣容中的定位,以及團隊選用它的原因。
InfiniteTalk 是來自 WaveSpeedAI 的影片生成模型,可透過 WaveSpeedAI REST API 使用。WaveSpeedAI InfiniteTalk 可將一張照片加上音訊,轉為會說話或會唱歌的虛擬人影片,最長 10 分鐘。提供 Standard 與 Fast 等級,另有 Multi 版本(單張圖片搭配兩段音訊,輸出多角色影片)與 Video-to-Video 版本(以新音訊驅動現有影片)。
提供 Standard 與 Fast 等級,並支援 720p 輸出。Multi 版本接受單張圖片加兩段音訊,生成多角色的說話/唱歌影片。Video-to-Video 版本以新音訊驅動現有影片,用於替換對嘴。輸出最長 10 分鐘。
WaveSpeedAI 上的 InfiniteTalk 系列提供 8 個 REST 端點,涵蓋 Digital-Human 等工作流程。每個變體都有各自的定價、參數選項與範例輸出 — 請挑選符合您輸入模態與生產限制的版本,或使用同一組 API 金鑰呼叫多個變體,組合成多步驟的處理流程。
使用您呼叫其他 1,000+ 個 WaveSpeedAI AI 模型時相同的 API 金鑰、帳單帳戶與速率限制額度來執行 InfiniteTalk。無需另外設定供應商、無需各家 SDK、無需處理各家不同的速率限制 — 一次整合,涵蓋從文字轉圖片、文字轉影片,到音訊合成、3D 生成、放大與編輯的所有功能。
端點
所有 InfiniteTalk API 端點
WaveSpeedAI 目前提供 8 個 InfiniteTalk 端點 — 請選擇符合您工作流程的變體。
/filters:quality(82)/media/images/20260408110527_g86tqkpw.webp)
Infinitetalk Fast Video To Video Multi
InfiniteTalk fast video-to-video multi converts a video and two audio inputs into multi-character talking or singing videos. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408110532_2m95tzbp.webp)
Infinitetalk Fast Video To Video
Audio-driven infinitetalk-fast turns one video plus audio into realistic talking or singing videos with lip-sync. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408111359_7pt74rzh.webp)
Infinitetalk Video To Video Multi
InfiniteTalk Video-to-Video Multi converts a video and two audio inputs into multi-character talking or singing videos at up to 720p. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408110534_dl097qgv.webp)
Infinitetalk Fast Multi
InfiniteTalk fast multi converts a single image and two audio inputs into multi-character talking or singing videos. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408110525_m58v6n7u.webp)
Infinitetalk Fast
InfiniteTalk fast converts one photo + audio into audio-driven talking or singing avatar videos (Image-to-Video), up to 10 minutes. Ready-to-use REST API, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408111403_q1ar1bex.webp)
Infinitetalk Video To Video
Audio-driven InfiniteTalk turns one video plus audio into realistic talking or singing videos with lip-sync in 480p or 720p. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/1790561759067766019_QVeeWlOj.webp)
Infinitetalk
InfiniteTalk Image-to-Video converts a single photo and audio track into long-form audio-driven talking or singing avatar videos, supporting up to 10 minutes, 720P output, natural lip sync, expressive motion, and digital human video workflows. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408111406_upu4dbpi.webp)
Infinitetalk Multi
InfiniteTalk Multi converts a single image and two audio inputs into multi-character talking or singing videos at up to 720p. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
範例
看看 InfiniteTalk 的實際效果
由 InfiniteTalk API 生成的真實輸出。將滑鼠移到任一影片上即可預覽,點擊可開啟完整尺寸檢視器。
使用方式
如何使用 InfiniteTalk API
從註冊到完成生成,只要四個步驟。完整的 Python、Node.js 與 cURL 範例請見下方的 API 區段。
- 01
取得 API 金鑰
註冊 WaveSpeedAI 帳號,並從控制台複製您的 API 金鑰。新帳號會獲贈免費入門點數 — 足以在開始計費前執行數十次 Playground。
- 02
提交 prediction
將您的輸入以 JSON 格式 POST 到 https://api.wavespeed.ai/api/v3/wavespeed-ai/infinitetalk。端點會立即回傳 prediction id — 生成是非同步進行的,因此推論期間您不需要保持連線。
- 03
輪詢完成狀態
GET https://api.wavespeed.ai/api/v3/predictions/{request_id}/result。狀態為 completed 時回傳輸出;狀態為 failed、cancelled、timeout 或 deleted 時停止並回報錯誤;其他狀態則持續輪詢。
- 04
讀取輸出網址
當狀態為 "completed" 時,從 data.outputs[0] 讀取網址。該網址指向 WaveSpeedAI CDN 上您生成的媒體 — 依您呼叫的 InfiniteTalk 變體,可能是圖片、影片、音訊或 3D 檔案。
應用情境
您可以用 InfiniteTalk 打造什麼
開發者與創作者使用 InfiniteTalk API 的常見工作流程。
以照片生成說話或唱歌的虛擬人
wavespeed-ai/infinitetalk 可將一張照片加上音訊,轉為說話或唱歌的虛擬人影片。目錄定位:「圖片轉影片,最長 10 分鐘,720p 等級」。支援唱歌是其特色。
以兩段音訊生成多角色影片
wavespeed-ai/infinitetalk/multi 接受單張圖片加兩段音訊,生成最高 720p 的多角色說話/唱歌影片。適合從單一設定製作對話場景、二重唱與雙人簡報。
影片轉影片的對嘴替換
wavespeed-ai/infinitetalk/video-to-video 以新音訊驅動現有影片,生成逼真的說話或唱歌與對嘴效果(480p 或 720p)。適合為現有素材以新的旁白重新配音。
最長 10 分鐘的輸出
目錄說明,基礎版本最長可達 10 分鐘,明顯長於多數影片模型,可在單次生成中製作 Podcast、講座、長篇旁白與整集的說話虛擬人內容。
Fast 等級
wavespeed-ai/infinitetalk-fast。相同的圖片轉影片流程,搭配最佳化的推論,適合大量作業與前期迭代。Multi 與 video-to-video 也提供 Fast 版本。
多角色影片轉影片
wavespeed-ai/infinitetalk/video-to-video-multi 接受一段影片與兩段音訊,生成最高 720p 的多角色說話/唱歌影片,一次呼叫即可結合多角色與影片來源的工作流程。
技巧
InfiniteTalk 提示詞技巧
讓 InfiniteTalk 產出更好結果的實用建議 — 整理自在實際生產流程中,影片模型通用的有效做法。
- 01
先清理音訊,再對嘴同步
對嘴同步的品質受限於音訊的清晰度。輸入音訊前請先移除背景雜音、標準化音量,並檢查是否有爆音失真。乾淨的音訊對對嘴同步的改善超過其他任何變因。
- 02
讓參考圖片符合音訊的語言與文化
英語音訊搭配明顯的西方角色,比不搭配的組合看起來更自然。日語 / 中文 / 韓語音訊搭配對應的角色參考也是如此。
- 03
正面肖像的同步效果最乾淨
正面直視的肖像參考能產生最自然的對嘴同步。四分之三側面與側臉也可使用,但會有輕微瑕疵。若您能控制角色圖片,請提供接近正面的姿勢。
- 04
不只能說話,也支援唱歌
目錄功能:「說話或唱歌的虛擬人影片」。可用於音樂影片、合唱 / 獨唱內容,以及以特定角色主打的歌詞影片,而不限於口語內容。
- 05
Multi 版本接受兩段音訊
wavespeed-ai/infinitetalk/multi 接受單張圖片加兩段音訊,生成最高 720p 的多角色說話/唱歌影片。適合從單一設定製作對話場景、二重唱與雙人簡報。
- 06
以 Video-to-video 為現有素材重新配音
wavespeed-ai/infinitetalk/video-to-video 以新音訊驅動現有影片,生成逼真的說話或唱歌與對嘴效果。適合為影片換上新的旁白,同時保留原本的畫面。
定價
InfiniteTalk API 定價
依輸出計費。最終費用會依您在各變體 Playground 中設定的參數(解析度、時長、輸出數量、參考素材)而調整。
| 端點 | 類型 | 起始價格 |
|---|---|---|
| wavespeed-ai/ | digital-human | $0.075 |
| wavespeed-ai/ | digital-human | $0.075 |
| wavespeed-ai/ | digital-human | $0.15 |
| wavespeed-ai/ | digital-human | $0.075 |
| wavespeed-ai/ | digital-human | $0.075 |
| wavespeed-ai/ | digital-human | $0.15 |
| wavespeed-ai/ | digital-human | $0.15 |
| wavespeed-ai/ | digital-human | $0.15 |
API
呼叫 InfiniteTalk API
請到 wavespeed.ai/accesskey 註冊取得 API 金鑰,然後透過 REST 提交 prediction。Playground 會為任何輸入組合產生可直接貼上的範例。
POSThttps://api.wavespeed.ai/api/v3/wavespeed-ai/infinitetalk
# 1. Submit the prediction.
SUBMIT_RESPONSE=$(curl --silent --show-error --fail-with-body \
-X POST "https://api.wavespeed.ai/api/v3/wavespeed-ai/infinitetalk" \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $WAVESPEED_API_KEY" \
-d '{
"image": "https://interactive-examples.mdn.mozilla.net/media/cc0-images/painted-hand-298-332.jpg",
"audio": "https://interactive-examples.mdn.mozilla.net/media/cc0-audio/t-rex-roar.mp3",
"resolution": "480p"
}')
TASK=$(printf '%s' "$SUBMIT_RESPONSE" | jq 'if has("data") then .data else . end')
PREDICTION_ID=$(printf '%s' "$TASK" | jq -r '.id')
if [ -z "$PREDICTION_ID" ] || [ "$PREDICTION_ID" = "null" ]; then
printf 'Submission response did not contain a prediction id
' >&2
exit 1
fi
RESULT_URL="https://api.wavespeed.ai/api/v3/predictions/$PREDICTION_ID/result"
# 2. Poll until the prediction finishes.
while true; do
RESPONSE=$(curl --silent --show-error --fail-with-body "$RESULT_URL" \
-H "Authorization: Bearer $WAVESPEED_API_KEY")
RESULT=$(printf '%s' "$RESPONSE" | jq 'if has("data") then .data else . end')
STATUS=$(printf '%s' "$RESULT" | jq -r '.status')
case "$STATUS" in
completed) printf '%s\n' "$RESULT" | jq '.outputs'; break ;;
failed|cancelled|timeout|deleted) printf '%s\n' "$RESULT" | jq . >&2; exit 1 ;;
*) sleep 2 ;;
esac
doneconst submitUrl = "https://api.wavespeed.ai/api/v3/wavespeed-ai/infinitetalk";
const apiKey = process.env.WAVESPEED_API_KEY;
if (!apiKey) throw new Error('Set WAVESPEED_API_KEY');
async function requestJson(url, options = {}) {
const response = await fetch(url, options);
if (!response.ok) throw new Error(await response.text());
return response.json();
}
// 1. Submit the prediction.
const body = await requestJson(submitUrl, {
method: "POST",
headers: {
"Authorization": `Bearer ${apiKey}`,
"Content-Type": "application/json",
},
body: JSON.stringify({
"image": "https://interactive-examples.mdn.mozilla.net/media/cc0-images/painted-hand-298-332.jpg",
"audio": "https://interactive-examples.mdn.mozilla.net/media/cc0-audio/t-rex-roar.mp3",
"resolution": "480p"
}),
});
const task = body.data ?? body;
const resultUrl = `https://api.wavespeed.ai/api/v3/predictions/${task.id}/result`;
// 2. Poll until the prediction finishes.
while (true) {
const resultBody = await requestJson(resultUrl, {
headers: { "Authorization": `Bearer ${apiKey}` },
});
const result = resultBody.data ?? resultBody;
if (result.status === "completed") {
console.log(result.outputs);
break;
}
if (["failed", "cancelled", "timeout", "deleted"].includes(result.status)) throw new Error(JSON.stringify(result));
await new Promise(resolve => setTimeout(resolve, 2000));
}import json
import os
import time
from urllib.request import Request, urlopen
api_key = os.environ["WAVESPEED_API_KEY"]
headers = {"Authorization": f"Bearer {api_key}", "Content-Type": "application/json"}
payload = {
"image": "https://interactive-examples.mdn.mozilla.net/media/cc0-images/painted-hand-298-332.jpg",
"audio": "https://interactive-examples.mdn.mozilla.net/media/cc0-audio/t-rex-roar.mp3",
"resolution": "480p"
}
def request_json(url, data=None):
request = Request(url, data=data, headers=headers, method="POST" if data else "GET")
with urlopen(request) as response:
return json.load(response)
# 1. Submit the prediction.
body = request_json("https://api.wavespeed.ai/api/v3/wavespeed-ai/infinitetalk", json.dumps(payload).encode())
task = body.get("data", body)
result_url = f"https://api.wavespeed.ai/api/v3/predictions/{task['id']}/result"
# 2. Poll until the prediction finishes.
while True:
result_body = request_json(result_url)
result = result_body.get("data", result_body)
status = result.get("status")
if status == "completed":
print(result.get("outputs", []))
break
if status in {"failed", "cancelled", "timeout", "deleted"}:
raise RuntimeError(result)
time.sleep(2)比較
InfiniteTalk 與其他選擇比較
在 WaveSpeedAI 上,何時該選擇 InfiniteTalk 而非類似的模型。
InfiniteTalk vs Wan 2.2 Speech-to-Video
Wan 2.2 Speech-to-Video(wavespeed-ai/wan-2.2/speech-to-video)支援最長 10 分鐘的 480p 影片,最大時長與 InfiniteTalk 相同。InfiniteTalk 另外提供 Wan 2.2 沒有獨立端點的 Multi 版本(兩段音訊輸入)、Video-to-Video 與 Fast 等級。
InfiniteTalk vs Stock avatar tools
素材庫式虛擬人工具(HeyGen 類型)只能使用精選的預訓練虛擬人。InfiniteTalk 則接受任何角色圖片,無論是品牌吉祥物、AI 生成角色或插畫主持人,都不需要逐一設定角色,並且除了說話也支援唱歌。
InfiniteTalk vs ElevenLabs voice tools
ElevenLabs 負責聲音(生成、複製、多語言 TTS)。InfiniteTalk 則是影片層:將 ElevenLabs 的旁白與角色圖片(或現有影片)搭配,即可產出完整對嘴的影片。
常見問題
InfiniteTalk API — 常見問題
定價、授權、整合 — 關於在 WaveSpeedAI 上執行 InfiniteTalk 的常見問題。
什麼是 InfiniteTalk API?
InfiniteTalk 是 WaveSpeedAI 的影片生成模型,在 WaveSpeedAI 上以 REST API 提供。WaveSpeedAI InfiniteTalk 可將一張照片加上音訊,轉為會說話或會唱歌的虛擬人影片,最長 10 分鐘。提供 Standard 與 Fast 等級,另有 Multi 版本(單張圖片搭配兩段音訊,輸出多角色影片)與 Video-to-Video 版本(以新音訊驅動現有影片)。您可以透過程式呼叫,也可以在上方連結的 Playground 試用。
如何呼叫 InfiniteTalk API?
註冊 WaveSpeedAI 帳號,從 /accesskey 複製您的 API 金鑰,然後將您的輸入以 JSON 格式 POST 到 https://api.wavespeed.ai/api/v3/wavespeed-ai/infinitetalk。端點會回傳 prediction id。請從約每 2 秒輪詢一次結果端點開始,長時間任務可拉長間隔,並在任何終止狀態時停止。上方提供適用於生產環境的 Python / Node.js / cURL 範例。
InfiniteTalk API 的費用是多少?
InfiniteTalk 每次執行 $0.075 起。實際費用會依您設定的參數(解析度、時長、輸出數量、參考素材)而調整。Playground 中「生成」按鈕旁的即時費用預覽會顯示您目前輸入的確切價格。
有哪些 InfiniteTalk 變體可用?
WaveSpeedAI 提供 8 個已上線的 InfiniteTalk 端點:wavespeed-ai/infinitetalk-fast/video-to-video-multi, wavespeed-ai/infinitetalk-fast/video-to-video, wavespeed-ai/infinitetalk/video-to-video-multi, wavespeed-ai/infinitetalk-fast/multi, wavespeed-ai/infinitetalk-fast, wavespeed-ai/infinitetalk/video-to-video, wavespeed-ai/infinitetalk, wavespeed-ai/infinitetalk/multi。每個變體都有各自的 Playground 頁面與定價。
InfiniteTalk 的輸出可以商用嗎?
商業使用權依 WaveSpeedAI 的模型授權而定。多數 WaveSpeedAI 模型允許商用輸出;請參閱各模型 Playground 頁面中的授權摘要,以及 WaveSpeedAI 的服務條款了解平台層級的條件。
為什麼要在 WaveSpeedAI 上使用 InfiniteTalk,而不是直接使用?
一組 API 金鑰、一個帳單帳戶,即可使用 InfiniteTalk 以及來自其他供應商的 1,000+ 個 AI 模型。無需設定各家 SDK、無需處理各自獨立的速率限制、無需為每個供應商重寫整合程式碼。價格通常與 WaveSpeedAI 的直接 API 相當或更低。
提供者
關於 WaveSpeedAI
InfiniteTalk 背後的團隊,以及 WaveSpeedAI 在 WaveSpeedAI 上的完整模型陣容。
WaveSpeedAI 營運一個推論平台,只需一組 API 金鑰、一個帳單帳戶與一組速率限制,即可使用來自各大供應商的 1,000 多個 AI 模型,包括 ByteDance、Google、OpenAI、Alibaba、快手、ElevenLabs 與數十家獨立實驗室。WaveSpeedAI 也推出針對正式生產管線調校的自有模型(圖像 / 影片放大器、浮水印移除工具、Animate、InfiniteTalk)。
在 WaveSpeedAI 上開始使用 InfiniteTalk 打造應用
註冊即贈免費入門點數。一組 API 金鑰,涵蓋來自 WaveSpeedAI 與所有其他供應商的 1,000+ 個 AI 模型。