InfiniteTalk API
WaveSpeedAI InfiniteTalk——将一张照片加音频转换为说话或唱歌的数字人视频,最长 10 分钟。提供 Standard 和 Fast 档位,以及 Multi 变体(单张图像加两路音频输入,生成多角色输出)和 Video-to-Video 变体(用新音频驱动现有视频)。
提供 Standard 和 Fast 档位,输出 720p。Multi 变体接受单张图像加两路音频输入,生成多角色的说话/唱歌视频。Video-to-Video 变体用新音频驱动现有视频,实现口型替换。输出最长 10 分钟。
概览
关于 InfiniteTalk API
InfiniteTalk 能做什么、它在 WaveSpeedAI 模型阵容中的定位,以及团队选择它的原因。
InfiniteTalk 是 WaveSpeedAI 推出的视频生成模型,可通过 WaveSpeedAI REST API 使用。WaveSpeedAI InfiniteTalk——将一张照片加音频转换为说话或唱歌的数字人视频,最长 10 分钟。提供 Standard 和 Fast 档位,以及 Multi 变体(单张图像加两路音频输入,生成多角色输出)和 Video-to-Video 变体(用新音频驱动现有视频)。
提供 Standard 和 Fast 档位,输出 720p。Multi 变体接受单张图像加两路音频输入,生成多角色的说话/唱歌视频。Video-to-Video 变体用新音频驱动现有视频,实现口型替换。输出最长 10 分钟。
WaveSpeedAI 上的 InfiniteTalk 系列提供 8 个 REST 端点,涵盖 Digital-Human 个工作流。每个变体都有各自的定价、参数选项和示例输出——请选择与你的输入模态和生产约束相匹配的那一个,或使用同一个 API 密钥调用多个变体,组合成多步骤流水线。
使用与 WaveSpeedAI 上其他 1,000 多个 AI 模型相同的 API 密钥、账单账户和速率限制来运行 InfiniteTalk。无需单独对接供应商,无需各家 SDK,也无需应对各家不同的速率限制——一次集成即可覆盖从文生图、文生视频到音频合成、3D 生成、放大和编辑的全部能力。
端点
全部 InfiniteTalk API 端点
WaveSpeedAI 现已提供 8 个 InfiniteTalk 端点——请选择适合你工作流的变体。
/filters:quality(82)/media/images/20260408110527_g86tqkpw.webp)
Infinitetalk Fast Video To Video Multi
InfiniteTalk fast video-to-video multi converts a video and two audio inputs into multi-character talking or singing videos. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408110532_2m95tzbp.webp)
Infinitetalk Fast Video To Video
Audio-driven infinitetalk-fast turns one video plus audio into realistic talking or singing videos with lip-sync. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408111359_7pt74rzh.webp)
Infinitetalk Video To Video Multi
InfiniteTalk Video-to-Video Multi converts a video and two audio inputs into multi-character talking or singing videos at up to 720p. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408110534_dl097qgv.webp)
Infinitetalk Fast Multi
InfiniteTalk fast multi converts a single image and two audio inputs into multi-character talking or singing videos. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408110525_m58v6n7u.webp)
Infinitetalk Fast
InfiniteTalk fast converts one photo + audio into audio-driven talking or singing avatar videos (Image-to-Video), up to 10 minutes. Ready-to-use REST API, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408111403_q1ar1bex.webp)
Infinitetalk Video To Video
Audio-driven InfiniteTalk turns one video plus audio into realistic talking or singing videos with lip-sync in 480p or 720p. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/1790561759067766019_QVeeWlOj.webp)
Infinitetalk
InfiniteTalk Image-to-Video converts a single photo and audio track into long-form audio-driven talking or singing avatar videos, supporting up to 10 minutes, 720P output, natural lip sync, expressive motion, and digital human video workflows. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408111406_upu4dbpi.webp)
Infinitetalk Multi
InfiniteTalk Multi converts a single image and two audio inputs into multi-character talking or singing videos at up to 720p. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
示例
看看 InfiniteTalk 的实际效果
由 InfiniteTalk API 生成的真实输出。悬停在任意视频上即可预览,点击可打开全尺寸查看器。
使用方法
如何使用 InfiniteTalk API
从注册到完成一次生成,只需四步。完整的 Python、Node.js 和 cURL 示例见下方的 API 部分。
- 01
获取 API 密钥
注册 WaveSpeedAI 账号,并从控制台复制你的 API 密钥。新账号附带免费体验额度——足够在开始计费前把 Playground 运行几十次。
- 02
提交预测
把你的输入以 JSON 形式 POST 到 https://api.wavespeed.ai/api/v3/wavespeed-ai/infinitetalk。端点会立即返回预测 ID——生成是异步的,因此推理期间你无需保持连接。
- 03
轮询完成状态
GET https://api.wavespeed.ai/api/v3/predictions/{request_id}/result。状态为 completed 时返回输出;状态为 failed、cancelled、timeout 或 deleted 时以错误终止;其他任何状态都继续轮询。
- 04
读取输出 URL
状态变为 "completed" 后,从 data.outputs[0] 读取 URL。该 URL 指向 WaveSpeedAI CDN 上你生成的媒体——具体是图片、视频、音频还是 3D 文件,取决于你调用的 InfiniteTalk 变体。
应用场景
用 InfiniteTalk 可以构建什么
开发者和创作者使用 InfiniteTalk API 的常见工作流。
用一张照片生成说话或唱歌的数字人
wavespeed-ai/infinitetalk 将一张照片加音频转换为说话或唱歌的数字人视频。目录定位:「图生视频,最长 10 分钟,720p 档位」。支持唱歌是其与众不同的功能。
两路音频输入的多角色
wavespeed-ai/infinitetalk/multi 接受单张图像加两路音频输入,生成最高 720p 的多角色说话/唱歌视频。适合对话场景、二重唱,以及基于同一设置的双人演示。
视频转视频的口型替换
wavespeed-ai/infinitetalk/video-to-video 用新音频驱动现有视频,生成口型同步的逼真说话或唱歌效果(480p 或 720p)。适合为现有素材换上新的配音。
最长 10 分钟的输出
目录中对基础变体的宣称:最长 10 分钟。比大多数视频模型长得多——可在一次生成中完成播客、讲座、长篇旁白和整集的说话数字人内容。
Fast 档位
wavespeed-ai/infinitetalk-fast。同样的图生视频流程,推理经过优化——适合大批量工作和前期迭代。Multi 和 video-to-video 也提供 Fast 变体。
多角色视频转视频
wavespeed-ai/infinitetalk/video-to-video-multi 接受一段视频和两路音频输入,生成最高 720p 的多角色说话/唱歌效果。一次调用即可完整组合多角色与视频源两种工作流。
技巧
InfiniteTalk 提示词技巧
让 InfiniteTalk 输出更好结果的实用建议——总结自生产流水线中各类视频模型都适用的做法。
- 01
先清理音频,再做同步
口型同步的质量受限于音频的清晰度。输入前请去除背景噪音、统一电平并检查是否削波。干净的音频对口型同步的改善胜过其他任何变量。
- 02
让参考图像与音频的语言/文化相匹配
英语音频搭配明显的西方角色,看起来比错配更自然。日语 / 中文 / 韩语音频搭配相应的角色参考也是同理。
- 03
正面肖像的同步效果最干净
正对镜头的肖像参考能产生最自然的口型同步。四分之三侧脸和侧面角度也可以,但会有细微的伪影。如果可以控制角色图像,请提供接近正面的姿势。
- 04
不仅支持说话,也支持唱歌
目录功能:「说话或唱歌的数字人视频」。可用于音乐视频、合唱 / 独唱内容,以及以特定角色为主角的歌词视频——不只是口语内容。
- 05
Multi 变体接受两路音频输入
wavespeed-ai/infinitetalk/multi 接受单张图像加两路音频输入,生成最高 720p 的多角色说话/唱歌视频。适合对话场景、二重唱,以及基于同一设置的双人演示。
- 06
视频转视频,为现有素材重新配音
wavespeed-ai/infinitetalk/video-to-video 用新音频驱动现有视频,生成口型同步的逼真说话或唱歌效果。适合在保留原始画面的同时,为片段换上新的配音。
定价
InfiniteTalk API 定价
按输出计费。最终费用会随你在各变体 Playground 中设置的参数(分辨率、时长、输出数量、参考素材)而变化。
| 端点 | 类型 | 起步价 |
|---|---|---|
| wavespeed-ai/ | digital-human | $0.075 |
| wavespeed-ai/ | digital-human | $0.075 |
| wavespeed-ai/ | digital-human | $0.15 |
| wavespeed-ai/ | digital-human | $0.075 |
| wavespeed-ai/ | digital-human | $0.075 |
| wavespeed-ai/ | digital-human | $0.15 |
| wavespeed-ai/ | digital-human | $0.15 |
| wavespeed-ai/ | digital-human | $0.15 |
API
调用 InfiniteTalk API
在 wavespeed.ai/accesskey 注册并获取 API 密钥,然后通过 REST 提交预测。Playground 可以为任意输入组合生成可直接粘贴的示例代码。
POSThttps://api.wavespeed.ai/api/v3/wavespeed-ai/infinitetalk
# 1. Submit the prediction.
SUBMIT_RESPONSE=$(curl --silent --show-error --fail-with-body \
-X POST "https://api.wavespeed.ai/api/v3/wavespeed-ai/infinitetalk" \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $WAVESPEED_API_KEY" \
-d '{
"image": "https://interactive-examples.mdn.mozilla.net/media/cc0-images/painted-hand-298-332.jpg",
"audio": "https://interactive-examples.mdn.mozilla.net/media/cc0-audio/t-rex-roar.mp3",
"resolution": "480p"
}')
TASK=$(printf '%s' "$SUBMIT_RESPONSE" | jq 'if has("data") then .data else . end')
PREDICTION_ID=$(printf '%s' "$TASK" | jq -r '.id')
if [ -z "$PREDICTION_ID" ] || [ "$PREDICTION_ID" = "null" ]; then
printf 'Submission response did not contain a prediction id
' >&2
exit 1
fi
RESULT_URL="https://api.wavespeed.ai/api/v3/predictions/$PREDICTION_ID/result"
# 2. Poll until the prediction finishes.
while true; do
RESPONSE=$(curl --silent --show-error --fail-with-body "$RESULT_URL" \
-H "Authorization: Bearer $WAVESPEED_API_KEY")
RESULT=$(printf '%s' "$RESPONSE" | jq 'if has("data") then .data else . end')
STATUS=$(printf '%s' "$RESULT" | jq -r '.status')
case "$STATUS" in
completed) printf '%s\n' "$RESULT" | jq '.outputs'; break ;;
failed|cancelled|timeout|deleted) printf '%s\n' "$RESULT" | jq . >&2; exit 1 ;;
*) sleep 2 ;;
esac
doneconst submitUrl = "https://api.wavespeed.ai/api/v3/wavespeed-ai/infinitetalk";
const apiKey = process.env.WAVESPEED_API_KEY;
if (!apiKey) throw new Error('Set WAVESPEED_API_KEY');
async function requestJson(url, options = {}) {
const response = await fetch(url, options);
if (!response.ok) throw new Error(await response.text());
return response.json();
}
// 1. Submit the prediction.
const body = await requestJson(submitUrl, {
method: "POST",
headers: {
"Authorization": `Bearer ${apiKey}`,
"Content-Type": "application/json",
},
body: JSON.stringify({
"image": "https://interactive-examples.mdn.mozilla.net/media/cc0-images/painted-hand-298-332.jpg",
"audio": "https://interactive-examples.mdn.mozilla.net/media/cc0-audio/t-rex-roar.mp3",
"resolution": "480p"
}),
});
const task = body.data ?? body;
const resultUrl = `https://api.wavespeed.ai/api/v3/predictions/${task.id}/result`;
// 2. Poll until the prediction finishes.
while (true) {
const resultBody = await requestJson(resultUrl, {
headers: { "Authorization": `Bearer ${apiKey}` },
});
const result = resultBody.data ?? resultBody;
if (result.status === "completed") {
console.log(result.outputs);
break;
}
if (["failed", "cancelled", "timeout", "deleted"].includes(result.status)) throw new Error(JSON.stringify(result));
await new Promise(resolve => setTimeout(resolve, 2000));
}import json
import os
import time
from urllib.request import Request, urlopen
api_key = os.environ["WAVESPEED_API_KEY"]
headers = {"Authorization": f"Bearer {api_key}", "Content-Type": "application/json"}
payload = {
"image": "https://interactive-examples.mdn.mozilla.net/media/cc0-images/painted-hand-298-332.jpg",
"audio": "https://interactive-examples.mdn.mozilla.net/media/cc0-audio/t-rex-roar.mp3",
"resolution": "480p"
}
def request_json(url, data=None):
request = Request(url, data=data, headers=headers, method="POST" if data else "GET")
with urlopen(request) as response:
return json.load(response)
# 1. Submit the prediction.
body = request_json("https://api.wavespeed.ai/api/v3/wavespeed-ai/infinitetalk", json.dumps(payload).encode())
task = body.get("data", body)
result_url = f"https://api.wavespeed.ai/api/v3/predictions/{task['id']}/result"
# 2. Poll until the prediction finishes.
while True:
result_body = request_json(result_url)
result = result_body.get("data", result_body)
status = result.get("status")
if status == "completed":
print(result.get("outputs", []))
break
if status in {"failed", "cancelled", "timeout", "deleted"}:
raise RuntimeError(result)
time.sleep(2)对比
InfiniteTalk 与其他方案对比
在 WaveSpeedAI 上,何时应选择 InfiniteTalk 而不是同类模型。
InfiniteTalk 对比 Wan 2.2 Speech-to-Video
Wan 2.2 Speech-to-Video(wavespeed-ai/wan-2.2/speech-to-video)支持最长 10 分钟、480p 的片段——最大时长与 InfiniteTalk 相同。InfiniteTalk 新增了 Multi 变体(两路音频输入)、Video-to-Video 和 Fast 档位,而 Wan 2.2 没有提供这些独立端点。
InfiniteTalk 对比 Stock avatar tools
库存数字人工具(HeyGen 类)把您限制在一个精选的预训练数字人库中。InfiniteTalk 接受任何角色图像——品牌吉祥物、AI 生成的角色、插画主持人——无需为每个角色单独设置,并且既支持说话也支持唱歌。
InfiniteTalk 对比 ElevenLabs voice tools
ElevenLabs 负责声音(生成、克隆、多语言 TTS)。InfiniteTalk 是视频层:将 ElevenLabs 的配音与角色图像(或现有视频)搭配,即可生成完整的口型同步视频。
常见问题
InfiniteTalk API — 常见问题
定价、许可、集成——关于在 WaveSpeedAI 上运行 InfiniteTalk 的常见问题。
InfiniteTalk API 是什么?
InfiniteTalk 是 WaveSpeedAI 的视频生成模型,在 WaveSpeedAI 上以 REST API 形式提供。WaveSpeedAI InfiniteTalk——将一张照片加音频转换为说话或唱歌的数字人视频,最长 10 分钟。提供 Standard 和 Fast 档位,以及 Multi 变体(单张图像加两路音频输入,生成多角色输出)和 Video-to-Video 变体(用新音频驱动现有视频)。你可以通过编程方式调用它,也可以在上方链接的 Playground 中试用。
如何调用 InfiniteTalk API?
注册 WaveSpeedAI 账号,从 /accesskey 复制你的 API 密钥,然后把输入以 JSON 形式 POST 到 https://api.wavespeed.ai/api/v3/wavespeed-ai/infinitetalk。端点会返回预测 ID。从大约每 2 秒一次开始轮询结果端点,长耗时任务可适当拉长间隔,并在任何终止状态时停止。上方有面向生产环境的 Python / Node.js / cURL 示例。
InfiniteTalk API 的费用是多少?
InfiniteTalk 每次调用 $0.075 起。实际费用会随你设置的参数(分辨率、时长、输出数量、参考素材)而变化。Playground 中“生成”按钮旁的实时费用预览会显示你当前输入对应的准确价格。
有哪些 InfiniteTalk 变体可用?
WaveSpeedAI 托管了 8 个已上线的 InfiniteTalk 端点:wavespeed-ai/infinitetalk-fast/video-to-video-multi, wavespeed-ai/infinitetalk-fast/video-to-video, wavespeed-ai/infinitetalk/video-to-video-multi, wavespeed-ai/infinitetalk-fast/multi, wavespeed-ai/infinitetalk-fast, wavespeed-ai/infinitetalk/video-to-video, wavespeed-ai/infinitetalk, wavespeed-ai/infinitetalk/multi。每个变体都有自己的 Playground 页面和定价。
InfiniteTalk 的输出可以商用吗?
商用权利遵循 WaveSpeedAI 的模型许可。大多数 WaveSpeedAI 模型允许商用输出;具体许可摘要请查看各模型的 Playground 页面,平台层面的条件请参阅 WaveSpeedAI 的服务条款。
为什么要在 WaveSpeedAI 上使用 InfiniteTalk,而不是直接对接?
一个 API 密钥、一个账单账户,即可使用 InfiniteTalk 以及来自其他提供方的 1,000 多个 AI 模型。无需逐家配置 SDK,无需应对各自独立的速率限制,也无需为每家重写集成代码。价格通常与 WaveSpeedAI 直接提供的 API 持平或更低。
提供方
关于 WaveSpeedAI
InfiniteTalk 及 WaveSpeedAI 上 WaveSpeedAI 更多模型背后的团队。
WaveSpeedAI 运营着一个推理平台,托管来自所有主流提供商——字节跳动、Google、OpenAI、阿里巴巴、快手、ElevenLabs 以及数十家独立实验室——的 1,000+ AI 模型,只需一个 API 密钥、一个计费账户和一套速率限制。WaveSpeedAI 还提供自有模型(图像 / 视频放大、水印消除、Animate、InfiniteTalk),专为生产流水线调优。
在 WaveSpeedAI 上用 InfiniteTalk 开始构建
注册即送免费体验额度。一个 API 密钥,即可使用来自 WaveSpeedAI 及其他所有提供方的 1,000 多个 AI 模型。