InfiniteTalk API
InfiniteTalk от WaveSpeedAI — превращает одно фото и аудио в видео с говорящим ИЛИ поющим аватаром длиной до 10 минут. Уровни Standard и Fast, а также варианты Multi (одно изображение + два аудио для видео с несколькими персонажами) и Video-to-Video (озвучивание существующего видео новым аудио).
Уровни Standard и Fast, а также вывод 720p. Варианты Multi принимают одно изображение и два аудио для видео с несколькими говорящими/поющими персонажами. Варианты Video-to-Video озвучивают существующее видео новым аудио для замены липсинка. Результаты до 10 минут.
Обзор
О модели InfiniteTalk API
Что делает InfiniteTalk, какое место занимает в линейке моделей WaveSpeedAI и почему её выбирают команды.
InfiniteTalk — модель генерации видео от WaveSpeedAI, доступная через REST API WaveSpeedAI. InfiniteTalk от WaveSpeedAI — превращает одно фото и аудио в видео с говорящим ИЛИ поющим аватаром длиной до 10 минут. Уровни Standard и Fast, а также варианты Multi (одно изображение + два аудио для видео с несколькими персонажами) и Video-to-Video (озвучивание существующего видео новым аудио).
Уровни Standard и Fast, а также вывод 720p. Варианты Multi принимают одно изображение и два аудио для видео с несколькими говорящими/поющими персонажами. Варианты Video-to-Video озвучивают существующее видео новым аудио для замены липсинка. Результаты до 10 минут.
Семейство InfiniteTalk в WaveSpeedAI включает 8 REST-эндпоинтов для сценария: Digital-Human. У каждого варианта свои цены, параметры и примеры результатов — выберите тот, что подходит под ваш тип входных данных и требования продакшена, или вызывайте несколько с одним API-ключом и собирайте многошаговые пайплайны.
Запускайте InfiniteTalk с тем же API-ключом, платёжным аккаунтом и лимитами, что и остальные 1000+ ИИ-моделей WaveSpeedAI. Без отдельной регистрации у вендора, без SDK для каждого провайдера, без разных лимитов у каждого поставщика — одна интеграция охватывает всё: от текста в изображение и текста в видео до синтеза аудио, 3D-генерации, апскейлинга и редактирования.
Эндпоинты
Все эндпоинты API InfiniteTalk
Сейчас в WaveSpeedAI доступно эндпоинтов InfiniteTalk: 8 — выберите вариант под ваш сценарий.
/filters:quality(82)/media/images/20260408110527_g86tqkpw.webp)
Infinitetalk Fast Video To Video Multi
InfiniteTalk fast video-to-video multi converts a video and two audio inputs into multi-character talking or singing videos. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408110532_2m95tzbp.webp)
Infinitetalk Fast Video To Video
Audio-driven infinitetalk-fast turns one video plus audio into realistic talking or singing videos with lip-sync. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408111359_7pt74rzh.webp)
Infinitetalk Video To Video Multi
InfiniteTalk Video-to-Video Multi converts a video and two audio inputs into multi-character talking or singing videos at up to 720p. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408110534_dl097qgv.webp)
Infinitetalk Fast Multi
InfiniteTalk fast multi converts a single image and two audio inputs into multi-character talking or singing videos. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408110525_m58v6n7u.webp)
Infinitetalk Fast
InfiniteTalk fast converts one photo + audio into audio-driven talking or singing avatar videos (Image-to-Video), up to 10 minutes. Ready-to-use REST API, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408111403_q1ar1bex.webp)
Infinitetalk Video To Video
Audio-driven InfiniteTalk turns one video plus audio into realistic talking or singing videos with lip-sync in 480p or 720p. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/1790561759067766019_QVeeWlOj.webp)
Infinitetalk
InfiniteTalk Image-to-Video converts a single photo and audio track into long-form audio-driven talking or singing avatar videos, supporting up to 10 minutes, 720P output, natural lip sync, expressive motion, and digital human video workflows. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408111406_upu4dbpi.webp)
Infinitetalk Multi
InfiniteTalk Multi converts a single image and two audio inputs into multi-character talking or singing videos at up to 720p. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
Примеры
InfiniteTalk в деле
Реальные результаты, созданные через API InfiniteTalk. Наведите курсор на видео для предпросмотра, нажмите, чтобы открыть в полном размере.
Как использовать
Как использовать API InfiniteTalk
Четыре шага от регистрации до готовой генерации. Полные примеры на Python, Node.js и cURL — в разделе API ниже.
- 01
Получите API-ключ
Создайте аккаунт WaveSpeedAI и скопируйте API-ключ на панели управления. Новые аккаунты получают бесплатные стартовые кредиты — их хватит, чтобы несколько десятков раз запустить playground до начала списаний.
- 02
Отправьте предсказание
Отправьте входные данные в формате JSON методом POST на https://api.wavespeed.ai/api/v3/wavespeed-ai/infinitetalk. Эндпоинт сразу возвращает id предсказания — генерация асинхронная, поэтому соединение не нужно держать открытым на время инференса.
- 03
Опрашивайте до завершения
Выполняйте GET https://api.wavespeed.ai/api/v3/predictions/{request_id}/result. При статусе completed забирайте результат; при failed, cancelled, timeout или deleted остановитесь с ошибкой; при любом другом статусе продолжайте опрос.
- 04
Получите URL результата
Когда статус станет "completed", возьмите URL из data.outputs[0]. Он указывает на созданный файл в CDN WaveSpeedAI — изображение, видео, аудио или 3D-файл, в зависимости от вызванного варианта InfiniteTalk.
Сценарии применения
Что можно создать с InfiniteTalk
Типичные сценарии, для которых разработчики и авторы используют API InfiniteTalk.
Говорящий ИЛИ поющий аватар по фото
wavespeed-ai/infinitetalk превращает одно фото и аудио в видео с говорящим или поющим аватаром. Формулировка из каталога: «Image-to-Video, до 10 минут, уровень 720p». Поддержка пения — отличительная особенность.
Несколько персонажей по двум аудио
wavespeed-ai/infinitetalk/multi принимает одно изображение и два аудио для видео с несколькими говорящими/поющими персонажами в разрешении до 720p. Полезно для диалоговых сцен, дуэтов и презентаций вдвоём из одной настройки.
Замена липсинка в video-to-video
wavespeed-ai/infinitetalk/video-to-video озвучивает существующее видео новым аудио, создавая реалистичную речь или пение с липсинком (480p или 720p). Полезно для переозвучки готового материала новым закадровым голосом.
Результаты до 10 минут
Заявление из каталога для базового варианта: до 10 минут. Значительно дольше большинства видеомоделей — подходит для подкастов, лекций, длинной озвучки и контента с говорящим аватаром длиной в целый эпизод за одну генерацию.
Уровень Fast
wavespeed-ai/infinitetalk-fast. Тот же процесс image-to-video с оптимизированным инференсом — полезно для больших объёмов и итераций на предпродакшене. У Multi и video-to-video тоже есть варианты Fast.
Video-to-video с несколькими персонажами
wavespeed-ai/infinitetalk/video-to-video-multi принимает видео и два аудио для видео с несколькими говорящими/поющими персонажами в разрешении до 720p. Полное сочетание процессов с несколькими персонажами и видео-источником в одном вызове.
Советы
Советы по написанию запросов для InfiniteTalk
Практические советы, как получать лучшие результаты от InfiniteTalk, — на основе приёмов, которые работают в продакшен-пайплайнах для моделей видео.
- 01
Сначала чистый звук, потом синхронизация
Качество липсинка упирается в чёткость звука. Удалите фоновый шум, нормализуйте уровни и проверьте клиппинг, прежде чем подавать звук. Чистый звук улучшает липсинк сильнее любого другого фактора.
- 02
Подбирайте референсное изображение под язык/культуру звука
Англоязычный звук с явно западным персонажем выглядит естественнее, чем несоответствие. То же для японского / китайского / корейского звука и соответствующих референсов персонажей.
- 03
Портреты анфас синхронизируются чище всего
Референсы-портреты прямо в лицо дают самый естественный липсинк. Ракурс в три четверти и профиль работают, но с едва заметными артефактами. Если вы управляете изображением персонажа, выбирайте позу, близкую к фронтальной.
- 04
Поддерживается не только речь, но и пение
Функция каталога: «видео с говорящим или поющим аватаром». Используйте для музыкальных клипов, контента с хором / солистом и лирик-видео с ведущим персонажем — не только для разговорного контента.
- 05
Вариант Multi принимает два аудио
wavespeed-ai/infinitetalk/multi принимает одно изображение и два аудио для видео с несколькими говорящими/поющими персонажами в разрешении до 720p. Полезно для диалоговых сцен, дуэтов и презентаций вдвоём из одной настройки.
- 06
Video-to-video для переозвучки готового материала
wavespeed-ai/infinitetalk/video-to-video озвучивает существующее видео новым аудио, создавая реалистичную речь или пение с липсинком. Полезно для переозвучки клипов новым закадровым голосом с сохранением исходной картинки.
Цены
Цены на API InfiniteTalk
Оплата — за каждый результат. Итоговая стоимость зависит от параметров, заданных в playground каждого варианта (разрешение, длительность, количество результатов, референсы).
| Эндпоинт | Тип | Цена от |
|---|---|---|
| wavespeed-ai/ | digital-human | $0.075 |
| wavespeed-ai/ | digital-human | $0.075 |
| wavespeed-ai/ | digital-human | $0.15 |
| wavespeed-ai/ | digital-human | $0.075 |
| wavespeed-ai/ | digital-human | $0.075 |
| wavespeed-ai/ | digital-human | $0.15 |
| wavespeed-ai/ | digital-human | $0.15 |
| wavespeed-ai/ | digital-human | $0.15 |
API
Вызов API InfiniteTalk
Получите API-ключ на wavespeed.ai/accesskey, затем отправьте предсказание через REST. Playground генерирует готовые к вставке примеры для любой комбинации входных данных.
POSThttps://api.wavespeed.ai/api/v3/wavespeed-ai/infinitetalk
# 1. Submit the prediction.
SUBMIT_RESPONSE=$(curl --silent --show-error --fail-with-body \
-X POST "https://api.wavespeed.ai/api/v3/wavespeed-ai/infinitetalk" \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $WAVESPEED_API_KEY" \
-d '{
"image": "https://interactive-examples.mdn.mozilla.net/media/cc0-images/painted-hand-298-332.jpg",
"audio": "https://interactive-examples.mdn.mozilla.net/media/cc0-audio/t-rex-roar.mp3",
"resolution": "480p"
}')
TASK=$(printf '%s' "$SUBMIT_RESPONSE" | jq 'if has("data") then .data else . end')
PREDICTION_ID=$(printf '%s' "$TASK" | jq -r '.id')
if [ -z "$PREDICTION_ID" ] || [ "$PREDICTION_ID" = "null" ]; then
printf 'Submission response did not contain a prediction id
' >&2
exit 1
fi
RESULT_URL="https://api.wavespeed.ai/api/v3/predictions/$PREDICTION_ID/result"
# 2. Poll until the prediction finishes.
while true; do
RESPONSE=$(curl --silent --show-error --fail-with-body "$RESULT_URL" \
-H "Authorization: Bearer $WAVESPEED_API_KEY")
RESULT=$(printf '%s' "$RESPONSE" | jq 'if has("data") then .data else . end')
STATUS=$(printf '%s' "$RESULT" | jq -r '.status')
case "$STATUS" in
completed) printf '%s\n' "$RESULT" | jq '.outputs'; break ;;
failed|cancelled|timeout|deleted) printf '%s\n' "$RESULT" | jq . >&2; exit 1 ;;
*) sleep 2 ;;
esac
doneconst submitUrl = "https://api.wavespeed.ai/api/v3/wavespeed-ai/infinitetalk";
const apiKey = process.env.WAVESPEED_API_KEY;
if (!apiKey) throw new Error('Set WAVESPEED_API_KEY');
async function requestJson(url, options = {}) {
const response = await fetch(url, options);
if (!response.ok) throw new Error(await response.text());
return response.json();
}
// 1. Submit the prediction.
const body = await requestJson(submitUrl, {
method: "POST",
headers: {
"Authorization": `Bearer ${apiKey}`,
"Content-Type": "application/json",
},
body: JSON.stringify({
"image": "https://interactive-examples.mdn.mozilla.net/media/cc0-images/painted-hand-298-332.jpg",
"audio": "https://interactive-examples.mdn.mozilla.net/media/cc0-audio/t-rex-roar.mp3",
"resolution": "480p"
}),
});
const task = body.data ?? body;
const resultUrl = `https://api.wavespeed.ai/api/v3/predictions/${task.id}/result`;
// 2. Poll until the prediction finishes.
while (true) {
const resultBody = await requestJson(resultUrl, {
headers: { "Authorization": `Bearer ${apiKey}` },
});
const result = resultBody.data ?? resultBody;
if (result.status === "completed") {
console.log(result.outputs);
break;
}
if (["failed", "cancelled", "timeout", "deleted"].includes(result.status)) throw new Error(JSON.stringify(result));
await new Promise(resolve => setTimeout(resolve, 2000));
}import json
import os
import time
from urllib.request import Request, urlopen
api_key = os.environ["WAVESPEED_API_KEY"]
headers = {"Authorization": f"Bearer {api_key}", "Content-Type": "application/json"}
payload = {
"image": "https://interactive-examples.mdn.mozilla.net/media/cc0-images/painted-hand-298-332.jpg",
"audio": "https://interactive-examples.mdn.mozilla.net/media/cc0-audio/t-rex-roar.mp3",
"resolution": "480p"
}
def request_json(url, data=None):
request = Request(url, data=data, headers=headers, method="POST" if data else "GET")
with urlopen(request) as response:
return json.load(response)
# 1. Submit the prediction.
body = request_json("https://api.wavespeed.ai/api/v3/wavespeed-ai/infinitetalk", json.dumps(payload).encode())
task = body.get("data", body)
result_url = f"https://api.wavespeed.ai/api/v3/predictions/{task['id']}/result"
# 2. Poll until the prediction finishes.
while True:
result_body = request_json(result_url)
result = result_body.get("data", result_body)
status = result.get("status")
if status == "completed":
print(result.get("outputs", []))
break
if status in {"failed", "cancelled", "timeout", "deleted"}:
raise RuntimeError(result)
time.sleep(2)Сравнение
InfiniteTalk и альтернативы
Когда стоит выбрать InfiniteTalk, а не похожие модели в WaveSpeedAI.
InfiniteTalk и Wan 2.2 Speech-to-Video
Wan 2.2 Speech-to-Video (wavespeed-ai/wan-2.2/speech-to-video) поддерживает клипы до 10 минут в 480p — та же максимальная длительность, что у InfiniteTalk. InfiniteTalk добавляет варианты Multi (два аудио), Video-to-Video и уровень Fast, которых у Wan 2.2 нет как отдельной конечной точки.
InfiniteTalk и Stock avatar tools
Инструменты со стоковыми аватарами (вроде HeyGen) ограничивают вас отобранной библиотекой готовых аватаров. InfiniteTalk принимает любое изображение персонажа — фирменного маскота, сгенерированного ИИ героя, иллюстрированного ведущего — без настройки под каждого персонажа и поддерживает пение наряду с речью.
InfiniteTalk и ElevenLabs voice tools
ElevenLabs отвечает за голос (генерация, клонирование, многоязычный TTS). InfiniteTalk — видеослой: соедините закадровый голос ElevenLabs с изображением персонажа (или существующим видео), чтобы получить полноценное видео с липсинком.
FAQ
InfiniteTalk API — часто задаваемые вопросы
Цены, лицензия, интеграция — частые вопросы о запуске InfiniteTalk в WaveSpeedAI.
Что такое API InfiniteTalk?
InfiniteTalk — модель генерации видео от WaveSpeedAI, доступная как REST API в WaveSpeedAI. InfiniteTalk от WaveSpeedAI — превращает одно фото и аудио в видео с говорящим ИЛИ поющим аватаром длиной до 10 минут. Уровни Standard и Fast, а также варианты Multi (одно изображение + два аудио для видео с несколькими персонажами) и Video-to-Video (озвучивание существующего видео новым аудио). Её можно вызывать программно или попробовать в playground по ссылке выше.
Как вызывать API InfiniteTalk?
Создайте аккаунт WaveSpeedAI, скопируйте API-ключ на странице /accesskey и отправьте POST на https://api.wavespeed.ai/api/v3/wavespeed-ai/infinitetalk с входными данными в JSON. Эндпоинт вернёт id предсказания. Опрашивайте эндпоинт результата примерно раз в 2 секунды, для долгих задач увеличивайте интервал и останавливайтесь на любом финальном статусе. Примеры для продакшена на Python / Node.js / cURL — выше.
Сколько стоит API InfiniteTalk?
InfiniteTalk стоит от $0.075 за запуск. Точная стоимость зависит от заданных параметров (разрешение, длительность, количество результатов, референсы). Предпросмотр стоимости рядом с кнопкой «Сгенерировать» в playground показывает точную цену для ваших текущих данных.
Какие варианты InfiniteTalk доступны?
В WaveSpeedAI доступно рабочих эндпоинтов InfiniteTalk: 8 — wavespeed-ai/infinitetalk-fast/video-to-video-multi, wavespeed-ai/infinitetalk-fast/video-to-video, wavespeed-ai/infinitetalk/video-to-video-multi, wavespeed-ai/infinitetalk-fast/multi, wavespeed-ai/infinitetalk-fast, wavespeed-ai/infinitetalk/video-to-video, wavespeed-ai/infinitetalk, wavespeed-ai/infinitetalk/multi. У каждого варианта своя страница playground и свои цены.
Можно ли использовать результаты InfiniteTalk в коммерческих целях?
Права на коммерческое использование определяются лицензией модели WaveSpeedAI. Большинство моделей WaveSpeedAI разрешают коммерческое использование результатов; краткое описание лицензии смотрите на странице playground каждой модели, а условия платформы — в Условиях использования WaveSpeedAI.
Зачем использовать InfiniteTalk в WaveSpeedAI, а не напрямую?
Один API-ключ и один платёжный аккаунт для InfiniteTalk И для 1000+ других ИИ-моделей от разных провайдеров. Без настройки SDK для каждого вендора, без отдельных лимитов, без переписывания интеграционного кода под каждого поставщика. Цены, как правило, на уровне прямого API WaveSpeedAI или ниже.
Разработчик
О WaveSpeedAI
Команда, стоящая за InfiniteTalk и всей линейкой моделей WaveSpeedAI в WaveSpeedAI.
WaveSpeedAI — платформа инференса, на которой размещено более 1000 моделей ИИ от всех крупных провайдеров — ByteDance, Google, OpenAI, Alibaba, Kuaishou, ElevenLabs и десятков независимых лабораторий — с одним ключом API, одним платёжным аккаунтом и одним общим лимитом запросов. WaveSpeedAI также выпускает собственные модели (апскейлеры изображений и видео, средства удаления водяных знаков, Animate, InfiniteTalk), настроенные для продакшен-конвейеров.
Начните создавать с InfiniteTalk в WaveSpeedAI
Бесплатные стартовые кредиты при регистрации. Один API-ключ для 1000+ ИИ-моделей от WaveSpeedAI и всех остальных провайдеров.