InfiniteTalk API
WaveSpeedAI InfiniteTalk — zamienia jedno zdjęcie i dźwięk w wideo z mówiącym LUB śpiewającym awatarem, do 10 minut. Poziomy Standard i Fast oraz warianty Multi (jeden obraz i dwa wejścia audio dla wyniku z wieloma postaciami) i Video-to-Video (steruj istniejącym wideo nowym dźwiękiem).
Poziomy Standard i Fast oraz wyjście 720p. Warianty Multi przyjmują jeden obraz i dwa wejścia audio, aby wygenerować wideo z wieloma mówiącymi/śpiewającymi postaciami. Warianty Video-to-Video sterują istniejącym wideo nowym dźwiękiem w celu zastąpienia synchronizacji ust. Wyniki do 10 minut.
Przegląd
O modelu InfiniteTalk API
Co robi InfiniteTalk, jakie miejsce zajmuje w linii modeli WaveSpeedAI i dlaczego zespoły po niego sięgają.
InfiniteTalk to model generowania wideo od WaveSpeedAI, dostępny przez REST API WaveSpeedAI. WaveSpeedAI InfiniteTalk — zamienia jedno zdjęcie i dźwięk w wideo z mówiącym LUB śpiewającym awatarem, do 10 minut. Poziomy Standard i Fast oraz warianty Multi (jeden obraz i dwa wejścia audio dla wyniku z wieloma postaciami) i Video-to-Video (steruj istniejącym wideo nowym dźwiękiem).
Poziomy Standard i Fast oraz wyjście 720p. Warianty Multi przyjmują jeden obraz i dwa wejścia audio, aby wygenerować wideo z wieloma mówiącymi/śpiewającymi postaciami. Warianty Video-to-Video sterują istniejącym wideo nowym dźwiękiem w celu zastąpienia synchronizacji ust. Wyniki do 10 minut.
Rodzina InfiniteTalk w WaveSpeedAI zawiera 8 endpointów REST obejmujące workflow: Digital-Human. Każdy wariant ma własny cennik, parametry i przykładowe wyniki — wybierz ten, który pasuje do Twoich danych wejściowych i wymagań produkcyjnych, albo wywołuj kilka z jednego klucza API, aby składać wieloetapowe pipeline'y.
Uruchamiaj InfiniteTalk z tym samym kluczem API, kontem rozliczeniowym i limitami, których używasz dla ponad 1000 innych modeli AI w WaveSpeedAI. Bez osobnej konfiguracji u dostawcy, bez osobnych SDK, bez osobnych limitów — jedna integracja obejmuje wszystko: od tekstu na obraz i tekstu na wideo, przez syntezę dźwięku i generowanie 3D, po upscaling i edycję.
Endpointy
Wszystkie endpointy API InfiniteTalk
8 endpointów InfiniteTalk dostępnych teraz w WaveSpeedAI — wybierz wariant pasujący do Twojego workflow.
/filters:quality(82)/media/images/20260408110527_g86tqkpw.webp)
Infinitetalk Fast Video To Video Multi
InfiniteTalk fast video-to-video multi converts a video and two audio inputs into multi-character talking or singing videos. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408110532_2m95tzbp.webp)
Infinitetalk Fast Video To Video
Audio-driven infinitetalk-fast turns one video plus audio into realistic talking or singing videos with lip-sync. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408111359_7pt74rzh.webp)
Infinitetalk Video To Video Multi
InfiniteTalk Video-to-Video Multi converts a video and two audio inputs into multi-character talking or singing videos at up to 720p. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408110534_dl097qgv.webp)
Infinitetalk Fast Multi
InfiniteTalk fast multi converts a single image and two audio inputs into multi-character talking or singing videos. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408110525_m58v6n7u.webp)
Infinitetalk Fast
InfiniteTalk fast converts one photo + audio into audio-driven talking or singing avatar videos (Image-to-Video), up to 10 minutes. Ready-to-use REST API, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408111403_q1ar1bex.webp)
Infinitetalk Video To Video
Audio-driven InfiniteTalk turns one video plus audio into realistic talking or singing videos with lip-sync in 480p or 720p. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/1790561759067766019_QVeeWlOj.webp)
Infinitetalk
InfiniteTalk Image-to-Video converts a single photo and audio track into long-form audio-driven talking or singing avatar videos, supporting up to 10 minutes, 720P output, natural lip sync, expressive motion, and digital human video workflows. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408111406_upu4dbpi.webp)
Infinitetalk Multi
InfiniteTalk Multi converts a single image and two audio inputs into multi-character talking or singing videos at up to 720p. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
Przykłady
InfiniteTalk w akcji
Prawdziwe wyniki wygenerowane przez API InfiniteTalk. Najedź na wideo, aby zobaczyć podgląd, kliknij, aby otworzyć pełnowymiarowy podgląd.
Jak zacząć
Jak korzystać z API InfiniteTalk
Cztery kroki od rejestracji do gotowego wyniku. Pełne przykłady w Pythonie, Node.js i cURL znajdziesz w sekcji API poniżej.
- 01
Uzyskaj klucz API
Załóż konto WaveSpeedAI i skopiuj klucz API z panelu. Nowe konta otrzymują darmowe kredyty na start — wystarczy na kilkadziesiąt uruchomień w playground, zanim zaczną się opłaty.
- 02
Wyślij predykcję
Wyślij dane wejściowe jako JSON metodą POST na https://api.wavespeed.ai/api/v3/wavespeed-ai/infinitetalk. Endpoint od razu zwraca identyfikator predykcji — generowanie jest asynchroniczne, więc nie trzymasz otwartego połączenia na czas inferencji.
- 03
Sprawdzaj ukończenie
Wywołaj GET https://api.wavespeed.ai/api/v3/predictions/{request_id}/result. Przy statusie completed odbierz wyniki; przy failed, cancelled, timeout lub deleted zakończ z błędem; przy każdym innym statusie odpytuj dalej.
- 04
Odczytaj adres wyniku
Gdy status to "completed", odczytaj adres URL z data.outputs[0]. Wskazuje on wygenerowane media w CDN WaveSpeedAI — obraz, wideo, dźwięk lub plik 3D, zależnie od wywołanego wariantu InfiniteTalk.
Zastosowania
Co możesz zbudować z InfiniteTalk
Typowe workflowy, do których deweloperzy i twórcy używają API InfiniteTalk.
Mówiący LUB śpiewający awatar ze zdjęcia
wavespeed-ai/infinitetalk zamienia jedno zdjęcie i dźwięk w wideo z mówiącym lub śpiewającym awatarem. Opis z katalogu: „Image-to-Video, do 10 minut, poziom 720p”. Obsługa śpiewu to wyróżniająca cecha.
Wiele postaci z dwoma wejściami audio
wavespeed-ai/infinitetalk/multi przyjmuje jeden obraz i dwa wejścia audio, aby generować wideo z wieloma mówiącymi/śpiewającymi postaciami do 720p. Przydatne w scenach dialogowych, duetach i prezentacjach dwóch osób z jednej konfiguracji.
Zastępowanie synchronizacji ust w wideo na wideo
wavespeed-ai/infinitetalk/video-to-video steruje istniejącym wideo nowym dźwiękiem, tworząc realistyczne mówienie lub śpiewanie z synchronizacją ust (480p lub 720p). Przydatne przy ponownym dubbingu istniejącego materiału nowym lektorem.
Wyniki do 10 minut
Deklaracja z katalogu dla wariantu bazowego: do 10 minut. Znacznie dłużej niż w większości modeli wideo — nadaje się do podcastów, wykładów, długiej narracji i pełnych odcinków z mówiącym awatarem w jednym generowaniu.
Poziom Fast
wavespeed-ai/infinitetalk-fast. Ten sam przepływ obraz na wideo ze zoptymalizowanym wnioskowaniem — przydatny przy pracy na dużą skalę i iteracji w preprodukcji. Multi i video-to-video również mają warianty Fast.
Wiele postaci w wideo na wideo
wavespeed-ai/infinitetalk/video-to-video-multi przyjmuje wideo i dwa wejścia audio dla wielu mówiących/śpiewających postaci do 720p. Pełne połączenie workflow z wieloma postaciami i źródłem wideo w jednym wywołaniu.
Wskazówki
Wskazówki do promptów dla InfiniteTalk
Praktyczne rady, jak uzyskiwać lepsze wyniki z InfiniteTalk — oparte na wzorcach, które sprawdzają się w produkcyjnych pipeline'ach dla modeli wideo.
- 01
Najpierw czysty dźwięk, potem synchronizacja
Jakość synchronizacji ust jest ograniczona przez czystość dźwięku. Usuń szum tła, znormalizuj poziomy i sprawdź przesterowanie, zanim wprowadzisz dźwięk. Czysty dźwięk poprawia synchronizację ust bardziej niż jakakolwiek inna zmienna.
- 02
Dopasuj obraz referencyjny do języka/kultury dźwięku
Anglojęzyczny dźwięk w połączeniu z wyraźnie zachodnią postacią wygląda naturalniej niż niedopasowanie. To samo dotyczy dźwięku japońskiego / chińskiego / koreańskiego i odpowiednich referencji postaci.
- 03
Portrety z przodu synchronizują się najczyściej
Portrety wprost z przodu dają najbardziej naturalną synchronizację ust. Ujęcia z trzech czwartych i z profilu działają, ale z subtelnymi artefaktami. Jeśli masz wpływ na obraz postaci, podaj niemal frontalną pozę.
- 04
Obsługiwany jest śpiew, nie tylko mówienie
Funkcja z katalogu: „wideo z mówiącym lub śpiewającym awatarem”. Używaj do teledysków, treści chóralnych / solowych i wideo z tekstami piosenek z wyróżnioną postacią — nie tylko do treści mówionych.
- 05
Wariant Multi przyjmuje dwa wejścia audio
wavespeed-ai/infinitetalk/multi przyjmuje jeden obraz i dwa wejścia audio, aby generować wideo z wieloma mówiącymi/śpiewającymi postaciami do 720p. Przydatne w scenach dialogowych, duetach i prezentacjach dwóch osób z jednej konfiguracji.
- 06
Wideo na wideo do ponownego dubbingu istniejącego materiału
wavespeed-ai/infinitetalk/video-to-video steruje istniejącym wideo nowym dźwiękiem, tworząc realistyczne mówienie lub śpiewanie z synchronizacją ust. Przydatne przy ponownym dubbingu klipów nowym lektorem z zachowaniem oryginalnego obrazu.
Cennik
Cennik API InfiniteTalk
Cena jest naliczana za wynik. Końcowa opłata zależy od parametrów ustawionych w playground każdego wariantu (rozdzielczość, czas trwania, liczba wyników, referencje).
| Endpoint | Typ | Cena początkowa |
|---|---|---|
| wavespeed-ai/ | digital-human | $0.075 |
| wavespeed-ai/ | digital-human | $0.075 |
| wavespeed-ai/ | digital-human | $0.15 |
| wavespeed-ai/ | digital-human | $0.075 |
| wavespeed-ai/ | digital-human | $0.075 |
| wavespeed-ai/ | digital-human | $0.15 |
| wavespeed-ai/ | digital-human | $0.15 |
| wavespeed-ai/ | digital-human | $0.15 |
API
Wywołaj API InfiniteTalk
Uzyskaj klucz API na wavespeed.ai/accesskey, a następnie wyślij predykcję przez REST. Playground generuje gotowe do wklejenia przykłady dla dowolnej kombinacji danych wejściowych.
POSThttps://api.wavespeed.ai/api/v3/wavespeed-ai/infinitetalk
# 1. Submit the prediction.
SUBMIT_RESPONSE=$(curl --silent --show-error --fail-with-body \
-X POST "https://api.wavespeed.ai/api/v3/wavespeed-ai/infinitetalk" \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $WAVESPEED_API_KEY" \
-d '{
"image": "https://interactive-examples.mdn.mozilla.net/media/cc0-images/painted-hand-298-332.jpg",
"audio": "https://interactive-examples.mdn.mozilla.net/media/cc0-audio/t-rex-roar.mp3",
"resolution": "480p"
}')
TASK=$(printf '%s' "$SUBMIT_RESPONSE" | jq 'if has("data") then .data else . end')
PREDICTION_ID=$(printf '%s' "$TASK" | jq -r '.id')
if [ -z "$PREDICTION_ID" ] || [ "$PREDICTION_ID" = "null" ]; then
printf 'Submission response did not contain a prediction id
' >&2
exit 1
fi
RESULT_URL="https://api.wavespeed.ai/api/v3/predictions/$PREDICTION_ID/result"
# 2. Poll until the prediction finishes.
while true; do
RESPONSE=$(curl --silent --show-error --fail-with-body "$RESULT_URL" \
-H "Authorization: Bearer $WAVESPEED_API_KEY")
RESULT=$(printf '%s' "$RESPONSE" | jq 'if has("data") then .data else . end')
STATUS=$(printf '%s' "$RESULT" | jq -r '.status')
case "$STATUS" in
completed) printf '%s\n' "$RESULT" | jq '.outputs'; break ;;
failed|cancelled|timeout|deleted) printf '%s\n' "$RESULT" | jq . >&2; exit 1 ;;
*) sleep 2 ;;
esac
doneconst submitUrl = "https://api.wavespeed.ai/api/v3/wavespeed-ai/infinitetalk";
const apiKey = process.env.WAVESPEED_API_KEY;
if (!apiKey) throw new Error('Set WAVESPEED_API_KEY');
async function requestJson(url, options = {}) {
const response = await fetch(url, options);
if (!response.ok) throw new Error(await response.text());
return response.json();
}
// 1. Submit the prediction.
const body = await requestJson(submitUrl, {
method: "POST",
headers: {
"Authorization": `Bearer ${apiKey}`,
"Content-Type": "application/json",
},
body: JSON.stringify({
"image": "https://interactive-examples.mdn.mozilla.net/media/cc0-images/painted-hand-298-332.jpg",
"audio": "https://interactive-examples.mdn.mozilla.net/media/cc0-audio/t-rex-roar.mp3",
"resolution": "480p"
}),
});
const task = body.data ?? body;
const resultUrl = `https://api.wavespeed.ai/api/v3/predictions/${task.id}/result`;
// 2. Poll until the prediction finishes.
while (true) {
const resultBody = await requestJson(resultUrl, {
headers: { "Authorization": `Bearer ${apiKey}` },
});
const result = resultBody.data ?? resultBody;
if (result.status === "completed") {
console.log(result.outputs);
break;
}
if (["failed", "cancelled", "timeout", "deleted"].includes(result.status)) throw new Error(JSON.stringify(result));
await new Promise(resolve => setTimeout(resolve, 2000));
}import json
import os
import time
from urllib.request import Request, urlopen
api_key = os.environ["WAVESPEED_API_KEY"]
headers = {"Authorization": f"Bearer {api_key}", "Content-Type": "application/json"}
payload = {
"image": "https://interactive-examples.mdn.mozilla.net/media/cc0-images/painted-hand-298-332.jpg",
"audio": "https://interactive-examples.mdn.mozilla.net/media/cc0-audio/t-rex-roar.mp3",
"resolution": "480p"
}
def request_json(url, data=None):
request = Request(url, data=data, headers=headers, method="POST" if data else "GET")
with urlopen(request) as response:
return json.load(response)
# 1. Submit the prediction.
body = request_json("https://api.wavespeed.ai/api/v3/wavespeed-ai/infinitetalk", json.dumps(payload).encode())
task = body.get("data", body)
result_url = f"https://api.wavespeed.ai/api/v3/predictions/{task['id']}/result"
# 2. Poll until the prediction finishes.
while True:
result_body = request_json(result_url)
result = result_body.get("data", result_body)
status = result.get("status")
if status == "completed":
print(result.get("outputs", []))
break
if status in {"failed", "cancelled", "timeout", "deleted"}:
raise RuntimeError(result)
time.sleep(2)Porównanie
InfiniteTalk a alternatywy
Kiedy wybrać InfiniteTalk zamiast podobnych modeli w WaveSpeedAI.
InfiniteTalk a Wan 2.2 Speech-to-Video
Wan 2.2 Speech-to-Video (wavespeed-ai/wan-2.2/speech-to-video) obsługuje klipy do 10 minut w 480p — taka sama maksymalna długość jak w InfiniteTalk. InfiniteTalk dodaje warianty Multi (dwa wejścia audio), Video-to-Video i poziom Fast, których Wan 2.2 nie oferuje jako osobnego endpointu.
InfiniteTalk a Stock avatar tools
Narzędzia z gotowymi awatarami (w stylu HeyGen) ograniczają Cię do wyselekcjonowanej biblioteki wstępnie wytrenowanych awatarów. InfiniteTalk przyjmuje dowolny obraz postaci — maskotkę marki, postać wygenerowaną przez AI, ilustrowanego prowadzącego — bez konfiguracji dla każdej postaci i obsługuje zarówno mówienie, jak i śpiew.
InfiniteTalk a ElevenLabs voice tools
ElevenLabs odpowiada za głos (generowanie, klonowanie, wielojęzyczne TTS). InfiniteTalk jest warstwą wideo: połącz lektora z ElevenLabs z obrazem postaci (lub istniejącym wideo), aby uzyskać pełne wideo z synchronizacją ust.
FAQ
InfiniteTalk API — najczęściej zadawane pytania
Cennik, licencja, integracja — typowe pytania o uruchamianie InfiniteTalk w WaveSpeedAI.
Czym jest API InfiniteTalk?
InfiniteTalk to model generowania wideo od WaveSpeedAI, udostępniony jako REST API w WaveSpeedAI. WaveSpeedAI InfiniteTalk — zamienia jedno zdjęcie i dźwięk w wideo z mówiącym LUB śpiewającym awatarem, do 10 minut. Poziomy Standard i Fast oraz warianty Multi (jeden obraz i dwa wejścia audio dla wyniku z wieloma postaciami) i Video-to-Video (steruj istniejącym wideo nowym dźwiękiem). Możesz wywoływać go programowo lub wypróbować w playground, do którego prowadzi link powyżej.
Jak wywołać API InfiniteTalk?
Załóż konto WaveSpeedAI, skopiuj klucz API z /accesskey, a następnie wyślij POST na https://api.wavespeed.ai/api/v3/wavespeed-ai/infinitetalk z danymi wejściowymi w JSON. Endpoint zwraca identyfikator predykcji. Odpytuj endpoint wyniku mniej więcej co 2 sekundy, wydłużaj odstęp przy długich zadaniach i zatrzymaj się przy dowolnym statusie końcowym. Produkcyjne przykłady w Pythonie / Node.js / cURL znajdziesz powyżej.
Ile kosztuje API InfiniteTalk?
InfiniteTalk zaczyna się od $0.075 za uruchomienie. Dokładny koszt zależy od ustawionych parametrów (rozdzielczość, czas trwania, liczba wyników, referencje). Podgląd kosztu na żywo obok przycisku Generuj w playground pokazuje dokładną cenę dla bieżących danych.
Jakie warianty InfiniteTalk są dostępne?
WaveSpeedAI udostępnia 8 aktywnych endpointów InfiniteTalk: wavespeed-ai/infinitetalk-fast/video-to-video-multi, wavespeed-ai/infinitetalk-fast/video-to-video, wavespeed-ai/infinitetalk/video-to-video-multi, wavespeed-ai/infinitetalk-fast/multi, wavespeed-ai/infinitetalk-fast, wavespeed-ai/infinitetalk/video-to-video, wavespeed-ai/infinitetalk, wavespeed-ai/infinitetalk/multi. Każdy wariant ma własną stronę playground i cennik.
Czy mogę używać wyników InfiniteTalk komercyjnie?
Prawa do komercyjnego użycia wynikają z licencji modelu WaveSpeedAI. Większość modeli WaveSpeedAI zezwala na komercyjne wykorzystanie wyników; skrót licencji znajdziesz na stronie playground każdego modelu, a warunki na poziomie platformy w Warunkach świadczenia usług WaveSpeedAI.
Dlaczego korzystać z InfiniteTalk w WaveSpeedAI zamiast bezpośrednio?
Jeden klucz API i jedno konto rozliczeniowe dla InfiniteTalk ORAZ ponad 1000 innych modeli AI od innych dostawców. Bez osobnej konfiguracji SDK, bez osobnych limitów, bez przepisywania kodu integracji pod każdego dostawcę. Ceny są zazwyczaj na poziomie bezpośredniego API WaveSpeedAI lub niższe.
Dostawca
O WaveSpeedAI
Zespół stojący za InfiniteTalk i szerszą linią modeli WaveSpeedAI w WaveSpeedAI.
WaveSpeedAI prowadzi platformę inferencji, która hostuje ponad 1000 modeli AI od wszystkich głównych dostawców — ByteDance, Google, OpenAI, Alibaba, Kuaishou, ElevenLabs i dziesiątek niezależnych laboratoriów — pod jednym kluczem API, jednym kontem rozliczeniowym i jednym limitem zapytań. WaveSpeedAI oferuje też własne modele (upscalery obrazów / wideo, usuwanie znaków wodnych, Animate, InfiniteTalk) dostrojone do potoków produkcyjnych.
Zacznij budować z InfiniteTalk w WaveSpeedAI
Darmowe kredyty na start po rejestracji. Jeden klucz API do ponad 1000 modeli AI od WaveSpeedAI i wszystkich innych dostawców.