InfiniteTalk API
WaveSpeedAI InfiniteTalk – macht aus einem Foto + Audio sprechende ODER singende Avatar-Videos von bis zu 10 Minuten. Stufen Standard und Fast sowie Multi-Varianten (ein Bild + zwei Audioeingaben für Ausgabe mit mehreren Figuren) und Video-to-Video-Varianten (ein vorhandenes Video mit neuem Audio steuern).
Stufen Standard und Fast sowie Ausgabe in 720p. Multi-Varianten akzeptieren ein einzelnes Bild + zwei Audioeingaben, um Sprech-/Gesangsvideos mit mehreren Figuren zu erzeugen. Video-to-Video-Varianten steuern ein vorhandenes Video mit neuem Audio für den Austausch der Lippensynchronisation. Ausgaben bis 10 Minuten.
Überblick
Über InfiniteTalk API
Was InfiniteTalk leistet, wie es in die Modellpalette von WaveSpeedAI passt und warum Teams darauf zurückgreifen.
InfiniteTalk ist ein Modell von WaveSpeedAI für Videogenerierung, verfügbar über die WaveSpeedAI-REST-API. WaveSpeedAI InfiniteTalk – macht aus einem Foto + Audio sprechende ODER singende Avatar-Videos von bis zu 10 Minuten. Stufen Standard und Fast sowie Multi-Varianten (ein Bild + zwei Audioeingaben für Ausgabe mit mehreren Figuren) und Video-to-Video-Varianten (ein vorhandenes Video mit neuem Audio steuern).
Stufen Standard und Fast sowie Ausgabe in 720p. Multi-Varianten akzeptieren ein einzelnes Bild + zwei Audioeingaben, um Sprech-/Gesangsvideos mit mehreren Figuren zu erzeugen. Video-to-Video-Varianten steuern ein vorhandenes Video mit neuem Audio für den Austausch der Lippensynchronisation. Ausgaben bis 10 Minuten.
Die Familie InfiniteTalk auf WaveSpeedAI umfasst 8 REST-Endpunkte für den Workflow Digital-Human. Jede Variante hat eigene Preise, Parameter und Beispielausgaben – wählen Sie die, die zu Ihrer Eingabemodalität und Ihren Produktionsanforderungen passt, oder rufen Sie mit demselben API-Schlüssel mehrere auf, um mehrstufige Pipelines zu bauen.
Nutzen Sie InfiniteTalk mit demselben API-Schlüssel, demselben Abrechnungskonto und denselben Rate Limits wie die über 1.000 weiteren KI-Modelle auf WaveSpeedAI. Keine separate Einrichtung bei Anbietern, keine SDKs pro Anbieter, keine Rate Limits pro Anbieter – eine Integration deckt alles ab, von Text-zu-Bild und Text-zu-Video über Audiosynthese, 3D-Generierung und Hochskalierung bis zur Bearbeitung.
Endpunkte
Alle InfiniteTalk-API-Endpunkte
8 InfiniteTalk-Endpunkte jetzt auf WaveSpeedAI verfügbar – wählen Sie die Variante, die zu Ihrem Workflow passt.
/filters:quality(82)/media/images/20260408110527_g86tqkpw.webp)
Infinitetalk Fast Video To Video Multi
InfiniteTalk fast video-to-video multi converts a video and two audio inputs into multi-character talking or singing videos. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408110532_2m95tzbp.webp)
Infinitetalk Fast Video To Video
Audio-driven infinitetalk-fast turns one video plus audio into realistic talking or singing videos with lip-sync. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408111359_7pt74rzh.webp)
Infinitetalk Video To Video Multi
InfiniteTalk Video-to-Video Multi converts a video and two audio inputs into multi-character talking or singing videos at up to 720p. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408110534_dl097qgv.webp)
Infinitetalk Fast Multi
InfiniteTalk fast multi converts a single image and two audio inputs into multi-character talking or singing videos. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408110525_m58v6n7u.webp)
Infinitetalk Fast
InfiniteTalk fast converts one photo + audio into audio-driven talking or singing avatar videos (Image-to-Video), up to 10 minutes. Ready-to-use REST API, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408111403_q1ar1bex.webp)
Infinitetalk Video To Video
Audio-driven InfiniteTalk turns one video plus audio into realistic talking or singing videos with lip-sync in 480p or 720p. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/1790561759067766019_QVeeWlOj.webp)
Infinitetalk
InfiniteTalk Image-to-Video converts a single photo and audio track into long-form audio-driven talking or singing avatar videos, supporting up to 10 minutes, 720P output, natural lip sync, expressive motion, and digital human video workflows. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408111406_upu4dbpi.webp)
Infinitetalk Multi
InfiniteTalk Multi converts a single image and two audio inputs into multi-character talking or singing videos at up to 720p. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
Beispiele
InfiniteTalk in Aktion
Echte Ausgaben der InfiniteTalk-API. Fahren Sie über ein Video für eine Vorschau und klicken Sie, um den Viewer in voller Größe zu öffnen.
Anleitung
So verwenden Sie die InfiniteTalk-API
Vier Schritte von der Registrierung bis zur fertigen Generierung. Vollständige Beispiele in Python, Node.js und cURL finden Sie unten im Abschnitt „API“.
- 01
API-Schlüssel holen
Registrieren Sie ein WaveSpeedAI-Konto und kopieren Sie Ihren API-Schlüssel aus dem Dashboard. Neue Konten erhalten kostenlose Start-Credits – genug, um den Playground einige Dutzend Mal zu nutzen, bevor die Abrechnung beginnt.
- 02
Prediction senden
Senden Sie Ihre Eingabe als JSON per POST an https://api.wavespeed.ai/api/v3/wavespeed-ai/infinitetalk. Der Endpunkt gibt sofort eine Prediction-ID zurück – Generierungen laufen asynchron, sodass Sie während der Inferenz keine Verbindung offen halten.
- 03
Auf Abschluss prüfen
GET https://api.wavespeed.ai/api/v3/predictions/{request_id}/result. Geben Sie bei „completed“ die Ausgaben zurück; brechen Sie bei „failed“, „cancelled“, „timeout“ oder „deleted“ mit einem Fehler ab; fragen Sie bei allen anderen Status weiter ab.
- 04
Ausgabe-URL lesen
Sobald der Status „completed“ ist, lesen Sie die URL aus data.outputs[0]. Die URL verweist auf Ihre generierten Medien im WaveSpeedAI-CDN – Bild, Video, Audio oder 3D-Datei, je nach aufgerufener Variante von InfiniteTalk.
Anwendungsfälle
Was Sie mit InfiniteTalk bauen können
Gängige Workflows, für die Entwickler und Kreative die InfiniteTalk-API nutzen.
Sprechender ODER singender Avatar aus einem Foto
wavespeed-ai/infinitetalk macht aus einem Foto + Audio sprechende oder singende Avatar-Videos. Katalogbeschreibung: „Image-to-Video, bis zu 10 Minuten, 720p-Stufe“. Die Unterstützung von Gesang ist ein besonderes Merkmal.
Mehrere Figuren mit zwei Audioeingaben
wavespeed-ai/infinitetalk/multi akzeptiert ein einzelnes Bild + zwei Audioeingaben, um Sprech-/Gesangsvideos mit mehreren Figuren in bis zu 720p zu erzeugen. Nützlich für Dialogszenen, Duette und Präsentationen zu zweit aus einem einzigen Setup.
Austausch der Lippensynchronisation per Video-to-Video
wavespeed-ai/infinitetalk/video-to-video steuert ein vorhandenes Video mit neuem Audio und erzeugt realistisches Sprechen oder Singen mit Lippensynchronisation (480p oder 720p). Nützlich, um vorhandenes Material mit einem neuen Voiceover neu zu synchronisieren.
Ausgaben bis 10 Minuten
Katalogangabe zur Basisvariante: bis zu 10 Minuten. Deutlich länger als die meisten Videomodelle – nutzbar für Podcasts, Vorlesungen, längere Erzählungen und Sprecher-Avatar-Inhalte in Episodenlänge in einer Generierung.
Fast-Stufe
wavespeed-ai/infinitetalk-fast. Derselbe Image-to-Video-Ablauf mit optimierter Inferenz – nützlich für Arbeit in großen Mengen und Iteration in der Vorproduktion. Multi und Video-to-Video gibt es ebenfalls als Fast-Varianten.
Video-to-Video mit mehreren Figuren
wavespeed-ai/infinitetalk/video-to-video-multi akzeptiert ein Video und zwei Audioeingaben für Sprechen/Singen mit mehreren Figuren in bis zu 720p. Die vollständige Kombination aus Mehrfiguren- und Videoquellen-Workflows in einem Aufruf.
Tipps
Tipps zum Prompting von InfiniteTalk
Praktische Ratschläge für bessere Ausgaben von InfiniteTalk – abgeleitet aus Mustern, die bei Video-Modellen in Produktions-Pipelines funktionieren.
- 01
Erst sauberes Audio, dann Synchronisation
Die Qualität der Lippensynchronisation wird durch die Klarheit des Audios begrenzt. Entfernen Sie Hintergrundrauschen, normalisieren Sie die Pegel und prüfen Sie auf Übersteuerung, bevor Sie das Audio einspeisen. Sauberes Audio verbessert die Lippensynchronisation mehr als jede andere Variable.
- 02
Referenzbild zu Sprache und Kultur des Audios passend wählen
Englisches Audio mit einer erkennbar westlichen Figur wirkt natürlicher als ein Mismatch. Dasselbe gilt für japanisches / chinesisches / koreanisches Audio + entsprechende Figurenreferenzen.
- 03
Frontale Porträts synchronisieren am saubersten
Frontale Porträtreferenzen liefern die natürlichste Lippensynchronisation. Dreiviertel- und Profilansichten funktionieren, aber mit leichten Artefakten. Wenn Sie das Figurenbild beeinflussen können, liefern Sie eine nahezu frontale Pose.
- 04
Gesang wird unterstützt, nicht nur Sprechen
Katalogfunktion: „sprechende oder singende Avatar-Videos“. Nutzen Sie es für Musikvideos, Chor- / Solisten-Inhalte und Lyric-Videos mit einer Hauptfigur – nicht nur für gesprochene Inhalte.
- 05
Die Multi-Variante akzeptiert zwei Audioeingaben
wavespeed-ai/infinitetalk/multi nimmt ein einzelnes Bild + zwei Audioeingaben entgegen und erzeugt Sprech-/Gesangsvideos mit mehreren Figuren in bis zu 720p. Nützlich für Dialogszenen, Duette und Präsentationen zu zweit aus einem Setup.
- 06
Video-to-Video zum Neu-Synchronisieren vorhandenen Materials
wavespeed-ai/infinitetalk/video-to-video steuert ein vorhandenes Video mit neuem Audio und erzeugt realistisches Sprechen oder Singen mit Lippensynchronisation. Nützlich, um Clips mit neuem Voiceover zu synchronisieren und das ursprüngliche Bild zu behalten.
Preise
InfiniteTalk-API-Preise
Die Abrechnung erfolgt pro Ausgabe. Der Endpreis richtet sich nach den Parametern, die Sie im Playground jeder Variante setzen (Auflösung, Dauer, Anzahl der Ausgaben, Referenzen).
| Endpunkt | Typ | Startpreis |
|---|---|---|
| wavespeed-ai/ | digital-human | $0.075 |
| wavespeed-ai/ | digital-human | $0.075 |
| wavespeed-ai/ | digital-human | $0.15 |
| wavespeed-ai/ | digital-human | $0.075 |
| wavespeed-ai/ | digital-human | $0.075 |
| wavespeed-ai/ | digital-human | $0.15 |
| wavespeed-ai/ | digital-human | $0.15 |
| wavespeed-ai/ | digital-human | $0.15 |
API
Die InfiniteTalk-API aufrufen
Holen Sie sich unter wavespeed.ai/accesskey einen API-Schlüssel und senden Sie dann eine Prediction per REST. Der Playground erzeugt einfügefertige Beispiele für jede Kombination von Eingaben.
POSThttps://api.wavespeed.ai/api/v3/wavespeed-ai/infinitetalk
# 1. Submit the prediction.
SUBMIT_RESPONSE=$(curl --silent --show-error --fail-with-body \
-X POST "https://api.wavespeed.ai/api/v3/wavespeed-ai/infinitetalk" \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $WAVESPEED_API_KEY" \
-d '{
"image": "https://interactive-examples.mdn.mozilla.net/media/cc0-images/painted-hand-298-332.jpg",
"audio": "https://interactive-examples.mdn.mozilla.net/media/cc0-audio/t-rex-roar.mp3",
"resolution": "480p"
}')
TASK=$(printf '%s' "$SUBMIT_RESPONSE" | jq 'if has("data") then .data else . end')
PREDICTION_ID=$(printf '%s' "$TASK" | jq -r '.id')
if [ -z "$PREDICTION_ID" ] || [ "$PREDICTION_ID" = "null" ]; then
printf 'Submission response did not contain a prediction id
' >&2
exit 1
fi
RESULT_URL="https://api.wavespeed.ai/api/v3/predictions/$PREDICTION_ID/result"
# 2. Poll until the prediction finishes.
while true; do
RESPONSE=$(curl --silent --show-error --fail-with-body "$RESULT_URL" \
-H "Authorization: Bearer $WAVESPEED_API_KEY")
RESULT=$(printf '%s' "$RESPONSE" | jq 'if has("data") then .data else . end')
STATUS=$(printf '%s' "$RESULT" | jq -r '.status')
case "$STATUS" in
completed) printf '%s\n' "$RESULT" | jq '.outputs'; break ;;
failed|cancelled|timeout|deleted) printf '%s\n' "$RESULT" | jq . >&2; exit 1 ;;
*) sleep 2 ;;
esac
doneconst submitUrl = "https://api.wavespeed.ai/api/v3/wavespeed-ai/infinitetalk";
const apiKey = process.env.WAVESPEED_API_KEY;
if (!apiKey) throw new Error('Set WAVESPEED_API_KEY');
async function requestJson(url, options = {}) {
const response = await fetch(url, options);
if (!response.ok) throw new Error(await response.text());
return response.json();
}
// 1. Submit the prediction.
const body = await requestJson(submitUrl, {
method: "POST",
headers: {
"Authorization": `Bearer ${apiKey}`,
"Content-Type": "application/json",
},
body: JSON.stringify({
"image": "https://interactive-examples.mdn.mozilla.net/media/cc0-images/painted-hand-298-332.jpg",
"audio": "https://interactive-examples.mdn.mozilla.net/media/cc0-audio/t-rex-roar.mp3",
"resolution": "480p"
}),
});
const task = body.data ?? body;
const resultUrl = `https://api.wavespeed.ai/api/v3/predictions/${task.id}/result`;
// 2. Poll until the prediction finishes.
while (true) {
const resultBody = await requestJson(resultUrl, {
headers: { "Authorization": `Bearer ${apiKey}` },
});
const result = resultBody.data ?? resultBody;
if (result.status === "completed") {
console.log(result.outputs);
break;
}
if (["failed", "cancelled", "timeout", "deleted"].includes(result.status)) throw new Error(JSON.stringify(result));
await new Promise(resolve => setTimeout(resolve, 2000));
}import json
import os
import time
from urllib.request import Request, urlopen
api_key = os.environ["WAVESPEED_API_KEY"]
headers = {"Authorization": f"Bearer {api_key}", "Content-Type": "application/json"}
payload = {
"image": "https://interactive-examples.mdn.mozilla.net/media/cc0-images/painted-hand-298-332.jpg",
"audio": "https://interactive-examples.mdn.mozilla.net/media/cc0-audio/t-rex-roar.mp3",
"resolution": "480p"
}
def request_json(url, data=None):
request = Request(url, data=data, headers=headers, method="POST" if data else "GET")
with urlopen(request) as response:
return json.load(response)
# 1. Submit the prediction.
body = request_json("https://api.wavespeed.ai/api/v3/wavespeed-ai/infinitetalk", json.dumps(payload).encode())
task = body.get("data", body)
result_url = f"https://api.wavespeed.ai/api/v3/predictions/{task['id']}/result"
# 2. Poll until the prediction finishes.
while True:
result_body = request_json(result_url)
result = result_body.get("data", result_body)
status = result.get("status")
if status == "completed":
print(result.get("outputs", []))
break
if status in {"failed", "cancelled", "timeout", "deleted"}:
raise RuntimeError(result)
time.sleep(2)Vergleich
InfiniteTalk im Vergleich zu Alternativen
Wann Sie InfiniteTalk ähnlichen Modellen auf WaveSpeedAI vorziehen sollten.
InfiniteTalk vs. Wan 2.2 Speech-to-Video
Wan 2.2 Speech-to-Video (wavespeed-ai/wan-2.2/speech-to-video) unterstützt Clips bis 10 Minuten in 480p – dieselbe Maximaldauer wie InfiniteTalk. InfiniteTalk ergänzt Multi-Varianten (zwei Audioeingaben), Video-to-Video und eine Fast-Stufe, die Wan 2.2 nicht als eigenen Endpunkt bietet.
InfiniteTalk vs. Stock avatar tools
Stock-Avatar-Tools (im Stil von HeyGen) beschränken Sie auf eine kuratierte Bibliothek vortrainierter Avatare. InfiniteTalk akzeptiert jedes Figurenbild – Markenmaskottchen, KI-generierte Figur, illustrierte Moderatorin oder illustrierten Moderator – ohne Einrichtung pro Figur und unterstützt neben Sprechen auch Gesang.
InfiniteTalk vs. ElevenLabs voice tools
ElevenLabs übernimmt die Stimme (Generierung, Klonen, mehrsprachiges TTS). InfiniteTalk ist die Videoebene: Kombinieren Sie ein ElevenLabs-Voiceover mit einem Figurenbild (oder einem vorhandenen Video), um ein vollständig lippensynchrones Video zu erzeugen.
FAQ
InfiniteTalk API — Häufig gestellte Fragen
Preise, Lizenz, Integration – häufige Fragen zur Nutzung von InfiniteTalk auf WaveSpeedAI.
Was ist die InfiniteTalk-API?
InfiniteTalk ist ein WaveSpeedAI-Modell für Videogenerierung, das auf WaveSpeedAI als REST-API bereitgestellt wird. WaveSpeedAI InfiniteTalk – macht aus einem Foto + Audio sprechende ODER singende Avatar-Videos von bis zu 10 Minuten. Stufen Standard und Fast sowie Multi-Varianten (ein Bild + zwei Audioeingaben für Ausgabe mit mehreren Figuren) und Video-to-Video-Varianten (ein vorhandenes Video mit neuem Audio steuern). Sie können es programmatisch aufrufen oder im oben verlinkten Playground ausprobieren.
Wie rufe ich die InfiniteTalk-API auf?
Registrieren Sie ein WaveSpeedAI-Konto, kopieren Sie Ihren API-Schlüssel von /accesskey und senden Sie dann per POST an https://api.wavespeed.ai/api/v3/wavespeed-ai/infinitetalk Ihre Eingabe als JSON. Der Endpunkt gibt eine Prediction-ID zurück. Fragen Sie den Ergebnis-Endpunkt etwa alle 2 Sekunden ab, verlängern Sie das Intervall bei lang laufenden Aufgaben und hören Sie bei jedem Endstatus auf. Produktionsnahe Beispiele in Python / Node.js / cURL finden Sie oben.
Was kostet die InfiniteTalk-API?
InfiniteTalk beginnt bei $0.075 pro Aufruf. Die genauen Kosten richten sich nach den Parametern, die Sie setzen (Auflösung, Dauer, Anzahl der Ausgaben, Referenzen). Die Live-Kostenvorschau neben der Schaltfläche „Generieren“ im Playground zeigt den genauen Preis für Ihre aktuelle Eingabe.
Welche Varianten von InfiniteTalk sind verfügbar?
WaveSpeedAI stellt 8 aktive InfiniteTalk-Endpunkte bereit: wavespeed-ai/infinitetalk-fast/video-to-video-multi, wavespeed-ai/infinitetalk-fast/video-to-video, wavespeed-ai/infinitetalk/video-to-video-multi, wavespeed-ai/infinitetalk-fast/multi, wavespeed-ai/infinitetalk-fast, wavespeed-ai/infinitetalk/video-to-video, wavespeed-ai/infinitetalk, wavespeed-ai/infinitetalk/multi. Jede Variante hat eine eigene Playground-Seite und eigene Preise.
Kann ich die Ausgaben von InfiniteTalk kommerziell nutzen?
Die kommerziellen Nutzungsrechte richten sich nach der Modelllizenz von WaveSpeedAI. Die meisten Modelle von WaveSpeedAI erlauben die kommerzielle Nutzung der Ausgaben; die konkrete Lizenzzusammenfassung finden Sie auf der Playground-Seite des jeweiligen Modells, die Bedingungen auf Plattformebene in den Nutzungsbedingungen von WaveSpeedAI.
Warum InfiniteTalk auf WaveSpeedAI nutzen statt direkt?
Ein API-Schlüssel und ein Abrechnungskonto für InfiniteTalk UND über 1.000 weitere KI-Modelle anderer Anbieter. Keine SDK-Einrichtung pro Anbieter, keine separaten Rate Limits, kein Neuschreiben von Integrationscode pro Anbieter. Die Preise liegen in der Regel auf dem Niveau der direkten API von WaveSpeedAI oder darunter.
Anbieter
Über WaveSpeedAI
Das Team hinter InfiniteTalk und der übrigen Modellpalette von WaveSpeedAI auf WaveSpeedAI.
WaveSpeedAI betreibt eine Inferenzplattform, die über 1.000 KI-Modelle aller großen Anbieter hostet – ByteDance, Google, OpenAI, Alibaba, Kuaishou, ElevenLabs und Dutzende unabhängige Labore – hinter einem API-Schlüssel, einem Abrechnungskonto und einem Rate-Limit-Rahmen. WaveSpeedAI liefert außerdem eigene Modelle (Bild-/Video-Upscaler, Wasserzeichen-Entferner, Animate, InfiniteTalk), die auf Produktions-Pipelines abgestimmt sind.
Starten Sie mit InfiniteTalk auf WaveSpeedAI
Kostenlose Start-Credits bei der Registrierung. Ein API-Schlüssel für über 1.000 KI-Modelle von WaveSpeedAI und allen anderen Anbietern.