InfiniteTalk API
WaveSpeedAI InfiniteTalk — convertit une photo + un audio en vidéos d'avatar parlant OU chantant, jusqu'à 10 minutes. Niveaux Standard et Fast, plus des variantes Multi (une seule image + deux entrées audio pour une sortie multi-personnages) et Video-to-Video (animer une vidéo existante avec un nouvel audio).
Niveaux Standard et Fast, plus sortie 720p. Les variantes Multi acceptent une seule image + deux entrées audio pour générer une vidéo multi-personnages parlant/chantant. Les variantes Video-to-Video animent une vidéo existante avec un nouvel audio pour remplacer la synchronisation labiale. Sorties jusqu'à 10 minutes.
Présentation
À propos de InfiniteTalk API
Ce que fait InfiniteTalk, sa place dans la gamme de modèles WaveSpeedAI, et pourquoi les équipes l’adoptent.
InfiniteTalk est un modèle de génération vidéo proposé par WaveSpeedAI, disponible via l’API REST de WaveSpeedAI. WaveSpeedAI InfiniteTalk — convertit une photo + un audio en vidéos d'avatar parlant OU chantant, jusqu'à 10 minutes. Niveaux Standard et Fast, plus des variantes Multi (une seule image + deux entrées audio pour une sortie multi-personnages) et Video-to-Video (animer une vidéo existante avec un nouvel audio).
Niveaux Standard et Fast, plus sortie 720p. Les variantes Multi acceptent une seule image + deux entrées audio pour générer une vidéo multi-personnages parlant/chantant. Les variantes Video-to-Video animent une vidéo existante avec un nouvel audio pour remplacer la synchronisation labiale. Sorties jusqu'à 10 minutes.
La famille InfiniteTalk sur WaveSpeedAI propose 8 points d’accès REST couvrant le workflow Digital-Human. Chaque variante a ses propres tarifs, paramètres et exemples de résultats — choisissez celle qui correspond à votre type d’entrée et à vos contraintes de production, ou appelez-en plusieurs avec la même clé API pour composer des pipelines en plusieurs étapes.
Exécutez InfiniteTalk avec la même clé API, le même compte de facturation et les mêmes limites de débit que pour les plus de 1 000 autres modèles IA de WaveSpeedAI. Pas de configuration fournisseur distincte, pas de SDK par fournisseur, pas de limites de débit par fournisseur — une seule intégration couvre tout, du texte vers image et du texte vers vidéo à la synthèse audio, la génération 3D, l’agrandissement et l’édition.
Points d’accès
Tous les points d’accès de l’API InfiniteTalk
8 points d’accès InfiniteTalk disponibles dès maintenant sur WaveSpeedAI — choisissez la variante qui correspond à votre workflow.
/filters:quality(82)/media/images/20260408110527_g86tqkpw.webp)
Infinitetalk Fast Video To Video Multi
InfiniteTalk fast video-to-video multi converts a video and two audio inputs into multi-character talking or singing videos. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408110532_2m95tzbp.webp)
Infinitetalk Fast Video To Video
Audio-driven infinitetalk-fast turns one video plus audio into realistic talking or singing videos with lip-sync. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408111359_7pt74rzh.webp)
Infinitetalk Video To Video Multi
InfiniteTalk Video-to-Video Multi converts a video and two audio inputs into multi-character talking or singing videos at up to 720p. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408110534_dl097qgv.webp)
Infinitetalk Fast Multi
InfiniteTalk fast multi converts a single image and two audio inputs into multi-character talking or singing videos. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408110525_m58v6n7u.webp)
Infinitetalk Fast
InfiniteTalk fast converts one photo + audio into audio-driven talking or singing avatar videos (Image-to-Video), up to 10 minutes. Ready-to-use REST API, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408111403_q1ar1bex.webp)
Infinitetalk Video To Video
Audio-driven InfiniteTalk turns one video plus audio into realistic talking or singing videos with lip-sync in 480p or 720p. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/1790561759067766019_QVeeWlOj.webp)
Infinitetalk
InfiniteTalk Image-to-Video converts a single photo and audio track into long-form audio-driven talking or singing avatar videos, supporting up to 10 minutes, 720P output, natural lip sync, expressive motion, and digital human video workflows. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408111406_upu4dbpi.webp)
Infinitetalk Multi
InfiniteTalk Multi converts a single image and two audio inputs into multi-character talking or singing videos at up to 720p. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
Exemples
InfiniteTalk en action
De vrais résultats générés par l’API InfiniteTalk. Survolez une vidéo pour la prévisualiser, cliquez pour ouvrir la visionneuse en taille réelle.
Mode d’emploi
Comment utiliser l’API InfiniteTalk
Quatre étapes de l’inscription à une génération terminée. Des exemples complets en Python, Node.js et cURL se trouvent dans la section API ci-dessous.
- 01
Obtenez une clé API
Créez un compte WaveSpeedAI et copiez votre clé API depuis le tableau de bord. Les nouveaux comptes reçoivent des crédits de démarrage gratuits — de quoi utiliser le playground quelques dizaines de fois avant le début de la facturation.
- 02
Soumettez une prédiction
Envoyez votre entrée en JSON par POST à https://api.wavespeed.ai/api/v3/wavespeed-ai/infinitetalk. Le point d’accès renvoie immédiatement un identifiant de prédiction — les générations sont asynchrones, vous ne gardez donc pas de connexion ouverte pendant l’inférence.
- 03
Interrogez jusqu’à la fin
GET https://api.wavespeed.ai/api/v3/predictions/{request_id}/result. Retournez les outputs sur completed ; arrêtez avec une erreur sur failed, cancelled, timeout ou deleted ; continuez d’interroger pour tout autre statut.
- 04
Lisez l’URL du résultat
Une fois le statut "completed", lisez l’URL dans data.outputs[0]. Elle pointe vers votre média généré sur le CDN de WaveSpeedAI — fichier image, vidéo, audio ou 3D selon la variante InfiniteTalk appelée.
Cas d’usage
Ce que vous pouvez créer avec InfiniteTalk
Les workflows courants pour lesquels développeurs et créateurs utilisent l’API InfiniteTalk.
Avatar parlant OU chantant à partir d'une photo
wavespeed-ai/infinitetalk convertit une photo + un audio en vidéos d'avatar parlant ou chantant. Positionnement du catalogue : « Image vers vidéo, jusqu'à 10 minutes, niveau 720p ». La prise en charge du chant est une fonctionnalité distinctive.
Multi-personnages avec deux entrées audio
wavespeed-ai/infinitetalk/multi accepte une seule image + deux entrées audio pour générer des vidéos multi-personnages parlant/chantant jusqu'en 720p. Utile pour les scènes de dialogue, les duos et les présentations à deux personnes à partir d'une seule configuration.
Remplacement de la synchronisation labiale en vidéo vers vidéo
wavespeed-ai/infinitetalk/video-to-video anime une vidéo existante avec un nouvel audio, pour une parole ou un chant réaliste avec synchronisation labiale (480p ou 720p). Utile pour redoubler des séquences existantes avec une nouvelle voix off.
Sorties jusqu'à 10 minutes
Affirmation du catalogue pour la variante de base : jusqu'à 10 minutes. Nettement plus long que la plupart des modèles vidéo — utilisable pour les podcasts, les conférences, les narrations longues et des épisodes complets d'avatar parlant en une seule génération.
Niveau Fast
wavespeed-ai/infinitetalk-fast. Le même flux image vers vidéo avec une inférence optimisée — utile pour le gros volume et l'itération en préproduction. Multi et video-to-video proposent aussi des variantes Fast.
Vidéo vers vidéo multi-personnages
wavespeed-ai/infinitetalk/video-to-video-multi accepte une vidéo et deux entrées audio pour des personnages multiples parlant/chantant jusqu'en 720p. La combinaison complète des workflows multi-personnages + source vidéo en un seul appel.
Conseils
Conseils pour rédiger vos prompts avec InfiniteTalk
Des conseils pratiques pour obtenir de meilleurs résultats avec InfiniteTalk — tirés des pratiques qui fonctionnent sur les modèles vidéo dans les pipelines de production.
- 01
D'abord un audio propre, ensuite la synchronisation
La qualité de la synchronisation labiale est limitée par la clarté de l'audio. Supprimez le bruit de fond, normalisez les niveaux et vérifiez l'absence d'écrêtage avant de fournir l'audio. Un audio propre améliore la synchronisation labiale plus que toute autre variable.
- 02
Accordez l'image de référence à la langue/culture de l'audio
Un audio en anglais associé à un personnage clairement occidental paraît plus naturel qu'un décalage. Idem pour un audio japonais / chinois / coréen avec des références de personnages correspondantes.
- 03
Les portraits de face se synchronisent le mieux
Les références de portrait de face produisent la synchronisation labiale la plus naturelle. Les angles de trois-quarts et de profil fonctionnent, mais avec de légers artefacts. Si vous maîtrisez l'image du personnage, fournissez une pose quasi frontale.
- 04
Le chant est pris en charge, pas seulement la parole
Fonctionnalité du catalogue : « vidéos d'avatar parlant ou chantant ». À utiliser pour les clips musicaux, les contenus de chœur / de soliste, les vidéos de paroles avec un personnage mis en avant — pas seulement pour du contenu parlé.
- 05
La variante Multi accepte deux entrées audio
wavespeed-ai/infinitetalk/multi prend une seule image + deux entrées audio pour générer des vidéos multi-personnages parlant/chantant jusqu'en 720p. Utile pour les scènes de dialogue, les duos et les présentations à deux personnes avec une seule configuration.
- 06
Vidéo vers vidéo pour redoubler des séquences existantes
wavespeed-ai/infinitetalk/video-to-video anime une vidéo existante avec un nouvel audio, pour une parole ou un chant réaliste avec synchronisation labiale. Utile pour redoubler des clips avec une nouvelle voix off tout en gardant l'image d'origine.
Tarifs
Tarifs de l’API InfiniteTalk
La tarification se fait par résultat. Le montant final dépend des paramètres définis dans le playground de chaque variante (résolution, durée, nombre de résultats, références).
| Point d’accès | Type | Prix de départ |
|---|---|---|
| wavespeed-ai/ | digital-human | $0.075 |
| wavespeed-ai/ | digital-human | $0.075 |
| wavespeed-ai/ | digital-human | $0.15 |
| wavespeed-ai/ | digital-human | $0.075 |
| wavespeed-ai/ | digital-human | $0.075 |
| wavespeed-ai/ | digital-human | $0.15 |
| wavespeed-ai/ | digital-human | $0.15 |
| wavespeed-ai/ | digital-human | $0.15 |
API
Appelez l’API InfiniteTalk
Obtenez une clé API sur wavespeed.ai/accesskey, puis soumettez une prédiction via REST. Le playground génère des exemples prêts à copier pour toute combinaison d’entrées.
POSThttps://api.wavespeed.ai/api/v3/wavespeed-ai/infinitetalk
# 1. Submit the prediction.
SUBMIT_RESPONSE=$(curl --silent --show-error --fail-with-body \
-X POST "https://api.wavespeed.ai/api/v3/wavespeed-ai/infinitetalk" \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $WAVESPEED_API_KEY" \
-d '{
"image": "https://interactive-examples.mdn.mozilla.net/media/cc0-images/painted-hand-298-332.jpg",
"audio": "https://interactive-examples.mdn.mozilla.net/media/cc0-audio/t-rex-roar.mp3",
"resolution": "480p"
}')
TASK=$(printf '%s' "$SUBMIT_RESPONSE" | jq 'if has("data") then .data else . end')
PREDICTION_ID=$(printf '%s' "$TASK" | jq -r '.id')
if [ -z "$PREDICTION_ID" ] || [ "$PREDICTION_ID" = "null" ]; then
printf 'Submission response did not contain a prediction id
' >&2
exit 1
fi
RESULT_URL="https://api.wavespeed.ai/api/v3/predictions/$PREDICTION_ID/result"
# 2. Poll until the prediction finishes.
while true; do
RESPONSE=$(curl --silent --show-error --fail-with-body "$RESULT_URL" \
-H "Authorization: Bearer $WAVESPEED_API_KEY")
RESULT=$(printf '%s' "$RESPONSE" | jq 'if has("data") then .data else . end')
STATUS=$(printf '%s' "$RESULT" | jq -r '.status')
case "$STATUS" in
completed) printf '%s\n' "$RESULT" | jq '.outputs'; break ;;
failed|cancelled|timeout|deleted) printf '%s\n' "$RESULT" | jq . >&2; exit 1 ;;
*) sleep 2 ;;
esac
doneconst submitUrl = "https://api.wavespeed.ai/api/v3/wavespeed-ai/infinitetalk";
const apiKey = process.env.WAVESPEED_API_KEY;
if (!apiKey) throw new Error('Set WAVESPEED_API_KEY');
async function requestJson(url, options = {}) {
const response = await fetch(url, options);
if (!response.ok) throw new Error(await response.text());
return response.json();
}
// 1. Submit the prediction.
const body = await requestJson(submitUrl, {
method: "POST",
headers: {
"Authorization": `Bearer ${apiKey}`,
"Content-Type": "application/json",
},
body: JSON.stringify({
"image": "https://interactive-examples.mdn.mozilla.net/media/cc0-images/painted-hand-298-332.jpg",
"audio": "https://interactive-examples.mdn.mozilla.net/media/cc0-audio/t-rex-roar.mp3",
"resolution": "480p"
}),
});
const task = body.data ?? body;
const resultUrl = `https://api.wavespeed.ai/api/v3/predictions/${task.id}/result`;
// 2. Poll until the prediction finishes.
while (true) {
const resultBody = await requestJson(resultUrl, {
headers: { "Authorization": `Bearer ${apiKey}` },
});
const result = resultBody.data ?? resultBody;
if (result.status === "completed") {
console.log(result.outputs);
break;
}
if (["failed", "cancelled", "timeout", "deleted"].includes(result.status)) throw new Error(JSON.stringify(result));
await new Promise(resolve => setTimeout(resolve, 2000));
}import json
import os
import time
from urllib.request import Request, urlopen
api_key = os.environ["WAVESPEED_API_KEY"]
headers = {"Authorization": f"Bearer {api_key}", "Content-Type": "application/json"}
payload = {
"image": "https://interactive-examples.mdn.mozilla.net/media/cc0-images/painted-hand-298-332.jpg",
"audio": "https://interactive-examples.mdn.mozilla.net/media/cc0-audio/t-rex-roar.mp3",
"resolution": "480p"
}
def request_json(url, data=None):
request = Request(url, data=data, headers=headers, method="POST" if data else "GET")
with urlopen(request) as response:
return json.load(response)
# 1. Submit the prediction.
body = request_json("https://api.wavespeed.ai/api/v3/wavespeed-ai/infinitetalk", json.dumps(payload).encode())
task = body.get("data", body)
result_url = f"https://api.wavespeed.ai/api/v3/predictions/{task['id']}/result"
# 2. Poll until the prediction finishes.
while True:
result_body = request_json(result_url)
result = result_body.get("data", result_body)
status = result.get("status")
if status == "completed":
print(result.get("outputs", []))
break
if status in {"failed", "cancelled", "timeout", "deleted"}:
raise RuntimeError(result)
time.sleep(2)Comparer
InfiniteTalk face aux alternatives
Quand choisir InfiniteTalk plutôt que des modèles similaires sur WaveSpeedAI.
InfiniteTalk vs Wan 2.2 Speech-to-Video
Wan 2.2 Speech-to-Video (wavespeed-ai/wan-2.2/speech-to-video) prend en charge des clips jusqu'à 10 minutes en 480p — même durée maximale qu'InfiniteTalk. InfiniteTalk ajoute des variantes Multi (deux entrées audio), Video-to-Video et un niveau Fast que Wan 2.2 ne propose pas comme endpoint distinct.
InfiniteTalk vs Stock avatar tools
Les outils d'avatars prêts à l'emploi (type HeyGen) vous limitent à une bibliothèque sélectionnée d'avatars préentraînés. InfiniteTalk accepte n'importe quelle image de personnage — mascotte de marque, personnage généré par IA, présentateur illustré — sans configuration par personnage, et prend en charge le chant comme la parole.
InfiniteTalk vs ElevenLabs voice tools
ElevenLabs gère la voix (génération, clonage, synthèse vocale multilingue). InfiniteTalk est la couche vidéo : associez une voix off ElevenLabs à une image de personnage (ou une vidéo existante) pour produire une vidéo complète synchronisée sur les lèvres.
FAQ
InfiniteTalk API — Questions fréquentes
Tarifs, licence, intégration — les questions courantes sur l’utilisation de InfiniteTalk sur WaveSpeedAI.
Qu’est-ce que l’API InfiniteTalk ?
InfiniteTalk est un modèle WaveSpeedAI de génération vidéo exposé sous forme d’API REST sur WaveSpeedAI. WaveSpeedAI InfiniteTalk — convertit une photo + un audio en vidéos d'avatar parlant OU chantant, jusqu'à 10 minutes. Niveaux Standard et Fast, plus des variantes Multi (une seule image + deux entrées audio pour une sortie multi-personnages) et Video-to-Video (animer une vidéo existante avec un nouvel audio). Vous pouvez l’appeler par programmation ou l’essayer depuis le playground indiqué ci-dessus.
Comment appeler l’API InfiniteTalk ?
Créez un compte WaveSpeedAI, copiez votre clé API depuis /accesskey, puis envoyez votre entrée en JSON par POST à https://api.wavespeed.ai/api/v3/wavespeed-ai/infinitetalk. Le point d’accès renvoie un identifiant de prédiction. Interrogez le point d’accès de résultat environ toutes les 2 secondes, augmentez l’intervalle pour les tâches longues et arrêtez-vous à tout statut final. Des exemples Python / Node.js / cURL orientés production figurent ci-dessus.
Combien coûte l’API InfiniteTalk ?
InfiniteTalk démarre à $0.075 par exécution. Le coût exact dépend des paramètres définis (résolution, durée, nombre de résultats, références). L’estimation en direct à côté du bouton Générer dans le playground affiche le prix exact pour votre saisie actuelle.
Quelles variantes de InfiniteTalk sont disponibles ?
WaveSpeedAI héberge 8 points d’accès InfiniteTalk actifs : wavespeed-ai/infinitetalk-fast/video-to-video-multi, wavespeed-ai/infinitetalk-fast/video-to-video, wavespeed-ai/infinitetalk/video-to-video-multi, wavespeed-ai/infinitetalk-fast/multi, wavespeed-ai/infinitetalk-fast, wavespeed-ai/infinitetalk/video-to-video, wavespeed-ai/infinitetalk, wavespeed-ai/infinitetalk/multi. Chaque variante a sa propre page playground et ses propres tarifs.
Puis-je utiliser commercialement les résultats de InfiniteTalk ?
Les droits d’usage commercial suivent la licence du modèle WaveSpeedAI. La plupart des modèles WaveSpeedAI autorisent l’usage commercial des résultats ; consultez la page playground de chaque modèle pour le résumé de sa licence, et les Conditions d’utilisation de WaveSpeedAI pour les conditions au niveau de la plateforme.
Pourquoi utiliser InfiniteTalk sur WaveSpeedAI plutôt qu’en direct ?
Une seule clé API et un seul compte de facturation pour InfiniteTalk ET plus de 1 000 autres modèles IA d’autres fournisseurs. Pas de configuration de SDK par fournisseur, pas de limites de débit distinctes, pas de code d’intégration à réécrire pour chaque fournisseur. Les tarifs sont généralement au niveau de l’API directe de WaveSpeedAI, ou en dessous.
Fournisseur
À propos de WaveSpeedAI
L’équipe derrière InfiniteTalk et la gamme plus large de modèles WaveSpeedAI sur WaveSpeedAI.
WaveSpeedAI exploite une plateforme d'inférence qui héberge plus de 1 000 modèles d'IA de tous les grands fournisseurs — ByteDance, Google, OpenAI, Alibaba, Kuaishou, ElevenLabs et des dizaines de laboratoires indépendants — derrière une seule clé API, un seul compte de facturation et une seule enveloppe de limites de débit. WaveSpeedAI propose aussi ses propres modèles (Image / Video Upscalers, Watermark Removers, Animate, InfiniteTalk) réglés pour les pipelines de production.
Commencez à créer avec InfiniteTalk sur WaveSpeedAI
Crédits de démarrage gratuits à l’inscription. Une seule clé API pour plus de 1 000 modèles IA de WaveSpeedAI et de tous les autres fournisseurs.