InfiniteTalk API
WaveSpeedAI InfiniteTalk — converte una foto + audio in video di avatar che parlano O cantano, fino a 10 minuti. Livelli Standard e Fast, più varianti Multi (una sola immagine + due input audio per output multi-personaggio) e varianti Video-to-Video (guida un video esistente con nuovo audio).
Livelli Standard e Fast, più output a 720p. Le varianti Multi accettano una sola immagine + due input audio per generare video multi-personaggio in cui si parla/canta. Le varianti Video-to-Video guidano un video esistente con nuovo audio per sostituire il lip-sync. Output fino a 10 minuti.
Panoramica
Informazioni su InfiniteTalk API
Cosa fa InfiniteTalk, come si inserisce nella gamma di modelli di WaveSpeedAI e perché i team lo scelgono.
InfiniteTalk è un modello di generazione video di WaveSpeedAI, disponibile tramite l'API REST di WaveSpeedAI. WaveSpeedAI InfiniteTalk — converte una foto + audio in video di avatar che parlano O cantano, fino a 10 minuti. Livelli Standard e Fast, più varianti Multi (una sola immagine + due input audio per output multi-personaggio) e varianti Video-to-Video (guida un video esistente con nuovo audio).
Livelli Standard e Fast, più output a 720p. Le varianti Multi accettano una sola immagine + due input audio per generare video multi-personaggio in cui si parla/canta. Le varianti Video-to-Video guidano un video esistente con nuovo audio per sostituire il lip-sync. Output fino a 10 minuti.
La famiglia InfiniteTalk su WaveSpeedAI offre 8 endpoint REST che coprono il flusso di lavoro Digital-Human. Ogni variante ha il suo prezzo, i suoi parametri e i suoi esempi di output: scegli quella più adatta alla tua modalità di input e ai tuoi vincoli di produzione, oppure richiamane diverse con la stessa chiave API per comporre pipeline in più passaggi.
Usa InfiniteTalk con la stessa chiave API, lo stesso account di fatturazione e gli stessi limiti di frequenza che usi per gli altri oltre 1.000 modelli AI di WaveSpeedAI. Nessuna configurazione separata per fornitore, nessun SDK per provider, nessun limite di frequenza per fornitore: un'unica integrazione copre tutto, dal text-to-image e text-to-video alla sintesi audio, alla generazione 3D, all'upscaling e all'editing.
Endpoint
Tutti gli endpoint API InfiniteTalk
8 endpoint InfiniteTalk disponibili ora su WaveSpeedAI: scegli la variante più adatta al tuo flusso di lavoro.
/filters:quality(82)/media/images/20260408110527_g86tqkpw.webp)
Infinitetalk Fast Video To Video Multi
InfiniteTalk fast video-to-video multi converts a video and two audio inputs into multi-character talking or singing videos. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408110532_2m95tzbp.webp)
Infinitetalk Fast Video To Video
Audio-driven infinitetalk-fast turns one video plus audio into realistic talking or singing videos with lip-sync. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408111359_7pt74rzh.webp)
Infinitetalk Video To Video Multi
InfiniteTalk Video-to-Video Multi converts a video and two audio inputs into multi-character talking or singing videos at up to 720p. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408110534_dl097qgv.webp)
Infinitetalk Fast Multi
InfiniteTalk fast multi converts a single image and two audio inputs into multi-character talking or singing videos. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408110525_m58v6n7u.webp)
Infinitetalk Fast
InfiniteTalk fast converts one photo + audio into audio-driven talking or singing avatar videos (Image-to-Video), up to 10 minutes. Ready-to-use REST API, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408111403_q1ar1bex.webp)
Infinitetalk Video To Video
Audio-driven InfiniteTalk turns one video plus audio into realistic talking or singing videos with lip-sync in 480p or 720p. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/1790561759067766019_QVeeWlOj.webp)
Infinitetalk
InfiniteTalk Image-to-Video converts a single photo and audio track into long-form audio-driven talking or singing avatar videos, supporting up to 10 minutes, 720P output, natural lip sync, expressive motion, and digital human video workflows. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408111406_upu4dbpi.webp)
Infinitetalk Multi
InfiniteTalk Multi converts a single image and two audio inputs into multi-character talking or singing videos at up to 720p. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
Esempi
InfiniteTalk in azione
Output reali generati dall'API InfiniteTalk. Passa il mouse su un video per l'anteprima, clicca per aprire il visualizzatore a schermo intero.
Guida
Come usare l'API InfiniteTalk
Quattro passaggi dalla registrazione alla generazione completata. Esempi completi in Python, Node.js e cURL sono nella sezione API qui sotto.
- 01
Ottieni una chiave API
Registrati su WaveSpeedAI e copia la tua chiave API dalla dashboard. I nuovi account includono crediti gratuiti di benvenuto: bastano per usare il playground qualche decina di volte prima che inizi la fatturazione.
- 02
Invia una predizione
Invia con POST il tuo input in formato JSON a https://api.wavespeed.ai/api/v3/wavespeed-ai/infinitetalk. L'endpoint restituisce subito un id di predizione: le generazioni sono asincrone, quindi non devi tenere una connessione aperta durante l'inferenza.
- 03
Controlla il completamento
Fai GET su https://api.wavespeed.ai/api/v3/predictions/{request_id}/result. Restituisci gli output con completed; interrompi con un errore con failed, cancelled, timeout o deleted; continua il polling per ogni altro stato.
- 04
Leggi l'URL dell'output
Quando lo stato è "completed", leggi l'URL da data.outputs[0]. L'URL punta al tuo contenuto generato sulla CDN di WaveSpeedAI: immagine, video, audio o file 3D a seconda della variante di InfiniteTalk che hai richiamato.
Casi d'uso
Cosa puoi creare con InfiniteTalk
I flussi di lavoro più comuni per cui sviluppatori e creator usano l'API InfiniteTalk.
Avatar che parla O canta da una foto
wavespeed-ai/infinitetalk converte una foto + audio in video di avatar che parlano o cantano. Posizionamento a catalogo: «Image-to-Video, fino a 10 minuti, livello 720p». Il supporto al canto è una caratteristica distintiva.
Multi-personaggio con due input audio
wavespeed-ai/infinitetalk/multi accetta una sola immagine + due input audio per generare video multi-personaggio in cui si parla/canta fino a 720p. Utile per scene di dialogo, duetti e presentazioni a due voci da un'unica configurazione.
Sostituzione del lip-sync da video a video
wavespeed-ai/infinitetalk/video-to-video guida un video esistente con nuovo audio, producendo parlato o canto realistici con lip-sync (480p o 720p). Utile per ridoppiare filmati esistenti con una nuova voce fuori campo.
Output fino a 10 minuti
Dichiarazione a catalogo sulla variante base: fino a 10 minuti. Molto più lungo della maggior parte dei modelli video — utilizzabile per podcast, lezioni, narrazioni di lunga durata e contenuti con avatar parlante da episodio intero in una sola generazione.
Livello Fast
wavespeed-ai/infinitetalk-fast. Lo stesso flusso image-to-video con inferenza ottimizzata — utile per il lavoro ad alto volume e l'iterazione in pre-produzione. Anche Multi e video-to-video hanno varianti Fast.
Video-to-video multi-personaggio
wavespeed-ai/infinitetalk/video-to-video-multi accetta un video e due input audio per parlato/canto multi-personaggio fino a 720p. La combinazione completa dei workflow multi-personaggio e con sorgente video in una sola chiamata.
Consigli
Consigli per scrivere i prompt per InfiniteTalk
Consigli pratici per ottenere output migliori da InfiniteTalk, ricavati dagli schemi che funzionano con i modelli video nelle pipeline di produzione.
- 01
Prima audio pulito, poi sincronizzazione
La qualità del lip-sync dipende dalla chiarezza dell'audio. Rimuovi il rumore di fondo, normalizza i livelli e verifica l'assenza di clipping prima di fornire l'audio. Un audio pulito migliora il lip-sync più di qualsiasi altra variabile.
- 02
Abbina l'immagine di riferimento a lingua/cultura dell'audio
Un audio in inglese abbinato a un personaggio chiaramente occidentale appare più naturale di una combinazione discordante. Lo stesso vale per audio in giapponese / cinese / coreano + riferimenti di personaggi corrispondenti.
- 03
I ritratti frontali si sincronizzano meglio
I riferimenti con ritratto frontale producono il lip-sync più naturale. Gli angoli a tre quarti e di profilo funzionano, ma con lievi artefatti. Se puoi controllare l'immagine del personaggio, fornisci una posa quasi frontale.
- 04
Il canto è supportato, non solo il parlato
Funzione a catalogo: «video di avatar che parlano o cantano». Da usare per video musicali, contenuti di coro / solisti, lyric video con un personaggio protagonista — non solo contenuti parlati.
- 05
La variante Multi accetta due input audio
wavespeed-ai/infinitetalk/multi accetta una sola immagine + due input audio per generare video multi-personaggio in cui si parla/canta fino a 720p. Utile per scene di dialogo, duetti e presentazioni a due voci da un'unica configurazione.
- 06
Video-to-video per ridoppiare filmati esistenti
wavespeed-ai/infinitetalk/video-to-video guida un video esistente con nuovo audio, producendo parlato o canto realistici con lip-sync. Utile per ridoppiare clip con una nuova voce fuori campo mantenendo l'immagine originale.
Prezzi
Prezzi dell'API InfiniteTalk
Il prezzo è per output. L'addebito finale dipende dai parametri impostati nel playground di ciascuna variante (risoluzione, durata, numero di output, riferimenti).
| Endpoint | Tipo | Prezzo di partenza |
|---|---|---|
| wavespeed-ai/ | digital-human | $0.075 |
| wavespeed-ai/ | digital-human | $0.075 |
| wavespeed-ai/ | digital-human | $0.15 |
| wavespeed-ai/ | digital-human | $0.075 |
| wavespeed-ai/ | digital-human | $0.075 |
| wavespeed-ai/ | digital-human | $0.15 |
| wavespeed-ai/ | digital-human | $0.15 |
| wavespeed-ai/ | digital-human | $0.15 |
API
Richiama l'API InfiniteTalk
Ottieni una chiave API su wavespeed.ai/accesskey, poi invia una predizione tramite REST. Il playground genera esempi pronti da incollare per qualsiasi combinazione di input.
POSThttps://api.wavespeed.ai/api/v3/wavespeed-ai/infinitetalk
# 1. Submit the prediction.
SUBMIT_RESPONSE=$(curl --silent --show-error --fail-with-body \
-X POST "https://api.wavespeed.ai/api/v3/wavespeed-ai/infinitetalk" \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $WAVESPEED_API_KEY" \
-d '{
"image": "https://interactive-examples.mdn.mozilla.net/media/cc0-images/painted-hand-298-332.jpg",
"audio": "https://interactive-examples.mdn.mozilla.net/media/cc0-audio/t-rex-roar.mp3",
"resolution": "480p"
}')
TASK=$(printf '%s' "$SUBMIT_RESPONSE" | jq 'if has("data") then .data else . end')
PREDICTION_ID=$(printf '%s' "$TASK" | jq -r '.id')
if [ -z "$PREDICTION_ID" ] || [ "$PREDICTION_ID" = "null" ]; then
printf 'Submission response did not contain a prediction id
' >&2
exit 1
fi
RESULT_URL="https://api.wavespeed.ai/api/v3/predictions/$PREDICTION_ID/result"
# 2. Poll until the prediction finishes.
while true; do
RESPONSE=$(curl --silent --show-error --fail-with-body "$RESULT_URL" \
-H "Authorization: Bearer $WAVESPEED_API_KEY")
RESULT=$(printf '%s' "$RESPONSE" | jq 'if has("data") then .data else . end')
STATUS=$(printf '%s' "$RESULT" | jq -r '.status')
case "$STATUS" in
completed) printf '%s\n' "$RESULT" | jq '.outputs'; break ;;
failed|cancelled|timeout|deleted) printf '%s\n' "$RESULT" | jq . >&2; exit 1 ;;
*) sleep 2 ;;
esac
doneconst submitUrl = "https://api.wavespeed.ai/api/v3/wavespeed-ai/infinitetalk";
const apiKey = process.env.WAVESPEED_API_KEY;
if (!apiKey) throw new Error('Set WAVESPEED_API_KEY');
async function requestJson(url, options = {}) {
const response = await fetch(url, options);
if (!response.ok) throw new Error(await response.text());
return response.json();
}
// 1. Submit the prediction.
const body = await requestJson(submitUrl, {
method: "POST",
headers: {
"Authorization": `Bearer ${apiKey}`,
"Content-Type": "application/json",
},
body: JSON.stringify({
"image": "https://interactive-examples.mdn.mozilla.net/media/cc0-images/painted-hand-298-332.jpg",
"audio": "https://interactive-examples.mdn.mozilla.net/media/cc0-audio/t-rex-roar.mp3",
"resolution": "480p"
}),
});
const task = body.data ?? body;
const resultUrl = `https://api.wavespeed.ai/api/v3/predictions/${task.id}/result`;
// 2. Poll until the prediction finishes.
while (true) {
const resultBody = await requestJson(resultUrl, {
headers: { "Authorization": `Bearer ${apiKey}` },
});
const result = resultBody.data ?? resultBody;
if (result.status === "completed") {
console.log(result.outputs);
break;
}
if (["failed", "cancelled", "timeout", "deleted"].includes(result.status)) throw new Error(JSON.stringify(result));
await new Promise(resolve => setTimeout(resolve, 2000));
}import json
import os
import time
from urllib.request import Request, urlopen
api_key = os.environ["WAVESPEED_API_KEY"]
headers = {"Authorization": f"Bearer {api_key}", "Content-Type": "application/json"}
payload = {
"image": "https://interactive-examples.mdn.mozilla.net/media/cc0-images/painted-hand-298-332.jpg",
"audio": "https://interactive-examples.mdn.mozilla.net/media/cc0-audio/t-rex-roar.mp3",
"resolution": "480p"
}
def request_json(url, data=None):
request = Request(url, data=data, headers=headers, method="POST" if data else "GET")
with urlopen(request) as response:
return json.load(response)
# 1. Submit the prediction.
body = request_json("https://api.wavespeed.ai/api/v3/wavespeed-ai/infinitetalk", json.dumps(payload).encode())
task = body.get("data", body)
result_url = f"https://api.wavespeed.ai/api/v3/predictions/{task['id']}/result"
# 2. Poll until the prediction finishes.
while True:
result_body = request_json(result_url)
result = result_body.get("data", result_body)
status = result.get("status")
if status == "completed":
print(result.get("outputs", []))
break
if status in {"failed", "cancelled", "timeout", "deleted"}:
raise RuntimeError(result)
time.sleep(2)Confronto
InfiniteTalk a confronto con le alternative
Quando scegliere InfiniteTalk rispetto a modelli simili su WaveSpeedAI.
InfiniteTalk vs Wan 2.2 Speech-to-Video
Wan 2.2 Speech-to-Video (wavespeed-ai/wan-2.2/speech-to-video) supporta clip fino a 10 minuti a 480p — la stessa durata massima di InfiniteTalk. InfiniteTalk aggiunge le varianti Multi (due input audio), Video-to-Video e un livello Fast che Wan 2.2 non offre come endpoint separato.
InfiniteTalk vs Stock avatar tools
Gli strumenti con avatar predefiniti (in stile HeyGen) ti limitano a una libreria curata di avatar pre-addestrati. InfiniteTalk accetta qualsiasi immagine di personaggio — mascotte del brand, personaggio generato dall'AI, conduttore illustrato — senza configurazione per personaggio, e supporta il canto oltre al parlato.
InfiniteTalk vs ElevenLabs voice tools
ElevenLabs si occupa della voce (generazione, clonazione, TTS multilingue). InfiniteTalk è il livello video: abbina una voce fuori campo ElevenLabs a un'immagine di personaggio (o a un video esistente) per ottenere un video completo con lip-sync.
FAQ
InfiniteTalk API — Domande frequenti
Prezzi, licenza, integrazione: le domande più comuni sull'uso di InfiniteTalk su WaveSpeedAI.
Che cos'è l'API InfiniteTalk?
InfiniteTalk è un modello di generazione video di WaveSpeedAI reso disponibile come API REST su WaveSpeedAI. WaveSpeedAI InfiniteTalk — converte una foto + audio in video di avatar che parlano O cantano, fino a 10 minuti. Livelli Standard e Fast, più varianti Multi (una sola immagine + due input audio per output multi-personaggio) e varianti Video-to-Video (guida un video esistente con nuovo audio). Puoi richiamarlo da codice o provarlo dal playground collegato qui sopra.
Come richiamo l'API InfiniteTalk?
Registrati su WaveSpeedAI, copia la tua chiave API da /accesskey, poi invia con POST a https://api.wavespeed.ai/api/v3/wavespeed-ai/infinitetalk il tuo input in formato JSON. L'endpoint restituisce un id di predizione. Fai polling sull'endpoint dei risultati circa ogni 2 secondi, aumenta l'intervallo per le attività di lunga durata e fermati a qualsiasi stato terminale. Gli esempi in Python / Node.js / cURL orientati alla produzione sono qui sopra.
Quanto costa l'API InfiniteTalk?
InfiniteTalk parte da $0.075 per esecuzione. Il costo esatto dipende dai parametri impostati (risoluzione, durata, numero di output, riferimenti). L'anteprima del costo in tempo reale accanto al pulsante Genera nel playground mostra il prezzo esatto per il tuo input attuale.
Quali varianti di InfiniteTalk sono disponibili?
WaveSpeedAI offre 8 endpoint InfiniteTalk attivi: wavespeed-ai/infinitetalk-fast/video-to-video-multi, wavespeed-ai/infinitetalk-fast/video-to-video, wavespeed-ai/infinitetalk/video-to-video-multi, wavespeed-ai/infinitetalk-fast/multi, wavespeed-ai/infinitetalk-fast, wavespeed-ai/infinitetalk/video-to-video, wavespeed-ai/infinitetalk, wavespeed-ai/infinitetalk/multi. Ogni variante ha la sua pagina playground e i suoi prezzi.
Posso usare gli output di InfiniteTalk a fini commerciali?
I diritti di uso commerciale seguono la licenza del modello di WaveSpeedAI. La maggior parte dei modelli di WaveSpeedAI consente l'uso commerciale degli output; consulta la pagina playground di ciascun modello per il riepilogo della licenza e i Termini di servizio di WaveSpeedAI per le condizioni a livello di piattaforma.
Perché usare InfiniteTalk su WaveSpeedAI invece di rivolgersi direttamente al fornitore?
Una sola chiave API e un solo account di fatturazione per InfiniteTalk E per oltre 1.000 altri modelli AI di altri provider. Nessuna configurazione di SDK per fornitore, nessun limite di frequenza separato, nessun codice di integrazione da riscrivere per ogni fornitore. I prezzi sono in genere in linea o inferiori a quelli dell'API diretta di WaveSpeedAI.
Provider
Informazioni su WaveSpeedAI
Il team dietro InfiniteTalk e dietro l'intera gamma di modelli di WaveSpeedAI su WaveSpeedAI.
WaveSpeedAI gestisce una piattaforma di inferenza che ospita oltre 1.000 modelli AI di tutti i principali provider — ByteDance, Google, OpenAI, Alibaba, Kuaishou, ElevenLabs e decine di laboratori indipendenti — dietro un'unica chiave API, un unico account di fatturazione e un unico limite di frequenza. WaveSpeedAI offre anche modelli proprietari (Image / Video Upscaler, Watermark Remover, Animate, InfiniteTalk) ottimizzati per le pipeline di produzione.
Inizia a creare con InfiniteTalk su WaveSpeedAI
Crediti gratuiti di benvenuto alla registrazione. Una sola chiave API per oltre 1.000 modelli AI di WaveSpeedAI e di ogni altro provider.