InfiniteTalk API
WaveSpeedAI InfiniteTalk — converte uma foto e um áudio em vídeos de avatar falando OU cantando, de até 10 minutos. Níveis Standard e Fast, além de variantes Multi (uma imagem e duas entradas de áudio para saída com vários personagens) e Video-to-Video (conduza um vídeo existente com um novo áudio).
Níveis Standard e Fast, além de saída em 720p. As variantes Multi aceitam uma imagem e duas entradas de áudio para gerar vídeo de vários personagens falando/cantando. As variantes Video-to-Video conduzem um vídeo existente com um novo áudio, para substituição de lip-sync. Saídas de até 10 minutos.
Visão geral
Sobre o InfiniteTalk API
O que o InfiniteTalk faz, como ele se encaixa na linha de modelos da WaveSpeedAI e por que as equipes o escolhem.
InfiniteTalk é um modelo de geração de vídeo da WaveSpeedAI, disponível pela API REST da WaveSpeedAI. WaveSpeedAI InfiniteTalk — converte uma foto e um áudio em vídeos de avatar falando OU cantando, de até 10 minutos. Níveis Standard e Fast, além de variantes Multi (uma imagem e duas entradas de áudio para saída com vários personagens) e Video-to-Video (conduza um vídeo existente com um novo áudio).
Níveis Standard e Fast, além de saída em 720p. As variantes Multi aceitam uma imagem e duas entradas de áudio para gerar vídeo de vários personagens falando/cantando. As variantes Video-to-Video conduzem um vídeo existente com um novo áudio, para substituição de lip-sync. Saídas de até 10 minutos.
A família InfiniteTalk na WaveSpeedAI traz 8 endpoints REST cobrindo o fluxo de Digital-Human. Cada variante tem seu próprio preço, parâmetros e exemplos de resultado — escolha a que combina com sua modalidade de entrada e suas restrições de produção, ou chame várias com a mesma chave de API para montar pipelines de várias etapas.
Execute o InfiniteTalk com a mesma chave de API, a mesma conta de cobrança e os mesmos limites de taxa que você usa nos outros mais de 1.000 modelos de IA da WaveSpeedAI. Sem configuração separada por fornecedor, sem SDKs por provedor, sem limites de taxa por fornecedor — uma única integração cobre tudo, de texto para imagem e texto para vídeo até síntese de áudio, geração 3D, ampliação e edição.
Endpoints
Todos os endpoints da API de InfiniteTalk
8 endpoints de InfiniteTalk disponíveis agora na WaveSpeedAI — escolha a variante que combina com seu fluxo de trabalho.
/filters:quality(82)/media/images/20260408110527_g86tqkpw.webp)
Infinitetalk Fast Video To Video Multi
InfiniteTalk fast video-to-video multi converts a video and two audio inputs into multi-character talking or singing videos. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408110532_2m95tzbp.webp)
Infinitetalk Fast Video To Video
Audio-driven infinitetalk-fast turns one video plus audio into realistic talking or singing videos with lip-sync. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408111359_7pt74rzh.webp)
Infinitetalk Video To Video Multi
InfiniteTalk Video-to-Video Multi converts a video and two audio inputs into multi-character talking or singing videos at up to 720p. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408110534_dl097qgv.webp)
Infinitetalk Fast Multi
InfiniteTalk fast multi converts a single image and two audio inputs into multi-character talking or singing videos. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408110525_m58v6n7u.webp)
Infinitetalk Fast
InfiniteTalk fast converts one photo + audio into audio-driven talking or singing avatar videos (Image-to-Video), up to 10 minutes. Ready-to-use REST API, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408111403_q1ar1bex.webp)
Infinitetalk Video To Video
Audio-driven InfiniteTalk turns one video plus audio into realistic talking or singing videos with lip-sync in 480p or 720p. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/1790561759067766019_QVeeWlOj.webp)
Infinitetalk
InfiniteTalk Image-to-Video converts a single photo and audio track into long-form audio-driven talking or singing avatar videos, supporting up to 10 minutes, 720P output, natural lip sync, expressive motion, and digital human video workflows. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408111406_upu4dbpi.webp)
Infinitetalk Multi
InfiniteTalk Multi converts a single image and two audio inputs into multi-character talking or singing videos at up to 720p. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
Exemplos
Veja o InfiniteTalk em ação
Resultados reais gerados pela API do InfiniteTalk. Passe o mouse sobre qualquer vídeo para pré-visualizar e clique para abrir o visualizador em tamanho real.
Como usar
Como usar a API do InfiniteTalk
Quatro passos do cadastro até uma geração concluída. Exemplos completos em Python, Node.js e cURL estão na seção de API abaixo.
- 01
Obtenha uma chave de API
Crie uma conta na WaveSpeedAI e copie sua chave de API no painel. Contas novas recebem créditos iniciais grátis — o suficiente para usar o playground algumas dezenas de vezes antes de a cobrança começar.
- 02
Envie uma predição
Faça POST da sua entrada em JSON para https://api.wavespeed.ai/api/v3/wavespeed-ai/infinitetalk. O endpoint devolve um id de predição imediatamente — as gerações são assíncronas, então você não mantém uma conexão aberta durante a inferência.
- 03
Consulte até concluir
Faça GET em https://api.wavespeed.ai/api/v3/predictions/{request_id}/result. Retorne os resultados quando o status for completed; pare com erro em failed, cancelled, timeout ou deleted; continue consultando em qualquer outro status.
- 04
Leia a URL do resultado
Quando o status for "completed", leia a URL em data.outputs[0]. A URL aponta para a mídia gerada na CDN da WaveSpeedAI — imagem, vídeo, áudio ou arquivo 3D, conforme a variante do InfiniteTalk que você chamou.
Casos de uso
O que você pode criar com o InfiniteTalk
Fluxos de trabalho comuns para os quais desenvolvedores e criadores usam a API do InfiniteTalk.
Avatar falando OU cantando a partir de uma foto
wavespeed-ai/infinitetalk converte uma foto e um áudio em vídeos de avatar falando ou cantando. Descrição do catálogo: "imagem para vídeo, até 10 minutos, nível 720p". O suporte a canto é um diferencial.
Vários personagens com duas entradas de áudio
wavespeed-ai/infinitetalk/multi aceita uma imagem e duas entradas de áudio para gerar vídeos de vários personagens falando/cantando em até 720p. Útil para cenas de diálogo, duetos e apresentações a duas pessoas a partir de uma única configuração.
Substituição de lip-sync de vídeo para vídeo
wavespeed-ai/infinitetalk/video-to-video conduz um vídeo existente com um novo áudio, produzindo fala ou canto realista com lip-sync (480p ou 720p). Útil para redublar filmagens existentes com uma nova narração.
Saídas de até 10 minutos
Afirmação do catálogo na variante base: até 10 minutos. Bem mais longo que a maioria dos modelos de vídeo — utilizável em podcasts, aulas, narrações longas e conteúdo de avatar falante de episódio completo em uma única geração.
Nível Fast
wavespeed-ai/infinitetalk-fast. O mesmo fluxo de imagem para vídeo com inferência otimizada — útil para trabalho em alto volume e iteração em pré-produção. Multi e video-to-video também têm variantes Fast.
Vídeo para vídeo com vários personagens
wavespeed-ai/infinitetalk/video-to-video-multi aceita um vídeo e duas entradas de áudio para vários personagens falando/cantando em até 720p. A combinação completa de vários personagens e origem em vídeo em uma só chamada.
Dicas
Dicas de prompt para o InfiniteTalk
Conselhos práticos para obter melhores resultados com o InfiniteTalk — extraídos dos padrões que funcionam em modelos de vídeo em pipelines de produção.
- 01
Primeiro áudio limpo, depois sincronização
A qualidade do lip-sync é limitada pela clareza do áudio. Remova ruído de fundo, normalize os níveis e verifique clipping antes de enviar o áudio. Um áudio limpo melhora o lip-sync mais do que qualquer outra variável.
- 02
Combine a imagem de referência com o idioma/a cultura do áudio
Áudio em inglês com um personagem claramente ocidental parece mais natural do que uma combinação incoerente. O mesmo vale para áudio em japonês / chinês / coreano com os personagens de referência correspondentes.
- 03
Retratos frontais sincronizam melhor
Referências de retrato de frente produzem o lip-sync mais natural. Ângulos de três quartos e de perfil funcionam, mas com artefatos sutis. Se você controla a imagem do personagem, envie uma pose quase frontal.
- 04
Canto é suportado, não apenas fala
Recurso do catálogo: "vídeos de avatar falando ou cantando". Use em videoclipes, conteúdo de coral / solista e vídeos de letras com um personagem em destaque — não apenas conteúdo falado.
- 05
A variante Multi aceita duas entradas de áudio
wavespeed-ai/infinitetalk/multi recebe uma imagem e duas entradas de áudio para gerar vídeos de vários personagens falando/cantando em até 720p. Útil para cenas de diálogo, duetos e apresentações a duas pessoas a partir de uma só configuração.
- 06
Vídeo para vídeo para redublar filmagens existentes
wavespeed-ai/infinitetalk/video-to-video conduz um vídeo existente com um novo áudio, produzindo fala ou canto realista com lip-sync. Útil para redublar clipes com uma nova narração mantendo o visual original.
Preços
Preços da API de InfiniteTalk
O preço é por resultado. O valor final varia conforme os parâmetros definidos no playground de cada variante (resolução, duração, quantidade de resultados, referências).
| Endpoint | Tipo | Preço inicial |
|---|---|---|
| wavespeed-ai/ | digital-human | $0.075 |
| wavespeed-ai/ | digital-human | $0.075 |
| wavespeed-ai/ | digital-human | $0.15 |
| wavespeed-ai/ | digital-human | $0.075 |
| wavespeed-ai/ | digital-human | $0.075 |
| wavespeed-ai/ | digital-human | $0.15 |
| wavespeed-ai/ | digital-human | $0.15 |
| wavespeed-ai/ | digital-human | $0.15 |
API
Chame a API de InfiniteTalk
Crie uma chave de API em wavespeed.ai/accesskey e envie uma predição via REST. O playground gera exemplos prontos para colar para qualquer combinação de entradas.
POSThttps://api.wavespeed.ai/api/v3/wavespeed-ai/infinitetalk
# 1. Submit the prediction.
SUBMIT_RESPONSE=$(curl --silent --show-error --fail-with-body \
-X POST "https://api.wavespeed.ai/api/v3/wavespeed-ai/infinitetalk" \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $WAVESPEED_API_KEY" \
-d '{
"image": "https://interactive-examples.mdn.mozilla.net/media/cc0-images/painted-hand-298-332.jpg",
"audio": "https://interactive-examples.mdn.mozilla.net/media/cc0-audio/t-rex-roar.mp3",
"resolution": "480p"
}')
TASK=$(printf '%s' "$SUBMIT_RESPONSE" | jq 'if has("data") then .data else . end')
PREDICTION_ID=$(printf '%s' "$TASK" | jq -r '.id')
if [ -z "$PREDICTION_ID" ] || [ "$PREDICTION_ID" = "null" ]; then
printf 'Submission response did not contain a prediction id
' >&2
exit 1
fi
RESULT_URL="https://api.wavespeed.ai/api/v3/predictions/$PREDICTION_ID/result"
# 2. Poll until the prediction finishes.
while true; do
RESPONSE=$(curl --silent --show-error --fail-with-body "$RESULT_URL" \
-H "Authorization: Bearer $WAVESPEED_API_KEY")
RESULT=$(printf '%s' "$RESPONSE" | jq 'if has("data") then .data else . end')
STATUS=$(printf '%s' "$RESULT" | jq -r '.status')
case "$STATUS" in
completed) printf '%s\n' "$RESULT" | jq '.outputs'; break ;;
failed|cancelled|timeout|deleted) printf '%s\n' "$RESULT" | jq . >&2; exit 1 ;;
*) sleep 2 ;;
esac
doneconst submitUrl = "https://api.wavespeed.ai/api/v3/wavespeed-ai/infinitetalk";
const apiKey = process.env.WAVESPEED_API_KEY;
if (!apiKey) throw new Error('Set WAVESPEED_API_KEY');
async function requestJson(url, options = {}) {
const response = await fetch(url, options);
if (!response.ok) throw new Error(await response.text());
return response.json();
}
// 1. Submit the prediction.
const body = await requestJson(submitUrl, {
method: "POST",
headers: {
"Authorization": `Bearer ${apiKey}`,
"Content-Type": "application/json",
},
body: JSON.stringify({
"image": "https://interactive-examples.mdn.mozilla.net/media/cc0-images/painted-hand-298-332.jpg",
"audio": "https://interactive-examples.mdn.mozilla.net/media/cc0-audio/t-rex-roar.mp3",
"resolution": "480p"
}),
});
const task = body.data ?? body;
const resultUrl = `https://api.wavespeed.ai/api/v3/predictions/${task.id}/result`;
// 2. Poll until the prediction finishes.
while (true) {
const resultBody = await requestJson(resultUrl, {
headers: { "Authorization": `Bearer ${apiKey}` },
});
const result = resultBody.data ?? resultBody;
if (result.status === "completed") {
console.log(result.outputs);
break;
}
if (["failed", "cancelled", "timeout", "deleted"].includes(result.status)) throw new Error(JSON.stringify(result));
await new Promise(resolve => setTimeout(resolve, 2000));
}import json
import os
import time
from urllib.request import Request, urlopen
api_key = os.environ["WAVESPEED_API_KEY"]
headers = {"Authorization": f"Bearer {api_key}", "Content-Type": "application/json"}
payload = {
"image": "https://interactive-examples.mdn.mozilla.net/media/cc0-images/painted-hand-298-332.jpg",
"audio": "https://interactive-examples.mdn.mozilla.net/media/cc0-audio/t-rex-roar.mp3",
"resolution": "480p"
}
def request_json(url, data=None):
request = Request(url, data=data, headers=headers, method="POST" if data else "GET")
with urlopen(request) as response:
return json.load(response)
# 1. Submit the prediction.
body = request_json("https://api.wavespeed.ai/api/v3/wavespeed-ai/infinitetalk", json.dumps(payload).encode())
task = body.get("data", body)
result_url = f"https://api.wavespeed.ai/api/v3/predictions/{task['id']}/result"
# 2. Poll until the prediction finishes.
while True:
result_body = request_json(result_url)
result = result_body.get("data", result_body)
status = result.get("status")
if status == "completed":
print(result.get("outputs", []))
break
if status in {"failed", "cancelled", "timeout", "deleted"}:
raise RuntimeError(result)
time.sleep(2)Comparar
InfiniteTalk vs alternativas
Quando escolher o InfiniteTalk em vez de modelos semelhantes na WaveSpeedAI.
InfiniteTalk vs Wan 2.2 Speech-to-Video
O Wan 2.2 Speech-to-Video (wavespeed-ai/wan-2.2/speech-to-video) suporta clipes de até 10 minutos em 480p — a mesma duração máxima do InfiniteTalk. O InfiniteTalk adiciona variantes Multi (duas entradas de áudio), Video-to-Video e um nível Fast que o Wan 2.2 não oferece como endpoint separado.
InfiniteTalk vs Stock avatar tools
Ferramentas de avatares prontos (estilo HeyGen) limitam você a uma biblioteca curada de avatares pré-treinados. O InfiniteTalk aceita qualquer imagem de personagem — mascote da marca, personagem gerado por IA, apresentador ilustrado — sem configuração por personagem, e suporta canto além de fala.
InfiniteTalk vs ElevenLabs voice tools
O ElevenLabs cuida da voz (geração, clonagem, TTS multilíngue). O InfiniteTalk é a camada de vídeo: combine uma narração do ElevenLabs com a imagem de um personagem (ou um vídeo existente) para produzir um vídeo completo com lip-sync.
FAQ
InfiniteTalk API — Perguntas frequentes
Preços, licença, integração — perguntas comuns sobre executar o InfiniteTalk na WaveSpeedAI.
O que é a API do InfiniteTalk?
InfiniteTalk é um modelo de geração de vídeo da WaveSpeedAI disponibilizado como API REST na WaveSpeedAI. WaveSpeedAI InfiniteTalk — converte uma foto e um áudio em vídeos de avatar falando OU cantando, de até 10 minutos. Níveis Standard e Fast, além de variantes Multi (uma imagem e duas entradas de áudio para saída com vários personagens) e Video-to-Video (conduza um vídeo existente com um novo áudio). Você pode chamá-lo por código ou testá-lo no playground indicado acima.
Como chamo a API do InfiniteTalk?
Crie uma conta na WaveSpeedAI, copie sua chave de API em /accesskey e faça POST para https://api.wavespeed.ai/api/v3/wavespeed-ai/infinitetalk com sua entrada em JSON. O endpoint devolve um id de predição. Consulte o endpoint de resultado a cada 2 segundos, aproximadamente, aumente o intervalo em tarefas longas e pare em qualquer status final. Exemplos prontos para produção em Python / Node.js / cURL estão acima.
Quanto custa a API do InfiniteTalk?
O InfiniteTalk começa em $0.075 por execução. O custo exato varia conforme os parâmetros definidos (resolução, duração, quantidade de resultados, referências). A prévia de custo ao vivo ao lado do botão Gerar no playground mostra o preço exato da sua entrada atual.
Quais variantes do InfiniteTalk estão disponíveis?
A WaveSpeedAI hospeda 8 endpoints de InfiniteTalk ativos: wavespeed-ai/infinitetalk-fast/video-to-video-multi, wavespeed-ai/infinitetalk-fast/video-to-video, wavespeed-ai/infinitetalk/video-to-video-multi, wavespeed-ai/infinitetalk-fast/multi, wavespeed-ai/infinitetalk-fast, wavespeed-ai/infinitetalk/video-to-video, wavespeed-ai/infinitetalk, wavespeed-ai/infinitetalk/multi. Cada variante tem sua própria página de playground e seu preço.
Posso usar os resultados do InfiniteTalk comercialmente?
Os direitos de uso comercial seguem a licença do modelo da WaveSpeedAI. A maioria dos modelos da WaveSpeedAI permite o uso comercial dos resultados; veja o resumo da licença na página do playground de cada modelo e os Termos de Serviço da WaveSpeedAI para as condições da plataforma.
Por que usar o InfiniteTalk na WaveSpeedAI em vez de ir direto à fonte?
Uma chave de API e uma conta de cobrança para o InfiniteTalk E mais de 1.000 outros modelos de IA de outros provedores. Sem configuração de SDK por fornecedor, sem limites de taxa separados, sem reescrever o código de integração a cada fornecedor. Os preços costumam ser iguais ou menores que os da API direta da WaveSpeedAI.
Provedor
Sobre a WaveSpeedAI
A equipe por trás do InfiniteTalk e de toda a linha de modelos da WaveSpeedAI na WaveSpeedAI.
A WaveSpeedAI opera uma plataforma de inferência que hospeda mais de 1.000 modelos de IA de todos os principais provedores — ByteDance, Google, OpenAI, Alibaba, Kuaishou, ElevenLabs e dezenas de laboratórios independentes — com uma única chave de API, uma conta de cobrança e um único limite de taxa. A WaveSpeedAI também lança modelos próprios (Image / Video Upscalers, Watermark Removers, Animate, InfiniteTalk) ajustados para pipelines de produção.
Comece a criar com o InfiniteTalk na WaveSpeedAI
Créditos iniciais grátis no cadastro. Uma chave de API para mais de 1.000 modelos de IA da WaveSpeedAI e de todos os outros provedores.