InfiniteTalk API
InfiniteTalk de WaveSpeedAI: convierte una foto y un audio en vídeos de avatares que hablan O cantan, de hasta 10 minutos. Niveles Standard y Fast, además de variantes Multi (una sola imagen y dos entradas de audio para vídeo con varios personajes) y variantes Video-to-Video (dirige un vídeo existente con audio nuevo).
Niveles Standard y Fast, además de salida en 720p. Las variantes Multi aceptan una sola imagen y dos entradas de audio para generar vídeo de varios personajes hablando o cantando. Las variantes Video-to-Video dirigen un vídeo existente con audio nuevo para sustituir la sincronización labial. Salidas de hasta 10 minutos.
Resumen
Acerca de InfiniteTalk API
Qué hace InfiniteTalk, cómo encaja en la gama de modelos de WaveSpeedAI y por qué los equipos lo eligen.
InfiniteTalk es un modelo de generación de vídeo de WaveSpeedAI, disponible a través de la API REST de WaveSpeedAI. InfiniteTalk de WaveSpeedAI: convierte una foto y un audio en vídeos de avatares que hablan O cantan, de hasta 10 minutos. Niveles Standard y Fast, además de variantes Multi (una sola imagen y dos entradas de audio para vídeo con varios personajes) y variantes Video-to-Video (dirige un vídeo existente con audio nuevo).
Niveles Standard y Fast, además de salida en 720p. Las variantes Multi aceptan una sola imagen y dos entradas de audio para generar vídeo de varios personajes hablando o cantando. Las variantes Video-to-Video dirigen un vídeo existente con audio nuevo para sustituir la sincronización labial. Salidas de hasta 10 minutos.
La familia InfiniteTalk en WaveSpeedAI incluye 8 endpoints REST que cubren el flujo de trabajo de Digital-Human. Cada variante tiene su propio precio, parámetros y ejemplos de resultados: elige la que se ajuste a tu modalidad de entrada y a tus requisitos de producción, o llama a varias con la misma clave de API para componer flujos de varios pasos.
Ejecuta InfiniteTalk con la misma clave de API, la misma cuenta de facturación y los mismos límites de uso que ya usas para los demás más de 1.000 modelos de IA de WaveSpeedAI. Sin configuración aparte por proveedor, sin SDK por proveedor, sin límites de uso distintos por proveedor: una sola integración lo cubre todo, desde texto a imagen y texto a vídeo hasta síntesis de audio, generación 3D, escalado y edición.
Endpoints
Todos los endpoints de la API de InfiniteTalk
8 endpoints de InfiniteTalk disponibles ahora en WaveSpeedAI: elige la variante que se ajuste a tu flujo de trabajo.
/filters:quality(82)/media/images/20260408110527_g86tqkpw.webp)
Infinitetalk Fast Video To Video Multi
InfiniteTalk fast video-to-video multi converts a video and two audio inputs into multi-character talking or singing videos. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408110532_2m95tzbp.webp)
Infinitetalk Fast Video To Video
Audio-driven infinitetalk-fast turns one video plus audio into realistic talking or singing videos with lip-sync. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408111359_7pt74rzh.webp)
Infinitetalk Video To Video Multi
InfiniteTalk Video-to-Video Multi converts a video and two audio inputs into multi-character talking or singing videos at up to 720p. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408110534_dl097qgv.webp)
Infinitetalk Fast Multi
InfiniteTalk fast multi converts a single image and two audio inputs into multi-character talking or singing videos. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408110525_m58v6n7u.webp)
Infinitetalk Fast
InfiniteTalk fast converts one photo + audio into audio-driven talking or singing avatar videos (Image-to-Video), up to 10 minutes. Ready-to-use REST API, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408111403_q1ar1bex.webp)
Infinitetalk Video To Video
Audio-driven InfiniteTalk turns one video plus audio into realistic talking or singing videos with lip-sync in 480p or 720p. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/1790561759067766019_QVeeWlOj.webp)
Infinitetalk
InfiniteTalk Image-to-Video converts a single photo and audio track into long-form audio-driven talking or singing avatar videos, supporting up to 10 minutes, 720P output, natural lip sync, expressive motion, and digital human video workflows. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408111406_upu4dbpi.webp)
Infinitetalk Multi
InfiniteTalk Multi converts a single image and two audio inputs into multi-character talking or singing videos at up to 720p. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
Ejemplos
Mira InfiniteTalk en acción
Resultados reales generados con la API de InfiniteTalk. Pasa el cursor sobre cualquier vídeo para previsualizarlo y haz clic para abrir el visor a tamaño completo.
Cómo empezar
Cómo usar la API de InfiniteTalk
Cuatro pasos desde el registro hasta una generación terminada. Encontrarás ejemplos completos en Python, Node.js y cURL en la sección de API más abajo.
- 01
Obtén una clave de API
Regístrate en WaveSpeedAI y copia tu clave de API desde el panel. Las cuentas nuevas incluyen créditos gratuitos para empezar: suficientes para usar el playground unas decenas de veces antes de que empiece la facturación.
- 02
Envía una predicción
Haz POST de tu entrada como JSON a https://api.wavespeed.ai/api/v3/wavespeed-ai/infinitetalk. El endpoint devuelve un id de predicción de inmediato: las generaciones son asíncronas, así que no mantienes una conexión abierta durante la inferencia.
- 03
Consulta hasta que termine
Haz GET a https://api.wavespeed.ai/api/v3/predictions/{request_id}/result. Devuelve los resultados con completed; detente con un error en failed, cancelled, timeout o deleted; sigue consultando con cualquier otro estado.
- 04
Lee la URL del resultado
Cuando status sea "completed", lee la URL de data.outputs[0]. La URL apunta a tu contenido generado en la CDN de WaveSpeedAI: imagen, vídeo, audio o archivo 3D según la variante de InfiniteTalk que hayas llamado.
Casos de uso
Qué puedes crear con InfiniteTalk
Flujos de trabajo habituales para los que desarrolladores y creadores usan la API de InfiniteTalk.
Avatar que habla O canta a partir de una foto
wavespeed-ai/infinitetalk convierte una foto y un audio en vídeos de avatares que hablan o cantan. Planteamiento del catálogo: «imagen a vídeo, hasta 10 minutos, nivel 720p». La compatibilidad con el canto es un rasgo diferenciador.
Varios personajes con dos entradas de audio
wavespeed-ai/infinitetalk/multi acepta una sola imagen y dos entradas de audio para generar vídeos de varios personajes hablando o cantando, hasta 720p. Útil para escenas de diálogo, dúos y presentaciones de dos personas con una sola configuración.
Sustitución de sincronización labial de vídeo a vídeo
wavespeed-ai/infinitetalk/video-to-video dirige un vídeo existente con audio nuevo y produce habla o canto realistas con sincronización labial (480p o 720p). Útil para redoblar metraje existente con una nueva locución.
Salidas de hasta 10 minutos
Afirmación del catálogo sobre la variante base: hasta 10 minutos. Mucho más largo que la mayoría de los modelos de vídeo; utilizable para pódcasts, clases, narración de formato largo y contenido completo de avatares parlantes en una sola generación.
Nivel Fast
wavespeed-ai/infinitetalk-fast. El mismo flujo de imagen a vídeo con inferencia optimizada; útil para trabajo en volumen e iteración de preproducción. Multi y video-to-video también tienen variantes Fast.
Varios personajes de vídeo a vídeo
wavespeed-ai/infinitetalk/video-to-video-multi acepta un vídeo y dos entradas de audio para varios personajes hablando o cantando, hasta 720p. La combinación completa de varios personajes y origen de vídeo en una sola llamada.
Consejos
Consejos para escribir prompts en InfiniteTalk
Consejos prácticos para obtener mejores resultados con InfiniteTalk, basados en los patrones que funcionan en modelos de vídeo en flujos de producción.
- 01
Primero audio limpio, después sincronización
La calidad de la sincronización labial depende sobre todo de la claridad del audio. Elimina el ruido de fondo, normaliza los niveles y comprueba que no haya recortes antes de introducir el audio. Un audio limpio mejora la sincronización labial más que cualquier otra variable.
- 02
Haz coincidir la imagen de referencia con el idioma y la cultura del audio
Un audio en inglés combinado con un personaje claramente occidental resulta más natural que una combinación que no encaje. Lo mismo vale para audio en japonés, chino o coreano con las referencias de personaje correspondientes.
- 03
Los retratos frontales se sincronizan mejor
Las referencias de retrato de frente producen la sincronización labial más natural. Los ángulos de tres cuartos y de perfil funcionan, pero con artefactos sutiles. Si controlas la imagen del personaje, aporta una pose casi frontal.
- 04
Se admite cantar, no solo hablar
Función del catálogo: «vídeos de avatares que hablan o cantan». Úsalo para videoclips, contenido de coro o solista y vídeos de letras con un personaje protagonista, no solo para contenido hablado.
- 05
La variante Multi acepta dos entradas de audio
wavespeed-ai/infinitetalk/multi toma una sola imagen y dos entradas de audio para generar vídeos de varios personajes hablando o cantando, hasta 720p. Útil para escenas de diálogo, dúos y presentaciones de dos personas con una sola configuración.
- 06
De vídeo a vídeo para redoblar metraje existente
wavespeed-ai/infinitetalk/video-to-video dirige un vídeo existente con audio nuevo y produce habla o canto realistas con sincronización labial. Útil para redoblar clips con una nueva locución conservando la imagen original.
Precios
Precios de la API de InfiniteTalk
El precio es por resultado. El cargo final depende de los parámetros que definas en el playground de cada variante (resolución, duración, número de resultados, referencias).
| Endpoint | Tipo | Precio inicial |
|---|---|---|
| wavespeed-ai/ | digital-human | $0.075 |
| wavespeed-ai/ | digital-human | $0.075 |
| wavespeed-ai/ | digital-human | $0.15 |
| wavespeed-ai/ | digital-human | $0.075 |
| wavespeed-ai/ | digital-human | $0.075 |
| wavespeed-ai/ | digital-human | $0.15 |
| wavespeed-ai/ | digital-human | $0.15 |
| wavespeed-ai/ | digital-human | $0.15 |
API
Llama a la API de InfiniteTalk
Obtén una clave de API en wavespeed.ai/accesskey y envía una predicción por REST. El playground genera ejemplos listos para pegar con cualquier combinación de entradas.
POSThttps://api.wavespeed.ai/api/v3/wavespeed-ai/infinitetalk
# 1. Submit the prediction.
SUBMIT_RESPONSE=$(curl --silent --show-error --fail-with-body \
-X POST "https://api.wavespeed.ai/api/v3/wavespeed-ai/infinitetalk" \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $WAVESPEED_API_KEY" \
-d '{
"image": "https://interactive-examples.mdn.mozilla.net/media/cc0-images/painted-hand-298-332.jpg",
"audio": "https://interactive-examples.mdn.mozilla.net/media/cc0-audio/t-rex-roar.mp3",
"resolution": "480p"
}')
TASK=$(printf '%s' "$SUBMIT_RESPONSE" | jq 'if has("data") then .data else . end')
PREDICTION_ID=$(printf '%s' "$TASK" | jq -r '.id')
if [ -z "$PREDICTION_ID" ] || [ "$PREDICTION_ID" = "null" ]; then
printf 'Submission response did not contain a prediction id
' >&2
exit 1
fi
RESULT_URL="https://api.wavespeed.ai/api/v3/predictions/$PREDICTION_ID/result"
# 2. Poll until the prediction finishes.
while true; do
RESPONSE=$(curl --silent --show-error --fail-with-body "$RESULT_URL" \
-H "Authorization: Bearer $WAVESPEED_API_KEY")
RESULT=$(printf '%s' "$RESPONSE" | jq 'if has("data") then .data else . end')
STATUS=$(printf '%s' "$RESULT" | jq -r '.status')
case "$STATUS" in
completed) printf '%s\n' "$RESULT" | jq '.outputs'; break ;;
failed|cancelled|timeout|deleted) printf '%s\n' "$RESULT" | jq . >&2; exit 1 ;;
*) sleep 2 ;;
esac
doneconst submitUrl = "https://api.wavespeed.ai/api/v3/wavespeed-ai/infinitetalk";
const apiKey = process.env.WAVESPEED_API_KEY;
if (!apiKey) throw new Error('Set WAVESPEED_API_KEY');
async function requestJson(url, options = {}) {
const response = await fetch(url, options);
if (!response.ok) throw new Error(await response.text());
return response.json();
}
// 1. Submit the prediction.
const body = await requestJson(submitUrl, {
method: "POST",
headers: {
"Authorization": `Bearer ${apiKey}`,
"Content-Type": "application/json",
},
body: JSON.stringify({
"image": "https://interactive-examples.mdn.mozilla.net/media/cc0-images/painted-hand-298-332.jpg",
"audio": "https://interactive-examples.mdn.mozilla.net/media/cc0-audio/t-rex-roar.mp3",
"resolution": "480p"
}),
});
const task = body.data ?? body;
const resultUrl = `https://api.wavespeed.ai/api/v3/predictions/${task.id}/result`;
// 2. Poll until the prediction finishes.
while (true) {
const resultBody = await requestJson(resultUrl, {
headers: { "Authorization": `Bearer ${apiKey}` },
});
const result = resultBody.data ?? resultBody;
if (result.status === "completed") {
console.log(result.outputs);
break;
}
if (["failed", "cancelled", "timeout", "deleted"].includes(result.status)) throw new Error(JSON.stringify(result));
await new Promise(resolve => setTimeout(resolve, 2000));
}import json
import os
import time
from urllib.request import Request, urlopen
api_key = os.environ["WAVESPEED_API_KEY"]
headers = {"Authorization": f"Bearer {api_key}", "Content-Type": "application/json"}
payload = {
"image": "https://interactive-examples.mdn.mozilla.net/media/cc0-images/painted-hand-298-332.jpg",
"audio": "https://interactive-examples.mdn.mozilla.net/media/cc0-audio/t-rex-roar.mp3",
"resolution": "480p"
}
def request_json(url, data=None):
request = Request(url, data=data, headers=headers, method="POST" if data else "GET")
with urlopen(request) as response:
return json.load(response)
# 1. Submit the prediction.
body = request_json("https://api.wavespeed.ai/api/v3/wavespeed-ai/infinitetalk", json.dumps(payload).encode())
task = body.get("data", body)
result_url = f"https://api.wavespeed.ai/api/v3/predictions/{task['id']}/result"
# 2. Poll until the prediction finishes.
while True:
result_body = request_json(result_url)
result = result_body.get("data", result_body)
status = result.get("status")
if status == "completed":
print(result.get("outputs", []))
break
if status in {"failed", "cancelled", "timeout", "deleted"}:
raise RuntimeError(result)
time.sleep(2)Comparar
InfiniteTalk frente a las alternativas
Cuándo elegir InfiniteTalk en lugar de modelos similares en WaveSpeedAI.
InfiniteTalk frente a Wan 2.2 Speech-to-Video
Wan 2.2 Speech-to-Video (wavespeed-ai/wan-2.2/speech-to-video) admite clips de hasta 10 minutos en 480p, la misma duración máxima que InfiniteTalk. InfiniteTalk añade variantes Multi (dos entradas de audio), Video-to-Video y un nivel Fast que Wan 2.2 no ofrece como endpoint aparte.
InfiniteTalk frente a Stock avatar tools
Las herramientas de avatares predefinidos (al estilo HeyGen) te limitan a una biblioteca curada de avatares preentrenados. InfiniteTalk acepta cualquier imagen de personaje (mascota de marca, personaje generado con IA, presentador ilustrado) sin configuración por personaje, y admite canto además de habla.
InfiniteTalk frente a ElevenLabs voice tools
ElevenLabs se ocupa de la voz (generación, clonación, TTS multilingüe). InfiniteTalk es la capa de vídeo: combina una locución de ElevenLabs con la imagen de un personaje (o un vídeo existente) para producir un vídeo completo con sincronización labial.
Preguntas frecuentes
InfiniteTalk API — Preguntas frecuentes
Precios, licencia, integración: preguntas habituales sobre cómo ejecutar InfiniteTalk en WaveSpeedAI.
¿Qué es la API de InfiniteTalk?
InfiniteTalk es un modelo de generación de vídeo de WaveSpeedAI expuesto como API REST en WaveSpeedAI. InfiniteTalk de WaveSpeedAI: convierte una foto y un audio en vídeos de avatares que hablan O cantan, de hasta 10 minutos. Niveles Standard y Fast, además de variantes Multi (una sola imagen y dos entradas de audio para vídeo con varios personajes) y variantes Video-to-Video (dirige un vídeo existente con audio nuevo). Puedes llamarlo por programación o probarlo desde el playground enlazado arriba.
¿Cómo llamo a la API de InfiniteTalk?
Regístrate en WaveSpeedAI, copia tu clave de API desde /accesskey y haz POST a https://api.wavespeed.ai/api/v3/wavespeed-ai/infinitetalk con tu entrada como JSON. El endpoint devuelve un id de predicción. Consulta el endpoint de resultados aproximadamente cada 2 segundos, aumenta el intervalo en las tareas largas y detente ante cualquier estado final. Arriba tienes ejemplos en Python / Node.js / cURL orientados a producción.
¿Cuánto cuesta la API de InfiniteTalk?
InfiniteTalk empieza en $0.075 por ejecución. El coste exacto depende de los parámetros que definas (resolución, duración, número de resultados, referencias). La vista previa del coste en tiempo real junto al botón Generar del playground muestra el precio exacto de tu entrada actual.
¿Qué variantes de InfiniteTalk hay disponibles?
WaveSpeedAI aloja 8 endpoints de InfiniteTalk en producción: wavespeed-ai/infinitetalk-fast/video-to-video-multi, wavespeed-ai/infinitetalk-fast/video-to-video, wavespeed-ai/infinitetalk/video-to-video-multi, wavespeed-ai/infinitetalk-fast/multi, wavespeed-ai/infinitetalk-fast, wavespeed-ai/infinitetalk/video-to-video, wavespeed-ai/infinitetalk, wavespeed-ai/infinitetalk/multi. Cada variante tiene su propia página de playground y sus propios precios.
¿Puedo usar comercialmente los resultados de InfiniteTalk?
Los derechos de uso comercial dependen de la licencia del modelo de WaveSpeedAI. La mayoría de los modelos de WaveSpeedAI permiten el uso comercial de los resultados; consulta la página del playground de cada modelo para ver el resumen de su licencia y los Términos del servicio de WaveSpeedAI para las condiciones de la plataforma.
¿Por qué usar InfiniteTalk en WaveSpeedAI en lugar de ir directamente al proveedor?
Una sola clave de API y una sola cuenta de facturación para InfiniteTalk Y más de 1.000 modelos de IA de otros proveedores. Sin configurar un SDK por proveedor, sin límites de uso aparte y sin reescribir el código de integración para cada proveedor. Los precios suelen ser iguales o inferiores a los de la API directa de WaveSpeedAI.
Proveedor
Acerca de WaveSpeedAI
El equipo detrás de InfiniteTalk y de la gama más amplia de modelos de WaveSpeedAI en WaveSpeedAI.
WaveSpeedAI opera una plataforma de inferencia que aloja más de 1.000 modelos de IA de todos los grandes proveedores (ByteDance, Google, OpenAI, Alibaba, Kuaishou, ElevenLabs y decenas de laboratorios independientes) con una sola clave de API, una sola cuenta de facturación y un único marco de límites de uso. WaveSpeedAI también ofrece modelos propios (escaladores de imagen y vídeo, eliminadores de marcas de agua, Animate, InfiniteTalk) ajustados para pipelines de producción.
Empieza a crear con InfiniteTalk en WaveSpeedAI
Créditos gratuitos al registrarte. Una sola clave de API para más de 1.000 modelos de IA de WaveSpeedAI y de todos los demás proveedores.