InfiniteTalk API
WaveSpeedAI InfiniteTalk — 사진 한 장과 오디오로 말하거나 노래하는 아바타 비디오를 최대 10분까지 만듭니다. Standard와 Fast 등급, Multi 변형(이미지 한 장 + 오디오 두 개로 다중 캐릭터 출력), Video-to-Video 변형(기존 비디오를 새 오디오로 구동)을 제공합니다.
Standard와 Fast 등급이며 720p 출력을 지원합니다. Multi 변형은 이미지 한 장과 오디오 두 개를 받아 다중 캐릭터가 말하거나 노래하는 비디오를 생성합니다. Video-to-Video 변형은 기존 비디오를 새 오디오로 구동해 립싱크를 교체합니다. 최대 10분 출력을 지원합니다.
개요
InfiniteTalk API 소개
InfiniteTalk의 기능, WaveSpeedAI 모델 라인업에서의 위치, 그리고 팀들이 이 모델을 선택하는 이유.
WaveSpeedAI의 비디오 생성 모델 InfiniteTalk. WaveSpeedAI REST API로 바로 사용할 수 있습니다. WaveSpeedAI InfiniteTalk — 사진 한 장과 오디오로 말하거나 노래하는 아바타 비디오를 최대 10분까지 만듭니다. Standard와 Fast 등급, Multi 변형(이미지 한 장 + 오디오 두 개로 다중 캐릭터 출력), Video-to-Video 변형(기존 비디오를 새 오디오로 구동)을 제공합니다.
Standard와 Fast 등급이며 720p 출력을 지원합니다. Multi 변형은 이미지 한 장과 오디오 두 개를 받아 다중 캐릭터가 말하거나 노래하는 비디오를 생성합니다. Video-to-Video 변형은 기존 비디오를 새 오디오로 구동해 립싱크를 교체합니다. 최대 10분 출력을 지원합니다.
WaveSpeedAI의 InfiniteTalk 제품군은 Digital-Human 워크플로를 아우르는 REST 엔드포인트 8개를 제공합니다. 각 변형은 고유한 가격, 파라미터, 예시 출력을 갖고 있으니 입력 방식과 운영 조건에 맞는 것을 고르거나, 같은 API 키로 여러 개를 호출해 다단계 파이프라인을 구성하세요.
InfiniteTalk 실행에도 WaveSpeedAI의 다른 1,000개 이상의 AI 모델과 같은 API 키, 결제 계정, 요청 한도 체계를 그대로 사용합니다. 별도의 벤더 설정도, 제공사별 SDK도, 벤더별 요청 한도 체계도 필요 없습니다. 하나의 연동으로 텍스트 → 이미지, 텍스트 → 비디오부터 오디오 합성, 3D 생성, 업스케일링, 편집까지 모두 지원합니다.
엔드포인트
InfiniteTalk API 전체 엔드포인트
InfiniteTalk 엔드포인트 8개를 지금 WaveSpeedAI에서 사용할 수 있습니다. 워크플로에 맞는 변형을 고르세요.
/filters:quality(82)/media/images/20260408110527_g86tqkpw.webp)
Infinitetalk Fast Video To Video Multi
InfiniteTalk fast video-to-video multi converts a video and two audio inputs into multi-character talking or singing videos. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408110532_2m95tzbp.webp)
Infinitetalk Fast Video To Video
Audio-driven infinitetalk-fast turns one video plus audio into realistic talking or singing videos with lip-sync. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408111359_7pt74rzh.webp)
Infinitetalk Video To Video Multi
InfiniteTalk Video-to-Video Multi converts a video and two audio inputs into multi-character talking or singing videos at up to 720p. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408110534_dl097qgv.webp)
Infinitetalk Fast Multi
InfiniteTalk fast multi converts a single image and two audio inputs into multi-character talking or singing videos. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408110525_m58v6n7u.webp)
Infinitetalk Fast
InfiniteTalk fast converts one photo + audio into audio-driven talking or singing avatar videos (Image-to-Video), up to 10 minutes. Ready-to-use REST API, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408111403_q1ar1bex.webp)
Infinitetalk Video To Video
Audio-driven InfiniteTalk turns one video plus audio into realistic talking or singing videos with lip-sync in 480p or 720p. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/1790561759067766019_QVeeWlOj.webp)
Infinitetalk
InfiniteTalk Image-to-Video converts a single photo and audio track into long-form audio-driven talking or singing avatar videos, supporting up to 10 minutes, 720P output, natural lip sync, expressive motion, and digital human video workflows. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408111406_upu4dbpi.webp)
Infinitetalk Multi
InfiniteTalk Multi converts a single image and two audio inputs into multi-character talking or singing videos at up to 720p. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
예시
InfiniteTalk 활용 예시
InfiniteTalk API로 생성한 실제 출력물입니다. 비디오 위에 마우스를 올리면 미리 보고, 클릭하면 전체 크기 뷰어가 열립니다.
사용 방법
InfiniteTalk API 사용 방법
가입부터 결과물 생성까지 네 단계입니다. Python, Node.js, cURL 전체 예시는 아래 API 섹션에 있습니다.
- 01
API 키 받기
WaveSpeedAI 계정을 만들고 대시보드에서 API 키를 복사하세요. 신규 계정에는 무료 스타터 크레딧이 제공되어, 요금이 청구되기 전에 Playground를 수십 번 실행해 볼 수 있습니다.
- 02
Prediction 제출
입력을 JSON으로 https://api.wavespeed.ai/api/v3/wavespeed-ai/infinitetalk에 POST하세요. 엔드포인트가 prediction id를 즉시 반환합니다. 생성은 비동기로 처리되므로 추론 중에 연결을 계속 열어 둘 필요가 없습니다.
- 03
완료될 때까지 폴링
https://api.wavespeed.ai/api/v3/predictions/{request_id}/result로 GET 요청을 보내세요. completed이면 outputs를 반환하고, failed, cancelled, timeout, deleted이면 오류로 종료하며, 그 밖의 모든 status에서는 폴링을 계속합니다.
- 04
출력 URL 읽기
status가 "completed"가 되면 data.outputs[0]에서 URL을 읽으세요. 이 URL은 WaveSpeedAI CDN에 있는 생성된 미디어를 가리키며, 호출한 InfiniteTalk 변형에 따라 이미지, 비디오, 오디오 또는 3D 파일입니다.
활용 사례
InfiniteTalk 활용 사례
개발자와 크리에이터가 InfiniteTalk API를 사용하는 대표적인 워크플로입니다.
사진 한 장으로 말하거나 노래하는 아바타
wavespeed-ai/infinitetalk는 사진 한 장과 오디오를 말하거나 노래하는 아바타 비디오로 변환합니다. 카탈로그 소개 문구: "이미지-투-비디오, 최대 10분, 720p 등급". 노래 지원이 차별점입니다.
오디오 두 개로 만드는 다중 캐릭터
wavespeed-ai/infinitetalk/multi는 이미지 한 장과 오디오 두 개를 받아 최대 720p로 다중 캐릭터가 말하거나 노래하는 비디오를 생성합니다. 하나의 설정으로 대화 장면, 듀엣, 2인 프레젠테이션에 유용합니다.
비디오-투-비디오 립싱크 교체
wavespeed-ai/infinitetalk/video-to-video는 기존 비디오를 새 오디오로 구동해 립싱크가 맞는 사실적인 말하기나 노래를 만듭니다(480p 또는 720p). 기존 영상을 새 보이스오버로 더빙할 때 유용합니다.
최대 10분 출력
기본 변형의 카탈로그 설명: 최대 10분. 대부분의 비디오 모델보다 훨씬 길어, 한 번의 생성으로 팟캐스트, 강의, 롱폼 내레이션, 전체 에피소드 분량의 토킹 아바타 콘텐츠에 사용할 수 있습니다.
Fast 등급
wavespeed-ai/infinitetalk-fast. 최적화된 추론으로 같은 이미지-투-비디오 흐름을 제공하며, 대량 작업과 프리프로덕션 반복 작업에 유용합니다. Multi와 video-to-video에도 Fast 변형이 있습니다.
다중 캐릭터 비디오-투-비디오
wavespeed-ai/infinitetalk/video-to-video-multi는 비디오 하나와 오디오 두 개를 받아 최대 720p로 다중 캐릭터가 말하거나 노래하게 합니다. 다중 캐릭터와 비디오 소스 워크플로를 한 번의 호출로 모두 결합합니다.
팁
InfiniteTalk 프롬프트 작성 팁
InfiniteTalk에서 더 나은 결과를 얻기 위한 실용적인 조언입니다. 운영 파이프라인에서 비디오 모델 전반에 통하는 패턴을 바탕으로 했습니다.
- 01
깨끗한 오디오가 먼저, 싱크는 그다음
립싱크 품질은 오디오의 명료도에 좌우됩니다. 오디오를 넣기 전에 배경 소음을 제거하고, 레벨을 맞추고, 클리핑이 없는지 확인하세요. 깨끗한 오디오는 다른 어떤 변수보다 립싱크를 크게 개선합니다.
- 02
레퍼런스 이미지를 오디오의 언어/문화에 맞추세요
영어 오디오에는 서양 인물로 보이는 캐릭터가 어울려, 어긋난 조합보다 더 자연스럽습니다. 일본어 / 중국어 / 한국어 오디오와 해당 문화권의 캐릭터 레퍼런스도 마찬가지입니다.
- 03
정면 인물 사진의 싱크가 가장 깔끔합니다
정면을 향한 인물 레퍼런스가 가장 자연스러운 립싱크를 만듭니다. 3/4 각도와 측면도 작동하지만 미세한 아티팩트가 생깁니다. 캐릭터 이미지를 직접 정할 수 있다면 거의 정면에 가까운 포즈를 제공하세요.
- 04
말하기뿐 아니라 노래도 지원합니다
카탈로그 기능: "말하거나 노래하는 아바타 비디오". 단순한 구어 콘텐츠뿐 아니라 뮤직비디오, 합창단 / 솔로 콘텐츠, 캐릭터가 등장하는 가사 영상에 사용하세요.
- 05
Multi 변형은 오디오 두 개를 받습니다
wavespeed-ai/infinitetalk/multi는 이미지 한 장과 오디오 두 개를 받아 최대 720p로 다중 캐릭터가 말하거나 노래하는 비디오를 생성합니다. 하나의 설정으로 대화 장면, 듀엣, 2인 프레젠테이션에 유용합니다.
- 06
기존 영상을 재더빙하는 비디오-투-비디오
wavespeed-ai/infinitetalk/video-to-video는 기존 비디오를 새 오디오로 구동해 립싱크가 맞는 사실적인 말하기나 노래를 만듭니다. 원본 비주얼은 유지하면서 클립을 새 보이스오버로 재더빙할 때 유용합니다.
가격
InfiniteTalk API 가격
가격은 출력당 책정됩니다. 최종 요금은 각 변형의 Playground에서 설정한 파라미터(해상도, 길이, 출력 수, 레퍼런스)에 따라 달라집니다.
| 엔드포인트 | 유형 | 시작 가격 |
|---|---|---|
| wavespeed-ai/ | digital-human | $0.075 |
| wavespeed-ai/ | digital-human | $0.075 |
| wavespeed-ai/ | digital-human | $0.15 |
| wavespeed-ai/ | digital-human | $0.075 |
| wavespeed-ai/ | digital-human | $0.075 |
| wavespeed-ai/ | digital-human | $0.15 |
| wavespeed-ai/ | digital-human | $0.15 |
| wavespeed-ai/ | digital-human | $0.15 |
API
InfiniteTalk API 호출하기
wavespeed.ai/accesskey에서 API 키를 발급받은 뒤 REST로 prediction을 제출하세요. Playground에서 입력 조합별로 바로 붙여넣을 수 있는 샘플이 생성됩니다.
POSThttps://api.wavespeed.ai/api/v3/wavespeed-ai/infinitetalk
# 1. Submit the prediction.
SUBMIT_RESPONSE=$(curl --silent --show-error --fail-with-body \
-X POST "https://api.wavespeed.ai/api/v3/wavespeed-ai/infinitetalk" \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $WAVESPEED_API_KEY" \
-d '{
"image": "https://interactive-examples.mdn.mozilla.net/media/cc0-images/painted-hand-298-332.jpg",
"audio": "https://interactive-examples.mdn.mozilla.net/media/cc0-audio/t-rex-roar.mp3",
"resolution": "480p"
}')
TASK=$(printf '%s' "$SUBMIT_RESPONSE" | jq 'if has("data") then .data else . end')
PREDICTION_ID=$(printf '%s' "$TASK" | jq -r '.id')
if [ -z "$PREDICTION_ID" ] || [ "$PREDICTION_ID" = "null" ]; then
printf 'Submission response did not contain a prediction id
' >&2
exit 1
fi
RESULT_URL="https://api.wavespeed.ai/api/v3/predictions/$PREDICTION_ID/result"
# 2. Poll until the prediction finishes.
while true; do
RESPONSE=$(curl --silent --show-error --fail-with-body "$RESULT_URL" \
-H "Authorization: Bearer $WAVESPEED_API_KEY")
RESULT=$(printf '%s' "$RESPONSE" | jq 'if has("data") then .data else . end')
STATUS=$(printf '%s' "$RESULT" | jq -r '.status')
case "$STATUS" in
completed) printf '%s\n' "$RESULT" | jq '.outputs'; break ;;
failed|cancelled|timeout|deleted) printf '%s\n' "$RESULT" | jq . >&2; exit 1 ;;
*) sleep 2 ;;
esac
doneconst submitUrl = "https://api.wavespeed.ai/api/v3/wavespeed-ai/infinitetalk";
const apiKey = process.env.WAVESPEED_API_KEY;
if (!apiKey) throw new Error('Set WAVESPEED_API_KEY');
async function requestJson(url, options = {}) {
const response = await fetch(url, options);
if (!response.ok) throw new Error(await response.text());
return response.json();
}
// 1. Submit the prediction.
const body = await requestJson(submitUrl, {
method: "POST",
headers: {
"Authorization": `Bearer ${apiKey}`,
"Content-Type": "application/json",
},
body: JSON.stringify({
"image": "https://interactive-examples.mdn.mozilla.net/media/cc0-images/painted-hand-298-332.jpg",
"audio": "https://interactive-examples.mdn.mozilla.net/media/cc0-audio/t-rex-roar.mp3",
"resolution": "480p"
}),
});
const task = body.data ?? body;
const resultUrl = `https://api.wavespeed.ai/api/v3/predictions/${task.id}/result`;
// 2. Poll until the prediction finishes.
while (true) {
const resultBody = await requestJson(resultUrl, {
headers: { "Authorization": `Bearer ${apiKey}` },
});
const result = resultBody.data ?? resultBody;
if (result.status === "completed") {
console.log(result.outputs);
break;
}
if (["failed", "cancelled", "timeout", "deleted"].includes(result.status)) throw new Error(JSON.stringify(result));
await new Promise(resolve => setTimeout(resolve, 2000));
}import json
import os
import time
from urllib.request import Request, urlopen
api_key = os.environ["WAVESPEED_API_KEY"]
headers = {"Authorization": f"Bearer {api_key}", "Content-Type": "application/json"}
payload = {
"image": "https://interactive-examples.mdn.mozilla.net/media/cc0-images/painted-hand-298-332.jpg",
"audio": "https://interactive-examples.mdn.mozilla.net/media/cc0-audio/t-rex-roar.mp3",
"resolution": "480p"
}
def request_json(url, data=None):
request = Request(url, data=data, headers=headers, method="POST" if data else "GET")
with urlopen(request) as response:
return json.load(response)
# 1. Submit the prediction.
body = request_json("https://api.wavespeed.ai/api/v3/wavespeed-ai/infinitetalk", json.dumps(payload).encode())
task = body.get("data", body)
result_url = f"https://api.wavespeed.ai/api/v3/predictions/{task['id']}/result"
# 2. Poll until the prediction finishes.
while True:
result_body = request_json(result_url)
result = result_body.get("data", result_body)
status = result.get("status")
if status == "completed":
print(result.get("outputs", []))
break
if status in {"failed", "cancelled", "timeout", "deleted"}:
raise RuntimeError(result)
time.sleep(2)비교
InfiniteTalk vs 대안
비슷한 WaveSpeedAI 모델과 비교한 InfiniteTalk의 선택 기준.
InfiniteTalk vs Wan 2.2 Speech-to-Video
Wan 2.2 Speech-to-Video(wavespeed-ai/wan-2.2/speech-to-video)는 480p에서 최대 10분 클립을 지원하며, 최대 길이는 InfiniteTalk과 같습니다. InfiniteTalk은 Wan 2.2가 별도 엔드포인트로 제공하지 않는 Multi 변형(오디오 두 개), Video-to-Video, Fast 등급을 추가합니다.
InfiniteTalk vs Stock avatar tools
스톡 아바타 도구(HeyGen 방식)는 미리 학습된 큐레이션 아바타 라이브러리로 제한됩니다. InfiniteTalk은 브랜드 마스코트, AI가 생성한 캐릭터, 일러스트 진행자 등 어떤 캐릭터 이미지든 캐릭터별 설정 없이 받으며, 말하기뿐 아니라 노래도 지원합니다.
InfiniteTalk vs ElevenLabs voice tools
ElevenLabs는 음성(생성, 클로닝, 다국어 TTS)을 담당합니다. InfiniteTalk은 비디오 레이어입니다. ElevenLabs 보이스오버를 캐릭터 이미지(또는 기존 비디오)와 짝지어 립싱크가 완성된 비디오를 만드세요.
FAQ
InfiniteTalk API — 자주 묻는 질문
가격, 라이선스, 연동 — WaveSpeedAI에서 InfiniteTalk 실행에 관한 자주 묻는 질문.
InfiniteTalk API란 무엇인가요?
InfiniteTalk — WaveSpeedAI에서 REST API로 제공되는 WaveSpeedAI의 비디오 생성 모델입니다. WaveSpeedAI InfiniteTalk — 사진 한 장과 오디오로 말하거나 노래하는 아바타 비디오를 최대 10분까지 만듭니다. Standard와 Fast 등급, Multi 변형(이미지 한 장 + 오디오 두 개로 다중 캐릭터 출력), Video-to-Video 변형(기존 비디오를 새 오디오로 구동)을 제공합니다. 프로그래밍 방식으로 호출하거나 위에 링크된 Playground에서 체험해 볼 수 있습니다.
InfiniteTalk API는 어떻게 호출하나요?
WaveSpeedAI 계정을 만들고 /accesskey에서 API 키를 복사한 뒤, 입력을 JSON으로 https://api.wavespeed.ai/api/v3/wavespeed-ai/infinitetalk에 POST하세요. 엔드포인트가 prediction id를 반환합니다. 결과 엔드포인트 폴링은 약 2초마다 시작하고, 오래 걸리는 작업은 간격을 늘리며, 종료 status가 나오면 중단하세요. 운영 환경용 Python / Node.js / cURL 예시는 위에 있습니다.
InfiniteTalk API 요금은 얼마인가요?
InfiniteTalk의 가격은 회당 $0.075부터입니다. 정확한 비용은 설정한 파라미터(해상도, 길이, 출력 수, 레퍼런스)에 따라 달라집니다. Playground의 생성 버튼 옆 실시간 비용 미리보기에서 현재 입력 기준의 정확한 가격을 확인할 수 있습니다.
InfiniteTalk에는 어떤 변형이 있나요?
WaveSpeedAI에는 라이브 InfiniteTalk 엔드포인트가 8개 있습니다: wavespeed-ai/infinitetalk-fast/video-to-video-multi, wavespeed-ai/infinitetalk-fast/video-to-video, wavespeed-ai/infinitetalk/video-to-video-multi, wavespeed-ai/infinitetalk-fast/multi, wavespeed-ai/infinitetalk-fast, wavespeed-ai/infinitetalk/video-to-video, wavespeed-ai/infinitetalk, wavespeed-ai/infinitetalk/multi. 각 변형에는 고유한 Playground 페이지와 가격이 있습니다.
InfiniteTalk 출력물을 상업적으로 사용할 수 있나요?
상업적 사용 권한은 WaveSpeedAI 모델 라이선스를 따릅니다. 대부분의 WaveSpeedAI 모델은 출력물의 상업적 사용을 허용합니다. 구체적인 라이선스 요약은 각 모델의 Playground 페이지를, 플랫폼 수준의 조건은 WaveSpeedAI 이용약관을 참고하세요.
직접 연동하지 않고 WaveSpeedAI에서 InfiniteTalk 모델을 사용하는 이유는 무엇인가요?
API 키 하나와 결제 계정 하나로 InfiniteTalk 모델과 다른 제공사의 1,000개 이상의 AI 모델을 모두 사용합니다. 벤더별 SDK 설정도, 별도의 요청 한도 체계도, 벤더마다 연동 코드를 다시 쓸 일도 없습니다. 가격은 대체로 WaveSpeedAI의 직접 API와 같거나 더 저렴합니다.
제공사
WaveSpeedAI 소개
WaveSpeedAI의 InfiniteTalk 및 WaveSpeedAI 전체 모델 라인업을 만든 팀.
WaveSpeedAI는 ByteDance, Google, OpenAI, Alibaba, Kuaishou, ElevenLabs를 비롯한 모든 주요 제공업체와 수십 개의 독립 연구소가 만든 1,000개 이상의 AI 모델을 하나의 API 키, 하나의 결제 계정, 하나의 속도 제한 범위로 호스팅하는 추론 플랫폼을 운영합니다. 또한 프로덕션 파이프라인에 맞춰 조정된 자체 모델(이미지 / 비디오 업스케일러, 워터마크 제거, Animate, InfiniteTalk)도 제공합니다.
WaveSpeedAI에서 InfiniteTalk 시작하기
가입 시 무료 스타터 크레딧 제공. WaveSpeedAI 및 다른 모든 제공사의 1,000개 이상 AI 모델을 API 키 하나로.