Vidu Q4 API
Shengshu の Vidu Q4 は、画像から動画とリファレンスから動画に対応し、3〜16秒のクリップ、540p〜4Kの出力、オプションの音声生成を備えています。リファレンスから動画では、1回のリクエストで最大12枚の参照画像と最大3本の参照オーディオを使えます。
エンドポイントは2つ。vidu/q4-preview/image-to-video は1枚の画像を動かし、vidu/q4-preview/reference-to-video はプロンプトと最大12枚の参照画像、3本の参照オーディオからシーンを組み立てます。どちらも3〜16秒の任意の整数秒の長さ、540p〜4Kの5段階の解像度、音声のオン/オフに対応しています。
概要
Vidu Q4 APIについて
Vidu Q4でできること、Shengshuのモデルラインナップにおける位置づけ、そして多くのチームに選ばれる理由。
Vidu Q4はShengshuの動画生成モデルで、WaveSpeedAIのREST APIから利用できます。Shengshu の Vidu Q4 は、画像から動画とリファレンスから動画に対応し、3〜16秒のクリップ、540p〜4Kの出力、オプションの音声生成を備えています。リファレンスから動画では、1回のリクエストで最大12枚の参照画像と最大3本の参照オーディオを使えます。
エンドポイントは2つ。vidu/q4-preview/image-to-video は1枚の画像を動かし、vidu/q4-preview/reference-to-video はプロンプトと最大12枚の参照画像、3本の参照オーディオからシーンを組み立てます。どちらも3〜16秒の任意の整数秒の長さ、540p〜4Kの5段階の解像度、音声のオン/オフに対応しています。
WaveSpeedAIのVidu Q4ファミリーには、Reference-To-Video, Image-To-Videoのワークフローをカバーする2個のRESTエンドポイントがあります。各バリアントには、それぞれ独自の料金、パラメーター、作例があります。入力の種類と本番環境の制約に合うものを選ぶか、同じAPIキーで複数を呼び出して、多段階のパイプラインを組み立ててください。
WaveSpeedAIの他の1,000以上のAIモデルと同じAPIキー、請求アカウント、レート制限の枠組みでVidu Q4を実行できます。ベンダーごとの設定も、プロバイダーごとのSDKも、ベンダーごとのレート制限も不要です。1つの連携で、テキストから画像、テキストから動画から、音声合成、3D生成、高画質化、編集まで、すべてカバーできます。
仕様
Vidu Q4 APIの機能とリリース状況
APIを選ぶ前に開発者が調べる、モデル固有の詳細情報:提供状況、想定される出力の長さ、参照入力への対応、そして現在利用できる代替エンドポイント。
エンドポイント
2つのバリアント
画像から動画とリファレンスから動画。
長さ
3〜16秒
任意の整数秒。デフォルトは5秒です。
解像度
540p〜4K
540p、720p、1080p、2K、4K。デフォルトは720pです。
参照素材
画像12枚 + オーディオ3本
リファレンスから動画で、テキストプロンプトと一緒に使えます。
エンドポイント
Vidu Q4のAPIエンドポイント一覧
WaveSpeedAIで現在利用可能なVidu Q4のエンドポイントは2個です。ワークフローに合ったバリアントを選んでください。
/filters:quality(82)/media/images/1790656175314160249_JiSjQ9AW.webp)
Q4 Preview Reference To Video
Vidu Q4 Reference-to-Video generates subject-consistent AI videos from text prompts, 1-12 reference images, and up to 3 reference audio clips, supporting character consistency, product videos, social content, brand assets, and reference-guided storytelling workflows. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/1790656159881988529_32y4wP0a.webp)
Q4 Preview Image To Video
Vidu Q4 Image-to-Video animates a single reference image into high-quality AI video with prompt-guided motion, optional audio, 3-16 second duration, and output resolutions from 540P to 4K for product animation, social content, marketing creatives, cinematic visuals, and production workflows. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
作例
Vidu Q4の実力を見る
Vidu Q4 APIで実際に生成された出力です。動画にカーソルを合わせるとプレビュー、クリックすると原寸のビューアで開きます。
使い方
Vidu Q4 APIの使い方
登録から生成完了まで4ステップ。Python、Node.js、cURLの完全なサンプルは、下のAPIセクションにあります。
- 01
APIキーを取得
WaveSpeedAIのアカウントに登録し、ダッシュボードからAPIキーをコピーします。新規アカウントには無料のスタータークレジットが付くので、課金が始まる前にプレイグラウンドを数十回実行できます。
- 02
予測を送信
入力をJSONとしてhttps://api.wavespeed.ai/api/v3/vidu/q4-preview/image-to-videoにPOSTします。エンドポイントはすぐに予測IDを返します。生成は非同期なので、推論中に接続を開いたままにする必要はありません。
- 03
完了までポーリング
https://api.wavespeed.ai/api/v3/predictions/{request_id}/resultにGETします。completedなら出力を返し、failed、cancelled、timeout、deletedならエラーで停止し、それ以外のステータスの間はポーリングを続けます。
- 04
出力URLを読み取る
ステータスが"completed"になったら、data.outputs[0]からURLを読み取ります。URLは、WaveSpeedAIのCDN上にある生成されたメディアを指します。呼び出したVidu Q4のバリアントに応じて、画像、動画、音声、3Dファイルのいずれかです。
活用例
Vidu Q4で作れるもの
開発者やクリエイターがVidu Q4 APIでよく使うワークフロー。
1枚の写真から商品アニメーション
vidu/q4-preview/image-to-video は、1枚の商品写真をプロモーション用のクリップに変えます。カメラワークと動きを指示するだけで、画像がビジュアルの軸として保たれます。
キャラクターの見た目を崩さない
vidu/q4-preview/reference-to-video は最大12枚の参照画像を受け付けるため、繰り返し登場するキャラクター、マスコット、スポークスパーソンを複数の角度から示し、クリップをまたいでも一目でわかる姿を保てます。
サウンドで導くシーン
audios フィールドで画像と一緒に最大3本の参照オーディオを追加し、generate_audio をオンにしておけば、1回の呼び出しで音付きのクリップが得られます。
そのまま納品できる4K
どちらのエンドポイントも540p、720p、1080p、2K、4Kで出力できます。540pや720pで下書きし、承認されたプロンプトを納品解像度で再実行すれば、別途アップスケールの工程は不要です。
あらゆるSNSフォーマットに
リファレンスから動画は16:9、9:16、1:1、3:4、4:3で出力でき、同じ参照素材から YouTube、Reels、Shorts、フィード投稿、商品ページまでカバーします。
ビートに合わせた尺
長さは3〜16秒の任意の整数秒。3秒のループ、6秒のバンパー、15秒のスポットを、すべて同じエンドポイントから作れます。
コツ
Vidu Q4のプロンプトのコツ
Vidu Q4からより良い出力を得るための実践的なアドバイス。本番のパイプラインで動画モデル全般に通用するパターンに基づいています。
- 01
鮮明で明るいソース画像を使う
vidu/q4-preview/image-to-video では、画像が被写体、構図、スタイルを決めます。被写体がひとつに定まったシャープな画像を選び、すでに写っている内容を説明し直すのではなく、プロンプトでは動きとカメラワークを指示しましょう。
- 02
参照素材ごとに役割を与える
vidu/q4-preview/reference-to-video では、キャラクター、商品、舞台など、シーンに本当に必要な参照素材を使い、それぞれをどう登場させるかをプロンプトで指示しましょう。関連の薄い画像をまとめて送るのは避けてください。
- 03
動きの量を尺に合わせる
クリップの長さに見合った量の動きを指示しましょう。3〜5秒のクリップならひとつの動作やジェスチャーが適しており、複数ステップの動きは10〜16秒に回しましょう。
- 04
下書きは低解像度、納品は高解像度
540pや720pの短い尺でアイデアを試し、選んだプロンプトを1080p、2K、4Kで再実行して納品しましょう。
- 05
音声とプロンプト書き換えは最初に決める
generate_audio はデフォルトでオンです。自前のサウンドトラックを付ける場合はオフにしましょう。画像から動画では、プロンプトを書いたとおりに使いたい場合、enable_prompt_expansion を false に設定してください。
料金
Vidu Q4 APIの料金
料金は出力ごとです。最終的な請求額は、各バリアントのプレイグラウンドで設定するパラメーター(解像度、長さ、出力数、参照入力)に応じて変わります。
| エンドポイント | タイプ | 最低料金 |
|---|---|---|
| vidu/ | reference-to-video | $0.25 |
| vidu/ | image-to-video | $0.25 |
API
Vidu Q4 APIを呼び出す
wavespeed.ai/accesskeyでAPIキーに登録し、RESTで予測を送信します。プレイグラウンドでは、入力の組み合わせに応じて、そのまま貼り付けられるサンプルが生成されます。
POSThttps://api.wavespeed.ai/api/v3/vidu/q4-preview/image-to-video
# 1. Submit the prediction.
SUBMIT_RESPONSE=$(curl --silent --show-error --fail-with-body \
-X POST "https://api.wavespeed.ai/api/v3/vidu/q4-preview/image-to-video" \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $WAVESPEED_API_KEY" \
-d '{
"prompt": "A cinematic shot of a city at sunset, soft golden light",
"image": "https://interactive-examples.mdn.mozilla.net/media/cc0-images/painted-hand-298-332.jpg",
"resolution": "720p",
"duration": 5,
"enable_prompt_expansion": true,
"generate_audio": true
}')
TASK=$(printf '%s' "$SUBMIT_RESPONSE" | jq 'if has("data") then .data else . end')
PREDICTION_ID=$(printf '%s' "$TASK" | jq -r '.id')
if [ -z "$PREDICTION_ID" ] || [ "$PREDICTION_ID" = "null" ]; then
printf 'Submission response did not contain a prediction id
' >&2
exit 1
fi
RESULT_URL="https://api.wavespeed.ai/api/v3/predictions/$PREDICTION_ID/result"
# 2. Poll until the prediction finishes.
while true; do
RESPONSE=$(curl --silent --show-error --fail-with-body "$RESULT_URL" \
-H "Authorization: Bearer $WAVESPEED_API_KEY")
RESULT=$(printf '%s' "$RESPONSE" | jq 'if has("data") then .data else . end')
STATUS=$(printf '%s' "$RESULT" | jq -r '.status')
case "$STATUS" in
completed) printf '%s\n' "$RESULT" | jq '.outputs'; break ;;
failed|cancelled|timeout|deleted) printf '%s\n' "$RESULT" | jq . >&2; exit 1 ;;
*) sleep 2 ;;
esac
doneconst submitUrl = "https://api.wavespeed.ai/api/v3/vidu/q4-preview/image-to-video";
const apiKey = process.env.WAVESPEED_API_KEY;
if (!apiKey) throw new Error('Set WAVESPEED_API_KEY');
async function requestJson(url, options = {}) {
const response = await fetch(url, options);
if (!response.ok) throw new Error(await response.text());
return response.json();
}
// 1. Submit the prediction.
const body = await requestJson(submitUrl, {
method: "POST",
headers: {
"Authorization": `Bearer ${apiKey}`,
"Content-Type": "application/json",
},
body: JSON.stringify({
"prompt": "A cinematic shot of a city at sunset, soft golden light",
"image": "https://interactive-examples.mdn.mozilla.net/media/cc0-images/painted-hand-298-332.jpg",
"resolution": "720p",
"duration": 5,
"enable_prompt_expansion": true,
"generate_audio": true
}),
});
const task = body.data ?? body;
const resultUrl = `https://api.wavespeed.ai/api/v3/predictions/${task.id}/result`;
// 2. Poll until the prediction finishes.
while (true) {
const resultBody = await requestJson(resultUrl, {
headers: { "Authorization": `Bearer ${apiKey}` },
});
const result = resultBody.data ?? resultBody;
if (result.status === "completed") {
console.log(result.outputs);
break;
}
if (["failed", "cancelled", "timeout", "deleted"].includes(result.status)) throw new Error(JSON.stringify(result));
await new Promise(resolve => setTimeout(resolve, 2000));
}import json
import os
import time
from urllib.request import Request, urlopen
api_key = os.environ["WAVESPEED_API_KEY"]
headers = {"Authorization": f"Bearer {api_key}", "Content-Type": "application/json"}
payload = {
"prompt": "A cinematic shot of a city at sunset, soft golden light",
"image": "https://interactive-examples.mdn.mozilla.net/media/cc0-images/painted-hand-298-332.jpg",
"resolution": "720p",
"duration": 5,
"enable_prompt_expansion": True,
"generate_audio": True
}
def request_json(url, data=None):
request = Request(url, data=data, headers=headers, method="POST" if data else "GET")
with urlopen(request) as response:
return json.load(response)
# 1. Submit the prediction.
body = request_json("https://api.wavespeed.ai/api/v3/vidu/q4-preview/image-to-video", json.dumps(payload).encode())
task = body.get("data", body)
result_url = f"https://api.wavespeed.ai/api/v3/predictions/{task['id']}/result"
# 2. Poll until the prediction finishes.
while True:
result_body = request_json(result_url)
result = result_body.get("data", result_body)
status = result.get("status")
if status == "completed":
print(result.get("outputs", []))
break
if status in {"failed", "cancelled", "timeout", "deleted"}:
raise RuntimeError(result)
time.sleep(2)比較
Vidu Q4と他モデルの比較
WaveSpeedAI上の類似モデルではなくVidu Q4を選ぶべきケース。
Vidu Q4 vs Vidu Q3
Vidu Q3 のリファレンスから動画は1〜4枚の参照画像に対応しますが、Q4 は最大12枚の画像と最大3本の参照オーディオに対応し、Q4 の両エンドポイントは4Kまで出力できます。テキストから動画、開始・終了キーフレームの補間、Pro と Turbo の階層が必要なら、引き続き Q3 が適しています。
Vidu Q4 vs Seedance 2.5
Seedance 2.5 は最長30秒のシングルショットに対応し、動画の編集と延長のエンドポイントも備えています。Vidu Q4 は画像とリファレンスを起点にした生成に特化し、最大4Kで出力します。
Vidu Q4 vs Wan 3.0
Wan 3.0 は、テキスト・画像・リファレンスから動画を、最長30秒、最大1080pで提供します。Vidu Q4 の上限は16秒ですが、2Kと4Kの出力、最大12枚の参照画像に対応しています。
FAQ
Vidu Q4 API — よくある質問
料金、ライセンス、連携など、WaveSpeedAIでVidu Q4を実行する際のよくある質問。
Vidu Q4 APIとは何ですか?
Vidu Q4は、Shengshuの動画生成モデルで、WaveSpeedAI上でREST APIとして提供されています。Shengshu の Vidu Q4 は、画像から動画とリファレンスから動画に対応し、3〜16秒のクリップ、540p〜4Kの出力、オプションの音声生成を備えています。リファレンスから動画では、1回のリクエストで最大12枚の参照画像と最大3本の参照オーディオを使えます。プログラムから呼び出すことも、上にリンクされたプレイグラウンドで試すこともできます。
Vidu Q4 APIはどう呼び出しますか?
WaveSpeedAIのアカウントに登録し、/accesskeyからAPIキーをコピーして、入力をJSONとしてhttps://api.wavespeed.ai/api/v3/vidu/q4-preview/image-to-videoにPOSTします。エンドポイントは予測IDを返します。結果のエンドポイントを約2秒ごとにポーリングし、長時間かかるタスクでは間隔を広げ、終端ステータスになったら停止してください。本番運用向けのPython / Node.js / cURLのサンプルは上にあります。
Vidu Q4 APIの料金はいくらですか?
Vidu Q4は1回あたり$0.25からです。実際の料金は、設定するパラメーター(解像度、長さ、出力数、参照入力)に応じて変わります。プレイグラウンドの「生成」ボタンの横に表示されるリアルタイムの料金プレビューで、現在の入力での正確な料金を確認できます。
Vidu Q4にはどのバリアントがありますか?
WaveSpeedAIでは、2個のVidu Q4エンドポイントが利用可能です:vidu/q4-preview/reference-to-video, vidu/q4-preview/image-to-video。各バリアントには、専用のプレイグラウンドページと料金があります。
Vidu Q4の出力を商用利用できますか?
商用利用の権利は、Shengshuのモデルライセンスに従います。Shengshuのほとんどのモデルは出力の商用利用を認めています。具体的なライセンスの概要は各モデルのプレイグラウンドページで、プラットフォーム全体の条件はWaveSpeedAIの利用規約でご確認ください。
なぜ直接ではなくWaveSpeedAIでVidu Q4を使うのですか?
Vidu Q4と、他のプロバイダーの1,000以上のAIモデルを、1つのAPIキー、1つの請求アカウントで利用できます。ベンダーごとのSDK設定も、個別のレート制限も、ベンダーごとの連携コードの書き直しも不要です。料金は、通常Shengshuの直接のAPIと同等かそれ以下です。
提供元
Shengshuについて
WaveSpeedAIにおけるVidu Q4と、Shengshuのモデルラインナップ全体を手がけるチーム。
Shengshu Technology は、清華大学発の中国のAIラボで、動画生成モデルの Vidu ファミリーを開発しています。最新世代の Vidu Q4 は、最大12枚の参照画像、最大3本の参照オーディオ、最大4Kの出力に対応した、画像から動画とリファレンスから動画を追加しました。Vidu Q3 は、Standard、Pro、Turbo の階層で、テキストから動画、画像から動画、リファレンスから動画(複数の被写体の一貫性のための1〜4枚の参照画像)、start-end-to-video(2枚の静止画の間のキーフレーム補間)を提供します。一部のバリアントは、最長16秒の出力に対応しています。
WaveSpeedAIでVidu Q4を使った開発を始めよう
登録時に無料のスタータークレジットを進呈。Shengshuをはじめ、あらゆるプロバイダーの1,000以上のAIモデルを、1つのAPIキーで。