Vidu Q4 API
Vidu Q4 de Shengshu: imagen a vídeo y referencia a vídeo con clips de 3 a 16 segundos, salida de 540p a 4K y audio generado opcional. Referencia a vídeo admite hasta 12 imágenes de referencia y hasta 3 clips de audio de referencia en una sola solicitud.
Dos endpoints: vidu/q4-preview/image-to-video anima una sola imagen, y vidu/q4-preview/reference-to-video construye una escena a partir de un prompt más hasta 12 imágenes de referencia y 3 clips de audio de referencia. Ambos admiten cualquier duración en segundos enteros de 3 a 16, cinco resoluciones de 540p a 4K y un interruptor de audio.
Resumen
Acerca de Vidu Q4 API
Qué hace Vidu Q4, cómo encaja en la gama de modelos de Shengshu y por qué los equipos lo eligen.
Vidu Q4 es un modelo de generación de vídeo de Shengshu, disponible a través de la API REST de WaveSpeedAI. Vidu Q4 de Shengshu: imagen a vídeo y referencia a vídeo con clips de 3 a 16 segundos, salida de 540p a 4K y audio generado opcional. Referencia a vídeo admite hasta 12 imágenes de referencia y hasta 3 clips de audio de referencia en una sola solicitud.
Dos endpoints: vidu/q4-preview/image-to-video anima una sola imagen, y vidu/q4-preview/reference-to-video construye una escena a partir de un prompt más hasta 12 imágenes de referencia y 3 clips de audio de referencia. Ambos admiten cualquier duración en segundos enteros de 3 a 16, cinco resoluciones de 540p a 4K y un interruptor de audio.
La familia Vidu Q4 en WaveSpeedAI incluye 2 endpoints REST que cubren los flujos de trabajo de Reference-To-Video, Image-To-Video. Cada variante tiene su propio precio, parámetros y ejemplos de resultados: elige la que se ajuste a tu modalidad de entrada y a tus requisitos de producción, o llama a varias con la misma clave de API para componer flujos de varios pasos.
Ejecuta Vidu Q4 con la misma clave de API, la misma cuenta de facturación y los mismos límites de uso que ya usas para los demás más de 1.000 modelos de IA de WaveSpeedAI. Sin configuración aparte por proveedor, sin SDK por proveedor, sin límites de uso distintos por proveedor: una sola integración lo cubre todo, desde texto a imagen y texto a vídeo hasta síntesis de audio, generación 3D, escalado y edición.
Especificaciones
Capacidades y estado de lanzamiento de Vidu Q4 API
Los detalles específicos del modelo que los desarrolladores buscan antes de elegir una API: disponibilidad, duración esperada del resultado, compatibilidad con referencias y la alternativa en producción actual.
Endpoints
2 variantes
Imagen a vídeo y referencia a vídeo.
Duración
3-16 s
Cualquier número entero de segundos; 5 s por defecto.
Resolución
De 540p a 4K
540p, 720p, 1080p, 2K, 4K; 720p por defecto.
Referencias
12 imágenes + 3 audios
En referencia a vídeo, junto con un prompt de texto.
Endpoints
Todos los endpoints de la API de Vidu Q4
2 endpoints de Vidu Q4 disponibles ahora en WaveSpeedAI: elige la variante que se ajuste a tu flujo de trabajo.
/filters:quality(82)/media/images/1790656175314160249_JiSjQ9AW.webp)
Q4 Preview Reference To Video
Vidu Q4 Reference-to-Video generates subject-consistent AI videos from text prompts, 1-12 reference images, and up to 3 reference audio clips, supporting character consistency, product videos, social content, brand assets, and reference-guided storytelling workflows. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/1790656159881988529_32y4wP0a.webp)
Q4 Preview Image To Video
Vidu Q4 Image-to-Video animates a single reference image into high-quality AI video with prompt-guided motion, optional audio, 3-16 second duration, and output resolutions from 540P to 4K for product animation, social content, marketing creatives, cinematic visuals, and production workflows. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
Ejemplos
Mira Vidu Q4 en acción
Resultados reales generados con la API de Vidu Q4. Pasa el cursor sobre cualquier vídeo para previsualizarlo y haz clic para abrir el visor a tamaño completo.
Cómo empezar
Cómo usar la API de Vidu Q4
Cuatro pasos desde el registro hasta una generación terminada. Encontrarás ejemplos completos en Python, Node.js y cURL en la sección de API más abajo.
- 01
Obtén una clave de API
Regístrate en WaveSpeedAI y copia tu clave de API desde el panel. Las cuentas nuevas incluyen créditos gratuitos para empezar: suficientes para usar el playground unas decenas de veces antes de que empiece la facturación.
- 02
Envía una predicción
Haz POST de tu entrada como JSON a https://api.wavespeed.ai/api/v3/vidu/q4-preview/image-to-video. El endpoint devuelve un id de predicción de inmediato: las generaciones son asíncronas, así que no mantienes una conexión abierta durante la inferencia.
- 03
Consulta hasta que termine
Haz GET a https://api.wavespeed.ai/api/v3/predictions/{request_id}/result. Devuelve los resultados con completed; detente con un error en failed, cancelled, timeout o deleted; sigue consultando con cualquier otro estado.
- 04
Lee la URL del resultado
Cuando status sea "completed", lee la URL de data.outputs[0]. La URL apunta a tu contenido generado en la CDN de WaveSpeedAI: imagen, vídeo, audio o archivo 3D según la variante de Vidu Q4 que hayas llamado.
Casos de uso
Qué puedes crear con Vidu Q4
Flujos de trabajo habituales para los que desarrolladores y creadores usan la API de Vidu Q4.
Animación de producto a partir de una foto
vidu/q4-preview/image-to-video convierte una sola foto de producto en un clip promocional. Describe el movimiento de cámara y la acción que quieres; la imagen sigue siendo el ancla visual.
Personajes que no pierden su identidad
vidu/q4-preview/reference-to-video acepta hasta 12 imágenes de referencia, así que un personaje recurrente, una mascota o un portavoz puede mostrarse desde varios ángulos y seguir siendo reconocible de un clip a otro.
Escenas guiadas por el sonido
Añade hasta 3 clips de audio de referencia mediante el campo audios junto a tus imágenes, y deja generate_audio activado para obtener un clip con sonido en una sola llamada.
4K listo para entregar
Ambos endpoints generan en 540p, 720p, 1080p, 2K o 4K. Haz los borradores en 540p o 720p y vuelve a ejecutar el prompt aprobado en la resolución de entrega, sin pasar por un escalado aparte.
Clips con la duración justa
La duración es cualquier número entero de segundos de 3 a 16, de modo que un loop de 3 segundos, un bumper de 6 segundos y un spot de 15 segundos salen del mismo endpoint.
Consejos
Consejos para escribir prompts en Vidu Q4
Consejos prácticos para obtener mejores resultados con Vidu Q4, basados en los patrones que funcionan en modelos de vídeo en flujos de producción.
- 01
Usa una imagen de origen limpia y bien iluminada
En vidu/q4-preview/image-to-video, la imagen define el sujeto, el encuadre y el estilo. Elige una imagen nítida con un único sujeto claro y usa el prompt para el movimiento y la dirección de cámara, en lugar de volver a describir lo que ya se ve.
- 02
Dale a cada referencia una función
Con vidu/q4-preview/reference-to-video, usa referencias que pertenezcan a la escena (el personaje, el producto, el escenario) e indica en el prompt cómo debe aparecer cada una, en lugar de enviar imágenes poco relacionadas.
- 03
Ajusta la acción a la duración
Pide una cantidad de acción acorde a la duración del clip. Un clip de 3 a 5 segundos va bien para un movimiento o gesto; reserva las acciones de varios pasos para 10 a 16 segundos.
- 04
Borradores en baja, entrega en alta
Explora ideas en 540p o 720p con duraciones cortas y luego vuelve a ejecutar el prompt elegido en 1080p, 2K o 4K para la entrega.
- 05
Decide de antemano el audio y la reescritura del prompt
generate_audio está activado por defecto; desactívalo si vas a añadir tu propia banda sonora. En imagen a vídeo, pon enable_prompt_expansion en false si quieres que tu prompt se use tal cual.
Precios
Precios de la API de Vidu Q4
El precio es por resultado. El cargo final depende de los parámetros que definas en el playground de cada variante (resolución, duración, número de resultados, referencias).
| Endpoint | Tipo | Precio inicial |
|---|---|---|
| vidu/ | reference-to-video | $0.25 |
| vidu/ | image-to-video | $0.25 |
API
Llama a la API de Vidu Q4
Obtén una clave de API en wavespeed.ai/accesskey y envía una predicción por REST. El playground genera ejemplos listos para pegar con cualquier combinación de entradas.
POSThttps://api.wavespeed.ai/api/v3/vidu/q4-preview/image-to-video
# 1. Submit the prediction.
SUBMIT_RESPONSE=$(curl --silent --show-error --fail-with-body \
-X POST "https://api.wavespeed.ai/api/v3/vidu/q4-preview/image-to-video" \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $WAVESPEED_API_KEY" \
-d '{
"prompt": "A cinematic shot of a city at sunset, soft golden light",
"image": "https://interactive-examples.mdn.mozilla.net/media/cc0-images/painted-hand-298-332.jpg",
"resolution": "720p",
"duration": 5,
"enable_prompt_expansion": true,
"generate_audio": true
}')
TASK=$(printf '%s' "$SUBMIT_RESPONSE" | jq 'if has("data") then .data else . end')
PREDICTION_ID=$(printf '%s' "$TASK" | jq -r '.id')
if [ -z "$PREDICTION_ID" ] || [ "$PREDICTION_ID" = "null" ]; then
printf 'Submission response did not contain a prediction id
' >&2
exit 1
fi
RESULT_URL="https://api.wavespeed.ai/api/v3/predictions/$PREDICTION_ID/result"
# 2. Poll until the prediction finishes.
while true; do
RESPONSE=$(curl --silent --show-error --fail-with-body "$RESULT_URL" \
-H "Authorization: Bearer $WAVESPEED_API_KEY")
RESULT=$(printf '%s' "$RESPONSE" | jq 'if has("data") then .data else . end')
STATUS=$(printf '%s' "$RESULT" | jq -r '.status')
case "$STATUS" in
completed) printf '%s\n' "$RESULT" | jq '.outputs'; break ;;
failed|cancelled|timeout|deleted) printf '%s\n' "$RESULT" | jq . >&2; exit 1 ;;
*) sleep 2 ;;
esac
doneconst submitUrl = "https://api.wavespeed.ai/api/v3/vidu/q4-preview/image-to-video";
const apiKey = process.env.WAVESPEED_API_KEY;
if (!apiKey) throw new Error('Set WAVESPEED_API_KEY');
async function requestJson(url, options = {}) {
const response = await fetch(url, options);
if (!response.ok) throw new Error(await response.text());
return response.json();
}
// 1. Submit the prediction.
const body = await requestJson(submitUrl, {
method: "POST",
headers: {
"Authorization": `Bearer ${apiKey}`,
"Content-Type": "application/json",
},
body: JSON.stringify({
"prompt": "A cinematic shot of a city at sunset, soft golden light",
"image": "https://interactive-examples.mdn.mozilla.net/media/cc0-images/painted-hand-298-332.jpg",
"resolution": "720p",
"duration": 5,
"enable_prompt_expansion": true,
"generate_audio": true
}),
});
const task = body.data ?? body;
const resultUrl = `https://api.wavespeed.ai/api/v3/predictions/${task.id}/result`;
// 2. Poll until the prediction finishes.
while (true) {
const resultBody = await requestJson(resultUrl, {
headers: { "Authorization": `Bearer ${apiKey}` },
});
const result = resultBody.data ?? resultBody;
if (result.status === "completed") {
console.log(result.outputs);
break;
}
if (["failed", "cancelled", "timeout", "deleted"].includes(result.status)) throw new Error(JSON.stringify(result));
await new Promise(resolve => setTimeout(resolve, 2000));
}import json
import os
import time
from urllib.request import Request, urlopen
api_key = os.environ["WAVESPEED_API_KEY"]
headers = {"Authorization": f"Bearer {api_key}", "Content-Type": "application/json"}
payload = {
"prompt": "A cinematic shot of a city at sunset, soft golden light",
"image": "https://interactive-examples.mdn.mozilla.net/media/cc0-images/painted-hand-298-332.jpg",
"resolution": "720p",
"duration": 5,
"enable_prompt_expansion": True,
"generate_audio": True
}
def request_json(url, data=None):
request = Request(url, data=data, headers=headers, method="POST" if data else "GET")
with urlopen(request) as response:
return json.load(response)
# 1. Submit the prediction.
body = request_json("https://api.wavespeed.ai/api/v3/vidu/q4-preview/image-to-video", json.dumps(payload).encode())
task = body.get("data", body)
result_url = f"https://api.wavespeed.ai/api/v3/predictions/{task['id']}/result"
# 2. Poll until the prediction finishes.
while True:
result_body = request_json(result_url)
result = result_body.get("data", result_body)
status = result.get("status")
if status == "completed":
print(result.get("outputs", []))
break
if status in {"failed", "cancelled", "timeout", "deleted"}:
raise RuntimeError(result)
time.sleep(2)Comparar
Vidu Q4 frente a las alternativas
Cuándo elegir Vidu Q4 en lugar de modelos similares en WaveSpeedAI.
Vidu Q4 frente a Vidu Q3
Referencia a vídeo de Vidu Q3 admite de 1 a 4 imágenes de referencia; Q4 admite hasta 12 imágenes más hasta 3 referencias de audio, y ambos endpoints de Q4 llegan a 4K. Q3 sigue siendo la opción para texto a vídeo, la interpolación de fotogramas clave inicio-fin y sus niveles Pro y Turbo.
Vidu Q4 frente a Seedance 2.5
Seedance 2.5 llega a tomas únicas de hasta 30 segundos y añade endpoints de edición y extensión de vídeo. Vidu Q4 se centra en la generación a partir de imágenes y referencias, con salida de hasta 4K.
Vidu Q4 frente a Wan 3.0
Wan 3.0 ofrece texto, imagen y referencia a vídeo de hasta 30 segundos con hasta 1080p. Vidu Q4 llega como máximo a 16 segundos, pero añade salida en 2K y 4K y hasta 12 imágenes de referencia.
Preguntas frecuentes
Vidu Q4 API — Preguntas frecuentes
Precios, licencia, integración: preguntas habituales sobre cómo ejecutar Vidu Q4 en WaveSpeedAI.
¿Qué es la API de Vidu Q4?
Vidu Q4 es un modelo de generación de vídeo de Shengshu expuesto como API REST en WaveSpeedAI. Vidu Q4 de Shengshu: imagen a vídeo y referencia a vídeo con clips de 3 a 16 segundos, salida de 540p a 4K y audio generado opcional. Referencia a vídeo admite hasta 12 imágenes de referencia y hasta 3 clips de audio de referencia en una sola solicitud. Puedes llamarlo por programación o probarlo desde el playground enlazado arriba.
¿Cómo llamo a la API de Vidu Q4?
Regístrate en WaveSpeedAI, copia tu clave de API desde /accesskey y haz POST a https://api.wavespeed.ai/api/v3/vidu/q4-preview/image-to-video con tu entrada como JSON. El endpoint devuelve un id de predicción. Consulta el endpoint de resultados aproximadamente cada 2 segundos, aumenta el intervalo en las tareas largas y detente ante cualquier estado final. Arriba tienes ejemplos en Python / Node.js / cURL orientados a producción.
¿Cuánto cuesta la API de Vidu Q4?
Vidu Q4 empieza en $0.25 por ejecución. El coste exacto depende de los parámetros que definas (resolución, duración, número de resultados, referencias). La vista previa del coste en tiempo real junto al botón Generar del playground muestra el precio exacto de tu entrada actual.
¿Qué variantes de Vidu Q4 hay disponibles?
WaveSpeedAI aloja 2 endpoints de Vidu Q4 en producción: vidu/q4-preview/reference-to-video, vidu/q4-preview/image-to-video. Cada variante tiene su propia página de playground y sus propios precios.
¿Puedo usar comercialmente los resultados de Vidu Q4?
Los derechos de uso comercial dependen de la licencia del modelo de Shengshu. La mayoría de los modelos de Shengshu permiten el uso comercial de los resultados; consulta la página del playground de cada modelo para ver el resumen de su licencia y los Términos del servicio de WaveSpeedAI para las condiciones de la plataforma.
¿Por qué usar Vidu Q4 en WaveSpeedAI en lugar de ir directamente al proveedor?
Una sola clave de API y una sola cuenta de facturación para Vidu Q4 Y más de 1.000 modelos de IA de otros proveedores. Sin configurar un SDK por proveedor, sin límites de uso aparte y sin reescribir el código de integración para cada proveedor. Los precios suelen ser iguales o inferiores a los de la API directa de Shengshu.
Proveedor
Acerca de Shengshu
El equipo detrás de Vidu Q4 y de la gama más amplia de modelos de Shengshu en WaveSpeedAI.
Shengshu Technology es un laboratorio de IA chino surgido de la Universidad de Tsinghua, detrás de la familia de modelos de generación de vídeo Vidu. Vidu Q4, la generación más reciente, incorpora imagen a vídeo y referencia a vídeo con hasta 12 imágenes de referencia, hasta 3 clips de audio de referencia y salida de hasta 4K. Vidu Q3 ofrece texto a vídeo, imagen a vídeo, referencia a vídeo (de 1 a 4 imágenes de referencia para consistencia de varias entidades) y start-end-to-video (interpolación de fotogramas clave entre dos imágenes fijas) en los niveles Standard, Pro y Turbo. Algunas variantes admiten salidas de hasta 16 segundos.
Empieza a crear con Vidu Q4 en WaveSpeedAI
Créditos gratuitos al registrarte. Una sola clave de API para más de 1.000 modelos de IA de Shengshu y de todos los demás proveedores.