Qwen Image API
Qwen-Image de Alibaba: conjunto de herramientas de texto a imagen y edición de nueva generación basado en un MMDiT de 20B, con compatibilidad bilingüe chino/inglés, edición de varias imágenes, personalización con LoRA, composición por capas y un sistema de ángulos de cámara de 96 poses.
Texto a imagen en las variantes base, 2512 mejorada y 2.0-pro. Los endpoints de edición incluyen Edit, Edit-Plus (varias imágenes, ControlNet), Edit-LoRA, Edit-Multiple-Angles (sistema de cámara de 96 poses) y Layered (descomposición guiada por prompt). Las variantes de la familia Qwen Image 2.0 se incluyen bajo el mismo prefijo.
/filters:quality(82)/examples/e26b4143e025f71d55e3e5704c446d2b/1783682236366122456_NdT2cmvE.webp)
Resumen
Acerca de Qwen Image API
Qué hace Qwen Image, cómo encaja en la gama de modelos de Alibaba y por qué los equipos lo eligen.
Qwen Image es un modelo de generación y edición de imágenes de Alibaba, disponible a través de la API REST de WaveSpeedAI. Qwen-Image de Alibaba: conjunto de herramientas de texto a imagen y edición de nueva generación basado en un MMDiT de 20B, con compatibilidad bilingüe chino/inglés, edición de varias imágenes, personalización con LoRA, composición por capas y un sistema de ángulos de cámara de 96 poses.
Texto a imagen en las variantes base, 2512 mejorada y 2.0-pro. Los endpoints de edición incluyen Edit, Edit-Plus (varias imágenes, ControlNet), Edit-LoRA, Edit-Multiple-Angles (sistema de cámara de 96 poses) y Layered (descomposición guiada por prompt). Las variantes de la familia Qwen Image 2.0 se incluyen bajo el mismo prefijo.
La familia Qwen Image en WaveSpeedAI incluye 21 endpoints REST que cubren los flujos de trabajo de Image-To-Image, Text-To-Image, Training. Cada variante tiene su propio precio, parámetros y ejemplos de resultados: elige la que se ajuste a tu modalidad de entrada y a tus requisitos de producción, o llama a varias con la misma clave de API para componer flujos de varios pasos.
Ejecuta Qwen Image con la misma clave de API, la misma cuenta de facturación y los mismos límites de uso que ya usas para los demás más de 1.000 modelos de IA de WaveSpeedAI. Sin configuración aparte por proveedor, sin SDK por proveedor, sin límites de uso distintos por proveedor: una sola integración lo cubre todo, desde texto a imagen y texto a vídeo hasta síntesis de audio, generación 3D, escalado y edición.
Endpoints
Todos los endpoints de la API de Qwen Image
21 endpoints de Qwen Image disponibles ahora en WaveSpeedAI: elige la variante que se ajuste a tu flujo de trabajo.
/filters:quality(82)/media/images/20260408110013_8als1nwx.webp)
Qwen Image 2.0 Edit
Qwen Image 2.0 Edit is an advanced image-editing model with improved quality and better understanding of instructions. Up to 2k. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408110922_079iorac.webp)
Qwen Image 2.0 Pro Edit
Qwen Image 2.0 Pro Edit is a professional-grade image editing model with superior quality and advanced instruction understanding. Up to 2k. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408110019_rr2dv7f5.webp)
Qwen Image 2.0 Text To Image
Qwen Image 2.0 is an advanced text-to-image model with enhanced image quality and improved prompt understanding. Up to 2k. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408110930_uej3wr3b.webp)
Qwen Image 2.0 Pro Text To Image
Qwen Image 2.0 Pro is a professional-grade text-to-image model with superior quality and advanced prompt understanding. Up to 2k. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408110201_c4uo1ban.webp)
Qwen Image Edit 2509 Multiple Angles
Qwen Image Edit 2509 Multiple Angles is an AI image editing model that generates multiple-angle views of objects or scenes from a single image. Transform perspectives and create diverse viewpoints with text prompts. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408105730_1fu19xjx.webp)
Qwen Image Max Edit
Qwen Image Max Edit is an AI model for image editing with text prompts, supporting both Chinese and English languages. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408105738_sf8u0u8s.webp)
Qwen Image Max Text To Image
Qwen Image Max is a text-to-image model with high-quality image generation supporting Chinese and English prompts. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408110235_id9bp4jx.webp)
Qwen Image Edit Multiple Angles
Generate specific camera angles from a single image using a 96-pose camera system. Control horizontal rotation, vertical tilt, and zoom to create front, side, back views and more. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408111145_9y1tzzdn.webp)
Qwen Image 2512 Lora Trainer
Qwen-Image-2512 LoRA Trainer lets you train custom LoRA models 10x faster with style, character, and object training. From concept to model in minutes, not hours—upload a ZIP file containing images to start. Ready-to-use REST inference API, best performance, no cold starts, affordable pricing.
/filters:quality(82)/media/images/20260408110225_tzvu0c8q.webp)
Qwen Image Text To Image 2512 Lora
Qwen-Image-2512 LoRA is an enhanced 20B MMDiT text-to-image model with LoRA support for fast customization and refined image generation. Ready-to-use REST inference API, best performance, no cold starts, affordable pricing.
/filters:quality(82)/media/images/20260408110216_pnfbnar4.webp)
Qwen Image Text To Image 2512
Qwen Image 2512 is Qwen's latest text-to-image model with enhanced prompt understanding, superior text rendering, and versatile aspect ratio support. Ready-to-use REST inference API, best performance, no cold starts, affordable pricing.
/filters:quality(82)/media/images/20260408110130_3mxvct8p.webp)
Qwen Image Edit 2511 Lora
Qwen Image Edit 2511 LoRA is an enhanced version with custom LoRA support for personalized styles. It delivers stronger edit consistency, robust multi-person identity/pose consistency, custom LoRA styles, enhanced industrial/product design, and improved geometric reasoning for structure-preserving edits. Built for stable production use with a ready-to-use REST API, no cold starts, and predictable pricing.
/filters:quality(82)/media/images/20260408110155_wmxhc3xt.webp)
Qwen Image Edit 2511
Qwen Image Edit 2511 is a major upgrade over 2509 for real-world image editing and design. It delivers stronger edit consistency, robust multi-person identity/pose consistency, built-in LoRA styles, enhanced industrial/product design, and improved geometric reasoning for structure-preserving edits. Built for stable production use with a ready-to-use REST API, no cold starts, and predictable pricing.
/filters:quality(82)/media/images/20260408110230_htadxp5h.webp)
Qwen Image Layered
Qwen-Image Layered is a unified image-layer decomposition model for prompt-guided compositing. Provide points, boxes, or rough masks to isolate subjects and regions, and the model splits a single image into multiple RGBA layers with clean alpha, soft edges, and correct occlusion order. Ready-to-use REST inference API with fast response, no cold starts, and affordable pricing.
/filters:quality(82)/media/images/20260408110212_z5lpi1m1.webp)
Qwen Image Edit Plus Lora
Qwen-Image-Edit-Plus (2509) is 20B MMDiT image-to-image editor supporting multi-image edits, single-image consistency, and native ControlNet. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408110146_inh26a0l.webp)
Qwen Image Edit Plus
Qwen-Image-Edit-Plus (2509) is a 20B MMDiT image editor with multi-image editing, single-image consistency and native ControlNet support. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408110141_4lrnn2jl.webp)
Qwen Image Edit Lora
Qwen-Image-Edit LoRA (20B) enables bilingual Chinese/English image-to-image editing with style preservation and semantic and appearance edits. Ready-to-use REST API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408110150_zif3ayyb.webp)
Qwen Image Edit
Qwen-Image-Edit is a 20B MMDiT image-to-image model offering precise bilingual (Chinese & English) text edits while preserving style. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408111422_uw2jz93m.webp)
Qwen Image Lora Trainer
Train custom Qwen-Image LoRA models 10x faster. Style training, character training, object training. From concept to model in minutes, not hours. Upload a ZIP file containing images to start!
/filters:quality(82)/media/images/20260408110137_50swwx4z.webp)
Qwen Image Text To Image Lora
Qwen-Image LoRA is a 20B MMDiT next-gen text-to-image model with LoRA support for fast customization and refined image generation. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
/filters:quality(82)/media/images/20260408110208_kl4q8jw4.webp)
Qwen Image Text To Image
Qwen-Image is a 20B MMDiT next-gen text-to-image model that generates images from text prompts. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.
Ejemplos
Mira Qwen Image en acción
Resultados reales generados con la API de Qwen Image. Pasa el cursor sobre cualquier vídeo para previsualizarlo y haz clic para abrir el visor a tamaño completo.
Cómo empezar
Cómo usar la API de Qwen Image
Cuatro pasos desde el registro hasta una generación terminada. Encontrarás ejemplos completos en Python, Node.js y cURL en la sección de API más abajo.
- 01
Obtén una clave de API
Regístrate en WaveSpeedAI y copia tu clave de API desde el panel. Las cuentas nuevas incluyen créditos gratuitos para empezar: suficientes para usar el playground unas decenas de veces antes de que empiece la facturación.
- 02
Envía una predicción
Haz POST de tu entrada como JSON a https://api.wavespeed.ai/api/v3/wavespeed-ai/qwen-image/text-to-image. El endpoint devuelve un id de predicción de inmediato: las generaciones son asíncronas, así que no mantienes una conexión abierta durante la inferencia.
- 03
Consulta hasta que termine
Haz GET a https://api.wavespeed.ai/api/v3/predictions/{request_id}/result. Devuelve los resultados con completed; detente con un error en failed, cancelled, timeout o deleted; sigue consultando con cualquier otro estado.
- 04
Lee la URL del resultado
Cuando status sea "completed", lee la URL de data.outputs[0]. La URL apunta a tu contenido generado en la CDN de WaveSpeedAI: imagen, vídeo, audio o archivo 3D según la variante de Qwen Image que hayas llamado.
Casos de uso
Qué puedes crear con Qwen Image
Flujos de trabajo habituales para los que desarrolladores y creadores usan la API de Qwen Image.
Texto a imagen con MMDiT de 20B
wavespeed-ai/qwen-image/text-to-image es un modelo de texto a imagen de nueva generación MMDiT de 20B que genera imágenes a partir de prompts de texto: el endpoint de generación base de la familia Qwen Image.
2512 mejorada con un renderizado de texto superior
wavespeed-ai/qwen-image/text-to-image-2512 es el último modelo de texto a imagen de Qwen, con mejor comprensión del prompt, un renderizado de texto superior y compatibilidad con relaciones de aspecto versátiles, según el catálogo.
Edición de varias imágenes con Edit-Plus
wavespeed-ai/qwen-image/edit-plus es un editor MMDiT de 20B con edición de varias imágenes, consistencia de una sola imagen y compatibilidad nativa con ControlNet; útil para ediciones complejas que toman como referencia varias imágenes de origen.
Control de ángulos de cámara de 96 poses
wavespeed-ai/qwen-image/edit-multiple-angles genera ángulos de cámara concretos a partir de una sola imagen con un sistema de cámara de 96 poses: controla la rotación horizontal, la inclinación vertical y el zoom para vistas frontales, laterales, traseras y más.
Descomposición por capas para composición
wavespeed-ai/qwen-image/layered es un modelo unificado de descomposición de imágenes en capas para composición guiada por prompt: aporta puntos, cajas o máscaras aproximadas para aislar sujetos y dividir una sola imagen en capas.
Personalización con LoRA
Las variantes compatibles con LoRA (text-to-image-2512-lora, edit-lora, edit-plus-lora) permiten una personalización rápida y una generación refinada: entrena o aplica checkpoints de LoRA para lograr consistencia de estilo, personaje o marca.
Consejos
Consejos para escribir prompts en Qwen Image
Consejos prácticos para obtener mejores resultados con Qwen Image, basados en los patrones que funcionan en modelos de imagen en flujos de producción.
- 01
Usa 2512 para el renderizado de texto más reciente
text-to-image-2512 es la variante mejorada, con un renderizado de texto y una comprensión del prompt superiores; elígela en lugar del texto a imagen base cuando importe la tipografía.
- 02
Edit-Multiple-Angles para vistas de producto
edit-multiple-angles genera ángulos frontal, lateral, trasero y de cámara personalizados a partir de una sola foto de producto; útil para catálogos de comercio electrónico sin una sesión con varias cámaras.
- 03
Edit-Plus para referencias de varias imágenes
Cuando una edición depende de varias imágenes de origen, usa edit-plus, con compatibilidad nativa con ControlNet, en lugar de la edición de una sola imagen.
- 04
Layered para flujos de composición
Usa layered para descomponer una imagen en capas guiadas por prompt: aísla sujetos con puntos, cajas o máscaras aproximadas para la composición posterior.
- 05
Variantes LoRA para la consistencia de marca
Aplica checkpoints de LoRA entrenados mediante text-to-image-2512-lora o edit-plus-lora para mantener un estilo, un personaje o una identidad de marca recurrentes entre generaciones.
- 06
Edición bilingüe chino/inglés
Edit y Edit-LoRA admiten edición de imagen a imagen bilingüe chino/inglés conservando el estilo; útil para flujos de localización.
Precios
Precios de la API de Qwen Image
El precio es por resultado. El cargo final depende de los parámetros que definas en el playground de cada variante (resolución, duración, número de resultados, referencias).
API
Llama a la API de Qwen Image
Obtén una clave de API en wavespeed.ai/accesskey y envía una predicción por REST. El playground genera ejemplos listos para pegar con cualquier combinación de entradas.
POSThttps://api.wavespeed.ai/api/v3/wavespeed-ai/qwen-image/text-to-image
# 1. Submit the prediction.
SUBMIT_RESPONSE=$(curl --silent --show-error --fail-with-body \
-X POST "https://api.wavespeed.ai/api/v3/wavespeed-ai/qwen-image/text-to-image" \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $WAVESPEED_API_KEY" \
-d '{
"prompt": "A cinematic shot of a city at sunset, soft golden light",
"size": "1024*1024",
"output_format": "jpeg"
}')
TASK=$(printf '%s' "$SUBMIT_RESPONSE" | jq 'if has("data") then .data else . end')
PREDICTION_ID=$(printf '%s' "$TASK" | jq -r '.id')
if [ -z "$PREDICTION_ID" ] || [ "$PREDICTION_ID" = "null" ]; then
printf 'Submission response did not contain a prediction id
' >&2
exit 1
fi
RESULT_URL="https://api.wavespeed.ai/api/v3/predictions/$PREDICTION_ID/result"
# 2. Poll until the prediction finishes.
while true; do
RESPONSE=$(curl --silent --show-error --fail-with-body "$RESULT_URL" \
-H "Authorization: Bearer $WAVESPEED_API_KEY")
RESULT=$(printf '%s' "$RESPONSE" | jq 'if has("data") then .data else . end')
STATUS=$(printf '%s' "$RESULT" | jq -r '.status')
case "$STATUS" in
completed) printf '%s\n' "$RESULT" | jq '.outputs'; break ;;
failed|cancelled|timeout|deleted) printf '%s\n' "$RESULT" | jq . >&2; exit 1 ;;
*) sleep 2 ;;
esac
doneconst submitUrl = "https://api.wavespeed.ai/api/v3/wavespeed-ai/qwen-image/text-to-image";
const apiKey = process.env.WAVESPEED_API_KEY;
if (!apiKey) throw new Error('Set WAVESPEED_API_KEY');
async function requestJson(url, options = {}) {
const response = await fetch(url, options);
if (!response.ok) throw new Error(await response.text());
return response.json();
}
// 1. Submit the prediction.
const body = await requestJson(submitUrl, {
method: "POST",
headers: {
"Authorization": `Bearer ${apiKey}`,
"Content-Type": "application/json",
},
body: JSON.stringify({
"prompt": "A cinematic shot of a city at sunset, soft golden light",
"size": "1024*1024",
"output_format": "jpeg"
}),
});
const task = body.data ?? body;
const resultUrl = `https://api.wavespeed.ai/api/v3/predictions/${task.id}/result`;
// 2. Poll until the prediction finishes.
while (true) {
const resultBody = await requestJson(resultUrl, {
headers: { "Authorization": `Bearer ${apiKey}` },
});
const result = resultBody.data ?? resultBody;
if (result.status === "completed") {
console.log(result.outputs);
break;
}
if (["failed", "cancelled", "timeout", "deleted"].includes(result.status)) throw new Error(JSON.stringify(result));
await new Promise(resolve => setTimeout(resolve, 2000));
}import json
import os
import time
from urllib.request import Request, urlopen
api_key = os.environ["WAVESPEED_API_KEY"]
headers = {"Authorization": f"Bearer {api_key}", "Content-Type": "application/json"}
payload = {
"prompt": "A cinematic shot of a city at sunset, soft golden light",
"size": "1024*1024",
"output_format": "jpeg"
}
def request_json(url, data=None):
request = Request(url, data=data, headers=headers, method="POST" if data else "GET")
with urlopen(request) as response:
return json.load(response)
# 1. Submit the prediction.
body = request_json("https://api.wavespeed.ai/api/v3/wavespeed-ai/qwen-image/text-to-image", json.dumps(payload).encode())
task = body.get("data", body)
result_url = f"https://api.wavespeed.ai/api/v3/predictions/{task['id']}/result"
# 2. Poll until the prediction finishes.
while True:
result_body = request_json(result_url)
result = result_body.get("data", result_body)
status = result.get("status")
if status == "completed":
print(result.get("outputs", []))
break
if status in {"failed", "cancelled", "timeout", "deleted"}:
raise RuntimeError(result)
time.sleep(2)Comparar
Qwen Image frente a las alternativas
Cuándo elegir Qwen Image en lugar de modelos similares en WaveSpeedAI.
Qwen Image frente a Seedream 4.5
Seedream 4.5 hace hincapié en la tipografía y ofrece variantes Sequential para fijar la identidad en varias imágenes. Qwen Image cubre una superficie de edición más amplia: Edit-Plus, múltiples ángulos, composición por capas y edición bilingüe chino/inglés.
Qwen Image frente a GPT Image 2
GPT Image 2 tiene niveles de calidad explícitos y un flujo de edición con imágenes de referencia. Qwen Image ofrece compatibilidad nativa con ControlNet, ángulos de cámara de 96 poses y descomposición por capas: primitivas de edición distintas, con un menor coste por llamada.
Qwen Image frente a Nano Banana 2
Nano Banana 2 incluye consistencia de varios personajes (hasta 5) y una base de búsqueda web. Qwen Image gana en profundidad de edición: Edit-Plus con varias imágenes, generación de ángulos de cámara y descomposición en capas guiada por prompt.
Preguntas frecuentes
Qwen Image API — Preguntas frecuentes
Precios, licencia, integración: preguntas habituales sobre cómo ejecutar Qwen Image en WaveSpeedAI.
¿Qué es la API de Qwen Image?
Qwen Image es un modelo de generación de imágenes de Alibaba expuesto como API REST en WaveSpeedAI. Qwen-Image de Alibaba: conjunto de herramientas de texto a imagen y edición de nueva generación basado en un MMDiT de 20B, con compatibilidad bilingüe chino/inglés, edición de varias imágenes, personalización con LoRA, composición por capas y un sistema de ángulos de cámara de 96 poses. Puedes llamarlo por programación o probarlo desde el playground enlazado arriba.
¿Cómo llamo a la API de Qwen Image?
Regístrate en WaveSpeedAI, copia tu clave de API desde /accesskey y haz POST a https://api.wavespeed.ai/api/v3/wavespeed-ai/qwen-image/text-to-image con tu entrada como JSON. El endpoint devuelve un id de predicción. Consulta el endpoint de resultados aproximadamente cada 2 segundos, aumenta el intervalo en las tareas largas y detente ante cualquier estado final. Arriba tienes ejemplos en Python / Node.js / cURL orientados a producción.
¿Cuánto cuesta la API de Qwen Image?
Qwen Image empieza en $0.02 por ejecución. El coste exacto depende de los parámetros que definas (resolución, duración, número de resultados, referencias). La vista previa del coste en tiempo real junto al botón Generar del playground muestra el precio exacto de tu entrada actual.
¿Qué variantes de Qwen Image hay disponibles?
WaveSpeedAI aloja 21 endpoints de Qwen Image en producción: wavespeed-ai/qwen-image-2.0/edit, wavespeed-ai/qwen-image-2.0-pro/edit, wavespeed-ai/qwen-image-2.0/text-to-image, wavespeed-ai/qwen-image-2.0-pro/text-to-image, wavespeed-ai/qwen-image/edit-2509-multiple-angles, wavespeed-ai/qwen-image-max/edit, wavespeed-ai/qwen-image-max/text-to-image, wavespeed-ai/qwen-image/edit-multiple-angles y más. Cada variante tiene su propia página de playground y sus propios precios.
¿Puedo usar comercialmente los resultados de Qwen Image?
Los derechos de uso comercial dependen de la licencia del modelo de Alibaba. La mayoría de los modelos de Alibaba permiten el uso comercial de los resultados; consulta la página del playground de cada modelo para ver el resumen de su licencia y los Términos del servicio de WaveSpeedAI para las condiciones de la plataforma.
¿Por qué usar Qwen Image en WaveSpeedAI en lugar de ir directamente al proveedor?
Una sola clave de API y una sola cuenta de facturación para Qwen Image Y más de 1.000 modelos de IA de otros proveedores. Sin configurar un SDK por proveedor, sin límites de uso aparte y sin reescribir el código de integración para cada proveedor. Los precios suelen ser iguales o inferiores a los de la API directa de Alibaba.
Proveedor
Acerca de Alibaba
El equipo detrás de Qwen Image y de la gama más amplia de modelos de Alibaba en WaveSpeedAI.
Tongyi Lab, de Alibaba, produce la familia de modelos de vídeo Wan y la familia de LLM Qwen. Wan destaca por publicarse con pesos abiertos, por su amplia cobertura de variantes (texto a vídeo, imagen a vídeo, referencia a vídeo, edición de vídeo, extensión de vídeo, edición de imagen, texto a imagen) y por su solidez constante en estabilidad del movimiento y fidelidad al prompt con prompts multilingües.
Empieza a crear con Qwen Image en WaveSpeedAI
Créditos gratuitos al registrarte. Una sola clave de API para más de 1.000 modelos de IA de Alibaba y de todos los demás proveedores.
/filters:quality(82)/examples/ab6c113bc342972e2bf6fa3a3dd02d44/1783682238198695915_4tkuDMV6.webp)
/filters:quality(82)/examples/ae55efa5dc15feeab655c08c99c0fb67/1783682240218864185_xajsBKir.webp)
/filters:quality(82)/examples/2aae35cf0e4f367122dc3f8306577ba6/1783682242738489413_BobmvEaj.webp)
/filters:quality(82)/examples/fb556f2b9aa99c70a63a0a144d14bfe1/1783682244605044938_9FNX6enx.webp)