Nano Banana 2.1 現已上線 — Google 最新模型 | 立即體驗 →
Alibaba圖片 API每次 $0.02 起

Qwen Image API

Alibaba Qwen-Image 是 20B MMDiT 的新一代文字轉圖片與編輯工具組,支援中英雙語、多圖編輯、LoRA 客製化、分層合成,以及 96 種姿態的攝影機角度系統。

提供基礎版、強化版 2512 與 2.0-pro 的文字轉圖片版本。編輯端點包括 Edit、Edit-Plus(多圖、ControlNet)、Edit-LoRA、Edit-Multiple-Angles(96 種姿態的攝影機系統)與 Layered(以提示詞引導的分解)。同一前綴下也包含 Qwen Image 2.0 系列版本。

Qwen Image 範例輸出

概覽

關於 Qwen Image API

Qwen Image 的功能、它在 Alibaba 模型陣容中的定位,以及團隊選用它的原因。

Qwen Image 是來自 Alibaba 的圖片生成與編輯模型,可透過 WaveSpeedAI REST API 使用。Alibaba Qwen-Image 是 20B MMDiT 的新一代文字轉圖片與編輯工具組,支援中英雙語、多圖編輯、LoRA 客製化、分層合成,以及 96 種姿態的攝影機角度系統。

提供基礎版、強化版 2512 與 2.0-pro 的文字轉圖片版本。編輯端點包括 Edit、Edit-Plus(多圖、ControlNet)、Edit-LoRA、Edit-Multiple-Angles(96 種姿態的攝影機系統)與 Layered(以提示詞引導的分解)。同一前綴下也包含 Qwen Image 2.0 系列版本。

WaveSpeedAI 上的 Qwen Image 系列提供 21 個 REST 端點,涵蓋 Image-To-Image, Text-To-Image, Training 等工作流程。每個變體都有各自的定價、參數選項與範例輸出 — 請挑選符合您輸入模態與生產限制的版本,或使用同一組 API 金鑰呼叫多個變體,組合成多步驟的處理流程。

使用您呼叫其他 1,000+ 個 WaveSpeedAI AI 模型時相同的 API 金鑰、帳單帳戶與速率限制額度來執行 Qwen Image。無需另外設定供應商、無需各家 SDK、無需處理各家不同的速率限制 — 一次整合,涵蓋從文字轉圖片、文字轉影片,到音訊合成、3D 生成、放大與編輯的所有功能。

端點

所有 Qwen Image API 端點

WaveSpeedAI 目前提供 21 個 Qwen Image 端點 — 請選擇符合您工作流程的變體。

image-to-imageQwen Image 2.0 Edit — Alibaba 的 Qwen Image image-to-image 預覽

Qwen Image 2.0 Edit

Qwen Image 2.0 Edit is an advanced image-editing model with improved quality and better understanding of instructions. Up to 2k. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.

$0.03 起
image-to-imageQwen Image 2.0 Pro Edit — Alibaba 的 Qwen Image image-to-image 預覽

Qwen Image 2.0 Pro Edit

Qwen Image 2.0 Pro Edit is a professional-grade image editing model with superior quality and advanced instruction understanding. Up to 2k. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.

$0.07 起
text-to-imageQwen Image 2.0 Text To Image — Alibaba 的 Qwen Image text-to-image 預覽

Qwen Image 2.0 Text To Image

Qwen Image 2.0 is an advanced text-to-image model with enhanced image quality and improved prompt understanding. Up to 2k. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.

$0.03 起
text-to-imageQwen Image 2.0 Pro Text To Image — Alibaba 的 Qwen Image text-to-image 預覽

Qwen Image 2.0 Pro Text To Image

Qwen Image 2.0 Pro is a professional-grade text-to-image model with superior quality and advanced prompt understanding. Up to 2k. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.

$0.07 起
image-to-imageQwen Image Edit 2509 Multiple Angles — Alibaba 的 Qwen Image image-to-image 預覽

Qwen Image Edit 2509 Multiple Angles

Qwen Image Edit 2509 Multiple Angles is an AI image editing model that generates multiple-angle views of objects or scenes from a single image. Transform perspectives and create diverse viewpoints with text prompts. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.

$0.025 起
image-to-imageQwen Image Max Edit — Alibaba 的 Qwen Image image-to-image 預覽

Qwen Image Max Edit

Qwen Image Max Edit is an AI model for image editing with text prompts, supporting both Chinese and English languages. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.

$0.07 起
text-to-imageQwen Image Max Text To Image — Alibaba 的 Qwen Image text-to-image 預覽

Qwen Image Max Text To Image

Qwen Image Max is a text-to-image model with high-quality image generation supporting Chinese and English prompts. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.

$0.07 起
image-to-imageQwen Image Edit Multiple Angles — Alibaba 的 Qwen Image image-to-image 預覽

Qwen Image Edit Multiple Angles

Generate specific camera angles from a single image using a 96-pose camera system. Control horizontal rotation, vertical tilt, and zoom to create front, side, back views and more. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.

$0.025 起
trainingQwen Image 2512 Lora Trainer — Alibaba 的 Qwen Image training 預覽

Qwen Image 2512 Lora Trainer

Qwen-Image-2512 LoRA Trainer lets you train custom LoRA models 10x faster with style, character, and object training. From concept to model in minutes, not hours—upload a ZIP file containing images to start. Ready-to-use REST inference API, best performance, no cold starts, affordable pricing.

$1.00 起
text-to-imageQwen Image Text To Image 2512 Lora — Alibaba 的 Qwen Image text-to-image 預覽

Qwen Image Text To Image 2512 Lora

Qwen-Image-2512 LoRA is an enhanced 20B MMDiT text-to-image model with LoRA support for fast customization and refined image generation. Ready-to-use REST inference API, best performance, no cold starts, affordable pricing.

$0.025 起
text-to-imageQwen Image Text To Image 2512 — Alibaba 的 Qwen Image text-to-image 預覽

Qwen Image Text To Image 2512

Qwen Image 2512 is Qwen's latest text-to-image model with enhanced prompt understanding, superior text rendering, and versatile aspect ratio support. Ready-to-use REST inference API, best performance, no cold starts, affordable pricing.

$0.02 起
image-to-imageQwen Image Edit 2511 Lora — Alibaba 的 Qwen Image image-to-image 預覽

Qwen Image Edit 2511 Lora

Qwen Image Edit 2511 LoRA is an enhanced version with custom LoRA support for personalized styles. It delivers stronger edit consistency, robust multi-person identity/pose consistency, custom LoRA styles, enhanced industrial/product design, and improved geometric reasoning for structure-preserving edits. Built for stable production use with a ready-to-use REST API, no cold starts, and predictable pricing.

$0.025 起
image-to-imageQwen Image Edit 2511 — Alibaba 的 Qwen Image image-to-image 預覽

Qwen Image Edit 2511

Qwen Image Edit 2511 is a major upgrade over 2509 for real-world image editing and design. It delivers stronger edit consistency, robust multi-person identity/pose consistency, built-in LoRA styles, enhanced industrial/product design, and improved geometric reasoning for structure-preserving edits. Built for stable production use with a ready-to-use REST API, no cold starts, and predictable pricing.

$0.02 起
image-to-imageQwen Image Layered — Alibaba 的 Qwen Image image-to-image 預覽

Qwen Image Layered

Qwen-Image Layered is a unified image-layer decomposition model for prompt-guided compositing. Provide points, boxes, or rough masks to isolate subjects and regions, and the model splits a single image into multiple RGBA layers with clean alpha, soft edges, and correct occlusion order. Ready-to-use REST inference API with fast response, no cold starts, and affordable pricing.

$0.025 起
image-to-imageQwen Image Edit Plus Lora — Alibaba 的 Qwen Image image-to-image 預覽

Qwen Image Edit Plus Lora

Qwen-Image-Edit-Plus (2509) is 20B MMDiT image-to-image editor supporting multi-image edits, single-image consistency, and native ControlNet. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.

$0.025 起
image-to-imageQwen Image Edit Plus — Alibaba 的 Qwen Image image-to-image 預覽

Qwen Image Edit Plus

Qwen-Image-Edit-Plus (2509) is a 20B MMDiT image editor with multi-image editing, single-image consistency and native ControlNet support. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.

$0.02 起
image-to-imageQwen Image Edit Lora — Alibaba 的 Qwen Image image-to-image 預覽

Qwen Image Edit Lora

Qwen-Image-Edit LoRA (20B) enables bilingual Chinese/English image-to-image editing with style preservation and semantic and appearance edits. Ready-to-use REST API, best performance, no coldstarts, affordable pricing.

$0.025 起
image-to-imageQwen Image Edit — Alibaba 的 Qwen Image image-to-image 預覽

Qwen Image Edit

Qwen-Image-Edit is a 20B MMDiT image-to-image model offering precise bilingual (Chinese & English) text edits while preserving style. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.

$0.02 起
trainingQwen Image Lora Trainer — Alibaba 的 Qwen Image training 預覽

Qwen Image Lora Trainer

Train custom Qwen-Image LoRA models 10x faster. Style training, character training, object training. From concept to model in minutes, not hours. Upload a ZIP file containing images to start!

$1.00 起
text-to-imageQwen Image Text To Image Lora — Alibaba 的 Qwen Image text-to-image 預覽

Qwen Image Text To Image Lora

Qwen-Image LoRA is a 20B MMDiT next-gen text-to-image model with LoRA support for fast customization and refined image generation. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.

$0.025 起
text-to-imageQwen Image Text To Image — Alibaba 的 Qwen Image text-to-image 預覽

Qwen Image Text To Image

Qwen-Image is a 20B MMDiT next-gen text-to-image model that generates images from text prompts. Ready-to-use REST inference API, best performance, no coldstarts, affordable pricing.

$0.02 起

範例

看看 Qwen Image 的實際效果

由 Qwen Image API 生成的真實輸出。將滑鼠移到任一影片上即可預覽,點擊可開啟完整尺寸檢視器。

使用方式

如何使用 Qwen Image API

從註冊到完成生成,只要四個步驟。完整的 Python、Node.js 與 cURL 範例請見下方的 API 區段。

  1. 01

    取得 API 金鑰

    註冊 WaveSpeedAI 帳號,並從控制台複製您的 API 金鑰。新帳號會獲贈免費入門點數 — 足以在開始計費前執行數十次 Playground。

  2. 02

    提交 prediction

    將您的輸入以 JSON 格式 POST 到 https://api.wavespeed.ai/api/v3/wavespeed-ai/qwen-image/text-to-image。端點會立即回傳 prediction id — 生成是非同步進行的,因此推論期間您不需要保持連線。

  3. 03

    輪詢完成狀態

    GET https://api.wavespeed.ai/api/v3/predictions/{request_id}/result。狀態為 completed 時回傳輸出;狀態為 failed、cancelled、timeout 或 deleted 時停止並回報錯誤;其他狀態則持續輪詢。

  4. 04

    讀取輸出網址

    當狀態為 "completed" 時,從 data.outputs[0] 讀取網址。該網址指向 WaveSpeedAI CDN 上您生成的媒體 — 依您呼叫的 Qwen Image 變體,可能是圖片、影片、音訊或 3D 檔案。

應用情境

您可以用 Qwen Image 打造什麼

開發者與創作者使用 Qwen Image API 的常見工作流程。

01

20B MMDiT 文字轉圖片

wavespeed-ai/qwen-image/text-to-image 是 20B MMDiT 的新一代文字轉圖片模型,可依文字提示詞生成圖片,是 Qwen Image 系列的基礎生成端點。

text-to-image20bmmdit
02

文字渲染更出色的強化版 2512

依目錄說明,wavespeed-ai/qwen-image/text-to-image-2512 是 Qwen 最新的文字轉圖片模型,具有更強的提示詞理解、更出色的文字渲染,並支援多樣的長寬比。

2512typographyaspect-ratio
03

以 Edit-Plus 進行多圖編輯

wavespeed-ai/qwen-image/edit-plus 是 20B MMDiT 編輯器,支援多圖編輯、單圖一致性與原生 ControlNet,適合需要參考多張來源圖片的複雜編輯。

edit-plusmulti-imagecontrolnet
04

96 種姿態的攝影機角度控制

wavespeed-ai/qwen-image/edit-multiple-angles 以 96 種姿態的攝影機系統,從單張圖片生成特定的攝影機角度,可控制水平旋轉、垂直傾斜與縮放,產出正面、側面、背面等視角。

camera-angles96-pose3d-views
05

分層合成分解

wavespeed-ai/qwen-image/layered 是統一的圖層分解模型,用於以提示詞引導的合成,提供點、框或粗略遮罩即可分離主體,並將單張圖片拆分為多個圖層。

layeredcompositingdecomposition
06

LoRA 客製化

支援 LoRA 的版本(text-to-image-2512-lora、edit-lora、edit-plus-lora)可快速客製化並精修生成結果,可訓練或套用 LoRA 檢查點,以維持風格、角色或品牌的一致性。

loracustomizationconsistency

技巧

Qwen Image 提示詞技巧

讓 Qwen Image 產出更好結果的實用建議 — 整理自在實際生產流程中,圖片模型通用的有效做法。

  1. 01

    使用 2512 取得最新的文字渲染

    text-to-image-2512 是強化版本,文字渲染與提示詞理解更出色。當字體排版很重要時,請選用它而非基礎的 text-to-image。

  2. 02

    以 Edit-Multiple-Angles 製作產品視角

    edit-multiple-angles 可從單張產品照片生成正面、側面、背面與自訂攝影機角度,適合電商商品目錄,無須多機位拍攝。

  3. 03

    多圖參考使用 Edit-Plus

    當編輯需要依據多張來源圖片時,請使用具備原生 ControlNet 支援的 edit-plus,而非單圖編輯。

  4. 04

    用於合成工作流程的 Layered

    使用 layered 將圖片分解為由提示詞引導的圖層,以點、框或粗略遮罩分離主體,供後續合成使用。

  5. 05

    以 LoRA 版本維持品牌一致

    透過 text-to-image-2512-lora 或 edit-plus-lora 套用訓練好的 LoRA 檢查點,在多次生成中維持固定的風格、角色或品牌身分。

  6. 06

    中英雙語編輯

    Edit 與 Edit-LoRA 支援中英雙語的圖生圖編輯並保留風格,適合在地化工作流程。

定價

Qwen Image API 定價

依輸出計費。最終費用會依您在各變體 Playground 中設定的參數(解析度、時長、輸出數量、參考素材)而調整。

API

呼叫 Qwen Image API

請到 wavespeed.ai/accesskey 註冊取得 API 金鑰,然後透過 REST 提交 prediction。Playground 會為任何輸入組合產生可直接貼上的範例。

POSThttps://api.wavespeed.ai/api/v3/wavespeed-ai/qwen-image/text-to-image

# 1. Submit the prediction.
SUBMIT_RESPONSE=$(curl --silent --show-error --fail-with-body \
  -X POST "https://api.wavespeed.ai/api/v3/wavespeed-ai/qwen-image/text-to-image" \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $WAVESPEED_API_KEY" \
  -d '{
    "prompt": "A cinematic shot of a city at sunset, soft golden light",
    "size": "1024*1024",
    "output_format": "jpeg"
}')

TASK=$(printf '%s' "$SUBMIT_RESPONSE" | jq 'if has("data") then .data else . end')
PREDICTION_ID=$(printf '%s' "$TASK" | jq -r '.id')
if [ -z "$PREDICTION_ID" ] || [ "$PREDICTION_ID" = "null" ]; then
  printf 'Submission response did not contain a prediction id
' >&2
  exit 1
fi
RESULT_URL="https://api.wavespeed.ai/api/v3/predictions/$PREDICTION_ID/result"

# 2. Poll until the prediction finishes.
while true; do
  RESPONSE=$(curl --silent --show-error --fail-with-body "$RESULT_URL" \
    -H "Authorization: Bearer $WAVESPEED_API_KEY")
  RESULT=$(printf '%s' "$RESPONSE" | jq 'if has("data") then .data else . end')
  STATUS=$(printf '%s' "$RESULT" | jq -r '.status')
  case "$STATUS" in
    completed) printf '%s\n' "$RESULT" | jq '.outputs'; break ;;
    failed|cancelled|timeout|deleted) printf '%s\n' "$RESULT" | jq . >&2; exit 1 ;;
    *) sleep 2 ;;
  esac
done

比較

Qwen Image 與其他選擇比較

在 WaveSpeedAI 上,何時該選擇 Qwen Image 而非類似的模型。

Qwen Image vs Seedream 4.5

Seedream 4.5 著重字體排版,並提供用於多圖身分鎖定的 Sequential 版本。Qwen Image 的編輯範圍更廣,包括 Edit-Plus、多角度、分層合成,以及中英雙語編輯。

Qwen Image vs GPT Image 2

GPT Image 2 有明確的品質等級與以參考圖編輯的工作流程。Qwen Image 則提供原生 ControlNet、96 種姿態的攝影機角度與分層分解,編輯方式不同,且單次呼叫成本更低。

Qwen Image vs Nano Banana 2

Nano Banana 2 提供多角色一致性(最多 5 個)與網頁搜尋。Qwen Image 則在編輯深度上勝出,包括多圖 Edit-Plus、攝影機角度生成,以及提示詞引導的圖層分解。

常見問題

Qwen Image API — 常見問題

定價、授權、整合 — 關於在 WaveSpeedAI 上執行 Qwen Image 的常見問題。

什麼是 Qwen Image API?

Qwen Image 是 Alibaba 的圖片生成模型,在 WaveSpeedAI 上以 REST API 提供。Alibaba Qwen-Image 是 20B MMDiT 的新一代文字轉圖片與編輯工具組,支援中英雙語、多圖編輯、LoRA 客製化、分層合成,以及 96 種姿態的攝影機角度系統。您可以透過程式呼叫,也可以在上方連結的 Playground 試用。

如何呼叫 Qwen Image API?

註冊 WaveSpeedAI 帳號,從 /accesskey 複製您的 API 金鑰,然後將您的輸入以 JSON 格式 POST 到 https://api.wavespeed.ai/api/v3/wavespeed-ai/qwen-image/text-to-image。端點會回傳 prediction id。請從約每 2 秒輪詢一次結果端點開始,長時間任務可拉長間隔,並在任何終止狀態時停止。上方提供適用於生產環境的 Python / Node.js / cURL 範例。

Qwen Image API 的費用是多少?

Qwen Image 每次執行 $0.02 起。實際費用會依您設定的參數(解析度、時長、輸出數量、參考素材)而調整。Playground 中「生成」按鈕旁的即時費用預覽會顯示您目前輸入的確切價格。

有哪些 Qwen Image 變體可用?

WaveSpeedAI 提供 21 個已上線的 Qwen Image 端點:wavespeed-ai/qwen-image-2.0/edit, wavespeed-ai/qwen-image-2.0-pro/edit, wavespeed-ai/qwen-image-2.0/text-to-image, wavespeed-ai/qwen-image-2.0-pro/text-to-image, wavespeed-ai/qwen-image/edit-2509-multiple-angles, wavespeed-ai/qwen-image-max/edit, wavespeed-ai/qwen-image-max/text-to-image, wavespeed-ai/qwen-image/edit-multiple-angles等。每個變體都有各自的 Playground 頁面與定價。

Qwen Image 的輸出可以商用嗎?

商業使用權依 Alibaba 的模型授權而定。多數 Alibaba 模型允許商用輸出;請參閱各模型 Playground 頁面中的授權摘要,以及 WaveSpeedAI 的服務條款了解平台層級的條件。

為什麼要在 WaveSpeedAI 上使用 Qwen Image,而不是直接使用?

一組 API 金鑰、一個帳單帳戶,即可使用 Qwen Image 以及來自其他供應商的 1,000+ 個 AI 模型。無需設定各家 SDK、無需處理各自獨立的速率限制、無需為每個供應商重寫整合程式碼。價格通常與 Alibaba 的直接 API 相當或更低。

提供者

關於 Alibaba

Qwen Image 背後的團隊,以及 Alibaba 在 WaveSpeedAI 上的完整模型陣容。

Alibaba 通義實驗室打造了 Wan 影片模型系列與 Qwen 大型語言模型系列。Wan 的特色在於以開放權重釋出、版本涵蓋廣泛(文字轉影片、圖片轉影片、參考轉影片、video-edit、video-extend、image-edit、文字轉圖片),並在多語言提示詞下持續展現出色的動態穩定性與提示詞遵循度。

在 WaveSpeedAI 上開始使用 Qwen Image 打造應用

註冊即贈免費入門點數。一組 API 金鑰,涵蓋來自 Alibaba 與所有其他供應商的 1,000+ 個 AI 模型。