MAI-Image-2.5 API:開發者必知要點

MAI-Image-2.5 已向開發者開放。了解 API 存取方式、Flash 與保真度的取捨、Arena 排名,以及生產環境圖像編輯的應用場景。

By Dora 3 min read

大家好。Microsoft 現在有一個旗艦圖像模型,在 Arena 圖像編輯排行榜上排名第二,在文字轉圖像排行榜上排名第三。光憑這一點,無法判斷 MAI-Image-2.5 是否適合納入你的工作流程。本文是我在做決定前想先讀到的內容——它究竟是什麼、如何存取、適用場景,以及不適用的場景。

我還沒有跑它超過兩週。這裡大部分內容是存取層面的實際情況和公開基準測試數據。工作流程方面的判斷都有特別標注。

MAI-Image-2.5 是什麼

Microsoft 最新的圖像生成與編輯模型

MAI-Image-2.5 是 Microsoft AI 第一方圖像系列目前的頂尖之作,於 2026 年 6 月 2 日發布,同時推出了一個更快的 Flash 變體。它在同一個模型中支援文字轉圖像生成和圖像轉圖像編輯。Microsoft Foundry 文件將其描述為一個基於擴散的系統,針對「精準編輯與一致性」進行優化——包括針對性物件編輯、版面調整、文字更新、消除運動模糊等瑕疵清理——並在多次迭代中保持視覺一致性。

對於開發者而言,有兩點值得注意。

其一:這不是隱藏在候補名單後面的研究預覽。該模型已整合進 Microsoft 的產品介面——PowerPoint 用於圖像生成,OneDrive 用於精準編輯——這表明 Microsoft 將其視為生產基礎設施,而非演示。Microsoft AI 的 MAI-Image 展示頁面上列出的企業客戶包括 WPP(全球首席創意官 Rob Reilly 有引言)和 Shutterstock(首席 PM Vanessa Salvo 評估了該模型系列)。

其二:這是一個快速發布節奏中的最新版本。MAI-Image-1 於 2025 年 10 月 13 日發布。MAI-Image-2 和 MAI-Image-2-Efficient 於 2026 年春季在 Foundry 上線。2.5 版本在 Image-1 大約八個月後發布。你今天做的任何決定,其有效期都比以往更短。

MAI-Image-2.5 與 MAI-Image-2.5-Flash 的比較

Microsoft 推出了兩個變體。它們同屬一個系列,但解決的是不同問題。

變體優化方向Foundry 標準定價(輸入)Foundry 標準定價(圖像輸出)
MAI-Image-2.5最高保真度$5 / 100萬文字 token,$8 / 100萬圖像 token$47 / 100萬圖像 token
MAI-Image-2.5-Flash規模化速度與成本$1.75 / 100萬 token(文字與圖像輸入)$19.50–$33 / 100萬圖像 token,依來源而異

根據 Microsoft Foundry 定價公告,標準版本的文字輸入為 $5/M token,圖像輸入為 $8/M,圖像輸出為 $47/M。Flash 的文字和圖像輸入降至 $1.75/M,圖像輸出為 $33/M。輸入定價約為標準版的三分之一;圖像輸出——通常是主要成本項——約為標準版的 70%。Microsoft 的定位是:高量生產流程使用 Flash,當 Flash 的輸出效果不夠好時,再升級到基礎模型。

對於大多數生產圖像工作,Flash 是預設選擇,基礎模型是當 Flash 輸出不夠理想時的升級路徑。在圍繞它構建任何東西之前,請先查看 Foundry 的即時定價頁面——Microsoft 一直在調整這些數字。

開發者的確認存取路徑

Azure AI Foundry 與 MAI Playground

MAI-Image-2.5 API 透過 Microsoft Foundry 提供——這是你部署 MAI-Image-2、GPT-Image-1.5 以及其他合作夥伴和第一方圖像模型的同一目錄。你從 Foundry 模型目錄配置部署,獲取 Azure 端點,使用 Entra ID token 或 API 金鑰進行身份驗證,然後呼叫標準的 MAI 圖像編輯 API 介面。對於工作量可預測的團隊,可使用 PTU 保留定價。

如果你在整合之前需要測試,MAI Playground 提供了無程式碼介面。在那裡構建提示,然後再移轉到 API。

OpenRouter 與聚合層存取

你不必直接通過 Azure。OpenRouter 上的 MAI-Image-2.5 以 OpenRouter 統一帳單和路由層為前端,提供相同的模型。Microsoft 在同一份公告中確認了 OpenRouter 的上線,OpenRouter 指出「900 萬開發者」現在可以透過他們已經用於其他模型的同一 API 存取 MAI-Image-2.5。Foundry 仍然是來源——OpenRouter 將每個請求轉發給 Microsoft,無需對該特定模型做出路由決策。

這值得特別指出,因為聚合的重要性比以前更高了。如果你已經透過一個整合層運行 GPT-Image-2、Nano Banana 2 或 Grok Imagine,添加 Microsoft 的模型並不意味著要編寫新的客戶端。只需更換一個模型字串即可。

PowerPoint 和 OneDrive 產品推出

Microsoft 已將此模型整合到 PowerPoint(生成)和 OneDrive(精準編輯)中。大多數終端使用者會在不知道其名稱的情況下接觸到它。對於開發者而言,這在兩個方面有所影響:它暗示了 Microsoft 在內部所承諾的可靠性標準,也是一個競爭信號——Microsoft 在自己的產品中使用自己的圖像模型,而不是將一切路由到 OpenAI。這個方向可能是永久性的。

Arena 排名:編輯 vs 文字轉圖像

圖像編輯排行榜第二名

這是頭條結果。在圖像編輯排行榜上,MAI-Image-2.5 排名第二,領先 Nano Banana 2.1。根據 Microsoft 的透明度說明,評估窗口是 2026 年 5 月 31 日至 6 月 1 日在 LMArena 排行榜上進行的盲測人工偏好評判,Microsoft 報告在 12 個編輯類別的多數中獲勝——包括清理、背景、陰影和文字——在評判次數 ≥100 的類別中。這是 Arena 排名通常不會呈現的方法論細節,如果你要押注這個排名,了解評估群體是值得的。

文字轉圖像排行榜第三名

在文字轉圖像方面,它排名第三,相比 MAI-Image-2,各類別平均 ELO 提升 +74.5,根據 Microsoft Foundry Labs 頁面,在文字渲染方面尤其顯著,提升了 +104 ELO。該排行榜的前兩名是 GPT-Image-2 和 Nano Banana 2——與 GPT-Image-2 的頭條差距在報導中被描述為 Arena 有史以來記錄的最大差距,但確切的 ELO 差值每天都在變化,在引用之前應重新核實即時排行榜。

我會避免的錯誤是:將這些混為一談,說「MAI-Image-2.5 是第二名的圖像模型」。事實並非如此。編輯排名第二,文字轉圖像排名第三。不同的排行榜,不同的信號。

為何 Arena 不能取代特定工作流程的評估

Arena 是盲測配對投票。它是我們評估一般使用者偏好最誠實的信號,追蹤哪些模型何時進入哪些排行榜對於背景了解很有用。但它無法告訴你該模型是否能在你特定的產品照片、你特定的品牌字型、你特定的編輯目錄上保持身份一致性。Microsoft 的發布文章對此風險直言不諱:「與所有圖像模型一樣,MAI-Image-2.5 可能反映其訓練數據中的偏見,並可能產生看似合理但不準確或具誤導性的視覺細節。」

Arena 告訴你的是:它在頂級行列。它無法告訴你的是:它是否是最適合你工作負載的頂級模型。

生產圖像編輯使用場景

產品圖像清理和背景替換

圖像轉圖像 API 支援物件移除、替換、屬性更改、修復繪製和瑕疵清理(特別提到了運動模糊),同時保留構圖。對於電商——將手錶從一個背景取出、放到另一個背景上、去除反光、更換錶帶顏色——這是關鍵的功能介面。Microsoft 明確表示該模型針對「創意工作實際進行的方式」進行了調整,我將其解讀為:重點是編輯,而不僅僅是生成。官方 MAI-Image 頁面上的 WPP 推薦強化了這一點——活動就緒圖像是其定位框架。

局部編輯、文字替換和視覺推理

AI 圖像編輯在文字方面的崩潰速度比其他任何方面都快。海報、包裝、標牌、UI 截圖——這些都取決於模型是否能夠渲染和重新渲染文字而不出現亂碼。Microsoft 的定位特別強調了文字渲染,而文字渲染方面 +104 ELO 的提升是發布材料中最有力的量化聲明。

我還沒有在生產規模下對多語言標牌進行壓力測試。這在待辦清單上。文字渲染聲明總是需要按語言驗證——拉丁字元集和 CJK 的表現非常不同。

人像和身份一致性工作流程

人像方面是身份漂移最容易造成傷害的地方。Microsoft 記錄該模型能夠保留「可識別的臉部,以及在風格化、姿勢和版面更改中的髮型、服裝、全身身份」——工作流程的關注點是:生成一張人像,編輯姿勢,保持同一個人。如果你一直在將此類工作路由到在第二次編輯時就會漂移的模型,這值得進行真正的比較。「身份與角色一致性」能力定位於品牌角色、代言人和社群活動。

直接 Foundry 存取 vs 聚合層

直接使用 Microsoft 存取的適用場景

你已經在 Azure 上。你的團隊有 Entra ID,你的帳單流經 Microsoft,你的合規立場是圍繞它構建的。你想要 PTU 保留定價。你只運行一個模型,或者你在運行以 Microsoft 為主的技術棧。直接通過 Foundry 是摩擦較小的路徑。兩個變體的完整定價結構和部署介面都在 Microsoft 的 Foundry 公告中。

在 GPT-Image、Nano Banana、Grok Imagine 和 MAI 之間進行模型路由的適用場景

這是我一直在思考的部分。圖像生成領域目前有四個頂尖競爭者——GPT-Image-2、Nano Banana 2 / 2.1、Grok Imagine 和 MAI-Image-2.5——各自有不同的優勢、不同的定價曲線,以及在相同提示下不同的編輯行為。如果你的產品需要針對每個任務選擇最合適的模型,構建四個獨立的整合是浪費工程資源的。

這正是「一個 API,多個模型」模式發揮價值的地方。將 MAI 用於精準編輯,將 GPT-Image-2 用於密集文字渲染,將 Nano Banana 2 用於高解析度輸出,按需路由。聚合平台從不同角度解決相同問題。選擇延遲和覆蓋範圍與你的工作流程相符的那個。

這就是我在存取層面能確認的全部內容。特定工作流程的判斷——哪個模型在你的圖像上真正勝出——是你需要自己運行的部分。

常見問題

開發者通常如何在自己的圖像編輯工作流程中測試 MAI-Image-2.5? 最經濟的方式是使用 MAI Playground 進行提示迭代,然後使用 Flash 移轉到 Foundry 圖像編輯 API 進行批次測試。從你的真實生產集中保留 20–30 個具代表性的輸入——不是精心挑選的演示——然後通過 Flash 和基礎模型運行它們。你實際工作負載上的差異比任何 Arena 排行榜都更有參考價值。

直接使用 MAI-Image-2.5 和通過聚合層使用有什麼實際差別? 直接 Foundry 給你與 Microsoft 最清晰的帳單關係、PTU 保留定價和 Entra ID 身份驗證。聚合層給你跨提供商路由——無需重建整合即可在 MAI、GPT-Image-2、Nano Banana 2 和 Grok Imagine 之間切換。如果你只運行一個圖像模型,就直接使用。如果你需要比較或切換,聚合層會物有所值。

團隊何時會選擇 MAI-Image-2.5 而不是他們已在使用的其他圖像模型? 我會指出三種情況:精準編輯工作負載,需要在多次迭代中保持身份和構圖(Arena 編輯排名第二是這裡最有力的信號);Azure 原生技術棧,Foundry 帳單和 Entra ID 身份驗證降低了整合開銷;以及商業圖像——包裝、標牌、以品牌為導向的視覺內容——Microsoft 明確針對此進行了調整,WPP 和 Shutterstock 被列為評估者。

團隊在將圖像生成工作負載遷移到 MAI-Image-2.5 時應注意什麼? 三點。預覽狀態——兩個變體在 Foundry 中仍標記為預覽版,因此 SLA 和功能對等性會有變動。定價流動性——MAI 圖像系列在過去幾個月中有多次定價更新;構建成本估算時留有餘地。模型生命週期——以 Microsoft 的發布速度(Image-1 到 2.5 大約八個月),不要硬編碼任何你無法替換的東西。

這就是存取層面的全貌。用真實輸入自己運行它。那比我說的任何話都更有說服力。

相關文章: