MAI-Image-2.5 API:开发者须知

MAI-Image-2.5 已向开发者开放。了解 API 访问方式、Flash 与保真度的权衡、Arena 排名以及生产环境图像编辑使用场景。

By Dora 3 min read

大家好。微软现在拥有一款旗舰图像模型,在 Arena 图像编辑榜上排名第二,在文本生成图像榜上排名第三。仅凭这一点,还无法判断 MAI-Image-2.5 是否适合你的工作流程。这篇文章是我在做决定之前想读的内容——它究竟是什么、如何获取、适用场景,以及不适用的场景。

我使用它还不到两周。这里大部分内容是基于访问层的实际情况和公开基准测试数据。工作流程方面的判断已明确标注。

MAI-Image-2.5 是什么

微软最新的图像生成与编辑模型

MAI-Image-2.5 是微软 AI 自有图像系列的当前顶尖产品,于 2026 年 6 月 2 日发布,同时推出了更快速的 Flash 变体。它在同一模型中同时支持文本生成图像和图像到图像的编辑。Microsoft Foundry 文档将其描述为一个扩散式系统,针对”精准编辑与一致性”进行了优化——包括定向对象编辑、布局调整、文本更新、运动模糊去除等伪影清理——并在多次迭代中保持视觉一致性。

对于开发者而言,有两点值得关注。

第一:这不是藏在候补名单后面的研究预览版。该模型已经集成到微软的产品界面中——PowerPoint 用于图像生成,OneDrive 用于精准编辑——这表明微软将其视为生产级基础设施,而非演示。微软 AI 的 MAI-Image 展示页面上的企业客户包括 WPP(全球首席创意官 Rob Reilly 有引言)和 Shutterstock(首席项目经理 Vanessa Salvo 参与了模型评估)。

第二:这是快速迭代发布节奏中的最新成果。MAI-Image-1 于 2025 年 10 月 13 日发布。MAI-Image-2 和 MAI-Image-2-Efficient 于 2026 年春季在 Foundry 上线。2.5 版本大约在 Image-1 发布八个月后推出。你今天做出的任何决定,其有效期都会比平时更短。

MAI-Image-2.5 与 MAI-Image-2.5-Flash 对比

微软推出了两个变体,它们属于同一系列,但解决不同的问题。

变体优化方向Foundry 定价(输入)Foundry 定价(图像输出)
MAI-Image-2.5最高保真度文本 token $5/百万,图像 token $8/百万$47/百万图像 token
MAI-Image-2.5-Flash大规模场景下的速度与成本文本和图像输入 $1.75/百万 token根据来源 $19.50–$33/百万图像 token

根据 Microsoft Foundry 定价公告,标准版定价为文本输入 $5/百万 token,图像输入 $8/百万 token,图像输出 $47/百万 token。Flash 版降至文本和图像输入 $1.75/百万 token,图像输出 $33/百万 token。输入定价约为标准版的三分之一;图像输出——通常是主要成本项——约为标准版的 70%。微软的定位是:高并发生产流水线使用 Flash,需要最高质量输出时使用基础模型。

对于大多数生产图像工作,Flash 是默认选择,当 Flash 输出质量不够时再升级到基础模型。在构建任何依赖它的系统之前,请务必查阅 Foundry 的实时定价页面——微软一直在调整这些价格。

开发者的确认访问路径

Azure AI Foundry 与 MAI Playground

MAI-Image-2.5 API 通过 Microsoft Foundry 提供——这是同一个目录,你在其中部署 MAI-Image-2、GPT-Image-1.5 以及其他合作伙伴和第一方图像模型。你从 Foundry 模型目录部署,获取 Azure 端点,使用 Entra ID token 或 API 密钥进行身份验证,然后调用标准的 MAI 图像编辑 API 接口。对于有稳定工作负载的团队,PTU 预留定价也可选。

如果你在集成前想先测试,MAI Playground 提供了无代码界面。在那里构建提示词,然后再迁移到 API。

OpenRouter 与聚合层访问

你不必直接通过 Azure。OpenRouter 上的 MAI-Image-2.5 以 OpenRouter 的统一计费和路由层暴露相同的模型。微软在同一公告中确认了 OpenRouter 的上线,OpenRouter 表示”900 万开发者”现在可以通过他们已在使用的同一 API 访问 MAI-Image-2.5。Foundry 仍然是源头——OpenRouter 将每个请求转发给微软,无需对该特定模型做路由决策。

这值得特别指出,因为聚合层的重要性比以前更高了。如果你已经通过一个集成层运行 GPT-Image-2、Nano Banana 2 或 Grok Imagine,添加微软的模型并不意味着要编写新客户端,只需切换一个模型字符串即可。

PowerPoint 和 OneDrive 产品集成

微软已将该模型集成到 PowerPoint(生成)和 OneDrive(精准编辑)中。大多数终端用户会在不知道模型名称的情况下使用它。对于开发者来说,这在两方面有意义:一是它提示了微软内部承诺的可靠性标准;二是这是一个竞争信号——微软在自己的产品中使用自己的图像模型,而不是将所有内容路由到 OpenAI。这个方向可能是永久性的。

Arena 排名:编辑 vs 文本生成图像

图像编辑榜第二名

这是核心结果。在图像编辑榜上,MAI-Image-2.5 排名第二,超过 Nano Banana 2.1。根据微软的透明度说明,评估窗口是 2026 年 5 月 31 日至 6 月 1 日在 LMArena 排行榜上的盲评人工偏好评判,微软报告在 12 个编辑类别中的大多数类别获胜——包括清理、背景、阴影和文字——这些类别均有 ≥100 次评判。这是 Arena 排名通常不会呈现的方法论细节,如果你要依赖这个排名做决策,了解评估范围是值得的。

文本生成图像榜第三名

在文本生成图像方面,排名第三,相比 MAI-Image-2 在各类别平均 ELO 提升 +74.5,根据 Microsoft Foundry Labs 页面,文字渲染方面有显著的 +104 ELO 提升。该榜前两名是 GPT-Image-2 和 Nano Banana 2——与 GPT-Image-2 的差距在报道中被描述为 Arena 有史以来最大的,但确切的 ELO 差值每天都在变化,引用前应在实时排行榜上重新核实。

我会避免的误解是:将这些简单概括为”MAI-Image-2.5 是第二名图像模型”。事实并非如此。编辑榜第二,文本生成图像榜第三。不同的榜单,不同的信号。

为什么 Arena 不能替代特定工作流的评估

Arena 是盲测两两对比投票。这是我们目前拥有的最真实的通用用户偏好信号,追踪哪些模型何时进入哪些榜单对于了解背景很有用。但它无法告诉你该模型是否能在你特定的产品图、你特定的品牌字体、你特定的编辑目录上保持身份一致性。微软发布文章明确提示了这一风险:“与所有图像模型一样,MAI-Image-2.5 可能反映其训练数据中的偏见,并可能产生貌似合理但不准确或具有误导性的视觉细节。”

Arena 告诉你的是:它处于顶级水平。它无法告诉你的是:对于你的工作负载,它是否是正确的顶级模型。

生产级图像编辑使用场景

产品图像清理与背景替换

图像到图像 API 支持对象移除、替换、属性更改、局部重绘和伪影清理(运动模糊被明确列出),同时保持构图完整性。对于电商场景——将手表从一个背景中取出、放置到另一个背景上、去除反光、替换表带颜色——这正是关键功能。微软明确表示该模型针对”创意工作的实际流程”进行了调整,我将其理解为:重点在于编辑,而非仅仅生成。官方 MAI-Image 页面上 WPP 的评价也印证了这一点——他们强调的是适合活动的图像制作。

局部编辑、文字替换与视觉推理

AI 图像编辑在文字处理上比其他任何方面都更容易失败。海报、包装、标牌、UI 截图——这些都取决于模型能否在不出现乱码的情况下渲染和重新渲染文字。微软的定位特别强调了文字渲染,而 +104 ELO 的文字渲染提升是发布材料中最有力的量化声明。

我还没有在生产规模下对多语言标牌进行压力测试。这在计划之中。文字渲染的声明总是需要逐语言验证——拉丁字符集和 CJK 的表现差异很大。

人像与身份一致性工作流

人像处理是身份漂移问题最突出的场景。微软记录了该模型能够在”风格化、姿势和布局变化中保持可识别的面孔,以及发型、服装、全身身份”——工作流程的核心诉求是:生成一张人像,编辑姿势,保持同一个人的特征。如果你一直在使用那些在第二次编辑时就会漂移的模型,这个方面值得进行真实的对比测试。“身份与角色一致性”能力针对品牌角色、代言人和社交媒体活动进行了定位。

直接访问 Foundry vs 聚合层

何时直接使用微软访问更合适

你已经在 Azure 上。你的团队有 Entra ID,账单通过微软流转,合规体系围绕微软构建。你需要 PTU 预留定价。你只运行一个模型,或者你的技术栈以微软为主。直接通过 Foundry 是阻力最小的路径。两个变体的完整定价结构和部署方式见微软的 Foundry 公告。

何时需要跨 GPT-Image、Nano Banana、Grok Imagine 和 MAI 进行模型路由

这是我反复思考的部分。图像生成领域目前有四个顶级竞争者——GPT-Image-2、Nano Banana 2/2.1、Grok Imagine 和 MAI-Image-2.5——各有不同的优势、不同的定价曲线,以及对同一提示词的不同编辑行为。如果你的产品需要针对不同任务选择最合适的模型,构建四套独立的集成是工程资源的浪费。

这正是”一个 API,多个模型”模式体现价值的地方。用 MAI 做精准编辑,用 GPT-Image-2 处理密集文字渲染,用 Nano Banana 2 生成高分辨率输出,按需路由。聚合平台从不同角度解决同样的问题。选择延迟和覆盖范围与你的工作流程匹配的那个。

这就是我在访问层方面能确认的全部内容。特定工作流的判断——哪个模型在你的图像上真正胜出——是你必须自己测试的部分。

常见问题

开发者通常如何在自己的图像编辑工作流程中测试 MAI-Image-2.5? 最低成本的路径是用 MAI Playground 进行提示词迭代,然后用 Flash 版本切换到 Foundry 图像编辑 API 进行批量测试。从你真实的生产集中准备 20–30 个有代表性的输入——不是精心挑选的演示——分别用 Flash 和基础模型运行。你实际工作负载上的差异比任何 Arena 榜单都更有参考价值。

直接使用 MAI-Image-2.5 与通过聚合层使用有什么实际区别? 直接使用 Foundry 能为你提供与微软最简洁的账单关系、PTU 预留定价以及 Entra ID 身份验证。聚合层则提供跨供应商路由——无需重建集成即可在 MAI、GPT-Image-2、Nano Banana 2 和 Grok Imagine 之间切换。如果你只使用一个图像模型,直接访问即可。如果你需要比较或切换,聚合层的价值会自然显现。

团队在什么情况下会选择 MAI-Image-2.5 而非其他已在使用的图像模型? 我会提出三种情况:精准编辑工作负载,需要在多次迭代中保持身份和构图(Arena 编辑榜第二是这里最有力的信号);Azure 原生技术栈,Foundry 计费和 Entra ID 身份验证减少了集成开销;以及商业图像制作——包装、标牌、品牌视觉内容——这是微软明确调优的方向,WPP 和 Shutterstock 被点名为评估方。

将图像生成工作负载迁移到 MAI-Image-2.5 时,团队应该注意什么? 三点。预览状态——两个变体在 Foundry 中仍标注为 Preview,因此 SLA 和功能一致性还会变化。定价流动性——MAI 图像系列在过去几个月经历了多次定价调整,构建成本估算时留出余量。模型生命周期——按照微软的发布节奏(Image-1 到 2.5 大约八个月),不要硬编码任何无法快速替换的内容。

这就是访问层的全貌。用真实输入自己跑一遍,那会告诉你比我说的任何话都更多的信息。

往期文章: