MAI-Image-2.5 API:ビルダーが知っておくべきこと

MAI-Image-2.5がビルダー向けに公開されました。APIアクセス方法、Flashと忠実度のトレードオフ、Arenaランキング、本番環境での画像編集ユースケースについて解説します。

By Dora 1 min read

みなさん。MicrosoftがArenaの画像編集ボードで2位、テキストから画像生成で3位にランクインしたフラッグシップ画像モデルを持つようになりました。それだけでは、MAI-Image-2.5があなたのパイプラインに適しているかどうかは判断できません。この記事は、判断する前に私自身が読みたかったもの――実際に何であるか、アクセス方法、どこに適合し、どこには適合しないか――をまとめたものです。

まだ2週間も使い込んでいません。ここに書いてある内容のほとんどは、アクセス層の実態と公開ベンチマークの状況です。ワークフローに関する判断はその旨を明記しています。

MAI-Image-2.5とは

Microsoftの最新画像生成・編集モデル

MAI-Image-2.5は、Microsoft AIのファーストパーティ画像ラインの現時点での最高峰であり、より高速なFlashバリアントとともに2026年6月2日にリリースされました。テキストから画像の生成と画像から画像への編集を同一モデルで行います。Microsoft Foundryのドキュメントでは、「一貫性を保ちながら精密な編集」に最適化された拡散ベースのシステムと説明されており、対象オブジェクトの編集、レイアウト調整、テキスト更新、モーションブラー除去などのアーティファクトクリーンアップを、反復を経ても視覚的一貫性を維持しながら実現します。

ビルダーにとって重要な点が2つあります。

1つ目:これはウェイトリストの裏に隠された研究プレビューではありません。このモデルはすでにMicrosoftの製品サービスに組み込まれており――PowerPointの画像生成、OneDriveの精密編集――これはMicrosoftがデモではなく本番インフラとして扱っているシグナルです。Microsoft AIのMAI-Imageショーケースには、WPP(グローバルチーフクリエイティブオフィサーのRob Reillyが引用)やShutterstock(プリンシパルPMのVanessa Salvoがモデルラインを評価)といった名前の挙がったエンタープライズ顧客が含まれています。

2つ目:これは急速なリリースペースの最新作です。MAI-Image-1は2025年10月13日に出荷されました。MAI-Image-2とMAI-Image-2-Efficientは2026年春にFoundryでリリースされました。2.5リリースはImage-1から約8ヶ月後に登場しました。今日下した決断は、通常より賞味期限が短いです。

MAI-Image-2.5 vs MAI-Image-2.5-Flash

Microsoftは2つのバリアントを出荷しました。同じファミリーを共有しますが、異なる問題を解決します。

バリアント最適化対象Foundry定価(入力)Foundry定価(画像出力)
MAI-Image-2.5最大忠実度$5 / 100万テキストトークン、$8 / 100万画像トークン$47 / 100万画像トークン
MAI-Image-2.5-Flashスケール時の速度とコスト$1.75 / 100万トークン(テキストおよび画像入力)$19.50〜$33 / 100万画像トークン(ソースによる)

Microsoft Foundryの価格発表によると、スタンダードティアはテキスト入力$5/Mトークン、画像入力$8/M、画像出力$47/Mです。Flashはテキストと画像入力が$1.75/Mに下がり、画像出力は$33/Mになります。入力価格はスタンダードティアの約3分の1で、通常コストの主要項目である画像出力はスタンダードの約70%です。Microsoftの考え方:大量本番パイプラインにはFlashを使い、ファミリーの最高品質が必要な場合はベースモデルを使う。

ほとんどの本番画像作業では、Flashがデフォルトで、ベースモデルはFlashの出力が不十分な場合のエスカレーションパスです。何かを構築する前にFoundryのライブページで価格を確認してください――Microsoftはこれらを調整し続けています。

ビルダー向けの確認済みアクセスパス

Azure AI FoundryとMAI Playground

MAI-Image-2.5 APIはMicrosoft Foundryを通じて提供されます――MAI-Image-2、GPT-Image-1.5、その他のパートナーおよびファーストパーティ画像モデルをデプロイするのと同じカタログです。Foundryモデルカタログからデプロイメントをプロビジョニングし、AzureエンドポイントとEntra IDトークンまたはAPIキーで認証し、標準のMAI画像編集APIサーフェスを呼び出します。予測可能なワークロードを持つチーム向けにPTU予約価格が利用可能です。

統合前にテストする場合は、MAI Playgroundがノーコードのサーフェスとしてアクセスできます。そこでプロンプトを構築してから、APIに移行します。

OpenRouterとアグリゲーション層アクセス

Azureを直接使用する必要はありません。OpenRouter上のMAI-Image-2.5は、その前にOpenRouterの統合課金とルーティング層を持つ同じモデルを公開しています。MicrosoftはOpenRouterのローンチを同じ発表で確認し、OpenRouterは「900万人の開発者」が他のモデルにすでに使用しているのと同じAPIを通じてMAI-Image-2.5にアクセスできるようになったと述べています。Foundryは依然としてソースです――OpenRouterはすべてのリクエストをMicrosoftに転送し、その特定のモデルについてルーティングの決定はありません。

これは、アグリゲーションが以前より重要になっているため、注目に値します。すでに1つの統合層を通じてGPT-Image-2、Nano Banana 2、またはGrok Imagineを実行している場合、Microsoftのモデルを追加することは新しいクライアントを作成することを意味しません。モデル文字列を切り替えるだけです。

PowerPointとOneDriveの製品ロールアウト

MicrosoftはすでにこのモデルをPowerPoint(生成)とOneDrive(精密編集)に組み込みました。ほとんどのエンドユーザーは名前を知らずに使うことになります。ビルダーにとってこれが重要な理由は2つあります:Microsoftが内部でコミットしている信頼性バーのヒントであること、そして競争的なシグナルであること――MicrosoftはすべてをOpenAIにルーティングするのではなく、自社製品に自社の画像モデルを使用しています。その方向性はおそらく恒久的なものです。

Arenaランキング:編集 vs テキストから画像生成

画像編集でNo. 2

これがヘッドラインの結果です。画像編集ボードで、MAI-Image-2.5はNano Banana 2.1を上回り2位にランクインしました。Microsoftの透明性ノートによると、評価ウィンドウは2026年5月31日から6月1日の間にLMArenaリーダーボードでのブラインドヒューマン選好判定であり、Microsoftはクリーンアップ、背景、影、テキストを含む編集カテゴリの中で、100件以上の判定マッチがあるカテゴリの大多数で勝利を報告しています。これはArenaランキングが通常明示しない方法論的詳細であり、ランキングを根拠にする場合はコホートを知っておく価値があります。

テキストから画像でNo. 3

テキストから画像では、Microsoft Foundry Labsページによると、カテゴリ平均でMAI-Image-2比+74.5 ELO向上、テキストレンダリングでは特に+104 ELOゲインを記録し、3位に位置しています。そのボードのトップ2はGPT-Image-2とNano Banana 2です――GPT-Image-2とのヘッドラインギャップは、報道ではArenaが記録した最大のものと表現されていますが、正確なELOデルタは毎日変動するため、引用前にライブリーダーボードで再確認すべきです。

避けたい間違い:これらを「MAI-Image-2.5はNo. 2の画像モデル」とまとめること。そうではありません。編集でNo. 2、テキストから画像でNo. 3。異なるボード、異なるシグナルです。

Arenaがワークフロー固有の評価を代替できない理由

Arenaはブラインドペアワイズ投票です。一般的なユーザー選好について私たちが持つ最も正直なシグナルであり、どのモデルがいつどのボードに入ったかを追跡することはコンテキストとして有用です。しかし、あなたの特定の製品写真、特定のブランドフォント、特定の編集カタログでモデルがアイデンティティを保持するかどうかは教えてくれません。Microsoftのローンチポストはこのリスクについて明示的です:「すべての画像モデルと同様に、MAI-Image-2.5はトレーニングデータのバイアスを反映し、もっともらしいが不正確または誤解を招く視覚的詳細を生成する可能性があります。」

Arenaが教えてくれること:トップティアにいること。教えてくれないこと:あなたのワークロードに適した最高のモデルかどうか。

本番画像編集ユースケース

製品画像のクリーンアップと背景置換

画像から画像へのAPIは、構図を維持しながら、オブジェクト除去、置換、属性変更、インペインティング、アーティファクトクリーンアップ(モーションブラーが明示されています)をサポートします。eコマース向け――時計をある背景から外して別の背景に置き、反射を除去し、ストラップの色を変える――これが重要なサーフェスです。Microsoftは「クリエイティブな作業が実際に行われる方法」に合わせてモデルが調整されたと明示しており、私はそれを「生成だけでなく、編集」と読み解きます。公式MAI-ImageページのWPPの証言はこれを裏付けています――キャンペーン対応の画像がフレーミングです。

ローカル編集、テキスト置換、視覚的推論

AI画像編集は他の何よりも速くテキストで壊れます。ポスター、パッケージング、看板、UIスクリーンショット――これらすべては、モデルがテキストをぐちゃぐちゃにせずにレンダリングおよび再レンダリングできるかどうかにかかっています。Microsoftのポジショニングはテキストレンダリングを特に強調しており、テキストレンダリングでの+104 ELOゲインはローンチ資料で最も強力な定量的主張です。

本番規模での多言語看板でこれをストレステストしていません。それはリストにあります。テキストレンダリングの主張は常に言語ごとの確認が必要です――ラテン文字セットとCJKは非常に異なる動作をします。

ポートレートとアイデンティティ一貫性ワークフロー

ポートレートサーフェスは、アイデンティティのドリフトが最も傷つく場所です。Microsoftはモデルについて「スタイル化、ポーズ、レイアウト変更を経ても認識可能な顔、さらに髪、衣服、全身のアイデンティティを保持する」と文書化しています――ワークフロー上の懸念:ポートレートを生成し、ポーズを編集し、同じ人物を維持する。2回目の編集でドリフトするモデルを通じてこれをルーティングしていた場合、これは実際の比較に値します。「アイデンティティとキャラクターの一貫性」機能は、ブランドキャラクター、スポークスパーソン、ソーシャルキャンペーン向けにポジショニングされています。

Foundryへの直接アクセス vs アグリゲーション層

Microsoftへの直接アクセスが有効な場合

すでにAzureを使用している。チームがEntra IDを持ち、課金がMicrosoftを通じて流れ、コンプライアンス体制がそれに基づいて構築されている。PTU予約価格が必要。1つのモデルを実行しているか、またはMicrosoft中心のスタックを実行している。Foundryを直接使用することは、摩擦の少ないパスです。両バリアントの完全な価格体系とデプロイメントサーフェスはMicrosoftのFoundry発表に記載されています。

GPT-Image、Nano Banana、Grok Imagine、MAI全体でモデルルーティングが有効な場合

ここが私が何度も立ち戻ってくる部分です。現在、画像生成分野にはトップに4つの真剣な競合他社があります――GPT-Image-2、Nano Banana 2 / 2.1、Grok Imagine、MAI-Image-2.5――それぞれ異なる強み、異なる価格曲線、同じプロンプトでの異なる編集動作を持ちます。製品がタスクごとに最適なモデルを必要とする場合、4つの独立した統合を構築することは無駄なエンジニアリングです。

これが「1つのAPI、複数のモデル」パターンが価値を発揮するところです。精密な編集にはMAIを実行し、密なテキストレンダリングにはGPT-Image-2を、高解像度出力にはNano Banana 2を使い、適切にルーティングする。アグリゲーションプラットフォームは異なる角度から同じ問題を解決します。レイテンシとカバレッジがワークフローに合致するものを選んでください。

アクセス層の側面で確認できるのはここまでです。ワークフロー固有の判断――実際にどのモデルがあなたのショットで勝つか――は自分で実行しなければならない部分です。

FAQ

ビルダーは通常、自分の画像編集ワークフローでMAI-Image-2.5をどのようにテストしますか? 最もコストが低いパスは、プロンプトのイテレーションにMAI Playgroundを使用し、バッチテストにFlashを使用したFoundry画像編集APIに移行することです。実際の本番セットから厳選されたデモではなく20〜30の代表的な入力を用意し、Flashとベースモデルの両方で実行してください。実際のワークロードでのデルタは、Arenaボードよりも有益な情報を提供します。

MAI-Image-2.5を直接使用することとアグリゲーション層を通じて使用することの実際の違いは何ですか? 直接Foundryを使用すると、Microsoftとのクリーンな課金関係、PTU予約価格、Entra ID認証が得られます。アグリゲーション層は、統合を再構築せずにMAI、GPT-Image-2、Nano Banana 2、Grok Imagineを切り替えるクロスプロバイダールーティングを提供します。1つの画像モデルしか実行しない場合は直接アクセスを選び、比較または切り替えを行う場合はアグリゲーションが元を取ります。

チームがすでに使用している他の画像モデルよりMAI-Image-2.5を選ぶのはどのような場合ですか? 3つの状況を挙げます:アイデンティティと構図を反復を通じて保持する必要がある精密な編集ワークロード(ArenaのNo. 2ランキングが最も強いシグナルです);Foundry課金とEntra ID認証が統合オーバーヘッドを削減するAzureネイティブスタック;そしてMicrosoftが明示的に調整した商業的画像――パッケージング、看板、ブランド重視のビジュアル――WPPとShutterstockが評価者として名指しされています。

画像生成ワークロードをMAI-Image-2.5に移行する際にチームが注意すべき点は何ですか? 3つあります。プレビュー状態――両バリアントはFoundryでまだPreviewとラベルが付いているため、SLAと機能パリティは変化します。価格の流動性――MAI画像ラインは過去数ヶ月で複数の価格更新があったため、マージンを持ってコスト見積もりを作成してください。モデルライフサイクル――Microsoftの出荷ペース(Image-1から2.5まで約8ヶ月)を考えると、交換できないものをハードコードしないでください。

これがアクセスの全体像です。実際の入力で自分で実行してください。それが私が言えるどんなことよりも多くを教えてくれます。

過去の投稿: