API MAI-Image-2.5 : Ce que les développeurs doivent savoir

MAI-Image-2.5 est disponible pour les développeurs. Découvrez l'accès à l'API, les compromis entre Flash et fidélité, les classements Arena et les cas d'usage en édition d'image en production.

By Dora 13 min read

Hé, les amis. Microsoft dispose désormais d’un modèle d’image phare classé n° 2 sur le tableau d’édition d’images d’Arena et n° 3 en génération texte-vers-image. Cela seul ne vous dit pas si MAI-Image-2.5 a sa place dans votre pipeline. Cet article est ce que j’aurais voulu lire avant de décider — ce que c’est vraiment, comment y accéder, où il s’intègre, et où il ne s’intègre pas.

Je ne l’utilise pas depuis deux semaines. La plupart des informations présentées ici concernent la réalité de la couche d’accès et le tableau des benchmarks publics. Les jugements sur les workflows sont signalés comme tels.

Ce qu’est MAI-Image-2.5

Le dernier modèle de génération et d’édition d’images de Microsoft

MAI-Image-2.5 est le sommet actuel de la gamme d’images propriétaire de Microsoft AI, lancé le 2 juin 2026 avec une variante Flash plus rapide. Il effectue la génération texte-vers-image et l’édition image-vers-image dans le même modèle. La documentation Microsoft Foundry le décrit comme un système basé sur la diffusion optimisé pour les « modifications chirurgicales avec cohérence » — éditions ciblées d’objets, adaptation de mise en page, mises à jour de texte, nettoyage d’artefacts comme la suppression du flou de mouvement — avec une cohérence visuelle préservée à travers les itérations.

Deux points importants pour les développeurs.

Premier point : il ne s’agit pas d’un aperçu de recherche caché derrière une liste d’attente. Le modèle est déjà intégré dans les surfaces produits de Microsoft — PowerPoint pour la génération d’images, OneDrive pour l’édition précise — ce qui signale que Microsoft le traite comme une infrastructure de production, pas comme une démo. Les clients entreprises nommés sur la vitrine MAI-Image de Microsoft AI incluent WPP (le Directeur Créatif Mondial Rob Reilly est cité) et Shutterstock (la PM Principale Vanessa Salvo a évalué la gamme de modèles).

Deuxième point : c’est le dernier d’un rythme de publication rapide. MAI-Image-1 a été livré le 13 octobre 2025. MAI-Image-2 et MAI-Image-2-Efficient ont suivi sur Foundry au printemps 2026. La version 2.5 est sortie environ huit mois après Image-1. Quelle que soit votre décision aujourd’hui, sa durée de vie sera plus courte que d’habitude.

MAI-Image-2.5 vs MAI-Image-2.5-Flash

Microsoft a livré deux variantes. Elles partagent la même famille mais résolvent des problèmes différents.

VarianteOptimisée pourPrix catalogue Foundry (entrée)Prix catalogue Foundry (sortie image)
MAI-Image-2.5Fidélité maximale5 $ / 1M tokens texte, 8 $ / 1M tokens image47 $ / 1M tokens image
MAI-Image-2.5-FlashVitesse et coût à l’échelle1,75 $ / 1M tokens (entrée texte et image)19,50 $–33 $ / 1M tokens image selon la source

Selon l’annonce tarifaire Microsoft Foundry, le niveau standard est de 5 $/M tokens en entrée texte, 8 $/M en entrée image, et 47 $/M en sortie image. Flash descend à 1,75 $/M pour les entrées texte et image, et 33 $/M pour la sortie image. Le prix d’entrée est environ un tiers du niveau standard ; la sortie image — généralement la ligne de coût dominante — représente environ 70 % du standard. La position de Microsoft : utilisez Flash pour les pipelines de production à fort volume, utilisez le modèle de base quand vous avez besoin du meilleur de ce que la famille produit.

Pour la plupart des travaux d’image en production, Flash est le choix par défaut et le modèle de base est le recours lorsque la sortie de Flash n’est pas suffisante. Vérifiez les tarifs sur la page live de Foundry avant de construire quoi que ce soit autour — Microsoft les a ajustés.

Chemins d’accès confirmés pour les développeurs

Azure AI Foundry et MAI Playground

L’API MAI-Image-2.5 passe par Microsoft Foundry — le même catalogue où vous déployez MAI-Image-2, GPT-Image-1.5 et le reste des modèles d’image partenaires et propriétaires. Vous provisionnez un déploiement depuis le Catalogue de Modèles Foundry, obtenez un point de terminaison Azure, vous authentifiez avec un token Entra ID ou une clé API, et appelez la surface API standard d’éditions d’images MAI. La tarification de réservation PTU est disponible pour les équipes avec des charges de travail prévisibles.

Si vous testez avant d’intégrer, MAI Playground vous offre la surface sans code. Construisez le prompt là-bas, puis passez à l’API.

OpenRouter et accès par couche d’agrégation

Vous n’êtes pas obligé de passer par Azure directement. MAI-Image-2.5 sur OpenRouter expose le même modèle avec la couche de facturation unifiée et de routage d’OpenRouter. Microsoft a confirmé le lancement OpenRouter dans la même annonce, OpenRouter notant que « 9 millions de développeurs » peuvent désormais accéder à MAI-Image-2.5 via la même API qu’ils utilisent déjà pour d’autres modèles. Foundry reste la source — OpenRouter transfère chaque requête à Microsoft, sans décisions de routage à prendre pour ce modèle spécifique.

Cela vaut la peine d’être signalé car l’agrégation compte plus qu’avant. Si vous faites déjà tourner GPT-Image-2, Nano Banana 2, ou Grok Imagine via une couche d’intégration unique, ajouter le modèle de Microsoft ne signifie pas écrire un nouveau client. Cela signifie changer une chaîne de modèle.

Déploiement produit PowerPoint et OneDrive

Microsoft a déjà intégré ce modèle dans PowerPoint (génération) et OneDrive (édition précise). La plupart des utilisateurs finaux le rencontreront sans connaître son nom. Pour les développeurs, cela compte de deux façons : c’est un indice sur le niveau de fiabilité que Microsoft s’engage à maintenir en interne, et c’est un signal concurrentiel — Microsoft utilise son propre modèle d’image dans ses propres produits au lieu de tout router vers OpenAI. Cette direction est probablement permanente.

Classements Arena : édition vs texte-vers-image

N° 2 sur Arena Image Edit

C’est le résultat phare. Sur le tableau d’édition d’images, MAI-Image-2.5 se classe n° 2, devant Nano Banana 2.1. Selon la note de transparence de Microsoft, la fenêtre d’évaluation était un jugement humain à l’aveugle sur le classement LMArena entre le 31 mai et le 1er juin 2026, et Microsoft rapporte des victoires dans la majorité des 12 catégories d’édition — incluant le nettoyage, les arrière-plans, les ombres et le texte — parmi les catégories avec ≥100 matchs jugés. C’est le détail méthodologique que les classements Arena ne mettent généralement pas en avant, et il vaut la peine de connaître la cohorte si vous misez sur le classement.

N° 3 en texte-vers-image

En texte-vers-image, il se situe au n° 3 avec une amélioration ELO de +74,5 par rapport à MAI-Image-2 en moyenne sur les catégories, et un gain notable de +104 ELO spécifiquement sur le rendu de texte, selon la page Microsoft Foundry Labs. Les deux premiers sur ce tableau sont GPT-Image-2 et Nano Banana 2 — l’écart de tête avec GPT-Image-2 a été décrit dans les reportages comme le plus grand qu’Arena ait jamais enregistré, bien que les deltas ELO exacts changent quotidiennement et devraient être re-vérifiés sur le classement live avant d’être cités.

L’erreur à éviter : regrouper tout cela en « MAI-Image-2.5 est le modèle d’image n° 2. » Ce n’est pas le cas. N° 2 en édition, n° 3 en texte-vers-image. Des tableaux différents, des signaux différents.

Pourquoi Arena ne remplace pas les évaluations spécifiques aux workflows

Arena est un vote par paires à l’aveugle. C’est le signal le plus honnête dont nous disposons pour la préférence générale des utilisateurs, et suivre quels modèles sont entrés dans quels tableaux et quand est utile pour le contexte. Mais cela ne vous dit pas si le modèle conserve l’identité sur vos photos de produits spécifiques, vos polices de marque spécifiques, votre catalogue d’éditions spécifique. L’article de lancement de Microsoft est explicite sur ce risque : « Comme tous les modèles d’image, MAI-Image-2.5 peut refléter les biais de ses données d’entraînement et peut produire des détails visuels plausibles mais inexacts ou trompeurs. »

Ce qu’Arena vous dit : il est dans le niveau supérieur. Ce qu’il ne vous dit pas : s’il est le bon modèle de niveau supérieur pour votre charge de travail.

Cas d’usage d’édition d’images en production

Nettoyage d’images de produits et remplacement d’arrière-plan

L’API image-vers-image prend en charge la suppression d’objets, le remplacement, les changements d’attributs, l’inpainting et le nettoyage d’artefacts (le flou de mouvement est mentionné explicitement) tout en préservant la composition. Pour l’e-commerce — retirer une montre d’un arrière-plan, la placer sur un autre, supprimer les reflets, changer la couleur du bracelet — c’est la surface qui compte. Microsoft est explicite sur le fait que le modèle a été optimisé pour « la façon dont le travail créatif se fait réellement », ce que j’interprète comme : les éditions, pas seulement les générations. Le témoignage de WPP sur la page officielle MAI-Image renforce cela — l’imagerie prête pour les campagnes est le cadre.

Éditions locales, remplacement de texte et raisonnement visuel

L’édition d’images par IA s’effondre plus vite sur le texte que sur tout autre élément. Les affiches, emballages, signalisations, captures d’écran d’interface — tout cela repose sur la capacité du modèle à rendre et re-rendre le texte sans distorsion. Le positionnement de Microsoft met spécifiquement en avant le rendu de texte, et le gain de +104 ELO sur le rendu de texte est la revendication quantitative la plus forte dans le matériel de lancement.

Je n’ai pas encore testé cela sur de la signalisation multilingue à l’échelle de production. C’est sur la liste. Les revendications de rendu de texte nécessitent toujours une vérification par langue — les jeux de caractères latins et CJK se comportent très différemment.

Workflows de portrait et de cohérence d’identité

La surface des portraits est là où la dérive d’identité fait le plus de dégâts. Microsoft documente le modèle comme préservant « les visages reconnaissables, ainsi que les cheveux, les vêtements, l’identité complète à travers les changements de stylisation, de pose et de mise en page » — la préoccupation de workflow est : générer un portrait, éditer la pose, conserver la même personne. Si vous routez cela via des modèles qui dérivent à la deuxième édition, cela vaut une vraie comparaison. La capacité de « cohérence d’identité et de personnage » est positionnée pour les personnages de marque, les porte-paroles et les campagnes sociales.

Accès direct à Foundry vs couche d’agrégation

Quand l’accès direct à Microsoft a du sens

Vous êtes déjà sur Azure. Votre équipe a Entra ID, votre facturation passe par Microsoft, votre posture de conformité est construite autour de cela. Vous voulez la tarification de réservation PTU. Vous utilisez un seul modèle, ou vous avez une stack à dominante Microsoft. Passer directement par Foundry est le chemin à moindre friction. La structure tarifaire complète pour les deux variantes et les surfaces de déploiement se trouve dans l’annonce Foundry de Microsoft.

Quand le routage de modèles entre GPT-Image, Nano Banana, Grok Imagine et MAI a de l’importance

C’est la partie à laquelle je reviens sans cesse. Le domaine de la génération d’images compte quatre sérieux concurrents au sommet en ce moment — GPT-Image-2, Nano Banana 2 / 2.1, Grok Imagine et MAI-Image-2.5 — chacun avec des forces différentes, des courbes de tarification différentes et un comportement d’édition différent sur le même prompt. Si votre produit a besoin du modèle le mieux adapté par tâche, construire quatre intégrations séparées est de l’ingénierie gaspillée.

C’est là que le modèle « une API, plusieurs modèles » justifie son utilité. Utilisez MAI pour les éditions chirurgicales, GPT-Image-2 pour le rendu de texte dense, Nano Banana 2 pour la sortie haute résolution, routez en conséquence. Les plateformes d’agrégation résolvent le même problème sous différents angles. Choisissez celle dont la latence et la couverture correspondent à votre workflow.

C’est tout ce que je peux confirmer côté couche d’accès. Les jugements spécifiques aux workflows — quel modèle gagne réellement sur vos images — c’est la partie que vous devez exécuter vous-même.

FAQ

Comment les développeurs testent-ils généralement MAI-Image-2.5 dans leurs propres workflows d’édition d’images ? Le chemin le moins coûteux est MAI Playground pour l’itération de prompts, puis passez à l’API d’éditions d’images Foundry avec Flash pour les tests en lot. Conservez 20 à 30 entrées représentatives de votre vrai ensemble de production — pas des démos soigneusement sélectionnées — et faites-les passer à la fois par Flash et par le modèle de base. Le delta sur votre charge de travail réelle est plus informatif que n’importe quel tableau Arena.

Quelle est la différence pratique entre utiliser MAI-Image-2.5 directement et passer par une couche d’agrégation ? Foundry direct vous donne la relation de facturation la plus propre avec Microsoft, la tarification de réservation PTU et l’authentification Entra ID. Les couches d’agrégation vous donnent le routage multi-fournisseurs — basculer entre MAI, GPT-Image-2, Nano Banana 2 et Grok Imagine sans reconstruire l’intégration. Si vous n’utilisez qu’un seul modèle d’image, allez en direct. Si vous comparez ou changez, l’agrégation s’amortit.

Quand les équipes choisiraient-elles MAI-Image-2.5 plutôt que d’autres modèles d’image qu’elles utilisent déjà ? Trois situations que je signalerais : les charges de travail d’édition chirurgicale où l’identité et la composition doivent tenir à travers les itérations (le classement n° 2 Arena en édition est le signal le plus fort ici) ; les stacks natives Azure où la facturation Foundry et l’authentification Entra ID réduisent la charge d’intégration ; et l’imagerie commerciale — emballages, signalisation, visuels axés sur la marque — pour laquelle Microsoft a explicitement optimisé, avec WPP et Shutterstock nommés comme évaluateurs.

À quoi les équipes doivent-elles faire attention lors du passage des charges de travail de génération d’images à MAI-Image-2.5 ? Trois choses. Le statut Preview — les deux variantes sont encore étiquetées Preview dans Foundry, donc les SLA et la parité des fonctionnalités vont évoluer. La fluidité des prix — la gamme d’images MAI a eu plusieurs mises à jour tarifaires ces derniers mois ; construisez des estimations de coûts avec une marge. Le cycle de vie du modèle — au rythme où Microsoft livre (Image-1 à 2.5 en environ huit mois), ne codez en dur rien que vous ne puissiez pas remplacer.

Voilà pour la situation d’accès. Exécutez-le vous-même sur de vraies entrées. Cela vous en dira plus que tout ce que je dis.

Articles précédents :