MAI-Image-2.5 API: что нужно знать разработчикам
MAI-Image-2.5 доступен для разработчиков. Узнайте о доступе к API, компромиссах между Flash и точностью, рейтингах Arena и сценариях использования редактирования изображений в продакшене.
Привет, ребята. У Microsoft теперь есть флагманская модель генерации изображений, которая занимает 2-е место в рейтинге Arena по редактированию изображений и 3-е по созданию изображений из текста. Но это само по себе не отвечает на вопрос, нужна ли вам MAI-Image-2.5 в вашем пайплайне. Эта статья — то, что я хотел бы прочитать перед принятием решения: что это такое, как получить доступ, где она подходит, а где нет.
Я ещё не работал с ней две недели. Большая часть написанного здесь — это реальность на уровне доступа и публичная картина бенчмарков. Суждения о рабочих процессах помечены как таковые.
Что такое MAI-Image-2.5
Новейшая модель Microsoft для генерации и редактирования изображений
MAI-Image-2.5 — это флагманская модель линейки собственных изображений Microsoft AI, запущенная 2 июня 2026 года вместе с более быстрым вариантом Flash. Она выполняет генерацию изображений по тексту и редактирование изображений в одной модели. Документация Microsoft Foundry описывает её как систему на основе диффузии, оптимизированную для «точечных правок с сохранением согласованности» — целевое редактирование объектов, адаптация макета, обновление текста, устранение артефактов вроде размытия движения — с сохранением визуальной согласованности между итерациями.
Для разработчиков здесь важны два момента.
Первый: это не исследовательский предпросмотр за списком ожидания. Модель уже встроена в продукты Microsoft — PowerPoint для генерации изображений, OneDrive для точного редактирования — что сигнализирует о том, что Microsoft рассматривает её как производственную инфраструктуру, а не демо. Среди named enterprise-клиентов на странице MAI-Image от Microsoft AI — WPP (цитируется Global Chief Creative Officer Роб Рейли) и Shutterstock (Principal PM Ванесса Сальво оценивала линейку моделей).
Второй: это последнее звено в стремительном цикле выпусков. MAI-Image-1 вышла 13 октября 2025 года. MAI-Image-2 и MAI-Image-2-Efficient появились в Foundry весной 2026 года. Версия 2.5 вышла примерно через восемь месяцев после Image-1. Любое решение, принятое сегодня, имеет более короткий срок службы, чем обычно.
MAI-Image-2.5 против MAI-Image-2.5-Flash
Microsoft выпустила два варианта. Они принадлежат одному семейству, но решают разные задачи.
| Вариант | Оптимизирован для | Прейскурантная цена Foundry (входные данные) | Прейскурантная цена Foundry (вывод изображений) |
|---|---|---|---|
| MAI-Image-2.5 | Максимальное качество | $5 / 1М текстовых токенов, $8 / 1М токенов изображений | $47 / 1М токенов изображений |
| MAI-Image-2.5-Flash | Скорость и стоимость при масштабировании | $1,75 / 1М токенов (текст и изображения на входе) | $19,50–$33 / 1М токенов изображений в зависимости от источника |
Согласно объявлению о ценах Microsoft Foundry, стандартный тариф составляет $5/М токенов для текстового ввода, $8/М для ввода изображений и $47/М для вывода изображений. Flash снижает стоимость до $1,75/М для текста и ввода изображений и $33/М для вывода изображений. Цена на ввод составляет примерно треть стандартного тарифа; вывод изображений — обычно самая затратная статья — стоит около 70% от стандарта. Позиционирование Microsoft: используйте Flash для высокообъёмных производственных пайплайнов, базовую модель — когда нужен максимум возможностей семейства.
Для большинства производственных задач с изображениями Flash является выбором по умолчанию, а базовая модель — вариантом эскалации, когда результатов Flash недостаточно. Уточняйте цены на живой странице Foundry перед тем, как строить что-либо на этой основе — Microsoft их регулярно корректирует.
Подтверждённые пути доступа для разработчиков
Azure AI Foundry и MAI Playground
API MAI-Image-2.5 поставляется через Microsoft Foundry — тот же каталог, где вы развёртываете MAI-Image-2, GPT-Image-1.5 и остальные партнёрские и собственные модели изображений. Вы создаёте развёртывание из Foundry Model Catalog, получаете Azure endpoint, аутентифицируетесь с помощью токена Entra ID или API-ключа и вызываете стандартный API поверхности MAI для редактирования изображений. Для команд с предсказуемой нагрузкой доступно резервирование PTU.
Если вы тестируете перед интеграцией, MAI Playground предоставляет интерфейс без кода. Сформируйте запрос там, затем переходите к API.
OpenRouter и доступ через агрегационный слой
Не обязательно идти через Azure напрямую. MAI-Image-2.5 на OpenRouter предоставляет ту же модель с единым биллингом и маршрутизацией OpenRouter перед ней. Microsoft подтвердила запуск на OpenRouter в том же анонсе, при этом OpenRouter отметил, что «9 миллионов разработчиков» теперь могут получить доступ к MAI-Image-2.5 через тот же API, который они уже используют для других моделей. Foundry по-прежнему является источником — OpenRouter перенаправляет каждый запрос в Microsoft, никаких решений о маршрутизации для этой конкретной модели принимать не нужно.
Это стоит отметить, потому что агрегация важна больше, чем раньше. Если вы уже запускаете GPT-Image-2, Nano Banana 2 или Grok Imagine через один интеграционный слой, добавление модели Microsoft не означает написание нового клиента. Это означает смену строки модели.
Выкатка в PowerPoint и OneDrive
Microsoft уже встроила эту модель в PowerPoint (генерация) и OneDrive (точное редактирование). Большинство конечных пользователей столкнутся с ней, не зная названия. Для разработчиков это важно по двум причинам: это подсказка о планке надёжности, которую Microsoft берёт на себя внутри компании, и конкурентный сигнал — Microsoft использует собственную модель изображений в своих продуктах вместо того, чтобы перенаправлять всё в OpenAI. Это направление, вероятно, останется постоянным.
Рейтинги Arena: редактирование против генерации из текста
2-е место в Arena Image Edit
Это главный результат. В рейтинге редактирования изображений MAI-Image-2.5 занимает 2-е место, опережая Nano Banana 2.1. Согласно примечанию Microsoft о прозрачности, окно оценки представляло собой слепое голосование людей на таблице лидеров LMArena с 31 мая по 1 июня 2026 года, и Microsoft сообщает о победах в большинстве из 12 категорий редактирования — включая очистку, фоны, тени и текст — среди категорий с ≥100 оцениваемых совпадений. Это методологическая деталь, которую рейтинги Arena обычно не раскрывают, и стоит знать состав участников, если вы делаете ставку на эту позицию.
3-е место в генерации из текста
В генерации изображений по тексту модель занимает 3-е место с улучшением ELO на +74,5 по сравнению с MAI-Image-2 в среднем по категориям, и заметным приростом +104 ELO конкретно по рендерингу текста, согласно странице Microsoft Foundry Labs. Первые два места в этом рейтинге занимают GPT-Image-2 и Nano Banana 2 — разрыв с GPT-Image-2 в заголовках описывался как крупнейший, зафиксированный Arena, хотя точные дельты ELO меняются ежедневно и их следует перепроверять на живой таблице лидеров перед цитированием.
Ошибка, которой я бы избегал: сводить всё к «MAI-Image-2.5 — это модель изображений №2». Это не так. №2 по редактированию, №3 по генерации из текста. Разные рейтинги, разные сигналы.
Почему Arena не заменяет оценки для конкретных рабочих процессов
Arena — это слепое попарное голосование. Это наиболее честный сигнал о предпочтениях пользователей в целом, и отслеживание того, какие модели вошли в какие рейтинги и когда, полезно для контекста. Но это не скажет вам, удержит ли модель идентичность на ваших конкретных снимках продуктов, ваших конкретных фирменных шрифтах, вашем конкретном каталоге правок. Пост о запуске Microsoft прямо говорит об этом риске: «Как и все модели изображений, MAI-Image-2.5 может отражать предвзятости в обучающих данных и производить правдоподобные, но неточные или вводящие в заблуждение визуальные детали».
Что говорит вам Arena: модель находится в верхнем эшелоне. Чего она вам не говорит: является ли она правильной топовой моделью для вашей рабочей нагрузки.
Производственные сценарии редактирования изображений
Очистка изображений продуктов и замена фонов
API изображение-в-изображение поддерживает удаление объектов, замену, изменение атрибутов, инпейнтинг и устранение артефактов (размытие движения упоминается явно) при сохранении композиции. Для электронной коммерции — перенос часов с одного фона на другой, удаление отражений, смена цвета ремешка — это та поверхность, которая имеет значение. Microsoft прямо говорит, что модель была настроена для «того, как творческая работа реально выполняется», что я читаю как: правки, а не только генерации. Отзыв WPP на официальной странице MAI-Image подтверждает это — изображения, готовые для кампаний, это главный посыл.
Локальные правки, замена текста и визуальное мышление
Редактирование изображений с помощью ИИ быстрее всего ломается на тексте, чем на чём-либо другом. Постеры, упаковка, вывески, скриншоты интерфейсов — всё это зависит от того, может ли модель рендерить и перерендеривать текст без искажений. Microsoft особо выделяет рендеринг текста, и прирост +104 ELO по рендерингу текста — это самое сильное количественное утверждение в материалах запуска.
Я ещё не тестировал это на многоязычных вывесках в производственном масштабе. Это в списке. Утверждения о рендеринге текста всегда требуют проверки для каждого языка — латинские наборы символов и CJK ведут себя очень по-разному.
Рабочие процессы с портретами и согласованностью идентичности
Поверхность портретов — это место, где дрейф идентичности причиняет наибольший вред. Microsoft документирует модель как сохраняющую «узнаваемые лица, а также волосы, одежду, идентичность всего тела при изменении стилизации, позы и макета» — рабочий вопрос: сгенерировать портрет, изменить позу, сохранить того же человека. Если вы маршрутизировали это через модели, которые дрейфуют при втором редактировании, это стоит реального сравнения. Возможность «согласованности идентичности и персонажей» позиционируется для брендированных персонажей, спикеров и социальных кампаний.
Прямой доступ через Foundry против агрегационного слоя
Когда имеет смысл прямой доступ через Microsoft
Вы уже на Azure. У вашей команды есть Entra ID, ваш биллинг идёт через Microsoft, ваша позиция по соответствию требованиям построена вокруг неё. Вы хотите резервирование PTU. Вы запускаете одну модель или стек с преобладанием Microsoft. Прямой путь через Foundry — это путь меньшего сопротивления. Полная структура цен для обоих вариантов и поверхностей развёртывания приведена в анонсе Microsoft Foundry.
Когда важна маршрутизация между GPT-Image, Nano Banana, Grok Imagine и MAI
Это то, к чему я возвращаюсь снова и снова. На вершине сферы генерации изображений сейчас четыре серьёзных конкурента — GPT-Image-2, Nano Banana 2 / 2.1, Grok Imagine и MAI-Image-2.5 — каждый с разными сильными сторонами, разными кривыми ценообразования и разным поведением при редактировании одного и того же запроса. Если вашему продукту нужна наилучшая подходящая модель для каждой задачи, построение четырёх отдельных интеграций — это потраченные впустую инженерные ресурсы.
Здесь и проявляет себя паттерн «один API, несколько моделей». Запускайте MAI для точечных правок, GPT-Image-2 для плотного рендеринга текста, Nano Banana 2 для высококачественного вывода, маршрутизируйте соответственно. Агрегационные платформы решают ту же проблему с разных сторон. Выбирайте ту, чья задержка и охват соответствуют вашему рабочему процессу.
Это всё, что я могу подтвердить на уровне доступа. Суждения, специфичные для рабочих процессов — какая модель реально выигрывает на ваших снимках — это то, что вам нужно проверить самостоятельно.
FAQ
Как разработчики обычно тестируют MAI-Image-2.5 в своих рабочих процессах редактирования изображений? Самый дешёвый путь — MAI Playground для итерации по запросам, затем переход к API редактирования изображений Foundry с Flash для пакетного тестирования. Возьмите 20–30 репрезентативных входных данных из вашего реального производственного набора — не курированные демо — и прогоните их через Flash и базовую модель. Дельта на вашей реальной нагрузке информативнее любой таблицы Arena.
В чём практическая разница между использованием MAI-Image-2.5 напрямую и через агрегационный слой? Прямой Foundry даёт вам чистейшие биллинговые отношения с Microsoft, резервирование PTU и аутентификацию Entra ID. Агрегационные слои дают вам межпровайдерную маршрутизацию — переключение между MAI, GPT-Image-2, Nano Banana 2 и Grok Imagine без перестройки интеграции. Если вы всегда запускаете только одну модель изображений, идите напрямую. Если сравниваете или переключаетесь — агрегация окупается сама.
Когда команды выбирали бы MAI-Image-2.5 вместо других моделей изображений, которые они уже используют? Три ситуации, которые я бы выделил: рабочие нагрузки с точечными правками, где идентичность и композиция должны сохраняться между итерациями (рейтинг Arena по редактированию №2 — наиболее сильный сигнал здесь); стеки на базе Azure, где биллинг Foundry и аутентификация Entra ID снижают накладные расходы на интеграцию; и коммерческие изображения — упаковка, вывески, визуалы с сильной идентичностью бренда — для которых Microsoft настраивала модель явно, с WPP и Shutterstock в качестве оценщиков.
На что командам следует обратить внимание при переносе рабочих нагрузок генерации изображений на MAI-Image-2.5? Три вещи. Статус предпросмотра — оба варианта всё ещё помечены как Preview в Foundry, поэтому SLA и паритет функций будут меняться. Гибкость ценообразования — линейка MAI image претерпела несколько обновлений цен за последние несколько месяцев; стройте оценки затрат с запасом. Жизненный цикл модели — в темпе, с которым Microsoft выпускает релизы (от Image-1 до 2.5 примерно за восемь месяцев), не захардкодируйте ничего, что нельзя заменить.
Это картина доступа. Запустите сами на реальных входных данных. Это скажет вам больше, чем всё, что я могу написать.
Предыдущие посты:
