MAI-Image-2.5 API: 빌더가 알아야 할 것들
MAI-Image-2.5가 빌더들을 위해 출시되었습니다. API 접근 방법, Flash와 충실도 간의 트레이드오프, Arena 순위, 그리고 프로덕션 이미지 편집 사용 사례를 알아보세요.
안녕하세요, 여러분. Microsoft가 Arena 이미지 편집 보드에서 2위, 텍스트-이미지 변환에서 3위를 기록하는 플래그십 이미지 모델을 출시했습니다. 그것만으로는 MAI-Image-2.5가 여러분의 파이프라인에 적합한지 판단하기 어렵습니다. 이 글은 제가 결정을 내리기 전에 읽고 싶었던 내용입니다 — 실제로 무엇인지, 어떻게 접근하는지, 어디에 적합하고 어디에 적합하지 않은지.
아직 2주 동안 실행해보지는 않았습니다. 여기 있는 내용의 대부분은 접근 레이어 현실과 공개 벤치마크 데이터입니다. 워크플로 판단은 그렇게 표시되어 있습니다.
MAI-Image-2.5란 무엇인가
Microsoft의 최신 이미지 생성 및 편집 모델
MAI-Image-2.5는 현재 Microsoft AI의 자체 이미지 라인의 최상위 모델로, 더 빠른 Flash 변형과 함께 2026년 6월 2일에 출시되었습니다. 동일한 모델에서 텍스트-이미지 생성과 이미지-이미지 편집을 모두 수행합니다. Microsoft Foundry 문서에서는 “일관성을 유지하는 정밀 편집”에 최적화된 확산 기반 시스템으로 설명합니다 — 대상 객체 편집, 레이아웃 적응, 텍스트 업데이트, 모션 블러 제거와 같은 아티팩트 정리 — 반복 작업 전반에 걸쳐 시각적 일관성을 유지합니다.
빌더들에게 두 가지가 중요합니다.
첫째: 이것은 대기자 명단 뒤에 숨겨진 연구 미리보기가 아닙니다. 모델은 이미 Microsoft의 제품 서비스에 내장되어 있습니다 — 이미지 생성을 위한 PowerPoint, 정밀 편집을 위한 OneDrive — 이는 Microsoft가 데모가 아닌 프로덕션 인프라로 취급하고 있다는 신호입니다. Microsoft AI의 MAI-Image 쇼케이스에 이름이 올라간 기업 고객으로는 WPP(글로벌 최고 크리에이티브 책임자 Rob Reilly가 인용됨)와 Shutterstock(수석 PM Vanessa Salvo가 모델 라인을 평가함)이 포함됩니다.
둘째: 빠르게 움직이는 출시 주기의 최신 모델입니다. MAI-Image-1은 2025년 10월 13일에 출시되었습니다. MAI-Image-2와 MAI-Image-2-Efficient는 2026년 봄에 Foundry를 통해 출시되었습니다. 2.5 출시는 Image-1 이후 약 8개월 만에 이루어졌습니다. 오늘 결정하는 내용은 평소보다 유통 기한이 짧습니다.
MAI-Image-2.5 vs MAI-Image-2.5-Flash
Microsoft는 두 가지 변형을 출시했습니다. 동일한 패밀리를 공유하지만 서로 다른 문제를 해결합니다.
| 변형 | 최적화 대상 | Foundry 정가(입력) | Foundry 정가(이미지 출력) |
|---|---|---|---|
| MAI-Image-2.5 | 최대 충실도 | 텍스트 토큰 1M당 $5, 이미지 토큰 1M당 $8 | 이미지 토큰 1M당 $47 |
| MAI-Image-2.5-Flash | 대규모 속도 및 비용 | 토큰(텍스트 및 이미지 입력) 1M당 $1.75 | 소스에 따라 이미지 토큰 1M당 $19.50–$33 |
Microsoft Foundry 가격 발표에 따르면, 표준 티어는 텍스트 입력 M 토큰당 $5, 이미지 입력 M 토큰당 $8, 이미지 출력 M 토큰당 $47입니다. Flash는 텍스트 및 이미지 입력에서 M 토큰당 $1.75로, 이미지 출력에서는 M 토큰당 $33으로 낮아집니다. 입력 가격은 표준 티어의 약 3분의 1이며, 이미지 출력 — 일반적으로 지배적인 비용 항목 — 은 표준의 약 70%입니다. Microsoft의 설명: 대용량 프로덕션 파이프라인에는 Flash를 사용하고, 패밀리의 최상위 출력이 필요할 때는 기본 모델을 사용하세요.
대부분의 프로덕션 이미지 작업에서 Flash가 기본값이며, 기본 모델은 Flash 출력이 충분하지 않을 때의 에스컬레이션 경로입니다. 무언가를 구축하기 전에 Foundry의 라이브 페이지에서 가격을 확인하세요 — Microsoft가 이를 조정해 왔습니다.
빌더를 위해 확인된 접근 경로
Azure AI Foundry와 MAI Playground
MAI-Image-2.5 API는 Microsoft Foundry를 통해 제공됩니다 — MAI-Image-2, GPT-Image-1.5 및 나머지 파트너 및 자체 이미지 모델을 배포하는 동일한 카탈로그입니다. Foundry 모델 카탈로그에서 배포를 프로비저닝하고, Azure 엔드포인트를 얻고, Entra ID 토큰 또는 API 키로 인증하고, 표준 MAI 이미지 편집 API 서피스를 호출합니다. 예측 가능한 워크로드가 있는 팀을 위한 PTU 예약 가격도 이용 가능합니다.
통합 전에 테스트하는 경우, MAI Playground에서 코드 없이 사용할 수 있는 서피스를 제공합니다. 거기서 프롬프트를 구성한 다음 API로 이동하세요.
OpenRouter와 집계 레이어 접근
Azure를 직접 거칠 필요가 없습니다. OpenRouter의 MAI-Image-2.5는 동일한 모델을 OpenRouter의 통합 청구 및 라우팅 레이어와 함께 제공합니다. Microsoft는 동일한 발표에서 OpenRouter 출시를 확인했으며, OpenRouter는 “900만 개발자”가 이미 다른 모델에 사용하는 동일한 API를 통해 MAI-Image-2.5에 접근할 수 있다고 언급했습니다. Foundry는 여전히 소스입니다 — OpenRouter는 모든 요청을 Microsoft로 전달하며, 해당 특정 모델에 대한 라우팅 결정은 없습니다.
이것은 집계가 이전보다 더 중요해졌기 때문에 언급할 가치가 있습니다. 이미 하나의 통합 레이어를 통해 GPT-Image-2, Nano Banana 2 또는 Grok Imagine을 실행하고 있다면, Microsoft의 모델을 추가하는 것은 새로운 클라이언트를 작성하는 것을 의미하지 않습니다. 모델 문자열을 바꾸는 것을 의미합니다.
PowerPoint 및 OneDrive 제품 출시
Microsoft는 이미 이 모델을 PowerPoint(생성)와 OneDrive(정밀 편집)에 출시했습니다. 대부분의 최종 사용자는 이름을 모른 채 접하게 됩니다. 빌더에게 이것은 두 가지 방식으로 중요합니다: Microsoft가 내부적으로 약속하는 신뢰성 기준에 대한 힌트이며, 경쟁적 신호입니다 — Microsoft가 모든 것을 OpenAI로 라우팅하는 대신 자체 제품에서 자체 이미지 모델을 사용하고 있습니다. 그 방향은 아마 영구적일 것입니다.
Arena 순위: 편집 vs 텍스트-이미지
Arena 이미지 편집 2위
이것이 헤드라인 결과입니다. 이미지 편집 보드에서 MAI-Image-2.5는 Nano Banana 2.1을 앞서 2위에 올랐습니다. Microsoft의 투명성 노트에 따르면, 평가 기간은 2026년 5월 31일부터 6월 1일까지 LMArena 리더보드에서 블라인드 인간 선호도 판단이었으며, Microsoft는 ≥100번 판단된 매치 중 정리, 배경, 그림자, 텍스트를 포함한 12개 편집 카테고리 대부분에서 승리를 보고했습니다. 이것이 Arena 순위가 일반적으로 드러내지 않는 방법론적 세부사항이며, 순위에 베팅한다면 코호트를 아는 것이 중요합니다.
텍스트-이미지 3위
텍스트-이미지에서는 Microsoft Foundry Labs 페이지에 따르면 카테고리 전반에 걸쳐 MAI-Image-2에 비해 +74.5 ELO 개선과 함께 3위를 차지했으며, 특히 텍스트 렌더링에서는 +104 ELO 향상을 기록했습니다. 해당 보드의 상위 두 모델은 GPT-Image-2와 Nano Banana 2입니다 — GPT-Image-2와의 헤드라인 격차는 Arena가 기록한 가장 큰 격차로 보도에서 설명되었지만, 정확한 ELO 델타는 매일 변동하므로 인용하기 전에 라이브 리더보드에서 다시 확인해야 합니다.
제가 피하고 싶은 실수: “MAI-Image-2.5가 2위 이미지 모델”이라고 축약하는 것입니다. 그렇지 않습니다. 편집에서 2위, 텍스트-이미지에서 3위입니다. 다른 보드, 다른 신호입니다.
Arena가 워크플로별 평가를 대체하지 못하는 이유
Arena는 블라인드 쌍별 투표입니다. 일반 사용자 선호도에 대해 우리가 가진 가장 정직한 신호이며, 어떤 모델이 어떤 보드에 언제 진입했는지 추적하는 것은 맥락에 유용합니다. 하지만 모델이 특정 제품 사진, 특정 브랜드 폰트, 특정 편집 카탈로그에서 정체성을 유지하는지 여부는 알려주지 않습니다. Microsoft 출시 게시물은 이 위험에 대해 명시적입니다: “모든 이미지 모델과 마찬가지로, MAI-Image-2.5는 학습 데이터의 편향을 반영할 수 있으며 그럴듯하지만 부정확하거나 오해를 불러일으키는 시각적 세부사항을 생성할 수 있습니다.”
Arena가 알려주는 것: 상위 티어에 있다는 것. 알려주지 않는 것: 여러분의 워크로드에 맞는 올바른 상위 티어 모델인지 여부.
프로덕션 이미지 편집 사용 사례
제품 이미지 정리 및 배경 교체
이미지-이미지 API는 구성을 보존하면서 객체 제거, 교체, 속성 변경, 인페인팅 및 아티팩트 정리(모션 블러가 명시적으로 언급됨)를 지원합니다. 이커머스 — 하나의 배경에서 시계를 분리하고, 다른 배경에 배치하고, 반사를 제거하고, 스트랩 색상을 바꾸는 작업 — 에서 이것이 중요한 서피스입니다. Microsoft는 모델이 “창작 작업이 실제로 이루어지는 방식”에 맞게 조정되었다고 명시적으로 밝히고 있으며, 저는 이를 생성뿐만 아니라 편집에 맞게 조정되었다고 읽습니다. 공식 MAI-Image 페이지의 WPP 증언이 이를 뒷받침합니다 — 캠페인 준비 이미지가 핵심입니다.
로컬 편집, 텍스트 교체, 시각적 추론
AI 이미지 편집은 다른 무엇보다 텍스트에서 더 빨리 무너집니다. 포스터, 포장, 간판, UI 스크린샷 — 이 모든 것은 모델이 텍스트를 깨지지 않게 렌더링하고 다시 렌더링할 수 있는지 여부에 달려 있습니다. Microsoft의 포지셔닝은 특히 텍스트 렌더링을 강조하며, 텍스트 렌더링에서의 +104 ELO 향상은 출시 자료에서 가장 강력한 정량적 주장입니다.
아직 프로덕션 규모에서 다국어 간판을 대상으로 스트레스 테스트를 하지 않았습니다. 그것은 목록에 있습니다. 텍스트 렌더링 주장은 항상 언어별로 검증이 필요합니다 — 라틴 문자 세트와 CJK는 매우 다르게 동작합니다.
초상화 및 정체성 일관성 워크플로
초상화 서피스는 정체성 드리프트가 가장 큰 피해를 주는 곳입니다. Microsoft는 모델이 “스타일화, 포즈, 레이아웃 변경 전반에 걸쳐 인식 가능한 얼굴, 머리카락, 의상, 전신 정체성”을 보존한다고 문서화합니다 — 워크플로 관심사는: 초상화를 생성하고, 포즈를 편집하고, 동일한 사람을 유지하는 것입니다. 두 번째 편집에서 드리프트되는 모델을 통해 이를 라우팅해 왔다면, 이것은 진짜 비교를 할 가치가 있습니다. “정체성 및 캐릭터 일관성” 기능은 브랜드 캐릭터, 대변인, 소셜 캠페인을 위해 포지셔닝됩니다.
직접 Foundry 접근 vs 집계 레이어
Microsoft 직접 접근이 적합한 경우
이미 Azure를 사용하고 있습니다. 팀에 Entra ID가 있고, 청구가 Microsoft를 통해 이루어지고, 컴플라이언스 자세가 그것을 중심으로 구축되어 있습니다. PTU 예약 가격을 원합니다. 하나의 모델을 실행하거나, Microsoft 중심 스택을 실행하고 있습니다. Foundry를 통해 직접 가는 것이 마찰이 적은 경로입니다. 두 변형 모두의 전체 가격 구조와 배포 서피스는 Microsoft의 Foundry 발표에 있습니다.
GPT-Image, Nano Banana, Grok Imagine, MAI 간 모델 라우팅이 중요한 경우
이것이 제가 계속 돌아오는 부분입니다. 이미지 생성 분야에는 현재 상위에 네 가지 진지한 경쟁자가 있습니다 — GPT-Image-2, Nano Banana 2 / 2.1, Grok Imagine, MAI-Image-2.5 — 각각 다른 강점, 다른 가격 곡선, 동일한 프롬프트에서 다른 편집 동작을 가지고 있습니다. 제품이 작업별로 최적합 모델이 필요한 경우, 네 가지 별도 통합을 구축하는 것은 낭비되는 엔지니어링입니다.
이것이 “하나의 API, 여러 모델” 패턴이 가치를 발휘하는 곳입니다. 정밀 편집에는 MAI를 실행하고, 밀도 높은 텍스트 렌더링에는 GPT-Image-2를, 고해상도 출력에는 Nano Banana 2를 사용하고, 적절히 라우팅하세요. 집계 플랫폼은 다른 각도에서 동일한 문제를 해결합니다. 지연 시간과 커버리지가 워크플로에 맞는 것을 선택하세요.
그것이 제가 접근 레이어 측면에서 확인할 수 있는 전부입니다. 워크플로별 판단 — 어떤 모델이 실제로 여러분의 샷에서 이기는지 — 은 직접 실행해야 하는 부분입니다.
FAQ
빌더들은 보통 자신의 이미지 편집 워크플로에서 MAI-Image-2.5를 어떻게 테스트하나요? 가장 저렴한 경로는 프롬프트 반복을 위한 MAI Playground이고, 그런 다음 배치 테스트를 위해 Flash와 함께 Foundry 이미지 편집 API로 이동하는 것입니다. 실제 프로덕션 세트에서 20–30개의 대표 입력을 보유하세요 — 선별된 데모가 아닌 — 그리고 Flash와 기본 모델 모두를 통해 실행하세요. 실제 워크로드의 델타가 어떤 Arena 보드보다 더 유익합니다.
MAI-Image-2.5를 직접 사용하는 것과 집계 레이어를 통해 사용하는 것의 실질적인 차이는 무엇인가요? 직접 Foundry는 Microsoft와 가장 깔끔한 청구 관계, PTU 예약 가격, Entra ID 인증을 제공합니다. 집계 레이어는 통합을 다시 구축하지 않고 MAI, GPT-Image-2, Nano Banana 2, Grok Imagine 간에 전환하는 크로스 프로바이더 라우팅을 제공합니다. 이미지 모델 하나만 실행한다면 직접 가세요. 비교하거나 전환한다면 집계가 비용을 정당화합니다.
팀들이 이미 사용 중인 다른 이미지 모델 대신 MAI-Image-2.5를 선택할 때는 언제인가요? 세 가지 상황을 언급하겠습니다: 반복 작업 전반에 걸쳐 정체성과 구성을 유지해야 하는 정밀 편집 워크로드(Arena 편집 2위 순위가 여기서 가장 강력한 신호입니다); Foundry 청구와 Entra ID 인증이 통합 오버헤드를 줄이는 Azure 네이티브 스택; 그리고 상업 이미지 — 포장, 간판, 브랜드 중심 시각자료 — Microsoft가 WPP와 Shutterstock을 평가자로 지명하여 명시적으로 조정한 것.
팀들이 이미지 생성 워크로드를 MAI-Image-2.5로 이전할 때 주의해야 할 사항은 무엇인가요? 세 가지. 미리보기 상태 — 두 변형 모두 Foundry에서 여전히 미리보기로 표시되어 있으므로 SLA 및 기능 동등성이 변경될 것입니다. 가격 유동성 — MAI 이미지 라인은 지난 몇 달 동안 여러 가격 업데이트가 있었습니다; 마진을 두고 비용 추정을 구축하세요. 모델 수명 주기 — Microsoft가 출시하는 속도(Image-1에서 2.5까지 약 8개월)를 감안할 때, 교체할 수 없는 것은 하드코딩하지 마세요.
그것이 접근 그림입니다. 실제 입력으로 직접 실행해 보세요. 제가 말하는 어떤 것보다 더 많은 것을 알려줄 것입니다.
이전 게시물:





