API MAI-Image-2.5: Yang Perlu Diketahui Para Developer
MAI-Image-2.5 kini tersedia untuk para developer. Pelajari akses API, perbandingan Flash vs fidelitas, peringkat Arena, dan kasus penggunaan pengeditan gambar untuk produksi.
Hei, teman-teman. Microsoft kini memiliki model gambar unggulan yang menempati posisi No. 2 di papan edit gambar Arena dan No. 3 untuk teks-ke-gambar. Itu saja tidak cukup untuk menentukan apakah MAI-Image-2.5 layak masuk ke pipeline Anda. Artikel ini adalah apa yang ingin saya baca sebelum memutuskan — apa sebenarnya model ini, cara mengaksesnya, di mana ia cocok digunakan, dan di mana tidak.
Saya belum menjalankannya selama dua minggu penuh. Sebagian besar yang ada di sini adalah realita lapisan akses dan gambaran benchmark publik. Penilaian alur kerja ditandai sebagaimana mestinya.
Apa itu MAI-Image-2.5
Model generasi dan pengeditan gambar terbaru Microsoft
MAI-Image-2.5 adalah puncak lini gambar pertama Microsoft AI saat ini, diluncurkan pada 2 Juni 2026 bersama varian Flash yang lebih cepat. Model ini menangani generasi teks-ke-gambar dan pengeditan gambar-ke-gambar dalam satu model yang sama. Dokumentasi Microsoft Foundry mendeskripsikannya sebagai sistem berbasis difusi yang dioptimalkan untuk “pengeditan bedah dengan konsistensi” — pengeditan objek yang ditargetkan, adaptasi tata letak, pembaruan teks, pembersihan artefak seperti penghapusan motion blur — dengan konsistensi visual yang terjaga di seluruh iterasi.
Dua hal penting bagi para pengembang.
Pertama: ini bukan pratinjau riset yang tersembunyi di balik daftar tunggu. Model ini sudah ada di dalam permukaan produk Microsoft — PowerPoint untuk generasi gambar, OneDrive untuk pengeditan presisi — yang merupakan sinyal bahwa Microsoft memperlakukannya sebagai infrastruktur produksi, bukan sekadar demo. Pelanggan enterprise bernama di halaman showcase MAI-Image Microsoft AI termasuk WPP (dikutip Global Chief Creative Officer Rob Reilly) dan Shutterstock (Principal PM Vanessa Salvo yang mengevaluasi lini model tersebut).
Kedua: ini adalah yang terbaru dalam siklus rilis yang bergerak cepat. MAI-Image-1 dirilis pada 13 Oktober 2025. MAI-Image-2 dan MAI-Image-2-Efficient menyusul di Foundry pada musim semi 2026. Rilis 2.5 hadir sekitar delapan bulan setelah Image-1. Apapun yang Anda putuskan hari ini memiliki umur yang lebih pendek dari biasanya.
MAI-Image-2.5 vs MAI-Image-2.5-Flash
Microsoft merilis dua varian. Keduanya berasal dari keluarga yang sama tetapi memecahkan masalah yang berbeda.
| Varian | Dioptimalkan untuk | Harga daftar Foundry (input) | Harga daftar Foundry (output gambar) |
|---|---|---|---|
| MAI-Image-2.5 | Fidelitas maksimum | $5 / 1M token teks, $8 / 1M token gambar | $47 / 1M token gambar |
| MAI-Image-2.5-Flash | Kecepatan dan biaya dalam skala besar | $1,75 / 1M token (input teks dan gambar) | $19,50–$33 / 1M token gambar tergantung sumber |
Berdasarkan pengumuman harga Microsoft Foundry, tier standar adalah $5/M token input teks, $8/M input gambar, dan $47/M output gambar. Flash turun menjadi $1,75/M untuk input teks dan gambar, serta $33/M untuk output gambar. Harga input sekitar sepertiga dari tier standar; output gambar — biasanya biaya yang paling dominan — berkisar sekitar 70% dari standar. Framing Microsoft: gunakan Flash untuk pipeline produksi volume tinggi, gunakan model dasar ketika Anda membutuhkan hasil terbaik dari keluarga ini.
Untuk sebagian besar pekerjaan gambar produksi, Flash adalah pilihan default dan model dasar adalah jalur eskalasi ketika output Flash tidak cukup baik. Periksa harga di halaman langsung Foundry sebelum Anda membangun apapun berdasarkannya — Microsoft telah melakukan beberapa penyesuaian.
Jalur akses yang terkonfirmasi untuk pengembang
Azure AI Foundry dan MAI Playground
API MAI-Image-2.5 dikirimkan melalui Microsoft Foundry — katalog yang sama tempat Anda men-deploy MAI-Image-2, GPT-Image-1.5, dan model gambar mitra serta pihak pertama lainnya. Anda menyediakan deployment dari Foundry Model Catalog, mendapatkan endpoint Azure, mengautentikasi dengan token Entra ID atau API key, dan memanggil permukaan API pengeditan gambar MAI standar. Harga reservasi PTU tersedia untuk tim dengan beban kerja yang dapat diprediksi.
Jika Anda menguji sebelum mengintegrasikan, MAI Playground memberikan Anda antarmuka tanpa kode. Buat prompt di sana, kemudian beralih ke API.
OpenRouter dan akses lapisan agregasi
Anda tidak harus melalui Azure secara langsung. MAI-Image-2.5 di OpenRouter mengekspos model yang sama dengan lapisan penagihan dan routing terpadu OpenRouter di depannya. Microsoft mengonfirmasi peluncuran OpenRouter dalam pengumuman yang sama, dengan OpenRouter mencatat bahwa “9 juta pengembang” kini dapat mengakses MAI-Image-2.5 melalui API yang sudah mereka gunakan untuk model lain. Foundry tetap menjadi sumbernya — OpenRouter meneruskan setiap permintaan ke Microsoft, tidak ada keputusan routing yang perlu dibuat untuk model tertentu tersebut.
Ini layak dicatat karena agregasi semakin penting dari sebelumnya. Jika Anda sudah menjalankan GPT-Image-2, Nano Banana 2, atau Grok Imagine melalui satu lapisan integrasi, menambahkan model Microsoft tidak berarti menulis klien baru. Cukup mengubah string model.
Rollout produk PowerPoint dan OneDrive
Microsoft sudah mengintegrasikan model ini ke PowerPoint (generasi) dan OneDrive (pengeditan presisi). Sebagian besar pengguna akhir akan menggunakannya tanpa mengetahui namanya. Bagi pengembang, ini penting dalam dua hal: ini adalah petunjuk tentang standar keandalan yang Microsoft komitkan secara internal, dan ini adalah sinyal kompetitif — Microsoft menggunakan model gambarnya sendiri dalam produknya sendiri alih-alih merutekan semuanya ke OpenAI. Arah tersebut kemungkinan bersifat permanen.
Peringkat Arena: edit vs teks-ke-gambar
No. 2 di Arena Image Edit
Ini adalah hasil utamanya. Di papan pengeditan gambar, MAI-Image-2.5 menempati posisi No. 2, unggul dari Nano Banana 2.1. Berdasarkan catatan transparansi Microsoft, jendela evaluasi adalah penilaian preferensi manusia secara buta di papan peringkat LMArena antara 31 Mei dan 1 Juni 2026, dan Microsoft melaporkan kemenangan di mayoritas dari 12 kategori pengeditan — termasuk pembersihan, latar belakang, bayangan, dan teks — di antara kategori dengan ≥100 pertandingan yang dinilai. Itu adalah detail metodologis yang biasanya tidak ditampilkan oleh peringkat Arena, dan penting untuk mengetahui kohortnya jika Anda mengandalkan peringkat tersebut.
No. 3 untuk teks-ke-gambar
Untuk teks-ke-gambar, ia berada di No. 3 dengan peningkatan ELO +74,5 dibandingkan MAI-Image-2 rata-rata di seluruh kategori, dan peningkatan ELO +104 yang signifikan khusus untuk rendering teks, berdasarkan halaman Microsoft Foundry Labs. Dua teratas di papan tersebut adalah GPT-Image-2 dan Nano Banana 2 — kesenjangan utama dengan GPT-Image-2 telah digambarkan dalam liputan sebagai yang terbesar yang pernah dicatat Arena, meski delta ELO yang tepat berubah setiap hari dan harus diverifikasi ulang terhadap papan peringkat langsung sebelum dikutip.
Kesalahan yang ingin saya hindari: menyederhanakan ini menjadi “MAI-Image-2.5 adalah model gambar No. 2.” Bukan begitu. No. 2 untuk pengeditan, No. 3 untuk teks-ke-gambar. Papan berbeda, sinyal berbeda.
Mengapa Arena tidak menggantikan evaluasi khusus alur kerja
Arena adalah voting berpasangan yang buta. Ini adalah sinyal paling jujur yang kita miliki untuk preferensi pengguna umum, dan melacak model mana yang masuk ke papan mana dan kapan berguna untuk konteks. Namun ini tidak memberi tahu Anda apakah model tersebut mempertahankan identitas pada foto produk spesifik Anda, font merek spesifik Anda, katalog pengeditan spesifik Anda. Postingan peluncuran Microsoft secara eksplisit menyebutkan risiko ini: “Seperti semua model gambar, MAI-Image-2.5 dapat mencerminkan bias dalam data pelatihannya dan mungkin menghasilkan detail visual yang masuk akal namun tidak akurat atau menyesatkan.”
Apa yang Arena sampaikan: model ini berada di tingkat teratas. Apa yang tidak disampaikan: apakah ini model tingkat teratas yang tepat untuk beban kerja Anda.
Kasus penggunaan pengeditan gambar produksi
Pembersihan gambar produk dan penggantian latar belakang
API gambar-ke-gambar mendukung penghapusan objek, penggantian, perubahan atribut, inpainting, dan pembersihan artefak (motion blur disebutkan secara khusus) sambil mempertahankan komposisi. Untuk e-commerce — mengambil jam tangan dari satu latar belakang, menempatkannya di latar belakang lain, menghilangkan refleksi, mengganti warna tali — ini adalah permukaan yang penting. Microsoft secara eksplisit menyatakan bahwa model ini disetel untuk “cara kerja kreatif yang sebenarnya dilakukan,” yang saya artikan sebagai: pengeditan, bukan sekadar generasi. Testimoni WPP di halaman MAI-Image resmi memperkuat hal ini — citra siap kampanye adalah framing-nya.
Pengeditan lokal, penggantian teks, dan penalaran visual
Pengeditan gambar AI lebih cepat rusak pada teks dibandingkan hal lain apapun. Poster, kemasan, papan tanda, tangkapan layar UI — semuanya bergantung pada apakah model dapat merender dan me-render ulang teks tanpa menjadi kacau. Positioning Microsoft menyoroti rendering teks secara khusus, dan peningkatan ELO +104 pada rendering teks adalah klaim kuantitatif terkuat dalam materi peluncuran.
Saya belum menguji ini secara intensif pada papan tanda multibahasa dalam skala produksi. Itu ada dalam daftar. Klaim rendering teks selalu memerlukan verifikasi per bahasa — set karakter Latin dan CJK berperilaku sangat berbeda.
Alur kerja potret dan konsistensi identitas
Permukaan potret adalah tempat di mana penyimpangan identitas paling terasa. Microsoft mendokumentasikan model sebagai mempertahankan “wajah yang dapat dikenali, ditambah rambut, pakaian, identitas tubuh penuh di seluruh stilisasi, pose, dan perubahan tata letak” — perhatian alur kerja adalah: buat potret, edit pose, pertahankan orang yang sama. Jika Anda telah merutekan ini melalui model yang menyimpang pada pengeditan kedua, ini layak untuk perbandingan nyata. Kemampuan “konsistensi identitas & karakter” diposisikan untuk karakter bermerek, juru bicara, dan kampanye sosial.
Akses Foundry langsung vs lapisan agregasi
Kapan akses Microsoft langsung masuk akal
Anda sudah berada di Azure. Tim Anda memiliki Entra ID, penagihan Anda melalui Microsoft, posisi kepatuhan Anda dibangun di sekitarnya. Anda menginginkan harga reservasi PTU. Anda menjalankan satu model, atau Anda menjalankan stack yang berat Microsoft. Langsung melalui Foundry adalah jalur dengan gesekan lebih rendah. Struktur harga lengkap untuk kedua varian dan permukaan deployment ada di pengumuman Foundry Microsoft.
Kapan routing model di antara GPT-Image, Nano Banana, Grok Imagine, dan MAI penting
Ini adalah bagian yang terus saya pikirkan. Bidang generasi gambar saat ini memiliki empat pesaing serius di puncak — GPT-Image-2, Nano Banana 2 / 2.1, Grok Imagine, dan MAI-Image-2.5 — masing-masing dengan kekuatan berbeda, kurva harga berbeda, dan perilaku pengeditan berbeda pada prompt yang sama. Jika produk Anda membutuhkan model yang paling sesuai per tugas, membangun empat integrasi terpisah adalah rekayasa yang terbuang sia-sia.
Di sinilah pola “satu API, banyak model” membuktikan nilainya. Jalankan MAI untuk pengeditan bedah, GPT-Image-2 untuk rendering teks yang padat, Nano Banana 2 untuk output resolusi tinggi, rutekan sesuai kebutuhan. Platform agregasi memecahkan masalah yang sama dari sudut yang berbeda. Pilih yang latensi dan cakupannya sesuai dengan alur kerja Anda.
Itulah semua yang dapat saya konfirmasi di sisi lapisan akses. Penilaian khusus alur kerja — model mana yang sebenarnya menang pada foto Anda — adalah bagian yang harus Anda jalankan sendiri.
FAQ
Bagaimana cara pengembang biasanya menguji MAI-Image-2.5 dalam alur kerja pengeditan gambar mereka sendiri? Jalur termurah adalah MAI Playground untuk iterasi prompt, kemudian beralih ke API pengeditan gambar Foundry dengan Flash untuk pengujian batch. Siapkan 20–30 input representatif dari set produksi nyata Anda — bukan demo yang dikurasi — dan jalankan melalui Flash maupun model dasar. Delta pada beban kerja aktual Anda lebih informatif daripada papan Arena manapun.
Apa perbedaan praktis antara menggunakan MAI-Image-2.5 secara langsung dan melalui lapisan agregasi? Foundry langsung memberi Anda hubungan penagihan yang lebih bersih dengan Microsoft, harga reservasi PTU, dan autentikasi Entra ID. Lapisan agregasi memberi Anda routing lintas penyedia — beralih antara MAI, GPT-Image-2, Nano Banana 2, dan Grok Imagine tanpa membangun ulang integrasi. Jika Anda hanya menjalankan satu model gambar, gunakan langsung. Jika Anda membandingkan atau beralih, agregasi akan terbayar dengan sendirinya.
Kapan tim akan memilih MAI-Image-2.5 dibandingkan model gambar lain yang sudah mereka gunakan? Tiga situasi yang perlu saya tandai: beban kerja pengeditan bedah di mana identitas dan komposisi perlu dipertahankan di seluruh iterasi (peringkat No. 2 pengeditan Arena adalah sinyal terkuat di sini); stack native Azure di mana penagihan Foundry dan autentikasi Entra ID mengurangi overhead integrasi; dan citra komersial — kemasan, papan tanda, visual bermerek — yang secara eksplisit disetel Microsoft, dengan WPP dan Shutterstock disebut sebagai evaluator.
Apa yang perlu diperhatikan tim saat memindahkan beban kerja generasi gambar ke MAI-Image-2.5? Tiga hal. Status pratinjau — kedua varian masih berlabel Pratinjau di Foundry, sehingga SLA dan paritas fitur akan berubah. Fluiditas harga — lini gambar MAI telah mengalami beberapa pembaruan harga dalam beberapa bulan terakhir; bangun estimasi biaya dengan margin. Siklus hidup model — dengan kecepatan pengiriman Microsoft (Image-1 ke 2.5 dalam sekitar delapan bulan), jangan hard-code apapun yang tidak bisa Anda ganti.
Itulah gambaran aksesnya. Jalankan sendiri pada input nyata. Itu akan memberi tahu Anda lebih banyak daripada apapun yang saya katakan.
Postingan sebelumnya:
