API GPT-5.4 Mini: Harga, Konteks & Penggunaan Produksi

API GPT-5.4 Mini untuk pengembang: harga, jendela konteks, dukungan alat, dan beban kerja volume tinggi yang cocok dalam pengaturan routing.

By Dora 9 min read

API GPT-5.4 Mini telah tersedia sejak 17 Maret. Saya sudah merutekan traffic nyata melaluinya selama sekitar tiga bulan, bersama tiga model lainnya. Artikel ini adalah catatan kerja tentang di mana model ini sebenarnya cocok digunakan.

Halo, Dora di sini. Klarifikasi sebelum segalanya, karena saya terus melihat orang-orang bingung soal ini: GPT-5.4 bukan lagi model terdepan OpenAI. GPT-5.5-lah yang menyandang predikat itu. Kami membahas peluncuran 5.5 di artikel terpisah, dan artikel-artikel bocoran pra-peluncuran 5.4 dari Maret sudah tidak relevan lagi. Yang saya tulis di sini lebih sempit — mini dan nano sebagai tier perutean berbiaya rendah, yaitu peran yang kini mereka emban.

Jika Anda membangun perutean model untuk beban kerja AI produksi, perbedaan itu lebih penting daripada spesifikasi teknisnya.

Di Mana GPT-5.4 Mini Cocok Digunakan

Dirilis 17 Maret 2026 sebagai varian cepat / berbiaya rendah

OpenAI meluncurkan GPT-5.4 mini dan nano pada 17 Maret sebagai versi lebih kecil dari rilis GPT-5.4 beberapa minggu sebelumnya. Framing dalam pengumuman tersebut jujur tentang apa yang mereka tawarkan: versi yang didistilasi, lebih murah, lebih cepat untuk pekerjaan bervolume tinggi. Lebih dari 2× lebih cepat dari GPT-5 mini, menurut angka OpenAI. (Angka mereka, kondisi mereka. Saya belum menjalankan benchmark terkontrol — tetapi dalam latensi beban kerja aktual, lebih cepat sesuai dengan yang saya amati.)

Pertanyaan lebih besar bagi para pengembang bukan “apakah mini bagus” — melainkan “bagus untuk apa.” Itulah bagian yang diremehkan pengumuman tersebut dan yang ditonjolkan oleh pertanyaan perutean.

Akses API (mini juga tersedia di tier gratis ChatGPT)

Ada tiga tempat untuk menggunakan model gpt 5.4 mini: API OpenAI secara langsung, di dalam ChatGPT (termasuk tier gratis — ya, tier gratis), dan melalui agregator yang merutekan ke endpoint OpenAI. GitHub Copilot juga mengadopsinya sejak hari pertama — changelog mereka terbit 17 Maret bersamaan dengan pengumuman OpenAI.

Nano hanya tersedia via API. Tidak ada antarmuka ChatGPT untuknya. Penting diketahui jika Anda tergoda untuk mengarahkan pengguna langsung ke nano — tidak bisa, hanya ke integrasi API yang Anda bangun di sekitarnya.

Harga & Konteks

Tarif input/output & cached input

Angka per tanggal publikasi, dari halaman model resmi OpenAI. Angka ini dapat berubah, jadi periksa sebelum Anda berkomitmen:

  • GPT-5.4 mini: $0,75 per 1 juta input, $4,50 per 1 juta output, $0,075 cached input
  • GPT-5.4 nano: $0,20 per 1 juta input, $1,25 per 1 juta output

Tarif cached input adalah yang perlu benar-benar direncanakan. $0,075 adalah diskon 10× pada input, dan untuk beban kerja apa pun dengan system prompt yang stabil atau konteks yang berulang (hampir setiap agen, sebagian besar antarmuka chat, apa pun yang berbentuk RAG), caching pada akhirnya menjadi faktor utama pengurangan biaya. Harga gpt 5.4 mini yang tertera adalah kasus terburuk, bukan kasus tipikal.

Satu catatan kaki: endpoint pemrosesan regional (residensi data) membawa kenaikan 10%. Tidak terlalu besar, tetapi perlu diperhitungkan jika Anda merutekan melalui EU atau permukaan regional lainnya.

Jendela konteks

Dokumentasi OpenAI mencantumkan 400.000 token konteks, 128.000 output maksimum untuk mini. Saya pernah melihat halaman agregator mengutip angka berbeda (salah satunya menyebut 1,1 juta, yang tidak sesuai sumbernya). Jika ragu, halaman model resmi yang menang — dan angka resminya adalah 400.000.

Saya menguji pada 350.000 (transkrip agen yang padat ditambah output alat). Berjalan lancar. Saya tidak memaksanya ke batasnya — pada harga ini saya lebih suka merutekan kasus konteks-panjang yang sesungguhnya ke model terdepan daripada menguji batas mini.

Beban Kerja Produksi yang Paling Cocok

Tugas bervolume tinggi dan sensitif terhadap latensi

Di sinilah mini mendapatkan tempatnya dalam tabel perutean. Pola yang bertahan di berbagai proyek yang saya terapkan:

  • Klasifikasi, ekstraksi, reformatting ringan — apa pun yang membutuhkan jawaban terstruktur dengan cepat dan penalarannya hanya satu atau dua langkah. Mini menanganinya dengan biaya sebagian kecil dari biaya model terdepan.
  • Sesi chat panjang dengan giliran sederhana — ketika 80% giliran tidak membutuhkan penalaran berat, membayar tarif penuh GPT-5.5 untuk semuanya adalah pemborosan.
  • Subtugas high-fanout — membuat 50 varian sesuatu, menilai 200 dokumen yang diambil, dll. Perbedaan biaya per unit berakumulasi dengan cepat.

Di mana saya melihatnya gagal: apa pun yang membutuhkan perencanaan multi-langkah mendalam, atau di mana model harus memutuskan apa yang harus dilakukan alih-alih mengeksekusi langkah yang sudah ditentukan dengan baik. (Saya pernah memiliki alur kerja di mana mini berperan sebagai perencana. Tiga hari. Saya ganti. Jangan seperti saya.)

Penggunaan alat & subtugas agen

Perlu ditandai karena ini adalah bagian yang mengejutkan saya. Menurut pengumuman tersebut, pada OSWorld-Verified — benchmark penggunaan komputer — mini mendekati GPT-5.4 penuh dan jauh melampaui GPT-5 mini. Dalam penggunaan aktual saya akan menggambarkannya sebagai: andal dalam mengeksekusi panggilan alat setelah rencana ada, kurang andal dalam memutuskan alat mana yang harus digunakan dalam situasi ambigu.

Jadi pola yang berhasil:

  1. Model terdepan (GPT-5.5 atau lainnya) merencanakan dan memutuskan.
  2. Mini mengeksekusi langkah-langkah — memanggil alat, mengurai hasil, menyerahkan kembali ke perencana.

OpenAI menyebut ini “subagen di Codex.” Bentuk umumnya sudah ada sebelum istilah itu — ini hanyalah pemisahan standar perencana-berat / eksekutor-murah. Mini sangat baik di kursi eksekutor.

Merutekan Mini dalam Setup Multi-Model

Kapan harus eskalasi ke model terdepan

Perutean adalah kunci segalanya dengan mini. Gunakan di mana saja secara membabi buta dan Anda akan merasakan kegagalan penalaran pada giliran yang sulit. Tidak menggunakannya sama sekali dan Anda akan membuang uang pada giliran yang mudah. Aturan eskalasi yang saya gunakan, kira-kira berurutan dari yang paling penting:

  1. Eskalasi pada pertanyaan berbentuk rencana. Apa pun yang memerlukan pemilihan strategi, mengurai tujuan yang ambigu, atau menimbang pertukaran. Mini baik-baik saja ketika sudah tahu apa yang harus dilakukan. Ia kesulitan ketika harus mencari tahu apa yang harus dilakukan.

  2. Eskalasi pada input >272.000 token. Bukan karena mini tidak bisa menangani 400.000 — bisa — tetapi karena setelah prompt Anda sebesar itu, beban kerja biasanya melibatkan penalaran lintas dokumen yang mendapat manfaat dari model terdepan. (GPT-5.5 juga mengenakan biaya 2× input di atas 272.000, sehingga gambaran biayanya juga berubah di sana.)

  3. Eskalasi pada panggilan tunggal yang kritis. Jika jawabannya penting dan tidak ada tinjauan manusia setelahnya, bayarlah ekstra. Perbedaan biaya pada satu panggilan tidak relevan; biaya kesalahan bukan.

  4. Jangan eskalasi hanya karena pertanyaan “terasa sulit.” Begitulah mini menjadi kurang dimanfaatkan. Banyak pertanyaan yang “terasa sulit” sebenarnya terdefinisi dengan baik dan mini menanganinya. Ujilah sebelum berasumsi.

Setup praktis: miliki classifier murah (mini sendiri, atau nano) untuk memutuskan rute. Tidak sempurna, tetapi lebih baik daripada merutekan semua ke model terdepan atau merutekan semua ke mini.

Batasan & Pertukaran

Beberapa yang nyata saya temui, dicantumkan apa adanya:

  • Nano secara signifikan lebih lemah dari mini. Selisih harga memberi kesan bahwa keduanya berada dalam percakapan yang sama. Tidak. Nano bekerja untuk tugas yang sangat sempit (klasifikasi murah, perutean sub-langkah). Untuk apa pun yang membutuhkan bahkan penalaran sederhana, mini menang dengan margin yang lebih besar dari rasio harga yang disarankan. Jangan pilih nano hanya karena biaya.
  • Jendela konteks vs kemampuan pakai konteks. 400.000 adalah batasnya. Model ini masih lebih baik menjaga koherensi pada 100.000 token pertama daripada 100.000 terakhir — sama seperti hampir setiap model konteks besar. Rencanakan prompt Anda sesuai.
  • Mini di API OpenAI juga mini di ChatGPT gratis. Ini kurang relevan bagi pengembang dan lebih relevan untuk positioning produk — jika Anda membangun sesuatu yang bisa dilakukan pengguna di ChatGPT secara gratis, diferensiasinya harus datang dari aplikasi Anda, bukan dari akses ke model.
  • GPT-5.4 bukan lagi model terdepan. Saya menyebutkan ini di atas tetapi perlu diulang di bagian batasan. Jangan promosikan produk dengan embel-embel “didukung oleh GPT-5.4” seolah-olah itu mutakhir — siapa pun yang memperhatikan tahu itu bukan. Promosi yang jujur adalah logika peruteannya, bukan nama modelnya.

Saya juga ingin menyebut hal membosankan ini: perilaku API berubah. Sematkan snapshot model jika Anda peduli dengan reproduksibilitas. Alias perutean otomatis (gpt-5.4-mini) akan diam-diam berpindah ke snapshot yang lebih baru seiring waktu.

FAQ

Apakah GPT-5.4 Mini hanya tersedia melalui API atau juga di ChatGPT?

Keduanya. API GPT-5.4 Mini adalah permukaan bagi pengembang. Model yang sama juga berjalan di ChatGPT, termasuk tier gratis. Nano hanya tersedia via API.

Berapa ukuran jendela konteks sebenarnya untuk GPT-5.4 Mini?

400.000 token input, 128.000 output maksimum, menurut dokumentasi resmi OpenAI. Beberapa halaman agregator mencantumkan angka lain — ketika ada konflik, halaman model OpenAI yang berlaku.

Apakah GPT-5.4 Mini mendukung penggunaan alat dan input multimodal?

Ya. Input teks dan gambar, ditambah pemanggilan fungsi, pencarian web, pencarian file, penggunaan komputer, dan keterampilan melalui Responses API. Output teks saja. Kuat dalam eksekusi alat; kurang kuat dalam memutuskan alat mana yang harus digunakan dalam kondisi ambigu.

Kapan saya harus merutekan tugas ke GPT-5.5 daripada menggunakan Mini?

Ketika tugas memerlukan perencanaan daripada eksekusi, ketika input melebihi ~272.000 token, ketika kualitas jawaban dari satu panggilan lebih penting daripada selisih biaya, atau ketika Anda melihat kegagalan penalaran yang dapat dikaitkan dengan kemampuan model daripada bentuk prompt. Untuk segalanya yang lain, mini.

Bagaimana cara saya memutuskan antara GPT-5.4 Mini dan model lain dalam setup perutean?

Jalankan sebagian kecil traffic produksi nyata melalui setiap model kandidat. Ukur biaya, latensi, dan metrik kualitas spesifik tugas yang benar-benar Anda pedulikan — bukan benchmark generik. Lalu rutekan sesuai itu. Keputusan ini bersifat empiris dan per-beban-kerja; tidak ada aturan umum yang bertahan menghadapi data Anda.

Kesimpulan

Hal menarik tentang API GPT-5.4 Mini bukan kekuatannya. Melainkan bahwa ini adalah model yang tepat untuk ditempatkan di kursi eksekutor dalam setup perutean — lapisan murah dan cepat yang melakukan sebagian besar pekerjaan sementara model terdepan menangani sebagian kecil giliran di mana kemampuan paling penting.

Jika stack Anda masih single-model — satu model menangani segalanya — Anda entah membayar terlalu mahal untuk giliran mudah atau berkinerja buruk pada giliran sulit. Atau keduanya. Keunggulan mini bukan pada menjadi model paling cerdas di ruangan. Melainkan menjadi model termurah yang cukup cerdas untuk sebagian besar pekerjaan di ruangan itu.

Yang sebenarnya akan saya lakukan sebelum menambahkannya ke lapisan perutean:

Jalankan traffic nyata selama seminggu melaluinya pada beban kerja yang akan Anda berikan. Ukur biaya, latensi, dan kualitas pada metrik apa pun yang benar-benar diandalkan produk Anda. Sematkan snapshot-nya. Bangun aturan eskalasi sebelum Anda merilis, bukan setelahnya.

Tiga bulan cukup untuk mengatakan mini bertahan dalam produksi. Tidak cukup untuk mengatakan apa pun tentang stabilitas harga jangka panjang — itu urusan OpenAI.

Untuk diverifikasi terhadap dokumentasi pada hari Anda benar-benar membangun.

Masih banyak yang akan datang.

Artikel sebelumnya: