Harga GPT-5.4 Mini: Biaya Input, Cache & Output

Penjelasan harga GPT-5.4 Mini: biaya token input, input yang di-cache, dan output, serta alasan model kecil dapat memangkas tagihan API volume tinggi.

By Dora 9 min read

Halo, saya Dora. Saya telah merutekan beban kerja klasifikasi volume tinggi melalui OpenAI selama beberapa minggu. Pertanyaan yang terus saya terima dari tim keuangan adalah pertanyaan yang selalu diajukan para builder setiap kali model “mini” dirilis: apakah matematikanya benar-benar berhasil, atau apakah tarif per-token yang lebih murah habis dimakan oleh faktor lain?

Artikel ini ditujukan bagi siapa saja yang sedang melakukan perhitungan yang sama untuk harga GPT-5.4 Mini saat ini — builder yang sadar biaya, eng lead yang berdekatan dengan keuangan. Saya akan menguraikan tarif input, cached input, dan output, menjelaskan di mana unit ekonominya bekerja, dan menandai di mana Mini diam-diam lebih mahal dari yang tertera di headline. Semua tarif berasal dari halaman harga API resmi OpenAI, diverifikasi per tanggal publikasi — tarif ini berubah, jadi periksa sebelum mengutip.

Ini bukan panduan integrasi. Routing dan kontrak API ada di artikel terpisah. Artikel ini membahas soal uang.

Rincian Biaya GPT-5.4 Mini

Tarif input vs output

GPT-5.4 Mini dihargai $0,75 per juta token input dan $4,50 per juta token output. Pengganda output 6x adalah bagian yang paling sering terlambat disadari orang. Input itu murah. Output itulah yang menghabiskan anggaran.

Sebagai konteks, posisi Mini dalam keluarga GPT-5.4 per tanggal publikasi:

ModelInput ($/M)Cached Input ($/M)Output ($/M)
GPT-5.5$5,00$0,50$30,00
GPT-5.4$2,50$0,25$15,00
GPT-5.4 Mini$0,75$0,08$4,50

Mini sekitar 3,3x lebih murah dari GPT-5.4 dan 6,7x lebih murah dari GPT-5.5. Rasio itulah yang menjadi keseluruhan cerita saat Anda memutuskan apakah sebuah beban kerja cocok untuk Mini.

Tarif standar berlaku untuk context window di bawah ~270K token input. Di atas itu, OpenAI menerapkan harga 2x input dan 1,5x output untuk seluruh sesi — termasuk di bawah tier Batch dan Flex. Ini adalah kejutan termahal yang paling tidak terduga di platform ini.

Diskon cached input

Cached input pada GPT-5.4 Mini adalah $0,075 per juta token — pengurangan 90% dari tarif input standar, mengikuti pola yang sama di seluruh keluarga GPT-5.4 dan GPT-5.5. Cache bersifat otomatis: tidak ada flag API, tidak ada perubahan kode. Jika permintaan Anda menggunakan ulang prefix yang sudah pernah dihitung OpenAI, token-token tersebut ditagih dengan tarif cache.

Aturan yang penting:

  • Prefix harus stabil byte-per-byte. Timestamp di system prompt Anda akan membunuh cache.
  • Prefix perlu cukup panjang (sekitar 1.024 token minimum).
  • Cache kedaluwarsa setelah beberapa menit tidak aktif.
  • Harga output tidak berubah.

Untuk aplikasi RAG dengan system prompt stabil yang besar, tingkat cache hit di atas 70% adalah hal yang realistis. Untuk beban kerja single-turn tanpa preamble bersama, cache hampir tidak membantu. Penghematannya nyata tapi bersyarat, itulah mengapa saya tidak pernah mengutipnya sebagai persentase tetap kepada tim keuangan.

Mengapa Model Kecil Unggul pada Volume Tinggi

Matematika biaya-per-tugas vs frontier

Satuan yang tepat bukan biaya per token. Melainkan biaya per tugas yang berhasil. Beban kerja representatif — mengklasifikasikan 1 juta tiket dukungan pendek, masing-masing 800 token input dan 200 token output, tanpa caching:

ModelBiaya inputBiaya outputTotal
GPT-5.5$4.000$6.000$10.000
GPT-5.4$2.000$3.000$5.000
GPT-5.4 Mini$600$900$1.500

Berdasarkan harga standar OpenAI per Juni 2026. Hanya contoh perhitungan — harga aktual dapat bervariasi berdasarkan wilayah, tingkat cache hit, diskon volume, atau faktor lainnya. Selalu periksa halaman harga resmi OpenAI sebelum mengutip.

Mini masuk dengan tagihan 15% dari GPT-5.5. Pertanyaannya adalah apakah akurasi Mini pada tugas Anda cukup dekat sehingga penghematannya nyata dan bukan ditangguhkan ke pekerjaan ulang, eskalasi, atau tinjauan manusia.

Saya selalu menyimpan eval set di setiap beban kerja yang saya pindahkan ke Mini. Jika kualitas turun di bawah ambang batas, spreadsheet tidak lagi relevan.

Diskon Batch & Flex

Dua tuas tambahan:

  • Batch API: diskon tetap 50% untuk input dan output, pemrosesan asinkron dalam 24 jam. Pada Mini: $0,375 input dan $2,25 output per juta. Sebagian besar batch selesai dalam 1–6 jam.
  • Flex pricing: juga 50% lebih murah, dengan latensi variabel alih-alih antrian asinkron. Berguna untuk alat internal yang tidak menghadap pengguna.

Verifikasi tagihan yang tepat pada batch uji kecil sebelum mengkomit beban kerja besar — dokumen harga developer OpenAI adalah sumber kebenaran.

Faktor Biaya Tersembunyi

Pembengkakan token output

Ini adalah mode kegagalan yang paling sering saya lihat, dan tidak ada hubungannya dengan model.

Token output berharga 6x token input pada Mini. Jika Anda tidak membatasi panjang output, model yang sesekali mengembalikan 2.000 token ketika 200 sudah cukup secara diam-diam menggelembungkan tagihan Anda satu orde besarnya. Solusinya membosankan:

  • Tetapkan max_tokens pada setiap panggilan.
  • Gunakan structured output atau mode JSON ketat di mana skema membatasi respons.
  • Untuk klasifikasi, kembalikan label. Bukan penjelasan. Label.

Saya menemukan satu beban kerja di mana Mini rata-rata menghasilkan 480 token output karena system prompt meminta “justifikasi singkat.” Singkat, tampaknya, berarti apa pun yang diinginkan model. Setelah menghapus field justifikasi dan menambahkan max_tokens, output turun menjadi 12 token. Tagihannya pun turun dengan sesuai.

Pembengkakan output memakan semua penghematan yang diberikan tarif per-token yang lebih murah. Ini hal pertama yang perlu diaudit.

Caching membutuhkan prefix yang stabil

“System prompt yang konsisten” dalam istilah code review bukanlah hal yang sama dengan “stabil byte-per-byte.” Jika system prompt Anda menyertakan tanggal saat ini, field personalisasi khusus pengguna di bagian atas, blok dokumen yang diambil yang bervariasi per permintaan, atau varian A/B apa pun — caching dimatikan untuk prefix tersebut.

Cache hanya berlaku untuk prefix bersama terpanjang dari awal input. Solusinya bersifat struktural: tempelkan konten stabil di awal, taruh variabel di akhir.

Ini terdengar jelas. Namun saya masih melihat sistem produksi di mana caching diasumsikan aktif padahal tidak. Periksa tingkat cache hit Anda. Jangan berasumsi.

Siapa yang Harus Menggunakan Mini untuk Efisiensi Biaya

Kasus terbaik vs kasus di mana kinerjanya kurang baik

Mini bekerja dengan baik untuk klasifikasi volume tinggi, pemberian tag, keputusan routing, ringkasan input terstruktur, ekstraksi tahap pertama di mana model frontier meninjau kasus tepi, dan obrolan terbatas. Apa pun di mana Anda dapat membatasi panjang output secara agresif.

Mini berkinerja buruk pada penalaran multi-langkah di seluruh rantai panjang, pada output di mana kualitas menentukan kepercayaan pengguna (penyusunan hukum, analisis yang menghadap pelanggan), pada tugas di mana kasus tepi umum dan mahal untuk dilewatkan, dan di mana kesenjangan eval antara Mini dan GPT-5.4 pada tugas Anda dapat diukur.

Uji yang jujur adalah eval set Anda sendiri pada data Anda sendiri. Jika akurasi Mini berada dalam rentang yang dapat diterima dari GPT-5.4, penghematannya nyata. Jika tidak, Anda membayar untuk diskon dalam pekerjaan ulang, tiket dukungan, dan gesekan pengguna — yang tidak pernah muncul di tagihan API tetapi pasti muncul di suatu tempat.

Saya mengaudit setiap beberapa minggu untuk beban kerja yang sudah berjalan di Mini cukup lama. Drift itu nyata. Perbandingan harga API OpenAI menyediakan tampilan terbaru jika Anda perlu mengevaluasi ulang routing.

FAQ

Berapa sebenarnya biaya GPT-5.4 Mini dibandingkan GPT-5.5?

Kira-kira sepertuuh per token. GPT-5.4 Mini adalah $0,75 input dan $4,50 output per juta token; GPT-5.5 adalah $5,00 input dan $30,00 output. Pada volume yang setara tanpa caching, Mini berharga sekitar 15% dari GPT-5.5. Apakah itu benar-benar menghemat biaya tergantung pada apakah Mini menangani tugas Anda tanpa regresi kualitas. Lihat halaman model GPT-5.5 OpenAI untuk tabel harga lintas model.

Apakah harga cached input berlaku untuk GPT-5.4 Mini?

Ya. Cached input pada GPT-5.4 Mini adalah $0,075 per juta token, diskon 90% dari tarif standar $0,75. Otomatis ketika prompt Anda menggunakan ulang prefix stabil yang sudah pernah dihitung OpenAI. Cache kedaluwarsa setelah beberapa menit tidak aktif dan mengharuskan prefix cukup panjang (sekitar 1.024 token). Harga output tidak terpengaruh.

Apakah ada diskon batch untuk GPT-5.4 Mini?

Ya. Batch API memberikan diskon tetap 50% untuk input dan output pada endpoint gpt 5.4 mini api, dengan pemrosesan dalam 24 jam. Tarif batch efektif adalah $0,375 input dan $2,25 output per juta token. Flex pricing menawarkan diskon 50% serupa dengan latensi variabel alih-alih antrian asinkron.

Bagaimana cara memperkirakan biaya nyata beban kerja volume tinggi di Mini?

Tiga angka: token masuk per permintaan, token keluar per permintaan, jumlah permintaan per bulan. Kalikan dengan tarif yang relevan. Untuk akurasi, ambil sampel 100 permintaan nyata, ukur jumlah token aktual, dan periksa tingkat cache hit Anda. Kalkulator memberi Anda batas atas. Data sampel memberi Anda realita.

Kapan GPT-5.4 Mini terlalu lemah untuk tugas meskipun lebih murah?

Ketika eval set Anda menunjukkan regresi kualitas yang terukur dibandingkan GPT-5.4 atau GPT-5.5 pada output yang penting. Pemicu umum: penalaran multi-langkah, mengikuti instruksi pada prompt panjang, kasus tepi di mana jawaban yang salah itu mahal, output yang perlu terlihat sebagai tulisan yang dipoles. Penghematan tidak nyata jika mendorong pekerjaan ke tinjauan manual atau kesalahan yang menghadap pengguna. Jalankan eval terlebih dahulu.

Kesimpulan

Harga GPT-5.4 Mini sederhana di atas kertas: $0,75 input, $0,075 cached input, $4,50 output, per juta token. Di mana angkanya menjadi menarik adalah dalam tingkat cache hit, disiplin token output, routing batch, dan apakah model ini benar-benar cukup baik untuk tugasnya.

Tarif per-token yang lebih murah itu perlu tetapi tidak cukup. Pembengkakan output, caching yang rusak, dan regresi kualitas masing-masing dapat secara independen menghapus penghematan. Matematika hanya berhasil jika Anda melakukan matematika pada beban kerja Anda sendiri.

Saya menjalankan satu migrasi lagi bulan ini — pipeline ringkasan yang saat ini berjalan di GPT-5.4 yang menurut saya akan bertahan di Mini dengan batas output yang lebih ketat. Proyeksi biaya mengatakan penghematan 70%. Kita lihat apa yang dikatakan eval. Lanjut minggu depan.

Postingan sebelumnya: