GPT-5.4 Miniの料金:入力・キャッシュ・出力コスト
GPT-5.4 Miniの料金体系を解説:入力・キャッシュ入力・出力トークンのコストと、小型モデルが大量APIリクエストのコスト削減に効果的な理由。
こんにちは、Doraです。ここ数週間、大量の分類ワークロードをOpenAI経由でルーティングしてきました。財務部門から繰り返し受ける質問は、「mini」モデルがリリースされるたびにビルダーが尋ねるものと同じです。計算は実際に成り立つのか、それとも安いトークン単価が他のコストに食われてしまうのか?
今まさにGPT-5.4 Miniの価格で同じ計算をしているすべての方へ向けた記事です――コスト意識の高いビルダー、財務寄りのエンジニアリングリードの方々。入力、キャッシュ済み入力、出力のレートを分解し、ユニットエコノミクスが機能するケースを解説し、Miniが見かけ以上にコストがかかる場面も指摘します。すべてのレートはOpenAIの公式APIプライシングページから取得し、公開日時点で確認済みです――変更されることがあるため、引用前に必ず確認してください。
これはインテグレーションガイドではありません。ルーティングとAPIコントラクトは別の記事で扱います。この記事はお金の話です。
GPT-5.4 Miniのコスト内訳
入力レートと出力レート
GPT-5.4 Miniの価格は100万入力トークンあたり$0.75、100万出力トークンあたり$4.50です。ほとんどの人が後から気づく6倍の出力乗数こそが重要です。入力は安い。出力が予算を消費します。
参考として、公開日時点のGPT-5.4ファミリーにおけるMiniの位置づけ:
| モデル | 入力 ($/M) | キャッシュ済み入力 ($/M) | 出力 ($/M) |
|---|---|---|---|
| GPT-5.5 | $5.00 | $0.50 | $30.00 |
| GPT-5.4 | $2.50 | $0.25 | $15.00 |
| GPT-5.4 Mini | $0.75 | $0.08 | $4.50 |
Miniはおよそ GPT-5.4より3.3倍安く、GPT-5.5より6.7倍安い。ワークロードをMiniに乗せるべきかどうかを判断するとき、この比率がすべてです。
標準レートは約270K入力トークン以下のコンテキストウィンドウに適用されます。それを超えると、OpenAIはセッション全体に対して入力2倍・出力1.5倍の価格を適用します――BatchおよびFlexティアも含めて。プラットフォーム上で最も予想外の高額コストです。
キャッシュ済み入力の割引
GPT-5.4 Miniのキャッシュ済み入力は100万トークンあたり$0.075――標準入力レートから90%割引で、GPT-5.4およびGPT-5.5ファミリー全体のパターンと一致します。キャッシュは自動適用です:APIフラグも、コード変更も不要です。OpenAIがすでに計算済みのプレフィックスをリクエストが再利用すれば、それらのトークンはキャッシュレートで課金されます。
重要なルール:
- プレフィックスはバイト単位で完全に同一でなければなりません。システムプロンプトにタイムスタンプがあるとキャッシュは無効になります。
- プレフィックスは十分な長さ(最低約1,024トークン)が必要です。
- キャッシュは非アクティブ状態が数分続くと期限切れになります。
- 出力の価格は変わりません。
大きな安定したシステムプロンプトを持つRAGアプリケーションでは、70%以上のキャッシュヒット率が現実的です。共有プリアンブルのないシングルターンのワークロードでは、キャッシュはほとんど役に立ちません。節約は実在しますが条件付きです――だから私は財務部門に固定のパーセンテージとして伝えることはありません。
小規模モデルが大量処理で勝る理由
フロンティアモデルとのタスクあたりコスト比較
正しい単位はトークンあたりのコストではありません。成功タスクあたりのコストです。代表的なワークロード――100万件の短いサポートチケットの分類、入力800トークン・出力200トークン、キャッシュなし:
| モデル | 入力コスト | 出力コスト | 合計 |
|---|---|---|---|
| GPT-5.5 | $4,000 | $6,000 | $10,000 |
| GPT-5.4 | $2,000 | $3,000 | $5,000 |
| GPT-5.4 Mini | $600 | $900 | $1,500 |
2026年6月時点のOpenAI標準価格に基づく。あくまで計算例です――実際の価格はリージョン、キャッシュヒット率、ボリューム割引、その他の要因によって異なる場合があります。引用前は必ずOpenAIの公式プライシングページをご確認ください。
Miniの請求額はGPT-5.5の15%です。問題は、あなたのタスクでのMiniの精度が十分に近く、節約が再作業・エスカレーション・人的レビューに転嫁されない実質的なものかどうかです。
Miniに移行するすべてのワークロードに評価セットを用意しています。品質がしきい値を下回れば、スプレッドシートは意味をなさなくなります。
BatchとFlexの割引
さらに2つのレバー:
- Batch API:入力と出力に対して一律50%割引、24時間以内の非同期処理。Miniの場合:入力$0.375、出力$2.25(100万トークンあたり)。ほとんどのバッチは1〜6時間で完了します。
- Flexプライシング:同じく50%割引で、非同期キューではなく可変レイテンシー。ユーザー向けでない社内ツールに有効です。
大きなワークロードをコミットする前に、小規模なテストバッチで正確な課金を確認してください――OpenAI開発者向けプライシングドキュメントが情報源です。
隠れたコスト要因
出力トークンの肥大化
最もよく見る失敗パターンで、モデルとはまったく関係ありません。
Miniでは出力トークンは入力トークンの6倍のコストがかかります。出力の長さを制限しなければ、200トークンで済むところを時折2,000トークン返すモデルは、請求額を桁違いに膨らませていることになります。対策は地味です:
- すべての呼び出しに
max_tokensを設定する。 - スキーマでレスポンスを制限できる、構造化出力または厳格なJSONモードを使用する。
- 分類の場合、ラベルを返す。説明ではなく。ラベルを。
あるワークロードで、Miniの平均出力トークンが480になっていたことを発見しました。システムプロンプトに「簡単な理由を添えて」と書いていたからです。「簡単」とは、どうやらモデルの気分次第を意味するようでした。理由フィールドを削除してmax_tokensを追加すると、出力は12トークンに減りました。請求額も同様に減りました。
出力の肥大化は、安いトークン単価がもたらす節約をすべて食い尽くします。最初に監査すべき項目です。
キャッシュは安定したプレフィックスが必要
コードレビューの観点で「一貫したシステムプロンプト」というのは「バイト単位で完全に同一」とは同じではありません。システムプロンプトに現在の日付が含まれている場合、先頭にユーザー固有のパーソナライズフィールドがある場合、リクエストごとに変化する取得済みドキュメントブロックがある場合、またはA/Bバリアントがある場合――そのプレフィックスのキャッシュは無効になります。
キャッシュは入力の先頭から始まる最長の共有プレフィックスにのみ適用されます。修正は構造的なものです:安定したコンテンツを先頭に固定し、変数は末尾に置く。
明らかに聞こえるかもしれません。それでも、キャッシュが有効と想定されていたのに実際には有効でなかった本番システムを見てきました。キャッシュヒット率を確認してください。仮定しないこと。
コスト目的でMiniを使うべき人
最適なユースケースと性能が劣るケース
Miniは大量の分類、タグ付け、ルーティング判断、構造化入力の要約、フロンティアモデルがエッジケースをレビューするファーストパスの抽出、制限付きチャットに適しています。出力の長さを積極的に制限できるすべての用途です。
Miniが性能を発揮しにくいのは:長いチェーンにわたる多段階推論、品質がユーザーの信頼を左右する出力(法的文書、顧客向け分析)、エッジケースが多く見逃しコストが高いタスク、そしてあなたのタスクでMiniとGPT-5.4の評価差が計測可能な場合です。
正直なテストはあなた自身のデータでの評価セットです。MiniのGPT-5.4に対する精度が許容範囲内であれば、節約は本物です。そうでなければ、再作業・サポートチケット・ユーザーの不満という形で割引コストを払っていることになります――それはAPIの請求書には現れませんが、必ずどこかに現れます。
Miniで稼働中のワークロードは数週間おきに監査しています。ドリフトは実在します。ルーティングの再評価が必要な場合は、OpenAI APIプライシング比較が最新の情報を提供しています。
FAQ
GPT-5.4 MiniはGPT-5.5と比べて実際どれくらいのコストがかかりますか?
トークンあたり約7分の1です。GPT-5.4 Miniは入力$0.75・出力$4.50(100万トークンあたり)、GPT-5.5は入力$5.00・出力$30.00です。キャッシュなしで同等の量を処理すると、MiniはGPT-5.5の約15%のコストになります。それが実際の節約に繋がるかどうかは、Miniが品質を落とさずにあなたのタスクをこなせるかどうかにかかっています。モデル横断のプライシングテーブルはOpenAIのGPT-5.5モデルページをご覧ください。
キャッシュ済み入力の価格はGPT-5.4 Miniにも適用されますか?
はい。GPT-5.4 Miniのキャッシュ済み入力は100万トークンあたり$0.075で、標準の$0.75レートから90%割引になります。OpenAIがすでに計算済みの安定したプレフィックスをプロンプトが再利用する場合、自動的に適用されます。キャッシュは数分間の非アクティブ状態の後に期限切れになり、プレフィックスが十分な長さ(約1,024トークン)である必要があります。出力の価格は影響を受けません。
GPT-5.4 Miniにバッチ割引はありますか?
はい。Batch APIはgpt 5.4 mini apiエンドポイントの入力と出力の両方に一律50%割引を提供し、24時間以内に処理されます。有効なバッチレートは入力$0.375・出力$2.25(100万トークンあたり)です。Flexプライシングは非同期キューではなく可変レイテンシーで同様の50%割引を提供します。
Miniでの大量ワークロードの実際のコストはどう見積もればいいですか?
3つの数字:リクエストあたりの入力トークン、リクエストあたりの出力トークン、月間リクエスト数。それぞれ該当するレートを掛け算する。精度を上げるには、実際のリクエスト100件をサンプリングし、実際のトークン数を計測し、キャッシュヒット率を確認する。計算ツールは上限を与えます。サンプリングデータが現実を与えます。
GPT-5.4 Miniが安くてもタスクに力不足な場合はどのような時ですか?
評価セットが、重要な出力についてGPT-5.4またはGPT-5.5と比べて計測可能な品質低下を示す場合です。よくあるトリガー:多段階推論、長いプロンプトでのインストラクションフォロー、誤答のコストが高いエッジケース、洗練された文章として読まれる必要がある出力。節約は、手動レビューやユーザー向けエラーに作業を押しつける結果になるなら本物ではありません。まず評価を実施してください。
まとめ
GPT-5.4 Miniの価格は紙の上では明快です:入力$0.75、キャッシュ済み入力$0.075、出力$4.50(100万トークンあたり)。数字が面白くなるのは、キャッシュヒット率、出力トークンの規律、バッチルーティング、そしてモデルが実際にタスクに十分かどうかという点においてです。
トークンあたりの単価が安いことは必要条件ですが十分条件ではありません。出力の肥大化、キャッシュの無効化、品質の低下は、それぞれ独立して節約を帳消しにする可能性があります。計算が成り立つのは、自分のワークロードで計算を実際に行った場合に限ります。
今月はもう一件の移行を行います――現在GPT-5.4で動いている要約パイプラインで、より厳しい出力制限を設ければMiniで成立すると見込んでいます。コスト予測では70%の節約になります。評価が何を言うか、来週また報告します。
過去の投稿:





