GPT-5.4 Mini API:料金・コンテキスト・本番運用
開発者向けGPT-5.4 Mini API解説:料金、コンテキストウィンドウ、ツールサポート、そしてルーティング構成での大量処理ワークロードへの適用方法。
GPT-5.4 Mini APIは3月17日にリリースされた。私は約3ヶ月間、他の3つのモデルと並行して実際のトラフィックをルーティングしてきた。この記事は、実際にどこで使えるかについての作業メモだ。
Doraです。まず明確にしておきたいことがある。混乱している人をよく見かけるからだ:GPT-5.4はもはやOpenAIのフロンティアモデルではない。GPT-5.5がそれだ。5.5のローンチは別の記事で取り上げた。3月の5.4リリース前のリーク記事は定義上、古い情報だ。ここで書くのはもっと絞った話、つまりローコストルーティング層としてのminiとnanoだ。それが彼らの落ち着く役割になっている。
本番AIワークロードのモデルルーティングを構築しているなら、その区別はスペックシートよりも重要だ。
GPT-5.4 Miniの位置づけ
高速・低コストバリアントとして2026年3月17日にリリース
OpenAIはGPT-5.4 miniとnanoを3月17日にリリースした。これは数週間前のGPT-5.4リリースの小型版だ。アナウンスのフレーミングは正直だ:高ボリューム作業向けに蒸留されたより安価で高速なバージョン。OpenAIの数値によれば、GPT-5 miniより2倍以上高速。(彼らの数値、彼らの条件。制御されたベンチマークは実施していないが、実際のワークロードのレイテンシでは、高速という評価は私の体験と一致する。)
構築者にとってより重要な問いは「miniは優れているか」ではなく、「何に対して優れているか」だ。それがアナウンスで軽視されている部分であり、ルーティングの問いが明らかにする部分だ。
APIアクセス(miniはChatGPTの無料ティアでも利用可能)
gpt 5.4 miniモデルを使う場所は3つある:OpenAI APIを直接使う方法、ChatGPT内で使う方法(無料ティアを含む。そう、無料ティアだ)、そしてOpenAIのエンドポイントにルーティングするアグリゲーター経由だ。GitHub CopilotもDay 1でこれを採用した。そのchangelogはOpenAIのアナウンスと同日の3月17日に公開されている。
NanoはAPI専用だ。ChatGPTのサーフェスはない。ユーザーをnanoに直接誘導しようとしているなら知っておく価値がある。直接誘導はできず、自分で構築するAPI統合を通じてのみ可能だ。
価格とコンテキスト
入力・出力レートとキャッシュ入力
公開日時点の数値はOpenAIの公式モデルページより。変動するので、コミット前に確認すること:
- GPT-5.4 mini:入力$0.75/1Mトークン、出力$4.50/1Mトークン、キャッシュ入力$0.075
- GPT-5.4 nano:入力$0.20/1Mトークン、出力$1.25/1Mトークン
実際に計画の基礎に置くべきはキャッシュ入力レートだ。$0.075は入力コストの10倍割引であり、安定したシステムプロンプトや繰り返しコンテキストを持つワークロード(ほぼすべてのエージェント、ほとんどのチャットインターフェース、RAG形式のもの)では、キャッシュがコスト削減の主役になる。gpt 5.4 miniの見出し価格は最悪ケースであり、典型的なケースではない。
補足として:リージョナル処理(データレジデンシー)エンドポイントは10%の上乗せがある。大きくはないが、EUや他のリージョナルサーフェスを通じてルーティングする場合はモデル化する価値がある。
コンテキストウィンドウ
OpenAIのドキュメントはminiに対して400Kトークンのコンテキスト、128K最大出力を示している。アグリゲーターページが異なる数値を引用しているのを見かけた(1.1Mと記載しているものがあったが、ソースと一致しない)。疑わしい場合は公式モデルページが正しい。公式の数値は400Kだ。
350K(大量のエージェントトランスクリプトとツール出力を詰め込んだもの)でテストした。問題なく動作した。上限ギリギリまでは試していない。この価格帯では、本当に長いコンテキストのケースをフロンティアモデルにルーティングする方が、miniの上限をストレステストするより賢明だ。
最適な本番ワークロード
大容量・レイテンシ重視のタスク
これがminiがルーティングテーブルに存在感を示す部分だ。私が関わったプロジェクト全体で成立しているパターン:
- 分類、抽出、軽微な再フォーマット — 構造化された答えを素早く必要とし、推論が1〜2ステップで済むもの。Miniはフロンティアコストの何分の一かでこなす。
- シンプルなターンが多い長いチャットセッション — ターンの80%が重い推論を必要としない場合、全ターンにGPT-5.5の料金を払うのは間違いだ。
- 高ファンアウトのサブタスク — 50バリアントを生成する、200の取得ドキュメントをスコアリングするなど。単位コストの差が急速に積み重なる。
失敗した場面:深い多段階計画が必要なもの、または明確に指定されたステップを実行するのではなく何をすべきかを決定する必要があるもの。(miniをプランナーにしたワークフローがあった。3日間。切り替えた。同じ失敗をしないように。)
ツール使用とエージェントサブタスク
注目に値するのは、これが私が驚いた部分だからだ。アナウンスによれば、コンピュータ使用ベンチマークのOSWorld-Verifiedでは、miniは完全なGPT-5.4に近いパフォーマンスを示し、GPT-5 miniを大幅に上回っている。実際の使用感で言えば:計画が存在するときのツール呼び出し実行は信頼できるが、曖昧な状況でどのツールを選ぶかの判断は信頼性が低い。
機能するパターン:
- フロンティアモデル(GPT-5.5または他)が計画と判断を行う。
- Miniがステップを実行する:ツールを呼び出し、結果を解析し、プランナーに戻す。
OpenAIはこれを「Codexのサブエージェント」と呼んでいる。この全体的な形はその用語より古い。重いプランナー/安いエグゼキューターの標準的な分割だ。Miniはエグゼキューターの役割が際立って得意だ。
マルチモデル設定でのMiniのルーティング
フロンティアモデルへのエスカレーション時期
miniにとってルーティングがすべてだ。盲目的にどこでも使えば、難しいターンで推論の失敗を感じる。まったく使わなければ、簡単なターンでお金を無駄にする。私が使うエスカレーションルール、おおよそ重要度順:
-
計画が必要な質問にはエスカレート。 戦略を選ぶ、曖昧な目標を分解する、またはトレードオフを検討する必要があるもの。Miniは何をすべきかわかっているときは問題ない。何をすべきかを考え出す必要があるときに苦労する。
-
272Kトークンを超える入力にはエスカレート。 Miniが400Kを処理できないからではなく、プロンプトがそれほど大きい場合、ワークロードには通常フロンティアモデルが得意とするクロスドキュメント推論が含まれるからだ。(GPT-5.5も272K以上では入力が2倍課金されるため、そこでもコスト計算が変わる。)
-
高リスクの単発呼び出しにはエスカレート。 答えが重要でダウンストリームに人間レビューがない場合、追加料金を払う。1回の呼び出しのコスト差は無関係で、間違えたときのコストはそうではない。
-
質問が「難しそう」というだけでエスカレートしない。 それがminiが過小利用される原因だ。「難しそう」に見える質問の多くは実際には明確に指定されており、miniが対処する。仮定する前にテストする。
実用的な設定:安い分類器(mini自体、またはnano)にルートを決めさせる。完璧ではないが、すべてをフロンティアにルーティングするよりも、すべてをminiにルーティングするよりも良い。
制限とトレードオフ
実際に経験したいくつかの制限をありのままに挙げる:
- NanoはMiniより明確に弱い。 価格差は同じ会話レベルにいることを示唆している。そうではない。Nanoは非常に狭いタスク(安価な分類、サブステップルーティング)に機能する。わずかな推論でも必要なものには、価格比が示すより広いマージンでminiが勝る。コストだけでnanoを選ばないこと。
- コンテキストウィンドウ対コンテキストの使用可能性。 400Kが上限だ。モデルは最後の100Kより最初の100Kで一貫性を保つことが得意で、これはほぼすべての大コンテキストモデルと同じだ。それに合わせてプロンプトを計画すること。
- OpenAI APIのminiはChatGPT無料版のminiでもある。 これは構築者よりも製品ポジショニングに関係する。ユーザーがChatGPTで無料でできることを構築しているなら、差別化はモデルへのアクセスではなく、アプリケーションから生まれなければならない。
- GPT-5.4はもはやフロンティアではない。 冒頭で述べたが、制限セクションでも繰り返す価値がある。最先端であるかのように「GPT-5.4搭載」を中心にプロダクトを売り込まないこと。注目している人なら誰でもそうでないことを知っている。正直な売り込みはルーティングロジックであり、モデル名ではない。
退屈な話も挙げておく:APIの動作は変わる。再現性を重視するならモデルスナップショットをピンする。自動ルーティングエイリアス(gpt-5.4-mini)は時間とともに暗黙的に新しいスナップショットに移行する。
FAQ
GPT-5.4 MiniはAPIのみで利用可能ですか、それともChatGPTでも使えますか?
両方です。 GPT-5.4 Mini APIは開発者向けのサーフェスです。同じモデルはChatGPTでも動作し、無料ティアも含みます。NanoはAPI専用です。
GPT-5.4 Miniの実際のコンテキストウィンドウサイズは?
OpenAIの公式ドキュメントによれば、入力400Kトークン、最大出力128Kです。 一部のアグリゲーターページは異なる数値を示していますが、競合する場合はOpenAIのモデルページが正しいです。
GPT-5.4 Miniはツール使用とマルチモーダル入力をサポートしていますか?
はい。 テキストと画像入力、さらにファンクション呼び出し、ウェブ検索、ファイル検索、コンピュータ使用、Responses APIを通じたスキルに対応しています。出力はテキストのみです。ツール実行は得意ですが、曖昧な状況でどのツールを選ぶかの判断は苦手です。
タスクをMiniではなくGPT-5.5にルーティングすべきタイミングは?
タスクが実行より計画を必要とする場合、入力が約272Kトークンを超える場合、コスト差よりも単発呼び出しの品質が重要な場合、またはプロンプトの形ではなくモデルの能力に帰因できる推論の失敗が見られる場合。それ以外はminiで。
ルーティング設定でGPT-5.4 Miniと他のモデルをどう選ぶか?
実際の本番トラフィックの小さなホールドアウトを各候補モデルで実行する。 コスト、レイテンシ、そして本当に重要なタスク固有の品質指標を測定する。汎用ベンチマークではなく。そしてそれに基づいてルーティングする。決定は経験的かつワークロードごとのものであり、一般的なルールはあなたのデータに接触したとたん機能しなくなる。
まとめ
GPT-5.4 Mini APIの興味深い点はその能力ではない。ルーティング設定のエグゼキューターシートに置くのに最適なモデルだ。安くて高速な層が作業の大部分をこなし、フロンティアモデルが能力が最も重要な少数のターンを処理する。
スタックがまだシングルモデルであれば、簡単なターンに過払いしているか、難しいターンでパフォーマンス不足になっているか、あるいはその両方だ。miniが得意なことは、部屋で最も賢いモデルであることではない。部屋の大部分に対して十分に賢い最も安いモデルであることだ。
ルーティング層に追加する前に実際にすべきこと:
与えたいワークロードで1週間の実際のトラフィックを通じて実行する。プロダクトが実際に依存するメトリクスでコスト、レイテンシ、品質を測定する。スナップショットをピンする。エスカレーションルールはリリース後ではなく前に構築する。
3ヶ月はminiが本番で成立すると言うのに十分だ。長期的な価格安定性については言えない。それはOpenAI次第だ。
実際に構築する日にドキュメントに対して検証すること。
続報は後ほど。
過去の記事:





