GPT-5.4 Mini API:定價、上下文與生產環境應用
為開發者提供的GPT-5.4 Mini API指南:定價、上下文視窗、工具支援,以及在路由架構中適合的高吞吐量工作負載。
GPT-5.4 Mini API 自3月17日起已正式上線。我已將真實流量路由到它上面約三個月,同時並行測試另外三個模型。這篇文章是關於它實際適用場景的工作筆記。
我是 Dora。在正文開始前先澄清一件事,因為我一直看到有人對此感到困惑:GPT-5.4 已不再是 OpenAI 的前沿模型,GPT-5.5 才是。我們在另一篇文章中報導了 5.5 的發布,而3月份那些關於 5.4 發布前的洩露文章從定義上來說已經過時。我在這裡寫的範圍更窄——mini 和 nano 作為低成本路由層,這正是它們逐漸確立的定位。
如果你正在為生產 AI 工作負載構建模型路由,這個區別比規格說明書更重要。
GPT-5.4 Mini 的定位
2026年3月17日作為快速/低成本變體發布
OpenAI 在3月17日發布了 GPT-5.4 mini 和 nano,作為幾週前 GPT-5.4 發布的精簡版兄弟模型。公告中對它們的定位相當誠實:蒸餾版、更便宜、更快速,適用於大量工作負載。根據 OpenAI 的數據,速度是 GPT-5 mini 的2倍以上。(他們的數字,他們的條件。我沒有進行受控基準測試——但在實際工作負載延遲上,「更快」確實符合我的觀察。)
對於開發者來說,更大的問題不是「mini 好不好」,而是「對什麼好」。這一點在公告中被低估了,但路由問題讓它變得顯而易見。
API 訪問(mini 也在 ChatGPT 免費版中提供)
使用 gpt 5.4 mini 模型有三個途徑:直接通過 OpenAI API、在 ChatGPT 內(包括免費版——是的,免費版),以及通過路由到 OpenAI 端點的聚合器。GitHub Copilot 也在第一天就接入了——他們的更新日誌與 OpenAI 公告 同步於3月17日上線。
Nano 僅限 API 使用,沒有 ChatGPT 介面。如果你打算直接讓用戶使用 nano,需要知道這一點——你做不到,只能通過你圍繞它構建的 API 集成來使用。
定價與上下文
輸入/輸出費率及快取輸入
以下為發布日期的數據,來自 OpenAI 官方模型頁面。這些數字會變動,請在做決策前核實:
- GPT-5.4 mini:輸入 $0.75/1M tokens,輸出 $4.50/1M tokens,快取輸入 $0.075
- GPT-5.4 nano:輸入 $0.20/1M tokens,輸出 $1.25/1M tokens
快取輸入費率才是我真正會納入規劃的數字。$0.075 是輸入10倍的折扣,對於任何具有穩定系統提示或重複上下文的工作負載(幾乎所有 agent、大多數聊天介面、任何 RAG 形式的應用),快取最終承擔了成本控制的主要責任。gpt 5.4 mini 的標題定價是最壞情況,而非典型情況。
附帶說明:區域處理(數據駐留)端點需加收10%費用。雖然不算大,但如果你通過歐盟或其他區域服務路由,值得納入預算模型。
上下文窗口
OpenAI 的文件列出 mini 具有 40萬 tokens 的上下文,最大輸出 128K。我看到一些聚合器頁面引用了不同的數字(有一個顯示1.1M,與來源不符)。有疑問時,以官方模型頁面為準——官方數字是40萬。
我在35萬 tokens 的情況下進行了測試(一個密集的 agent 對話記錄加上工具輸出)。運行正常。沒有將其推到邊界——以這個價位,我寧願將真正需要長上下文的案例路由到前沿模型,而不是對 mini 的上限進行壓力測試。
最適合的生產工作負載
高吞吐量、對延遲敏感的任務
這正是 mini 在路由表中占有一席之地的原因。在我使用它的項目中,以下模式一直成立:
- 分類、提取、輕量重排格式——任何需要快速獲得結構化答案且推理只需一兩步的場景。Mini 以遠低於前沿模型的成本處理這些任務。
- 長時間聊天會話中的簡單輪次——當80%的輪次不需要深度推理時,對所有輪次都支付完整的 GPT-5.5 費率是一種浪費。
- 高扇出子任務——生成50個變體、對200個檢索文件進行評分等。單位成本差異的複利效應很快就會顯現。
我觀察到它失效的場景:任何需要深度多步驟規劃的任務,或者模型需要決定做什麼而非執行明確指定步驟的場景。(我曾有一個讓 mini 擔任規劃者的工作流程。三天後切換了。別學我的錯誤。)
工具使用與 Agent 子任務
值得特別指出,因為這是讓我感到驚訝的部分。根據公告,在 OSWorld-Verified(一個電腦使用基準測試)上,mini 接近完整的 GPT-5.4 表現,並大幅超越 GPT-5 mini。在實際使用中,我的描述是:在計劃已存在的情況下,執行工具調用可靠;在模糊情境下決定應使用哪個工具,則不夠可靠。
因此,有效的模式是:
- 前沿模型(GPT-5.5 或其他)負責規劃和決策。
- Mini 執行各步驟——調用工具、解析結果,然後回報給規劃者。
OpenAI 稱之為「Codex 中的子 agent」。這個大體框架比這個術語更早存在——這就是標準的「重量級規劃者 / 低成本執行者」分工。Mini 在執行者角色上出類拔萃。
在多模型設置中路由 Mini
何時升級至前沿模型
路由策略才是使用 mini 的核心所在。盲目地在所有地方使用它,你會在困難輪次中遭遇推理失敗。完全不使用它,你會在簡單輪次上燒掉不必要的資金。以下是我使用的升級規則,大致按重要性排序:
-
對計劃型問題升級。 任何需要選擇策略、分解模糊目標或權衡取捨的問題。Mini 在知道該做什麼時表現良好,在需要弄清楚該做什麼時則力不從心。
-
當輸入超過27.2萬 tokens 時升級。 不是因為 mini 無法處理40萬——它可以——而是一旦提示詞如此龐大,工作負載通常涉及跨文件推理,前沿模型會更有優勢。(GPT-5.5 在超過27.2萬 tokens 後也收取2倍輸入費用,所以那裡的成本計算也有所不同。)
-
對高風險的單次調用升級。 如果答案很重要且後續沒有人工審查,就多付那筆錢。單次調用的成本差異微不足道;出錯的代價則不然。
-
不要僅僅因為問題「感覺很難」就升級。 這正是 mini 被低估使用的原因。許多「感覺很難」的問題其實是明確指定的,mini 完全可以處理。先測試,再做假設。
一個實用的設置:用一個廉價的分類器(mini 本身,或 nano)來決定路由。它不完美,但比把所有任務都路由到前沿模型或都路由到 mini 要好。
限制與取捨
以下是我實際遇到的一些問題,如實列出:
- Nano 明顯弱於 mini。 定價差距讓人以為它們處於同一水準,但並非如此。Nano 適用於非常窄的任務(廉價分類、子步驟路由)。對於需要哪怕適度推理的任務,mini 的優勢比價格比率所暗示的要大得多。不要僅僅為了省錢而選擇 nano。
- 上下文窗口大小 vs 上下文可用性。 40萬是上限。模型在前10萬 tokens 上的連貫性仍然優於後10萬——這與幾乎所有大上下文模型相同。請相應地規劃你的提示詞。
- OpenAI API 中的 mini 也是 ChatGPT 免費版中的 mini。 這對開發者的影響較小,但對產品定位影響更大——如果你正在構建用戶可以在 ChatGPT 免費版中直接完成的功能,差異化必須來自你的應用程序,而不是對模型的訪問權限。
- GPT-5.4 已不再是前沿模型。 我在開頭提到了這一點,但值得在限制部分重申。不要以「由 GPT-5.4 驅動」作為賣點,彷彿它是尖端技術——任何關注業界動態的人都知道它不是。誠實的賣點是路由邏輯,而非模型名稱。
還要提一件平淡但重要的事:API 行為會發生變化。如果你關心可重現性,請固定模型快照版本。自動路由別名(gpt-5.4-mini)會隨時間默默遷移到更新的快照。
常見問題
GPT-5.4 Mini 只能通過 API 使用,還是在 ChatGPT 中也可以使用?
兩者都可以。 GPT-5.4 Mini API 是開發者介面。同一個模型也在 ChatGPT 中運行,包括免費版。Nano 僅限 API 使用。
GPT-5.4 Mini 的實際上下文窗口大小是多少?
根據 OpenAI 官方文件,輸入40萬 tokens,最大輸出128K。 一些聚合器頁面列出了其他數字——當發生衝突時,以 OpenAI 的模型頁面為準。
GPT-5.4 Mini 支持工具使用和多模態輸入嗎?
支持。 文字和圖片輸入,加上函數調用、網頁搜索、文件搜索、電腦使用,以及通過 Responses API 的技能。僅支持文字輸出。工具執行能力強;在模糊情境下決定使用哪個工具的能力較弱。
什麼情況下應該將任務路由到 GPT-5.5 而非 Mini?
當任務需要規劃而非執行,當輸入超過 ~27.2萬 tokens,當單次調用的答案品質比成本差異更重要,或當你觀察到可以歸因於模型能力而非提示詞設計的推理失敗時。其他情況,用 mini。
在路由設置中,如何在 GPT-5.4 Mini 和其他模型之間做選擇?
用少量真實生產流量對每個候選模型進行抽樣測試。 測量成本、延遲,以及你真正關心的任務特定品質指標——而不是通用基準測試。然後相應地進行路由。這個決策是基於經驗和工作負載的;沒有哪條通用規則能在面對你的實際數據時依然成立。
結論
GPT-5.4 Mini API 有趣的地方不在於它的能力有多強,而在於它是放在路由設置執行者位置的正確模型——那個廉價、快速的層,承擔大部分工作,而前沿模型處理少數真正需要強大能力的輪次。
如果你的技術棧仍然是單一模型——一個模型處理所有事情——你要麼在簡單輪次上多付錢,要麼在困難輪次上表現不佳。或者兩者兼而有之。Mini 的優勢不在於成為房間裡最聰明的模型,而在於成為對房間大多數任務而言足夠聰明的最廉價模型。
在將它加入路由層之前,我實際會做的事:
用真實流量在你打算分配給它的工作負載上運行一週。測量成本、延遲,以及你的產品實際依賴的品質指標。固定快照版本。在上線前就制定升級規則,而不是事後補救。
三個月足以說明 mini 在生產環境中表現穩定。但不足以對長期價格穩定性做出任何判斷——那取決於 OpenAI。
請在你實際開始構建的當天核對最新文件。
更多內容即將推出。
往期文章:
