GPT-5.4 Mini 定價:輸入、快取與輸出費用

GPT-5.4 Mini 定價詳解:輸入、快取輸入與輸出 token 費用,以及小型模型如何降低大量 API 呼叫帳單。

By Dora 3 min read

你好,我是 Dora。我已經將一個高流量分類工作負載通過 OpenAI 運行了幾週。財務部門不斷問我的問題,正是每次「mini」模型上市時,開發者都會問的那個問題:這筆帳真的算得過來嗎?還是較低的每 token 費率會被其他成本吃掉?

這篇文章是為任何正在計算 GPT-5.4 Mini 定價的人而寫的——注重成本的開發者、與財務相關的工程負責人。我將拆解輸入、快取輸入和輸出費率,說明單位經濟效益在哪裡成立,並指出 Mini 在哪些地方悄悄比標題所示的更貴。所有費率均來自 OpenAI 官方 API 定價頁面,並在發布日期前驗證——這些費率會變動,請在引用前自行確認。

這不是整合指南。路由和 API 規格另有專文說明。這篇只談錢。

GPT-5.4 Mini 費用明細

輸入與輸出費率

GPT-5.4 Mini 的定價為每百萬輸入 token $0.75 美元,以及每百萬輸出 token $4.50 美元。6 倍的輸出乘數是大多數人太晚才意識到的關鍵。輸入便宜,輸出才是燒預算的地方。

作為參考,截至發布日期,Mini 在 GPT-5.4 系列中的位置:

模型輸入($/M)快取輸入($/M)輸出($/M)
GPT-5.5$5.00$0.50$30.00
GPT-5.4$2.50$0.25$15.00
GPT-5.4 Mini$0.75$0.08$4.50

Mini 比 GPT-5.4 便宜約 3.3 倍,比 GPT-5.5 便宜約 6.7 倍。當你決定某個工作負載是否適合 Mini 時,這個比例就是核心考量。

標準費率適用於上下文視窗低於約 27 萬輸入 token 的情況。超過此閾值,OpenAI 會對整個會話收取 2 倍輸入和 1.5 倍輸出的費用——包括在 Batch 和 Flex 方案下——這是平台上最讓人措手不及的隱藏成本。

快取輸入折扣

GPT-5.4 Mini 的快取輸入為每百萬 token $0.075 美元——比標準輸入費率低 90%,與 GPT-5.4 和 GPT-5.5 系列的模式一致。快取是自動的:無需 API 標誌,無需更改程式碼。如果你的請求重複使用了 OpenAI 已計算過的前綴,這些 token 將以快取費率計費。

需要注意的規則:

  • 前綴必須逐字節保持穩定。系統提示中的時間戳會使快取失效。
  • 前綴需要足夠長(最少約 1,024 個 token)。
  • 快取在閒置幾分鐘後會過期。
  • 輸出定價不受影響。

對於具有大型穩定系統提示的 RAG 應用,快取命中率超過 70% 是現實可行的。對於沒有共享前言的單次工作負載,快取幾乎沒有幫助。節省是真實的,但有條件,這就是為什麼我從不以固定百分比向財務報告這些數字。

為何小型模型在高流量場景中勝出

每任務成本對比前沿模型

正確的單位不是每 token 成本,而是每個成功任務的成本。一個典型工作負載——對 100 萬張簡短的客服工單進行分類,每張 800 個輸入 token 和 200 個輸出 token,無快取:

模型輸入成本輸出成本總計
GPT-5.5$4,000$6,000$10,000
GPT-5.4$2,000$3,000$5,000
GPT-5.4 Mini$600$900$1,500

基於 OpenAI 2026 年 6 月的標準定價。僅為示例計算——實際價格可能因地區、快取命中率、批量折扣或其他因素而有所不同。請務必在引用前查閱 OpenAI 官方定價頁面。

Mini 的費用僅為 GPT-5.5 帳單的 15%。問題在於 Mini 在你的任務上的準確性是否足夠接近,使得節省是真實的,而不是轉移到了返工、升級或人工審查上。

我為每個遷移到 Mini 的工作負載保留一個評估集。如果品質下降到閾值以下,試算表就失去意義了。

Batch 與 Flex 折扣

另外兩個可用槓桿:

  • Batch API:對輸入和輸出均提供固定 50% 折扣,在 24 小時內非同步處理。Mini 的費率:每百萬 token 輸入 $0.375,輸出 $2.25。大多數批次在 1-6 小時內完成。
  • Flex 定價:同樣提供 50% 折扣,但採用可變延遲而非非同步排隊。適用於非面向用戶的內部工具。

在提交大型工作負載之前,請先用小型測試批次驗證實際計費——OpenAI 開發者定價文件是權威來源。

隱藏成本因素

輸出 token 膨脹

這是我最常見到的失敗模式,而且與模型本身無關。

Mini 的輸出 token 費用是輸入的 6 倍。如果你不限制輸出長度,一個偶爾返回 2,000 個 token 而 200 個就夠用的模型,會悄悄地讓你的帳單膨脹一個數量級。解決方法很無聊:

  • 每次呼叫都設置 max_tokens
  • 在結構限制響應的地方使用結構化輸出或嚴格 JSON 模式。
  • 對於分類任務,返回標籤,而不是解釋。只要標籤。

我曾發現一個工作負載,Mini 平均輸出 480 個 token,因為系統提示要求「簡短說明」。顯然,「簡短」對模型來說意味著它想要多少就多少。在去掉說明欄位並添加 max_tokens 後,輸出降至 12 個 token,帳單也隨之下降。

輸出膨脹會吃掉較低每 token 費率帶給你的所有節省。這是首要審計項目。

快取需要穩定的前綴

在程式碼審查意義上的「一致的系統提示」與「逐字節穩定」並不是同一回事。如果你的系統提示包含當前日期、頂部的用戶特定個人化欄位、每個請求都不同的檢索文件塊,或任何 A/B 變體——快取對該前綴就會失效。

快取只適用於從輸入開始算起最長的共享前綴。解決方案是結構性的:將穩定內容固定在開頭,將變數放在末尾。

這聽起來顯而易見。但我仍然見過生產系統中,快取被假設為處於活躍狀態,而實際上並非如此。請檢查你的快取命中率,不要想當然。

誰應該使用 Mini 來控制成本

最佳適用場景與表現不佳的場景

Mini 適用於高流量分類、標記、路由決策、結構化輸入摘要、由前沿模型審查邊緣案例的初步提取,以及有界限的對話。任何你能積極限制輸出長度的場景。

Mini 在以下情況表現不佳:跨長鏈的多步驟推理;品質決定用戶信任的輸出(法律起草、面向客戶的分析);邊緣案例常見且代價高昂的任務;以及 Mini 與 GPT-5.4 在你的任務上的評估差距可測量的情況。

誠實的測試是在你自己的數據上用你自己的評估集。如果 Mini 的準確性在 GPT-5.4 可接受範圍內,節省是真實的。如果不是,你是在為返工、客服工單和用戶摩擦買單折扣——這些永遠不會出現在 API 帳單上,但絕對會在某個地方出現。

我每隔幾週就會對已經在 Mini 上運行一段時間的工作負載進行審計。漂移是真實存在的。如果你需要重新評估路由,OpenAI API 定價比較明細提供了更新的視圖。

常見問題

GPT-5.4 Mini 與 GPT-5.5 相比實際費用如何?

每 token 大約是七分之一。GPT-5.4 Mini 為每百萬 token 輸入 $0.75,輸出 $4.50;GPT-5.5 為每百萬 token 輸入 $5.00,輸出 $30.00。在相同流量且無快取的情況下,Mini 的費用約為 GPT-5.5 的 15%。這是否能轉化為實際節省,取決於 Mini 是否能在不影響品質的情況下處理你的任務。跨模型定價表請參見 OpenAI 的 GPT-5.5 模型頁面

快取輸入定價適用於 GPT-5.4 Mini 嗎?

適用。GPT-5.4 Mini 的快取輸入為每百萬 token $0.075,比標準 $0.75 費率低 90%。當你的提示重複使用 OpenAI 已計算的穩定前綴時自動生效。快取在閒置幾分鐘後過期,並需要前綴足夠長(約 1,024 個 token)。輸出定價不受影響。

GPT-5.4 Mini 有批量折扣嗎?

有。Batch API 對 gpt 5.4 mini api 端點的輸入和輸出均提供固定 50% 折扣,在 24 小時內處理。有效批量費率為每百萬 token 輸入 $0.375,輸出 $2.25。Flex 定價提供類似的 50% 折扣,但採用可變延遲而非非同步排隊。

如何估算 Mini 上高流量工作負載的實際成本?

三個數字:每個請求的輸入 token 數、每個請求的輸出 token 數、每月請求數。乘以相應費率。為了準確起見,抽樣 100 個真實請求,測量實際 token 數,並檢查你的快取命中率。計算器給你一個上限,抽樣數據給你現實。

即使 GPT-5.4 Mini 更便宜,什麼情況下它對任務來說太弱?

當你的評估集顯示,在重要的輸出上,Mini 與 GPT-5.4 或 GPT-5.5 相比有可測量的品質下降時。常見觸發因素:多步驟推理、在長提示上的指令遵循、錯誤代價高昂的邊緣案例、需要讀起來像精良寫作的輸出。如果節省只是將工作推入人工審查或面向用戶的錯誤,那就不算真正的節省。先跑評估。

結論

GPT-5.4 Mini 的定價在紙面上很直接:每百萬 token 輸入 $0.75,快取輸入 $0.075,輸出 $4.50。讓數字變得有趣的地方在於快取命中率、輸出 token 紀律、批量路由,以及模型是否真的足夠勝任該任務。

較低的每 token 費率是必要的,但並不充分。輸出膨脹、失效的快取和品質下降,每一個都可以獨立抹殺節省。只有在你對自己的工作負載做了計算之後,這筆帳才真的算得過來。

本月我還有一個遷移——一個目前在 GPT-5.4 上運行的摘要管道,我認為在更嚴格的輸出限制下能在 Mini 上維持品質。成本預測顯示可節省 70%。我們拭目以待評估結果如何。下週繼續。

往期文章: