GPT-5.4 Mini 定價:輸入、快取與輸出費用
GPT-5.4 Mini 定價詳解:輸入、快取輸入與輸出 token 費用,以及小型模型如何降低大量 API 呼叫帳單。
你好,我是 Dora。我已經將一個高流量分類工作負載通過 OpenAI 運行了幾週。財務部門不斷問我的問題,正是每次「mini」模型上市時,開發者都會問的那個問題:這筆帳真的算得過來嗎?還是較低的每 token 費率會被其他成本吃掉?
這篇文章是為任何正在計算 GPT-5.4 Mini 定價的人而寫的——注重成本的開發者、與財務相關的工程負責人。我將拆解輸入、快取輸入和輸出費率,說明單位經濟效益在哪裡成立,並指出 Mini 在哪些地方悄悄比標題所示的更貴。所有費率均來自 OpenAI 官方 API 定價頁面,並在發布日期前驗證——這些費率會變動,請在引用前自行確認。
這不是整合指南。路由和 API 規格另有專文說明。這篇只談錢。
GPT-5.4 Mini 費用明細
輸入與輸出費率
GPT-5.4 Mini 的定價為每百萬輸入 token $0.75 美元,以及每百萬輸出 token $4.50 美元。6 倍的輸出乘數是大多數人太晚才意識到的關鍵。輸入便宜,輸出才是燒預算的地方。
作為參考,截至發布日期,Mini 在 GPT-5.4 系列中的位置:
| 模型 | 輸入($/M) | 快取輸入($/M) | 輸出($/M) |
|---|---|---|---|
| GPT-5.5 | $5.00 | $0.50 | $30.00 |
| GPT-5.4 | $2.50 | $0.25 | $15.00 |
| GPT-5.4 Mini | $0.75 | $0.08 | $4.50 |
Mini 比 GPT-5.4 便宜約 3.3 倍,比 GPT-5.5 便宜約 6.7 倍。當你決定某個工作負載是否適合 Mini 時,這個比例就是核心考量。
標準費率適用於上下文視窗低於約 27 萬輸入 token 的情況。超過此閾值,OpenAI 會對整個會話收取 2 倍輸入和 1.5 倍輸出的費用——包括在 Batch 和 Flex 方案下——這是平台上最讓人措手不及的隱藏成本。
快取輸入折扣
GPT-5.4 Mini 的快取輸入為每百萬 token $0.075 美元——比標準輸入費率低 90%,與 GPT-5.4 和 GPT-5.5 系列的模式一致。快取是自動的:無需 API 標誌,無需更改程式碼。如果你的請求重複使用了 OpenAI 已計算過的前綴,這些 token 將以快取費率計費。
需要注意的規則:
- 前綴必須逐字節保持穩定。系統提示中的時間戳會使快取失效。
- 前綴需要足夠長(最少約 1,024 個 token)。
- 快取在閒置幾分鐘後會過期。
- 輸出定價不受影響。
對於具有大型穩定系統提示的 RAG 應用,快取命中率超過 70% 是現實可行的。對於沒有共享前言的單次工作負載,快取幾乎沒有幫助。節省是真實的,但有條件,這就是為什麼我從不以固定百分比向財務報告這些數字。
為何小型模型在高流量場景中勝出
每任務成本對比前沿模型
正確的單位不是每 token 成本,而是每個成功任務的成本。一個典型工作負載——對 100 萬張簡短的客服工單進行分類,每張 800 個輸入 token 和 200 個輸出 token,無快取:
| 模型 | 輸入成本 | 輸出成本 | 總計 |
|---|---|---|---|
| GPT-5.5 | $4,000 | $6,000 | $10,000 |
| GPT-5.4 | $2,000 | $3,000 | $5,000 |
| GPT-5.4 Mini | $600 | $900 | $1,500 |
基於 OpenAI 2026 年 6 月的標準定價。僅為示例計算——實際價格可能因地區、快取命中率、批量折扣或其他因素而有所不同。請務必在引用前查閱 OpenAI 官方定價頁面。
Mini 的費用僅為 GPT-5.5 帳單的 15%。問題在於 Mini 在你的任務上的準確性是否足夠接近,使得節省是真實的,而不是轉移到了返工、升級或人工審查上。
我為每個遷移到 Mini 的工作負載保留一個評估集。如果品質下降到閾值以下,試算表就失去意義了。
Batch 與 Flex 折扣
另外兩個可用槓桿:
- Batch API:對輸入和輸出均提供固定 50% 折扣,在 24 小時內非同步處理。Mini 的費率:每百萬 token 輸入 $0.375,輸出 $2.25。大多數批次在 1-6 小時內完成。
- Flex 定價:同樣提供 50% 折扣,但採用可變延遲而非非同步排隊。適用於非面向用戶的內部工具。
在提交大型工作負載之前,請先用小型測試批次驗證實際計費——OpenAI 開發者定價文件是權威來源。
隱藏成本因素
輸出 token 膨脹
這是我最常見到的失敗模式,而且與模型本身無關。
Mini 的輸出 token 費用是輸入的 6 倍。如果你不限制輸出長度,一個偶爾返回 2,000 個 token 而 200 個就夠用的模型,會悄悄地讓你的帳單膨脹一個數量級。解決方法很無聊:
- 每次呼叫都設置
max_tokens。 - 在結構限制響應的地方使用結構化輸出或嚴格 JSON 模式。
- 對於分類任務,返回標籤,而不是解釋。只要標籤。
我曾發現一個工作負載,Mini 平均輸出 480 個 token,因為系統提示要求「簡短說明」。顯然,「簡短」對模型來說意味著它想要多少就多少。在去掉說明欄位並添加 max_tokens 後,輸出降至 12 個 token,帳單也隨之下降。
輸出膨脹會吃掉較低每 token 費率帶給你的所有節省。這是首要審計項目。
快取需要穩定的前綴
在程式碼審查意義上的「一致的系統提示」與「逐字節穩定」並不是同一回事。如果你的系統提示包含當前日期、頂部的用戶特定個人化欄位、每個請求都不同的檢索文件塊,或任何 A/B 變體——快取對該前綴就會失效。
快取只適用於從輸入開始算起最長的共享前綴。解決方案是結構性的:將穩定內容固定在開頭,將變數放在末尾。
這聽起來顯而易見。但我仍然見過生產系統中,快取被假設為處於活躍狀態,而實際上並非如此。請檢查你的快取命中率,不要想當然。
誰應該使用 Mini 來控制成本
最佳適用場景與表現不佳的場景
Mini 適用於高流量分類、標記、路由決策、結構化輸入摘要、由前沿模型審查邊緣案例的初步提取,以及有界限的對話。任何你能積極限制輸出長度的場景。
Mini 在以下情況表現不佳:跨長鏈的多步驟推理;品質決定用戶信任的輸出(法律起草、面向客戶的分析);邊緣案例常見且代價高昂的任務;以及 Mini 與 GPT-5.4 在你的任務上的評估差距可測量的情況。
誠實的測試是在你自己的數據上用你自己的評估集。如果 Mini 的準確性在 GPT-5.4 可接受範圍內,節省是真實的。如果不是,你是在為返工、客服工單和用戶摩擦買單折扣——這些永遠不會出現在 API 帳單上,但絕對會在某個地方出現。
我每隔幾週就會對已經在 Mini 上運行一段時間的工作負載進行審計。漂移是真實存在的。如果你需要重新評估路由,OpenAI API 定價比較明細提供了更新的視圖。
常見問題
GPT-5.4 Mini 與 GPT-5.5 相比實際費用如何?
每 token 大約是七分之一。GPT-5.4 Mini 為每百萬 token 輸入 $0.75,輸出 $4.50;GPT-5.5 為每百萬 token 輸入 $5.00,輸出 $30.00。在相同流量且無快取的情況下,Mini 的費用約為 GPT-5.5 的 15%。這是否能轉化為實際節省,取決於 Mini 是否能在不影響品質的情況下處理你的任務。跨模型定價表請參見 OpenAI 的 GPT-5.5 模型頁面。
快取輸入定價適用於 GPT-5.4 Mini 嗎?
適用。GPT-5.4 Mini 的快取輸入為每百萬 token $0.075,比標準 $0.75 費率低 90%。當你的提示重複使用 OpenAI 已計算的穩定前綴時自動生效。快取在閒置幾分鐘後過期,並需要前綴足夠長(約 1,024 個 token)。輸出定價不受影響。
GPT-5.4 Mini 有批量折扣嗎?
有。Batch API 對 gpt 5.4 mini api 端點的輸入和輸出均提供固定 50% 折扣,在 24 小時內處理。有效批量費率為每百萬 token 輸入 $0.375,輸出 $2.25。Flex 定價提供類似的 50% 折扣,但採用可變延遲而非非同步排隊。
如何估算 Mini 上高流量工作負載的實際成本?
三個數字:每個請求的輸入 token 數、每個請求的輸出 token 數、每月請求數。乘以相應費率。為了準確起見,抽樣 100 個真實請求,測量實際 token 數,並檢查你的快取命中率。計算器給你一個上限,抽樣數據給你現實。
即使 GPT-5.4 Mini 更便宜,什麼情況下它對任務來說太弱?
當你的評估集顯示,在重要的輸出上,Mini 與 GPT-5.4 或 GPT-5.5 相比有可測量的品質下降時。常見觸發因素:多步驟推理、在長提示上的指令遵循、錯誤代價高昂的邊緣案例、需要讀起來像精良寫作的輸出。如果節省只是將工作推入人工審查或面向用戶的錯誤,那就不算真正的節省。先跑評估。
結論
GPT-5.4 Mini 的定價在紙面上很直接:每百萬 token 輸入 $0.75,快取輸入 $0.075,輸出 $4.50。讓數字變得有趣的地方在於快取命中率、輸出 token 紀律、批量路由,以及模型是否真的足夠勝任該任務。
較低的每 token 費率是必要的,但並不充分。輸出膨脹、失效的快取和品質下降,每一個都可以獨立抹殺節省。只有在你對自己的工作負載做了計算之後,這筆帳才真的算得過來。
本月我還有一個遷移——一個目前在 GPT-5.4 上運行的摘要管道,我認為在更嚴格的輸出限制下能在 Mini 上維持品質。成本預測顯示可節省 70%。我們拭目以待評估結果如何。下週繼續。
往期文章:
