GPT-5.4 Mini定价详解:输入、缓存与输出费用
GPT-5.4 Mini定价说明:输入、缓存输入和输出token费用,以及小型模型如何降低大批量API账单。
你好,我是 Dora。过去几周,我一直在通过 OpenAI 处理一个高流量的分类任务。财务团队不断问我一个问题,也是每当”mini”模型上线时,开发者们都会问的问题:这笔账到底算不算得过来,还是说更低的每 token 单价会被其他成本吃掉?
这篇文章适合正在计算 GPT-5.4 Mini 定价的人——注重成本的开发者、偏财务的工程负责人。我将拆解输入、缓存输入和输出的费率,分析哪些场景单位经济效益成立,并指出 Mini 在哪些地方的实际成本悄悄超出了标题价格。所有费率均来自 OpenAI 官方 API 定价页面,截至发布日期已核实——这些价格会变动,引用前请自行核查。
这不是集成指南。路由和 API 协议放在另一篇文章里。这篇只讲钱。
GPT-5.4 Mini 成本拆解
输入与输出费率
GPT-5.4 Mini 的定价为每百万输入 token $0.75,每百万输出 token $4.50。输出是输入的 6 倍这一乘数,是大多数人没有及时意识到的关键。输入便宜,输出才是烧钱的地方。
作为参考,截至发布日期,Mini 在 GPT-5.4 系列中的定位:
| 模型 | 输入($/M) | 缓存输入($/M) | 输出($/M) |
|---|---|---|---|
| GPT-5.5 | $5.00 | $0.50 | $30.00 |
| GPT-5.4 | $2.50 | $0.25 | $15.00 |
| GPT-5.4 Mini | $0.75 | $0.08 | $4.50 |
Mini 比 GPT-5.4 便宜约 3.3 倍,比 GPT-5.5 便宜约 6.7 倍。当你决定某个工作负载是否适合跑在 Mini 上时,这个比例就是全部的逻辑。
标准费率适用于上下文窗口低于约 27 万输入 token 的情况。超过这个限制后,OpenAI 对整个会话的输入收取 2 倍费率、输出收取 1.5 倍费率——包括 Batch 和 Flex 等级在内。这是该平台上最容易让人措手不及的单项最大成本。
缓存输入折扣
GPT-5.4 Mini 的缓存输入价格为每百万 token $0.075——相当于标准输入费率打九折,与 GPT-5.4 和 GPT-5.5 系列的模式一致。缓存是自动生效的:无需 API 参数,无需改代码。如果你的请求复用了 OpenAI 已计算过的前缀,这些 token 将按缓存费率计费。
关键规则:
- 前缀必须逐字节稳定。系统提示中加一个时间戳,缓存就失效了。
- 前缀需要足够长(至少约 1,024 个 token)。
- 缓存在不活跃几分钟后过期。
- 输出定价不受影响。
对于使用大型稳定系统提示的 RAG 应用,缓存命中率超过 70% 是合理预期。对于无共享前导内容的单轮工作负载,缓存几乎帮不上忙。节省是真实的,但有条件,这也是为什么我从不向财务报告一个固定的节省百分比。
为什么小模型在高流量场景胜出
每任务成本 vs 前沿模型
正确的计量单位不是每 token 成本,而是每次成功任务的成本。一个典型工作负载的示例——对 100 万条简短支持工单进行分类,每条 800 个输入 token 和 200 个输出 token,无缓存:
| 模型 | 输入成本 | 输出成本 | 合计 |
|---|---|---|---|
| GPT-5.5 | $4,000 | $6,000 | $10,000 |
| GPT-5.4 | $2,000 | $3,000 | $5,000 |
| GPT-5.4 Mini | $600 | $900 | $1,500 |
基于 2026 年 6 月 OpenAI 标准定价。仅为示例计算——实际价格可能因地区、缓存命中率、批量折扣或其他因素而有所不同。引用前请务必查看 OpenAI 官方定价页面。
Mini 的费用约为 GPT-5.5 账单的 15%。问题在于:Mini 在你任务上的准确率是否足够接近,让这些节省真实落袋,而不是转移到返工、升级处理或人工审核上。
我对每个迁移到 Mini 的工作负载都保留一套评估集。如果质量低于阈值,那张电子表格就没有意义了。
Batch 和 Flex 折扣
还有两个额外杠杆:
- Batch API:输入和输出均享受统一 50% 折扣,24 小时内异步处理。Mini 上的费率:输入每百万 $0.375,输出每百万 $2.25。大多数批次在 1–6 小时内完成。
- Flex 定价:同样享受 50% 折扣,但以可变延迟代替异步排队。适合非面向用户的内部工具。
在提交大型工作负载之前,请先用一个小测试批次验证实际计费——OpenAI 开发者定价文档是权威来源。
隐性成本因素
输出 token 膨胀
这是我最常见到的失控模式,而且与模型本身无关。
Mini 上输出 token 的成本是输入 token 的 6 倍。如果你不约束输出长度,一个偶尔返回 2,000 个 token 而实际 200 个就够了的模型,会悄悄把你的账单推高一个数量级。修复方法很无聊:
- 每次调用都设置
max_tokens。 - 在 schema 能约束响应范围的场合使用结构化输出或严格 JSON 模式。
- 分类任务只返回标签,不要解释,就是一个标签。
我曾发现一个工作负载,Mini 的平均输出高达 480 个 token,原因是系统提示要求”简要说明理由”。“简要”,显然是模型自己定义的。删掉理由字段并添加 max_tokens 后,输出降到了 12 个 token,账单随之大幅下降。
输出膨胀会吃掉更低 token 单价带来的所有节省。这是第一个要审计的地方。
缓存需要稳定的前缀
代码审查意义上的”一致的系统提示”,并不等同于”逐字节稳定”。如果你的系统提示包含当前日期、顶部的用户个性化字段、每次请求各不相同的检索文档块,或任何 A/B 变体——该前缀的缓存就失效了。
缓存只对从输入起始处开始的最长共享前缀生效。解决方案是结构性的:把稳定内容固定在开头,把变量放在末尾。
这听起来显而易见。但我仍然见过生产系统在缓存未生效的情况下,却假设缓存是活跃的。检查你的缓存命中率,不要假设。
谁应该为了降低成本而使用 Mini
最适合的场景 vs 表现欠佳的场景
Mini 在以下场景表现良好:高流量分类、打标签、路由决策、结构化输入摘要、前端提取(由前沿模型审查边缘案例),以及能严格约束输出长度的有界对话任何场景。
Mini 在以下场景表现欠佳:跨长链的多步推理;质量决定用户信任的输出(法律起草、面向客户的分析);边缘案例频繁且代价高昂的任务;以及你在自己任务上测出 Mini 与 GPT-5.4 之间存在可量化质量差距的情况。
诚实的测试方法是用你自己的数据跑你自己的评估集。如果 Mini 的准确率在 GPT-5.4 可接受范围内,节省就是真实的。否则,你是在用返工、支持工单和用户摩擦来支付那个折扣的代价——这些永远不会出现在 API 账单上,但一定会出现在某个地方。
我对跑了一段时间 Mini 的工作负载每隔几周审计一次。模型漂移是真实存在的。如果需要重新评估路由,OpenAI API 定价对比详解提供了一个持续更新的视图。
常见问题
GPT-5.4 Mini 和 GPT-5.5 相比实际成本差多少?
大约是后者的七分之一。GPT-5.4 Mini 的输入每百万 $0.75,输出每百万 $4.50;GPT-5.5 的输入每百万 $5.00,输出每百万 $30.00。在等量使用、无缓存的情况下,Mini 的成本约为 GPT-5.5 的 15%。能否转化为实际节省,取决于 Mini 能否在不出现质量下降的前提下完成你的任务。跨模型定价表见 OpenAI GPT-5.5 模型页面。
缓存输入定价是否适用于 GPT-5.4 Mini?
适用。GPT-5.4 Mini 的缓存输入价格为每百万 token $0.075,相比标准 $0.75 打九折。当你的提示复用了 OpenAI 已计算过的稳定前缀时自动生效。缓存在不活跃几分钟后过期,且要求前缀足够长(约 1,024 个 token)。输出定价不受影响。
GPT-5.4 Mini 是否有批量折扣?
有。Batch API 对 gpt-5.4-mini API 端点的输入和输出均提供统一 50% 折扣,处理时间在 24 小时内。实际批量费率为每百万 token 输入 $0.375,输出 $2.25。Flex 定价也提供类似的 50% 折扣,但以可变延迟代替异步排队。
如何估算 Mini 上高流量工作负载的真实成本?
三个数字:每次请求的输入 token 数、输出 token 数、每月请求量。乘以对应费率即可。为了更准确,抽取 100 个真实请求,测量实际 token 数,并检查缓存命中率。计算器给你一个上限,采样数据给你现实。
即使 GPT-5.4 Mini 更便宜,什么情况下它仍不胜任任务?
当你的评估集显示,在关键输出上相比 GPT-5.4 或 GPT-5.5 存在可量化的质量下降时。常见触发场景:多步推理、长提示下的指令遵循、答错代价高昂的边缘案例、需要呈现出精炼写作风格的输出。如果节省是以人工审核或面向用户的错误为代价换来的,那就不是真正的节省。先跑评估。
结论
GPT-5.4 Mini 的定价在纸面上很直接:每百万 token 输入 $0.75,缓存输入 $0.075,输出 $4.50。数字变得复杂的地方在于缓存命中率、输出 token 纪律、批量路由,以及模型是否真的能胜任这个任务。
更低的 token 单价是必要条件,但不是充分条件。输出膨胀、缓存失效和质量下降,任何一个单独都能把节省全部抹掉。只有对自己的工作负载做好测算,这笔账才能真正算对。
这个月我还有一次迁移——一条摘要生成流水线,目前跑在 GPT-5.4 上,我认为在更严格的输出限制下 Mini 能撑住。成本预测显示可节省 70%。我们等评估结果说话。下周继续。
往期文章:
