GPT-5.4 Mini API:定价、上下文与生产环境应用

面向开发者的GPT-5.4 Mini API:定价、上下文窗口、工具支持,以及它在路由架构中适合的高并发工作负载场景。

By Dora 1 min read

GPT-5.4 Mini API 自3月17日起正式上线。过去三个月,我一直将真实流量路由到该模型,同时并行测试其他三个模型。本文是关于它实际适用场景的工作笔记。

我是Dora。在正式开始之前先澄清一件事,因为我一直看到有人对此感到困惑:GPT-5.4 已不再是OpenAI的前沿模型,GPT-5.5才是。我们在另一篇文章中详细介绍了5.5的发布情况,3月份发布的那些关于5.4预发布泄露的文章在定义上已经过时。我在这里聚焦于更窄的范围——mini和nano作为低成本路由层,这正是它们正在稳固的定位。

如果你在为生产AI工作负载构建模型路由,这一区别比规格说明书更重要。

GPT-5.4 Mini 的定位

于2026年3月17日作为快速/低成本变体发布

OpenAI于3月17日发布了GPT-5.4 mini和nano,作为几周前GPT-5.4发布的小型版本。发布公告对其定位的描述非常坦诚:这是面向大批量工作的精简版、更便宜、更快速的版本。按照OpenAI的数据,速度超过GPT-5 mini的2倍。(这是他们的数据和测试条件。我没有进行受控基准测试——但在实际工作负载延迟方面,“更快”与我观察到的情况一致。)

对于构建者而言,更重要的问题不是”mini好不好”——而是”适合什么用途”。这一点在发布公告中被低估了,但路由问题使其显而易见。

API访问(mini同时支持ChatGPT免费版)

使用 gpt 5.4 mini 模型有三种途径:直接通过OpenAI API、在ChatGPT内(包括免费版——对,免费版也支持),以及通过路由到OpenAI端点的聚合器。GitHub Copilot也在第一天就接入了——他们的更新日志在3月17日随OpenAI公告同步发布。

Nano仅限API使用,没有ChatGPT界面。如果你想直接让用户使用nano,这一点值得注意——你做不到,只能通过你构建的API集成来实现。

定价与上下文

输入/输出费率及缓存输入

以下数据截至本文发布日期,来自OpenAI官方模型页面。这些数字会变动,请在使用前确认:

  • GPT-5.4 mini:输入 $0.75/百万token,输出 $4.50/百万token,缓存输入 $0.075
  • GPT-5.4 nano:输入 $0.20/百万token,输出 $1.25/百万token

缓存输入费率是我实际会重点规划的数字。$0.075相当于输入成本打了1折,对于任何具有稳定系统提示或重复上下文的工作负载(几乎所有Agent、大多数聊天界面、任何RAG形态的应用),缓存最终在成本上起到关键作用。GPT-5.4 mini 定价的标题数字是最坏情况,而非典型情况。

补充一点:区域处理(数据驻留)端点会有10%的费用上浮。幅度不大,但如果你通过欧盟或其他区域性接入点路由,值得在预算模型中考虑。

上下文窗口

OpenAI的文档显示mini支持40万token的上下文,最大输出12.8万token。我看到一些聚合器页面引用了不同的数字(有一个写的是110万,与官方来源不符)。有疑问时,官方模型页面优先——官方数字是40万。

我在35万token(包含大量Agent对话记录和工具输出)下进行了测试,运行正常。没有测试极限值——以这个价位,对于真正需要长上下文的场景,我宁愿路由到前沿模型,而不是压力测试mini的上限。

最佳适用生产场景

大批量、对延迟敏感的任务

这正是mini在路由表中赢得一席之地的场景。在我使用它的各个项目中,以下模式一直有效:

  • 分类、提取、轻量格式转换 — 任何需要快速获得结构化答案且推理只需一两步的任务。Mini以极低的前沿成本搞定它。
  • 含简单轮次的长对话会话 — 当80%的对话轮次不需要深度推理时,对所有轮次都支付完整的GPT-5.5费用就是浪费。
  • 高扇出子任务 — 生成50个变体、对200个检索到的文档打分等。单价差距会快速复利。

我观察到它失败的场景:任何需要深度多步规划的任务,或者模型需要决定做什么而非执行明确步骤的场景。(我曾有一个工作流让mini担任规划者。坚持了三天,然后换掉了。别走我的弯路。)

工具调用与Agent子任务

值得单独提出,因为这是让我惊喜的部分。根据发布公告,在OSWorld-Verified(一个计算机使用基准测试)上,mini的表现接近完整版GPT-5.4,并大幅超越GPT-5 mini。在实际使用中,我的描述是:一旦计划已定,mini在执行工具调用方面表现可靠;但在模糊情况下决定应该调用哪个工具时,可靠性较低。

因此有效的模式是:

  1. 前沿模型(GPT-5.5或其他)负责规划和决策。
  2. Mini负责执行步骤——调用工具、解析结果,并将结果交回给规划者。

OpenAI将此称为”Codex中的子Agent”。这种通用架构比这个术语更古老——它就是标准的”重型规划者/廉价执行者”分工。Mini在执行者席位上表现异常出色。

在多模型设置中路由 Mini

何时升级到前沿模型

路由才是使用mini的核心。盲目地在所有场景使用它,在困难轮次上你会感受到推理失败。完全不使用它,你就会在简单轮次上浪费钱。我使用的升级规则,大致按重要性排序:

  1. 遇到规划类问题时升级。 任何需要选择策略、拆解模糊目标或权衡利弊的任务。Mini在知道该做什么时表现良好,在需要弄清楚该做什么时会遇到困难。

  2. 输入超过27.2万token时升级。 不是因为mini无法处理40万token——它可以——而是一旦你的提示达到这个规模,工作负载通常涉及跨文档推理,这类任务能从前沿模型中获益。(GPT-5.5在超过27.2万token的输入时也会收取2倍费用,所以那时成本计算也会改变。)

  3. 高风险的单次调用时升级。 如果答案很重要且下游没有人工审核,就多付这点钱。一次调用的成本差异可以忽略不计;出错的代价却不能。

  4. 不要仅仅因为问题”感觉很难”就升级。 这正是mini被低估使用的原因。许多”感觉很难”的问题其实有明确的规格,mini完全可以处理。先测试,再做假设。

一个实用的设置:用一个廉价的分类器(mini本身,或者nano)来决定路由。它并不完美,但比把所有东西路由到前沿模型或全部路由到mini要好得多。

局限性与权衡

以下是我实际遇到的一些真实局限,如实列出:

  • Nano在能力上明显弱于mini。 定价差距会让人觉得它们在同一个级别。但事实并非如此。Nano适用于非常窄的任务(廉价分类、子步骤路由)。对于任何需要哪怕少量推理的任务,mini的优势远大于价格比率所显示的差距。不要仅仅为了省钱而选择nano。
  • 上下文窗口与上下文可用性的差距。 40万token是上限。模型在处理前10万token时的连贯性仍然优于最后10万——几乎所有大上下文模型都一样。请据此规划你的提示。
  • OpenAI API中的mini也是ChatGPT免费版中的mini。 这对构建者的影响小于对产品定位的影响——如果你构建的东西用户可以直接在ChatGPT免费版中完成,差异化必须来自你的应用,而不是对模型的访问权。
  • GPT-5.4已不再是前沿模型。 我在开头提到过这点,但在局限性部分值得重申。不要把”由GPT-5.4驱动”作为产品宣传,好像它是最前沿的技术——任何关注行业动态的人都知道它不是。诚实的卖点是路由逻辑,而不是模型名称。

还有一点平淡但重要的事实:API行为会变化。如果你关心可重现性,请固定模型快照。自动路由别名(gpt-5.4-mini)会随时间静默地迁移到更新的快照。

常见问题

GPT-5.4 Mini 只能通过API使用,还是ChatGPT中也有?

两者都有。 GPT-5.4 Mini API是开发者接口。同一模型也在ChatGPT中运行,包括免费版。Nano仅限API使用。

GPT-5.4 Mini 的实际上下文窗口大小是多少?

根据OpenAI官方文档,输入40万token,最大输出12.8万token。 部分聚合器页面列出了其他数字——当存在冲突时,以OpenAI的模型页面为准。

GPT-5.4 Mini 支持工具调用和多模态输入吗?

支持。 支持文本和图像输入,以及函数调用、网页搜索、文件搜索、计算机使用,以及通过Responses API使用技能。仅支持文本输出。工具执行能力强;在模糊情况下决定调用哪个工具时能力较弱。

什么情况下应该将任务路由到GPT-5.5而不是Mini?

当任务需要规划而非执行时,当输入超过约27.2万token时,当单次调用的答案质量比成本差异更重要时,或者当你观察到可归因于模型能力而非提示设计的推理失败时。对于其他所有情况,使用mini。

在路由设置中,如何决定在GPT-5.4 Mini和其他模型之间选择?

从真实生产流量中抽取一个小样本,分别通过各候选模型运行。 衡量成本、延迟,以及你真正关心的任务特定质量指标——而不是通用基准测试。然后据此路由。决策是基于实证的,且针对特定工作负载;没有任何通用规则能经受得住你的真实数据的考验。

结论

GPT-5.4 Mini API的有趣之处不在于它的能力。而在于它是放在路由设置执行者席位上的合适模型——这个廉价、快速的层处理大部分工作,而前沿模型处理那小部分真正需要能力的轮次。

如果你的技术栈仍然是单模型——一个模型处理所有事情——你要么在简单轮次上多付了钱,要么在困难轮次上表现不足。或者两者兼有。mini擅长的不是成为房间里最聪明的模型,而是成为对房间大多数任务来说足够聪明的最廉价模型。

在将它加入路由层之前,我实际会怎么做:

在你准备交给它的工作负载上,用一周的真实流量进行测试。衡量成本、延迟,以及你的产品实际依赖的任何质量指标。固定快照。在上线前构建好升级规则,而不是上线后。

三个月足以说明mini在生产环境中经得住考验。但不足以对长期价格稳定性做出任何判断——那取决于OpenAI。

在你真正构建的那天,请对照文档进行核实。

后续内容即将推出。

往期文章: