Claude Fable 5 正式发布:SWE-Bench Pro 得分 80.3%,定价为 Opus 4.8 的 2 倍,6 月 22 日前免费使用
Anthropic 今日发布了首个公开可用的 Mythos 级模型——Claude Fable 5,该模型配备安全防护机制,在高风险提示下会自动回退至 Opus 4.8。SWE-Bench Pro 得分 80.3%,比 Opus 4.8 高出 11 个百分点。每百万 token 定价 $10/$50。在 Pro/Max 计划下免费使用至 6 月 22 日,此后按用量计费。
Anthropic 今日发布了首款面向公众的 Mythos 级别模型。Claude Fable 5 于 2026 年 6 月 9 日在 Claude API、AWS Bedrock、Vertex AI 和 Microsoft Foundry 上正式上线——同步发布的还有 Claude Mythos 5,二者底层模型相同,但 Mythos 5 解除了部分安全限制,仅面向 Project Glasswing 合作伙伴计划开放。两款模型定价均为每百万 token 输入 $10 / 输出 $50——恰好是 Claude Opus 4.8 定价的 2 倍。
不过,真正值得关注的细节并不在发布公告的标题里。在发布数据之下,隐藏着一个值得关注的定价机制(Pro/Max 用户在 6 月 22 日前免费使用,之后按积分计费)、一套真正将 Fable 5 与前代前沿模型拉开差距的顶级基准测试成绩,以及一项新的架构设计——自动分类器安全机制在触发时会回退到 Opus 4.8 而非直接拒绝请求——这一选择对实际部署方式有实质性影响。
发布内容
| 详情 | 数值 |
|---|---|
| 模型名称 | Claude Fable 5(公开版)+ Claude Mythos 5(受限版) |
| API 模型 ID | claude-fable-5 |
| 输入定价 | $10/1M tokens |
| 输出定价 | $50/1M tokens |
| 对比 Opus 4.8 定价 | 2×($5/$25) |
| 可用平台 | Claude API、AWS Bedrock、Vertex AI、Microsoft Foundry |
| 订阅访问 | Pro / Max / Team / Enterprise——2026 年 6 月 22 日前免费 |
| 6 月 22 日后 | 需在订阅基础上额外购买使用积分 |
| Mythos 5 访问权限 | 仅限 Project Glasswing 合作伙伴;生物研究人员可通过可信访问计划申请 |
两点定价说明值得特别关注:
- 13 天免费窗口是此次发布的引爆点。 Anthropic 利用订阅捆绑策略在前两周内驱动用户采用。6 月 22 日之后,Pro/Max 用户使用同款模型需要额外购买积分,生产用户将重新回到按 token 计费的模式,即上述 $10/$50 的定价。
- 2 倍 Opus 4.8 的定价并不便宜,但基准测试的差距能解释大部分原因(详见下文)。以 $50/1M 输出 token 计,Fable 是目前市场上最贵的前沿模型——在输出 token 上约为 Sonnet 4.6 的 3.3 倍、GPT-5.5 的 5 倍、Gemini 3.5 Flash 的 5.5 倍。
基准测试成绩——以及它真正说明了什么
Fable 5 声称在”几乎所有测试基准”上达到业界领先水平。Anthropic 公布的最具体、最具可比性的数据如下:
| 基准测试 | Fable 5 | Opus 4.8 | GPT-5.5 | Gemini 3.1 Pro |
|---|---|---|---|---|
| SWE-Bench Pro | 80.3% | 69.2% | 58.6% | 54.2% |
| FrontierCode | 29.3% | 13.4% | 5.7% | — |
三点解读:
80.3% 的 SWE-Bench Pro 成绩是核心数据。 这是 SWE-Bench 系列中难度最高的变体,也是最能预测模型在真实生产代码上表现的指标。Fable 5 领先 Opus 4.8 11.1 个百分点,领先 GPT-5.5 21.7 个百分点,领先 Gemini 3.1 Pro 26.1 个百分点。这是代际差距,而非微弱领先。对于需要横向比较模型质量的编程工作流而言,这是今年报告的最大单项前沿领先幅度。
FrontierCode 才是更能说明问题的数据。 该基准测试针对最高难度的编程问题——抽象算法难题、新型数据结构设计、性能关键型优化。Fable 5 的 29.3% 超过 Opus 4.8 的 2 倍,超过 GPT-5.5 的 5 倍。在前沿天花板约为 30% 的基准测试上实现这种跃升,是基准测试数据所能提供的最接近”能力阶跃”的证据。
Anthropic 的案例研究印证了这些数字。 据报道,Stripe 使用 Fable 5 在一天内完成了 5000 万行代码的迁移。Hebbia 报告称 Fable 5 在其金融基准测试中得分最高。IMC 表示其”几乎在所有交易分析评估中表现完美”。这些均为对品牌友好的客户证言,但多个独立客户在”代码/金融/科学知识工作”这一框架上的一致性,才是值得重点关注的信号。
基准测试中未涵盖的内容:Terminal-Bench 数据、GPQA、MMLU、HumanEval、AIME。Anthropic 似乎将 SWE-Bench Pro 和 FrontierCode 作为主要编程指标,这与该模型被定位为软件工程前沿模型的框架一致。
安全机制——一种不同的架构选择
Fable 5 能够公开发布,根本原因在于 Anthropic 在 Mythos 5 之上构建的三套自动分类器安全机制:
- 网络安全——屏蔽攻击性网络任务和漏洞利用开发
- 生物/化学——对大多数具有双重用途风险的生物/化学请求回退至 Opus 4.8(明确包括 AAV 设计)
- 蒸馏防护——屏蔽试图提取能力以训练竞争模型的请求
关键的架构选择:当安全机制触发时,响应由 Opus 4.8 处理,而非直接拒绝。 这是一个有意义的用户体验决策。即使 Fable 5 的前沿推理能力受到安全审查的限制,用户对大多数查询仍能获得可用的答案。Anthropic 报告称,超过 95% 的 Fable 会话完全不涉及回退——这意味着安全机制调校得足够精准,生产工作流基本感知不到它们的存在。
外部红队测试结果:
- 超过 1000 小时的外部漏洞赏金测试——未发现通用越狱方法
- 在 30 种公开越狱技术下,零例有害单轮网络安全请求被执行
- 一位外部红队成员称该安全机制”是所有测试模型中最为健壮的”
对于部署面向客户应用的开发者而言,这与”触发安全策略即拒绝”的运营模式截然不同。你可以围绕该模型构建产品,无需为每次安全拒绝设计回退用户体验——Opus 4.8 会在后台无缝处理长尾情况。
Mythos 5——以及它的存在意味着什么
解除安全限制的同款模型以 Mythos 5 的名称发布,仅限 Project Glasswing 网络安全合作伙伴访问,同时通过可信访问计划向生物研究人员逐步开放。Fable 5 与 Mythos 5 之间的能力差距集中在三个类别:
- ExploitBench(网络安全):Mythos 5 达到 78%,而 Opus 4.8 为 40%(Fable 5 不运行此基准测试,因为网络安全提示会触发安全机制)
- 药物设计:Mythos 5 据报道将蛋白质设计流程加速约 10 倍,14 个靶点中有 9 个产生了候选药物
- 科学假设生成:在盲测专家评比中,新颖的分子生物学假设约 80% 的情况下优于对比方案
Mythos 5 的存在表明,底层模型的实际能力远超 Fable 5 所展示的内容。对于大多数生产工作流而言,这一点无关紧要——但对于安全研究、药物发现等领域,Mythos 分支才是真正的前沿所在。公开访问受到明确限制,正是因为 Anthropic 判断原始模型存在双重用途风险,而分类器安全机制正是为此而生。
Sonnet 规律被打破意味着什么
两周前我曾论证,Anthropic 历史上将 Opus 和 Sonnet 小版本号配对发布的规律,使得 Sonnet 4.7 比 Sonnet 4.8 更有可能发布。但这一规律比我预期的打破得更彻底:没有 Sonnet 4.7,没有 Sonnet 4.8,Mythos 分支直接成了主角。 Opus 4.8 填补了 Pro 档位的空缺;Fable 5 则在其上开辟了全新的层级。
对 Claude 产品线未来走向的三种解读:
- Mythos 分支是新的前沿,Sonnet 和 Opus 成为其下的生产级选择。能力天花板已明显抬升。
- 命名已与版本号脱钩。 未来可以预期更多命名分支(Mythos、Fable),而非 Opus/Sonnet/Haiku 三元组。通过源码映射字符串来预测模型发布的方式已走到尽头。
- 定价层级差距正在拉大。 Fable 5 定价 $10/$50,是 Opus 4.8 的 2 倍,而 Opus 4.8 已是 Haiku 4.5 的 5 倍。前沿能力的成本增速远快于生产级能力的成本增速——这意味着路由决策比以往任何时候都更加重要。
Fable 5 在生产环境中的定位
具体的部署参考:
适合使用 Fable 5 的场景:
- SWE-Bench Pro 性能直接影响结果的重代码工作流——大规模迁移、新型算法开发、性能关键型重构。11 个百分点的领先优势能在真实代码库上转化为可量化的更好输出。
- 视觉密集型知识工作——从科学图表中提取结构化数据、根据截图重建 Web 应用、处理包含嵌入图表的技术文档。
- 长上下文推理——Anthropic 强调”在数百万 token 中保持专注”,这表明该模型在 1M+ 上下文末端的性能衰减曲线明显优于前代前沿模型。
- 金融/交易分析——独立基准测试(Hebbia)将 Fable 5 列为金融专项评估的首位。
应继续使用更经济替代方案的场景:
- 高量/低价值生成——以 $50/1M 输出 token 计,Fable 5 用于内容生成、分类或结构化提取极不经济。Sonnet 4.6 或 Gemini 3.5 Flash 可以约 10% 的价格完成同等工作。
- MCP / 工具编排 Agent 工作流——Gemini 3.5 Flash 目前在 MCP Atlas 和 Toolathlon 上领先,且成本仅为零头。Fable 的编程优势并不自动转化为 Agent 编排优势。
- 会触发回退的网络安全或生物查询——你以 Fable 定价支付,却获得 Opus 4.8 的输出。不如直接使用 Opus 4.8。
如何立即访问 Claude Fable 5
三种部署路径:
- 通过 Anthropic 直接访问——
claude-fable-5已在 Claude API 以及 AWS Bedrock、Vertex AI 和 Microsoft Foundry 上线。Pro/Max 计划用户可免费使用至 6 月 22 日;此后按 $10/$50 的 per-token 计费。 - 通过 WaveSpeedAI LLM 端点——以 OpenAI 兼容方式通过单一 API key 访问当前前沿文本模型。待 Fable 5 在平台上完成集成后,你可以在同一接口下对其与 Opus 4.8、Sonnet 4.6、GPT-5.5 和 Gemini 3.5 Flash 进行 A/B 测试,无需切换不同服务商的凭据。
- 通过提供商路由器——如果你使用聚合器(Vercel AI SDK、LangChain 等),
claude-fable-5模型 ID 已进入公开模型注册表。“对 SWE 密集型任务使用 Fable,其余使用 Sonnet”的路由策略只需修改一行配置即可实现。
未来两周值得关注的信号
三个关键信号:
- 6 月 22 日定价切换。 当 Pro/Max 免费窗口关闭后,公众采用率的真实信号将是有多少订阅用户愿意为 Fable 5 支付超额费用。这是检验 2 倍 Opus 4.8 定价对长尾用例是否可持续的最直接指标。
- 独立基准测试复现。 Anthropic 的 SWE-Bench Pro 和 FrontierCode 数据来自内部。关注独立基准测试套件的复现结果——以及 11 个百分点领先 Opus 4.8 的优势在 Anthropic 策划的测试集之外是否依然成立。
- 下一个 Sonnet 版本。 随着 Mythos 成为新的前沿分支,Sonnet 将何去何从?一个在成本和 Agent 基准测试上针对 Gemini 3.5 Flash 定位的更新版 Sonnet,将重新锚定 Claude 产品线的价值档位。若 Sonnet 保持沉默,则意味着 Anthropic 将让生产级档位在 4.6 上停留更长时间,超出历史节奏的预期。
在此之前:Fable 5 是新的能力天花板,Opus 4.8 是生产级默认选择,Sonnet 4.6 依然是性价比之选。未来两周将告诉你,Mythos 分支是一次性的前沿突破,还是 Anthropic 发布节奏的新常态。
来源:Anthropic 的 Fable 5 / Mythos 5 发布公告、The Decoder 基准测试分析、TechCrunch 关于发布及安全背景的报道、CNBC 报道、Amazon Bedrock 可用性公告。
