WaveSpeedAI

Claude Fable 5 正式发布:SWE-Bench Pro 得分 80.3%,定价为 Opus 4.8 的 2 倍,6 月 22 日前免费使用

Anthropic 今日发布了首个公开可用的 Mythos 级模型——Claude Fable 5,该模型配备安全防护机制,在高风险提示下会自动回退至 Opus 4.8。SWE-Bench Pro 得分 80.3%,比 Opus 4.8 高出 11 个百分点。每百万 token 定价 $10/$50。在 Pro/Max 计划下免费使用至 6 月 22 日,此后按用量计费。

By WaveSpeedAI4 min read

Anthropic 今日发布了首款面向公众的 Mythos 级别模型。Claude Fable 5 于 2026 年 6 月 9 日在 Claude API、AWS Bedrock、Vertex AI 和 Microsoft Foundry 上正式上线——同步发布的还有 Claude Mythos 5,二者底层模型相同,但 Mythos 5 解除了部分安全限制,仅面向 Project Glasswing 合作伙伴计划开放。两款模型定价均为每百万 token 输入 $10 / 输出 $50——恰好是 Claude Opus 4.8 定价的 2 倍。

不过,真正值得关注的细节并不在发布公告的标题里。在发布数据之下,隐藏着一个值得关注的定价机制(Pro/Max 用户在 6 月 22 日前免费使用,之后按积分计费)、一套真正将 Fable 5 与前代前沿模型拉开差距的顶级基准测试成绩,以及一项新的架构设计——自动分类器安全机制在触发时会回退到 Opus 4.8 而非直接拒绝请求——这一选择对实际部署方式有实质性影响。

发布内容

详情数值
模型名称Claude Fable 5(公开版)+ Claude Mythos 5(受限版)
API 模型 IDclaude-fable-5
输入定价$10/1M tokens
输出定价$50/1M tokens
对比 Opus 4.8 定价2×($5/$25)
可用平台Claude API、AWS Bedrock、Vertex AI、Microsoft Foundry
订阅访问Pro / Max / Team / Enterprise——2026 年 6 月 22 日前免费
6 月 22 日后需在订阅基础上额外购买使用积分
Mythos 5 访问权限仅限 Project Glasswing 合作伙伴;生物研究人员可通过可信访问计划申请

两点定价说明值得特别关注:

  1. 13 天免费窗口是此次发布的引爆点。 Anthropic 利用订阅捆绑策略在前两周内驱动用户采用。6 月 22 日之后,Pro/Max 用户使用同款模型需要额外购买积分,生产用户将重新回到按 token 计费的模式,即上述 $10/$50 的定价。
  2. 2 倍 Opus 4.8 的定价并不便宜,但基准测试的差距能解释大部分原因(详见下文)。以 $50/1M 输出 token 计,Fable 是目前市场上最贵的前沿模型——在输出 token 上约为 Sonnet 4.6 的 3.3 倍、GPT-5.5 的 5 倍、Gemini 3.5 Flash 的 5.5 倍。

基准测试成绩——以及它真正说明了什么

Fable 5 声称在”几乎所有测试基准”上达到业界领先水平。Anthropic 公布的最具体、最具可比性的数据如下:

基准测试Fable 5Opus 4.8GPT-5.5Gemini 3.1 Pro
SWE-Bench Pro80.3%69.2%58.6%54.2%
FrontierCode29.3%13.4%5.7%

三点解读:

80.3% 的 SWE-Bench Pro 成绩是核心数据。 这是 SWE-Bench 系列中难度最高的变体,也是最能预测模型在真实生产代码上表现的指标。Fable 5 领先 Opus 4.8 11.1 个百分点,领先 GPT-5.5 21.7 个百分点,领先 Gemini 3.1 Pro 26.1 个百分点。这是代际差距,而非微弱领先。对于需要横向比较模型质量的编程工作流而言,这是今年报告的最大单项前沿领先幅度。

FrontierCode 才是更能说明问题的数据。 该基准测试针对最高难度的编程问题——抽象算法难题、新型数据结构设计、性能关键型优化。Fable 5 的 29.3% 超过 Opus 4.8 的 2 倍,超过 GPT-5.5 的 5 倍。在前沿天花板约为 30% 的基准测试上实现这种跃升,是基准测试数据所能提供的最接近”能力阶跃”的证据。

Anthropic 的案例研究印证了这些数字。 据报道,Stripe 使用 Fable 5 在一天内完成了 5000 万行代码的迁移。Hebbia 报告称 Fable 5 在其金融基准测试中得分最高。IMC 表示其”几乎在所有交易分析评估中表现完美”。这些均为对品牌友好的客户证言,但多个独立客户在”代码/金融/科学知识工作”这一框架上的一致性,才是值得重点关注的信号。

基准测试中未涵盖的内容:Terminal-Bench 数据、GPQA、MMLU、HumanEval、AIME。Anthropic 似乎将 SWE-Bench Pro 和 FrontierCode 作为主要编程指标,这与该模型被定位为软件工程前沿模型的框架一致。

安全机制——一种不同的架构选择

Fable 5 能够公开发布,根本原因在于 Anthropic 在 Mythos 5 之上构建的三套自动分类器安全机制

  1. 网络安全——屏蔽攻击性网络任务和漏洞利用开发
  2. 生物/化学——对大多数具有双重用途风险的生物/化学请求回退至 Opus 4.8(明确包括 AAV 设计)
  3. 蒸馏防护——屏蔽试图提取能力以训练竞争模型的请求

关键的架构选择:当安全机制触发时,响应由 Opus 4.8 处理,而非直接拒绝。 这是一个有意义的用户体验决策。即使 Fable 5 的前沿推理能力受到安全审查的限制,用户对大多数查询仍能获得可用的答案。Anthropic 报告称,超过 95% 的 Fable 会话完全不涉及回退——这意味着安全机制调校得足够精准,生产工作流基本感知不到它们的存在。

外部红队测试结果:

  • 超过 1000 小时的外部漏洞赏金测试——未发现通用越狱方法
  • 在 30 种公开越狱技术下,零例有害单轮网络安全请求被执行
  • 一位外部红队成员称该安全机制”是所有测试模型中最为健壮的”

对于部署面向客户应用的开发者而言,这与”触发安全策略即拒绝”的运营模式截然不同。你可以围绕该模型构建产品,无需为每次安全拒绝设计回退用户体验——Opus 4.8 会在后台无缝处理长尾情况。

Mythos 5——以及它的存在意味着什么

解除安全限制的同款模型以 Mythos 5 的名称发布,仅限 Project Glasswing 网络安全合作伙伴访问,同时通过可信访问计划向生物研究人员逐步开放。Fable 5 与 Mythos 5 之间的能力差距集中在三个类别:

  • ExploitBench(网络安全):Mythos 5 达到 78%,而 Opus 4.8 为 40%(Fable 5 不运行此基准测试,因为网络安全提示会触发安全机制)
  • 药物设计:Mythos 5 据报道将蛋白质设计流程加速约 10 倍,14 个靶点中有 9 个产生了候选药物
  • 科学假设生成:在盲测专家评比中,新颖的分子生物学假设约 80% 的情况下优于对比方案

Mythos 5 的存在表明,底层模型的实际能力远超 Fable 5 所展示的内容。对于大多数生产工作流而言,这一点无关紧要——但对于安全研究、药物发现等领域,Mythos 分支才是真正的前沿所在。公开访问受到明确限制,正是因为 Anthropic 判断原始模型存在双重用途风险,而分类器安全机制正是为此而生。

Sonnet 规律被打破意味着什么

两周前我曾论证,Anthropic 历史上将 Opus 和 Sonnet 小版本号配对发布的规律,使得 Sonnet 4.7 比 Sonnet 4.8 更有可能发布。但这一规律比我预期的打破得更彻底:没有 Sonnet 4.7,没有 Sonnet 4.8,Mythos 分支直接成了主角。 Opus 4.8 填补了 Pro 档位的空缺;Fable 5 则在其上开辟了全新的层级。

对 Claude 产品线未来走向的三种解读:

  1. Mythos 分支是新的前沿,Sonnet 和 Opus 成为其下的生产级选择。能力天花板已明显抬升。
  2. 命名已与版本号脱钩。 未来可以预期更多命名分支(Mythos、Fable),而非 Opus/Sonnet/Haiku 三元组。通过源码映射字符串来预测模型发布的方式已走到尽头。
  3. 定价层级差距正在拉大。 Fable 5 定价 $10/$50,是 Opus 4.8 的 2 倍,而 Opus 4.8 已是 Haiku 4.5 的 5 倍。前沿能力的成本增速远快于生产级能力的成本增速——这意味着路由决策比以往任何时候都更加重要。

Fable 5 在生产环境中的定位

具体的部署参考:

适合使用 Fable 5 的场景:

  • SWE-Bench Pro 性能直接影响结果的重代码工作流——大规模迁移、新型算法开发、性能关键型重构。11 个百分点的领先优势能在真实代码库上转化为可量化的更好输出。
  • 视觉密集型知识工作——从科学图表中提取结构化数据、根据截图重建 Web 应用、处理包含嵌入图表的技术文档。
  • 长上下文推理——Anthropic 强调”在数百万 token 中保持专注”,这表明该模型在 1M+ 上下文末端的性能衰减曲线明显优于前代前沿模型。
  • 金融/交易分析——独立基准测试(Hebbia)将 Fable 5 列为金融专项评估的首位。

应继续使用更经济替代方案的场景:

  • 高量/低价值生成——以 $50/1M 输出 token 计,Fable 5 用于内容生成、分类或结构化提取极不经济。Sonnet 4.6 或 Gemini 3.5 Flash 可以约 10% 的价格完成同等工作。
  • MCP / 工具编排 Agent 工作流——Gemini 3.5 Flash 目前在 MCP Atlas 和 Toolathlon 上领先,且成本仅为零头。Fable 的编程优势并不自动转化为 Agent 编排优势。
  • 会触发回退的网络安全或生物查询——你以 Fable 定价支付,却获得 Opus 4.8 的输出。不如直接使用 Opus 4.8。

如何立即访问 Claude Fable 5

三种部署路径:

  1. 通过 Anthropic 直接访问——claude-fable-5 已在 Claude API 以及 AWS Bedrock、Vertex AI 和 Microsoft Foundry 上线。Pro/Max 计划用户可免费使用至 6 月 22 日;此后按 $10/$50 的 per-token 计费。
  2. 通过 WaveSpeedAI LLM 端点——以 OpenAI 兼容方式通过单一 API key 访问当前前沿文本模型。待 Fable 5 在平台上完成集成后,你可以在同一接口下对其与 Opus 4.8、Sonnet 4.6、GPT-5.5 和 Gemini 3.5 Flash 进行 A/B 测试,无需切换不同服务商的凭据。
  3. 通过提供商路由器——如果你使用聚合器(Vercel AI SDK、LangChain 等),claude-fable-5 模型 ID 已进入公开模型注册表。“对 SWE 密集型任务使用 Fable,其余使用 Sonnet”的路由策略只需修改一行配置即可实现。

未来两周值得关注的信号

三个关键信号:

  1. 6 月 22 日定价切换。 当 Pro/Max 免费窗口关闭后,公众采用率的真实信号将是有多少订阅用户愿意为 Fable 5 支付超额费用。这是检验 2 倍 Opus 4.8 定价对长尾用例是否可持续的最直接指标。
  2. 独立基准测试复现。 Anthropic 的 SWE-Bench Pro 和 FrontierCode 数据来自内部。关注独立基准测试套件的复现结果——以及 11 个百分点领先 Opus 4.8 的优势在 Anthropic 策划的测试集之外是否依然成立。
  3. 下一个 Sonnet 版本。 随着 Mythos 成为新的前沿分支,Sonnet 将何去何从?一个在成本和 Agent 基准测试上针对 Gemini 3.5 Flash 定位的更新版 Sonnet,将重新锚定 Claude 产品线的价值档位。若 Sonnet 保持沉默,则意味着 Anthropic 将让生产级档位在 4.6 上停留更长时间,超出历史节奏的预期。

在此之前:Fable 5 是新的能力天花板,Opus 4.8 是生产级默认选择,Sonnet 4.6 依然是性价比之选。未来两周将告诉你,Mythos 分支是一次性的前沿突破,还是 Anthropic 发布节奏的新常态。

来源:Anthropic 的 Fable 5 / Mythos 5 发布公告The Decoder 基准测试分析TechCrunch 关于发布及安全背景的报道CNBC 报道Amazon Bedrock 可用性公告

分享