Claude Fable 5 正式發布:SWE-Bench Pro 得分 80.3%、定價為 Opus 4.8 的 2 倍,6 月 22 日前免費使用
Anthropic 今日發布了首個公開可用的 Mythos 級模型——Claude Fable 5,內建安全機制,在高風險提示下會自動回退至 Opus 4.8。SWE-Bench Pro 得分 80.3%(超越 Opus 4.8 達 11 分)。每百萬 token 定價 $10/$50。Pro/Max 方案用戶可免費使用至 6 月 22 日,此後按用量計費。
Anthropic 今日正式推出首款公開可用的 Mythos 系列模型。Claude Fable 5 於 2026 年 6 月 9 日在 Claude API、AWS Bedrock、Vertex AI 及 Microsoft Foundry 全面上線——同步推出的還有 Claude Mythos 5,兩者共用相同底層模型,但 Mythos 5 解除了安全限制,僅限 Project Glasswing 合作夥伴計劃使用。兩款模型定價均為每百萬輸入 token $10 / 輸出 token $50——恰好是 Claude Opus 4.8 費率的 2 倍。
然而,真正值得關注的細節並不在標題數字上。發布數據之下,隱藏著一個耐人尋味的定價機制(Pro/Max 方案免費使用至 6 月 22 日,之後改為點數計費)、真正將 Fable 5 與前代前沿模型拉開差距的頂尖基準測試成績,以及一項新的架構選擇——自動分類器安全護欄在觸發時會回退至 Opus 4.8 而非直接拒絕——這對模型的實際部署方式有實質影響。
此次發布內容
| 細節 | 數值 |
|---|---|
| 模型名稱 | Claude Fable 5(公開版)+ Claude Mythos 5(限制版) |
| API 模型 ID | claude-fable-5 |
| 輸入定價 | $10/1M tokens |
| 輸出定價 | $50/1M tokens |
| 對比 Opus 4.8 定價 | 2×($5/$25) |
| 可用平台 | Claude API、AWS Bedrock、Vertex AI、Microsoft Foundry |
| 訂閱方案存取 | Pro / Max / Team / Enterprise — 免費使用至 2026 年 6 月 22 日 |
| 6 月 22 日後 | 需在訂閱費用之外額外購買使用點數 |
| Mythos 5 存取權限 | 僅限 Project Glasswing 合作夥伴;生物學研究人員可透過信任存取計劃申請 |
兩點定價說明值得特別提出:
- 13 天免費窗口是此次發布的核心槓桿。 Anthropic 利用訂閱方案捆綁策略推動前兩週的用戶採用。6 月 22 日後,Pro/Max 用戶使用同一模型需額外購買點數,這讓正式生產用戶回到按 token 計費的模式,即標題所示的 $10/$50 費率。
- Opus 4.8 定價 2 倍的門檻不低,但基準測試的差距可以解釋其合理性(詳見下文)。以 $50/1M 輸出 token 計算,Fable 是目前市場上最貴的前沿模型——輸出 token 費用約為 Sonnet 4.6 的 3.3 倍、GPT-5.5 的 5 倍、Gemini 3.5 Flash 的 5.5 倍。
基準測試——數字背後的真實意義
Fable 5 聲稱在「幾乎所有測試基準」上達到業界頂尖水準。Anthropic 公布的最具體、最具可比性的數據如下:
| 基準測試 | Fable 5 | Opus 4.8 | GPT-5.5 | Gemini 3.1 Pro |
|---|---|---|---|---|
| SWE-Bench Pro | 80.3% | 69.2% | 58.6% | 54.2% |
| FrontierCode | 29.3% | 13.4% | 5.7% | — |
三點解讀:
SWE-Bench Pro 80.3% 是最關鍵的數字。 這是 SWE-Bench 系列中難度最高的版本,也是最能預測模型在真實生產程式碼上表現的測試。Fable 5 領先 Opus 4.8 11.1 個百分點,領先 GPT-5.5 21.7 個百分點,領先 Gemini 3.1 Pro 26.1 個百分點。這是量級差距,而非微小優勢。對於需要逐一比較模型品質的程式開發工作流程而言,這是今年報告中前沿模型在單一維度上最大的領先幅度。
FrontierCode 的數字更能說明問題。 這個基準測試針對最高難度的程式設計問題——抽象演算法謎題、新型資料結構設計、效能關鍵最佳化。Fable 5 的 29.3% 是 Opus 4.8 的 2 倍以上,是 GPT-5.5 的 5 倍以上。在前沿天花板約為 30% 的基準測試中,這樣的飛躍是基準測試數據所能呈現的最接近能力躍升的證明。
Anthropic 的案例研究印證了這些數字。 據報導,Stripe 使用 Fable 5 在一天內完成了 5000 萬行程式碼的遷移工作。Hebbia 表示 Fable 5 在其金融基準測試中獲得最高分。IMC 表示它「幾乎在所有交易分析評估中都取得優異成績」。這些雖是偏向正面的第一方客戶推薦,但多位獨立客戶不約而同地以「程式/金融/科學知識工作」為框架描述其表現,這種一致性才是值得重視的訊號。
基準測試發布中未包含的內容:Terminal-Bench 數字、GPQA、MMLU、HumanEval、AIME。Anthropic 似乎將 SWE-Bench Pro 和 FrontierCode 定為頭條程式設計指標,這與模型定位為軟體工程前沿的描述一致。
安全護欄——一種不同的架構選擇
Fable 5 之所以能夠公開發布,關鍵在於 Anthropic 在 Mythos 5 之上構建的三層自動分類器安全護欄:
- 網路安全 — 封鎖攻擊性網路任務及漏洞開發
- 生物/化學 — 對大多數具雙重用途風險的生物/化學請求回退至 Opus 4.8(明確包含 AAV 設計)
- 防蒸餾 — 封鎖試圖提取能力以用於競爭模型的嘗試
最重要的架構選擇:當安全護欄觸發時,請求由 Opus 4.8 處理而非直接拒絕。 這是一個有意義的用戶體驗選擇。即便 Fable 5 的前沿推理能力受到安全審查限制,用戶對大多數查詢仍能獲得可用的回答。Anthropic 報告指出,超過 95% 的 Fable 對話完全不觸發任何回退——這意味著護欄調整得足夠精確,生產工作流程基本上感受不到其存在。
外部紅隊測試結果:
- 超過 1,000 小時的外部漏洞賞金測試——未發現通用越獄方法
- 在 30 種公開越獄技術中,零個有害的單輪網路安全請求獲得回應
- 一位外部紅隊成員稱這些護欄是「所有測試模型中最穩健的」
對於部署面向終端用戶應用程式的開發者而言,這與「因政策觸發而拒絕」是截然不同的運作模式。你可以圍繞這個模型構建產品,無需為每次安全拒絕設計備援用戶體驗——Opus 4.8 會在背後無縫處理這些邊緣情況。
Mythos 5——及其存在所隱含的意義
同一底層模型在解除護欄後以 Mythos 5 的形式發布,限制對象為 Project Glasswing 網路安全合作夥伴,並透過信任存取計劃向生物學研究人員擴展。Fable 5 與 Mythos 5 之間的能力差距集中在三個類別:
- ExploitBench(網路安全):Mythos 5 達到 78%,對比 Opus 4.8 的 40%(Fable 5 因網路安全提示觸發護欄而不執行此基準測試)
- 藥物設計:Mythos 5 據報將蛋白質設計流程加速約 10 倍,14 個目標中有 9 個產生了候選藥物
- 科學假說生成:在盲測專家比較中,新型分子生物學假說約 80% 的情況下更受偏好
Mythos 5 的存在說明,底層模型具備遠超 Fable 5 所展現能力的實質性更強大能力。對大多數生產工作流程而言,這無關緊要——但對於安全研究、藥物發現及類似領域,Mythos 分支才是真正的前沿所在。公開存取受到嚴格限制,正是因為 Anthropic 認定原始模型具有雙重用途風險,而分類器護欄的存在正是為了緩解這些風險。
Sonnet 模式的打破所傳達的訊號
兩週前我曾論述,Anthropic 歷來將 Opus 和 Sonnet 次要版本配對發布的模式,使 Sonnet 4.7 的發布比 Sonnet 4.8 更有可能。然而模式的打破超出了我的預期:沒有 Sonnet 4.7,沒有 Sonnet 4.8,Mythos 分支成了此次發布的主角。 Opus 4.8 以填補 Pro 階層的形式推出;Fable 5 則佔據了其之上全新的一個層級。
對 Claude 產品線未來走向,這意味著三種解讀:
- Mythos 分支是新的前沿,Sonnet 和 Opus 作為其下的生產級選擇。能力天花板已明顯提升。
- 命名已與版本號脫鉤。 未來預計將出現更多命名分支(Mythos、Fable),Opus/Sonnet/Haiku 三位一體的格局將逐漸淡出。透過原始碼映射中的字串預測模型發布的方式已成歷史。
- 定價層級的分化正在加劇。 Fable 5 的 $10/$50 是 Opus 4.8 的 2 倍,而 Opus 4.8 本身已是 Haiku 4.5 的 5 倍。前沿能力的成本上升速度,正快於生產級能力的成本上升速度——這意味著路由決策比以往任何時候都更加重要。
Fable 5 在當前生產環境中的定位
具體部署建議:
適合使用 Fable 5 的場景:
- SWE-Bench Pro 表現直接影響結果的程式密集工作流程 — 大規模遷移、新型演算法設計、效能關鍵重構。較 Opus 4.8 高出 11 個百分點的優勢,在真實程式碼庫上轉化為可量化的更優輸出。
- 視覺豐富的知識工作 — 從科學圖表中提取結構化資料、從截圖重建網頁應用程式、處理含嵌入式圖表的技術文件。
- 長上下文推理 — Anthropic 的定位強調「在數百萬 token 中保持專注」,這表明模型在 1M+ 上下文末端的效能衰減曲線明顯優於前一代前沿模型。
- 金融/交易分析 — 獨立基準測試(Hebbia)將 Fable 5 列為金融專項評估的首位。
可選擇更低成本替代方案的場景:
- 高量/低風險生成任務 — 以 $50/1M 輸出 token 計算,Fable 5 用於內容生成、分類或結構化提取並不划算。Sonnet 4.6 或 Gemini 3.5 Flash 能以約 10% 的價格完成這類工作。
- MCP / 工具編排的 Agent 工作流程 — Gemini 3.5 Flash 目前以遠低的成本在 MCP Atlas 和 Toolathlon 中領先。Fable 的程式設計優勢並不自動等同於 Agent 編排優勢。
- 網路安全或生物相關查詢(Fable 本就會回退) — 你在支付 Fable 定價,卻得到 Opus 4.8 的輸出。直接使用 Opus 4.8 即可。
如何立即存取 Claude Fable 5
三種部署路徑:
- 直接透過 Anthropic —
claude-fable-5已在 Claude API 及 AWS Bedrock、Vertex AI、Microsoft Foundry 上線。Pro/Max 方案免費使用至 6 月 22 日;此後按 $10/$50 的 token 費率計費。 - 透過 WaveSpeedAI LLM 端點 — 使用單一 API 金鑰以 OpenAI 相容方式存取當前前沿文字模型。當 Fable 5 在平台上線後,你將能在同一介面下對 Opus 4.8、Sonnet 4.6、GPT-5.5 及 Gemini 3.5 Flash 進行 A/B 測試,無需切換供應商憑證。
- 透過供應商路由器 — 如果你使用聚合器(Vercel AI SDK、LangChain 等),
claude-fable-5模型 ID 已進入公開模型登錄檔。「SWE 密集任務使用 Fable,其餘使用 Sonnet」的路由策略只需修改一行設定即可實現。
未來兩週值得關注的訊號
三個信號:
- 6 月 22 日定價轉換。 當 Pro/Max 免費窗口結束,公開採用率的訊號將體現在有多少訂閱用戶真正為 Fable 5 支付超額費用。這是判斷 Opus 4.8 定價 2 倍是否對長尾使用場景具有持續性的最清晰依據。
- 獨立基準測試複現。 Anthropic 的 SWE-Bench Pro 和 FrontierCode 數字是第一方數據。請留意獨立基準測試套件的複現結果——以及 Opus 4.8 領先 11 個百分點的優勢是否在 Anthropic 精選測試集以外依然成立。
- 下一個 Sonnet 版本。 以 Mythos 為新的前沿分支,Sonnet 將何去何從?一個在成本/Agent 基準測試上針對 Gemini 3.5 Flash 定位的更新版 Sonnet,將重新錨定 Claude 產品線的價值層級。如果 Sonnet 保持沉默,則意味著 Anthropic 打算讓生產層級在 4.6 上維持比歷史節奏更長的時間。
在此之前:Fable 5 是新的天花板,Opus 4.8 是生產級預設選擇,Sonnet 4.6 仍是性價比之選。未來兩週將告訴你,Mythos 分支究竟是曇花一現的前沿突破,還是 Anthropic 發布節奏的全新常態。
資料來源:Anthropic 的 Fable 5 / Mythos 5 公告、The Decoder 基準測試分析、TechCrunch 關於發布及安全背景的報導、CNBC 報導、Amazon Bedrock 可用性。
