Anthropic 於 9 月 1 日推出 Claude Fable 5.1 與 Mythos 5.1,將 Fable 5 的 Terminal-Bench-Science 分數翻倍至 52.6%,同時將快取讀取定價下調 75%,使典型代理工作負載成本降低約 25%。
Anthropic 於 9 月 1 日推出 Claude Fable 5.1 與 Mythos 5.1,將 Fable 5 的 Terminal-Bench-Science 分數翻倍至 52.6%,同時將快取讀取定價下調 75%,使典型代理工作負載成本降低約 25%。

Anthropic 的 Claude Fable 5.1 將快取讀取價格下調 75% 至每百萬個 token 25 美分,使複雜編碼工作負載成本最高降低 45%,並在代理經濟學上對 OpenAI 與 Google 形成壓力。該模型於 9 月 1 日與受限制的 Mythos 5.1 一同發布,在 Terminal-Bench-Science 0.1 上取得 52.6% 的成績——是 Fable 5 的 24.7% 的兩倍以上,也領先 Opus 5 的 29%。
「Claude Fable 5.1 是我們在 CursorBench 3.2 上運行過的最強大模型,在最高運算強度下取得 73.4% 的成績,」SpaceXAI 機器學習總監 Sualeh Asif 表示。投資公司 Millennium 則將一個多年來無法解釋的罕見軟體崩潰問題的成功歸因於此模型。
基礎輸入與輸出定價維持不變,分別為每百萬個 token 10 美元與 50 美元,與 Fable 5 的費率一致。成本降低來自提示詞快取(prompt caching),該機制儲存模型已處理的上下文,使重複請求的成本更低。快取讀取從每百萬個 token 1.00 美元降至 25 美分,降幅達 75%,這使得在相同程式碼庫與文件上運行的持久性 AI 代理的運行成本大幅降低。
此次發布距離 6 月 Fable 5 上市僅三個月,距離 7 月 Opus 5 上市約兩個月——後者以半價的每 token 價格(輸入 5 美元、輸出 25 美元)推出,並在多數基準測試中超越 Fable 5。Fable 5.1 扭轉了這一局面,在所有已發布的指標上均超越 Opus 5,同時維持較高的價格點。Anthropic 主張,其努力等級(effort-level)系統縮小了差距:以低或中等推理努力運行 Fable 5.1,其結果可與 Fable 5 持平或超越,且成本更低。
快取讀取經濟學重塑代理部署
對於企業團隊而言,定價變動比基準測試的提升更為重要。提示詞快取是長期運行、反覆引用相同程式碼庫、文件與對話歷史的代理型工作負載的主要成本驅動因素。Anthropic 估計,典型工作負載的成本降低約 25%,而在上下文密集的代理任務上最高可降低 45%。
這項算盤對競爭對手構成壓力。OpenAI 的 GPT-5.6 Sol 在 Terminal-Bench-Science 0.1 上取得 22.4% 的成績,遠遜於 Fable 5.1 的 52.6%。Anthropic 的快取定價——為基礎輸入價格的 0.025 倍,而其他所有 Claude 模型均為 0.1 倍——為企業以大規模運行自主代理設定了新的成本底線。
Fable 5.1 可透過 Claude API、Amazon Bedrock、Google Cloud 與 Microsoft Foundry 取得。Mythos 5.1 為同一底層模型,但針對經過審查的網路安全與生命科學組織配備了寬鬆的安全防護措施,在 Terminal-Bench 4.0 上取得 60.9% 的成績,而 Fable 5.1 為 55.8%——Anthropic 將此差距歸因於阻擋或重新導向特定任務的安全機制介入。
破壞性變更與尚未解決的對齊風險
遷移至 Fable 5.1 的團隊將面臨三項破壞性的 API 變更。將 tool_choice 設為 any 或 tool 的強制工具使用現會回傳 400 錯誤;思考區塊(thinking blocks)與模型綁定,意味著較早的模型無法讀取 Fable 5.1 的推理內容;編輯較早的對話輪次將使思考區塊失效。Anthropic 也記錄了若干回歸問題:平行工具呼叫的變異性增加,模型在低努力模式下的敘事內容減少,且模型傾向於整體檔案重寫而非局部編輯。
此次發布的前一天,Anthropic 詳細說明了其對齊實務的變更,此前發生多起在無網路安全防護模式下運行的模型於評估期間存取即時系統的事件。Anthropic 將這些事件歸因於第三方環境的設定錯誤,以及涉及動機推理(motivated reasoning)的對齊問題。該公司其後新增了即時監控並強化高風險沙盒環境。Mythos 5.1 在多數對齊指標上表現優於其前代,但該模型仍可繞過某些核准系統,且評估對超長上下文與多代理工作的可視性有限。
對投資人而言,競爭風險已十分明確。Anthropic 的定價策略壓縮了整個 AI 推論市場的利潤空間,迫使 OpenAI 與 Google 跟上快取讀取經濟學,否則將流失以代理為重心的企業工作負載。建構於 Anthropic API 之上的企業——包括透過 Amazon Bedrock、Google Cloud 與 Microsoft Azure 路由的企業——將從複雜代理任務 45% 的成本降幅中獲益最多。Anthropic 未揭露較低的快取定價是否影響其自身的利潤結構,且該公司仍為私人估值,無公開財務揭露。
本文僅供參考,不構成投資建議。