Claude Fable 5.1 被定位為 Anthropic 最強大的全能型模型,適用於編碼、電腦使用及長時間代理工作,並在關鍵領域展現實力:代理基準測試與每解決任務成本。重點不僅是更高的分數,更是更優的效能與成本曲線。實務上,運行終端代理、結構化研究循環或瀏覽器自動化的團隊,透過利用緩存讀取並為每項任務選擇合適的努力程度,可以用更少的代幣達成更高的完成率。這解鎖了過去因速度過慢或成本過高而無法持續運行的使用案例。
在多項知名評測中——包括用於代理編碼的 Terminal-Bench 變體、類 IDE 工作流程的 CursorBench、電腦使用的 OSWorld、商務任務的 AutomationBench,以及推理的 Humanity’s Last Exam——Fable 5.1 通常領先於 Opus 5,並較 Fable 5 有所提升,尤其在啟用工具且任務運行時間較長時。該模型似乎避免了導致多步驟鏈條可靠性下降的捷徑行為,其驗證循環更常定位根本原因,而非掩蓋表面症狀。這種可靠性轉化為更少的重試,這在大規模運行代理時與代幣價格同等重要。
成本是此升級成為可操作的關鍵。Anthropic 強調更便宜的緩存讀取價格,結合 Fable 5.1 有效重用狀態的能力,使代理工作負載能將更多計劃、上下文和工具結構推入可重用記憶體。對買家而言,當您:1) 將計劃與限制預先載入緩存系統提示;2) 對例行步驟降低預設努力程度;3) 僅在驗證關卡提升努力;4) 限制工具存取使模型減少探索性呼叫時,節省效果會疊加。結果是更佳的吞吐量、更合理的帳單,以及無人值守任務更簡單的服務水平目標(SLO)。


