Claude Fable 5.1 被定位为 Anthropic 在编码、计算机使用和长期代理工作中的最强全能模型——并且它在关键领域表现突出:代理基准测试和每解决任务的成本。重点不仅是更高的分数,更是更优的性能与成本曲线。实际应用中,运行终端代理、结构化研究循环或浏览器自动化的团队,在利用缓存读取和为每个任务选择合适的努力水平时,可以用更少的令牌实现更高的完成率。这解锁了之前因速度慢或成本高而无法持续运行的用例。
在众多知名评测中——包括针对代理编码的 Terminal-Bench 变体、类似 IDE 工作流的 CursorBench、计算机使用的 OSWorld、业务任务的 AutomationBench 以及推理能力的 Humanity’s Last Exam——Fable 5.1 通常领先于 Opus 5,并较 Fable 5 有所提升,尤其是在启用工具和任务运行时间较长时。该模型似乎避免了导致多步骤链条可靠性下降的捷径行为,其验证循环更常定位根本原因,而非掩盖表面症状。这种可靠性转化为更少的重跑,对于大规模运行代理时,重跑成本与列表价令牌同样重要。
成本方面的升级尤为关键。Anthropic 对更便宜缓存读取的定价策略,结合 Fable 5.1 有效重用状态的能力,使代理工作负载能够将更多计划、上下文和工具模式推入可重用内存。对于购买者来说,节省效果在于:1)将规划和约束预先加载到缓存的系统提示中;2)将常规步骤的默认努力水平调低;3)仅在验证关卡提升努力;4)限制工具访问,使模型减少探索性调用。结果是更高的吞吐量、更合理的账单和更简单的无人值守任务服务水平目标(SLO)。


