Opus 5 重新定义了您预算和设计自主代理系统的方式。思考现在默认开启,因此模型会自主分配每轮的推理令牌,努力设置成为主要的质量-延迟-成本调节器。作为回报,您将获得更稳定的多步骤分析、更好的长期工具使用循环以及更强的验证能力,无需过多引导。这也改变了输出上限的设定:max_tokens 现在同时限制隐藏推理和可见文本,因此从 4.8 迁移的团队应重新审视之前假设思考令牌为零的上限。
两个测试版功能对生产环境尤为重要:对话中途工具变更和默认回退模式。前者允许您在对话轮次间添加或移除工具而不破坏缓存连续性,减少编排摩擦和冷启动成本。后者通过将拒绝类别映射到 Anthropic 推荐的回退方案,简化了拒绝处理,避免维护脆弱的模型列表。结合更低的提示缓存最小值和 100 万令牌上下文,Opus 5 更适合融合检索、规划和多代理委派的长时会话。
有一个关键行为变化:仅当努力值为高或以下时允许禁用思考;将思考禁用与 xhigh 或 max 配对会返回 400 错误。如果必须禁用思考,预期工具调用行为更脆弱且可见输出中偶尔出现内部标记——请据此设计缓解措施和验证步骤。对其他用户,建议保持思考开启,从高努力开始,针对吞吐量调低,或针对难题调高至 xhigh/max,并配合更大的 max_tokens 以给模型足够空间进行推理和行动。
实际上,此版本减少了手动提示搭建。Opus 5 更频繁自我验证,避免长远编码和文档工作中的不完整交付。移除冗余的验证子代理和脚本化“最终检查”,然后重新测量质量和延迟。定价保持为输入每百万令牌 5 美元,输出每百万令牌 25 美元,Claude API 提供可选的快速模式,输出费率更高。主流云平台均可用,您可以标准化单一推理配置,同时根据用例层级调整努力值——面向客户的可靠性用高,内部生产力用中,预算限制下的前沿分析用最大。


