Anthropic的Claude Sonnet 5.5旨在成为可靠的主力:更快的吞吐量、更低的每任务成本,以及在实际工作流程中更敏锐的代理能力。在Terminal-Bench 4.0上其得分跃升至70.6%,相比Sonnet 5有显著提升,而CursorBench显示其成绩仅比Opus 5.5低几分。结果是模型在代码编辑、文档润色和界面设计建议方面更易操控且更果断。重要的是,令牌价格与Sonnet 5保持一致,但模型通常需要更少的令牌完成任务——因此您无需调整预算或采购条款即可实现节省。
经济效益至关重要。输入成本约为每百万令牌2美元,输出成本约为每百万令牌10美元,Sonnet 5.5通过更少的重试、更少的工具调用和更少的冗长绕行实现更多效果。在代理编码测试和企业试点中,这表现为更短的调用链和更小的追踪,从而降低了延迟和开销。团队还报告称对大型代码库的理解更快,工具使用批处理更高效,使得长时间运行的任务能在更少的分段内完成。当您在数百个持续集成检查、支持宏或数据清理作业中扩展时,每任务成本差异将在几天内显现,而非几个季度。
在Anthropic自家产品线中,Sonnet 5.5是对Opus 5.5的补充而非替代。Opus仍然在需要持续判断的复杂开放式任务中领先,但Sonnet现在承担更多范围明确的任务:修复漏洞、结构化编辑、图表解读和幻灯片制作。与评估中共享的GPT-6 Sol参考相比,Sonnet 5.5在关键编码和长远任务指标上表现竞争力,且在相似努力水平下每任务成本显著更低。实际结论是:默认将常规工作负载路由至Sonnet 5.5,遇到细节复杂、多约束权衡或高风险推理时升级至Opus 5.5。
在运营方面,Sonnet 5.5也加强了安全防护。它配备了与Opus 5相当的升级版网络安全措施,同时保持Sonnet 5的生物安全防护,并新增蒸馏保护以防止大规模能力提取。对于开发者,有两点设置须注意:该模型在主要云平台均可用,且支持零数据保留选项;如果您之前关闭了Sonnet的思考功能,迁移时需采用between_tools设置以确保平滑过渡。实际应用中,这既保证了常规工作的快速迭代,也保持了高风险请求的对齐安全。


