Opus 5 重新定義您如何預算與設計代理系統。思考現在預設啟用,因此模型會自動分配每回合的推理代幣,努力值設定成為主要的品質–延遲–成本調節器。回報是您將獲得更穩定的多步驟分析、更佳的長期工具使用迴圈,以及更強的驗證能力而無需手動干預。這也改變了您如何限制輸出:max_tokens 現在同時限制隱藏推理與可見文字,因此從 4.8 遷移的團隊應檢視先前假設推理代幣為零的上限。
兩項測試版對生產環境特別重要:對話中期工具變更與預設後備模式。前者允許您在回合間新增或移除工具而不破壞快取連續性,降低協調摩擦與冷啟動成本。後者透過將拒絕類別映射到 Anthropic 推薦的後備方案,簡化拒絕處理,避免維護脆弱的模型清單。結合更低的提示快取最低值與 1M 代幣上下文,Opus 5 更適合融合檢索、規劃與多代理委派的長期會話。
有一項關鍵行為變更:只有在努力值為高或以下時才允許禁用思考;將思考禁用與 xhigh 或 max 配對會回傳 400。如果您必須禁用思考,請預期工具呼叫行為更脆弱且可見輸出偶爾會有內部標記——請相應設計緩解與驗證步驟。對其他人而言,建議保持思考啟用,從高努力開始,根據吞吐量調降,或針對困難問題調升至 xhigh/max,並增加 max_tokens 以給模型推理與行動空間。
實務上,此版本減少了手動提示搭建。Opus 5 更頻繁自我驗證,避免長期編碼與文件工作中不完整的交付物。移除冗餘的驗證子代理與腳本化「最終檢查」,然後重新測量品質與延遲。價格維持每百萬輸入代幣 5 美元與每百萬輸出代幣 25 美元,Claude API 提供可選的快速模式,輸出費率較高。主要雲端均有供應,您可標準化單一推理設定,並依用例層級調整努力值——客戶端可靠性用高,中內部生產力用中,預算門檻限制的前沿分析用 max。


