Opus 5はエージェントシステムの予算と設計方法を再定義します。思考はデフォルトでオンになり、モデルは自律的にターンごとに推論トークンを割り当て、努力設定が主な品質・レイテンシ・コストの調整ダイヤルとなります。その結果、より安定した多段階分析、長期的なツール使用ループの改善、手助けなしでの強力な検証が得られます。これにより出力の上限設定も変わります:max_tokensは隠れた推論と可視テキストの両方を制限するため、4.8から移行するチームは以前は思考トークンがゼロと想定していた上限を見直す必要があります。
本番環境で特に重要なベータ機能は、会話中のツール変更とデフォルトフォールバックモードです。前者はターン間でツールの追加や削除を可能にし、キャッシュの連続性を壊さずにオーケストレーションの摩擦やコールドスタートコストを削減します。後者は拒否処理を簡素化し、壊れやすいモデルリストを維持する代わりにAnthropic推奨のフォールバックにカテゴリをマッピングします。これに加え、プロンプトキャッシュの最小値が下がり、1Mトークンのコンテキストが導入されたことで、Opus 5は検索、計画、マルチエージェント委任を組み合わせた長時間セッションにより適しています。
重要な動作変更があります:思考の無効化は努力が高またはそれ以下の場合のみ許可され、思考無効とxhighまたはmaxの組み合わせは400エラーを返します。思考を無効にして実行する必要がある場合は、ツール呼び出しの動作が不安定になり、可視出力に内部マークアップが時折含まれることを想定し、設計上の緩和策と検証手順を用意してください。その他のユーザーは思考を有効に保ち、高い努力から開始し、スループット向けに中程度に下げるか、難しい問題にはxhigh/maxまで上げて、モデルが推論と行動の余裕を持てるようにmax_tokensを大きくしてください。
実際には、このリリースにより手動のプロンプト構造化が減ります。Opus 5は自己検証をより頻繁に行い、長期的なコーディングやドキュメント作業で不完全な成果物を回避します。冗長な検証サブエージェントやスクリプト化された「最終チェック」を削除し、品質とレイテンシを再測定してください。価格は入力トークンあたり5ドル、出力トークンあたり25ドルで変わらず、Claude APIではプレミアム出力料金の高速モードも利用可能です。主要クラウドでの利用可能性により、単一の推論プロファイルを標準化しつつ、ユースケースの階層に応じて努力レベルを調整できます—顧客向け信頼性には高、内部生産性には中、予算制約のある最先端分析にはmaxを設定します。


