Opus 5는 에이전트 시스템을 설계하고 예산을 책정하는 방식을 재구성합니다. 사고가 이제 기본적으로 활성화되어 모델이 각 턴마다 자율적으로 추론 토큰을 할당하며, 노력 설정이 주요 품질–지연 시간–비용 조절 다이얼이 됩니다. 그 대가로 더 안정적인 다단계 분석, 장기적 도구 사용 루프, 그리고 수동 개입 없이도 강력한 검증 기능을 얻습니다. 이는 출력 제한 방식도 변경하는데, max_tokens가 숨겨진 추론과 가시 텍스트 모두를 제한하므로 4.8에서 마이그레이션하는 팀은 이전에 사고 토큰이 0이라고 가정했던 상한선을 재검토해야 합니다.
생산 환경에 특히 중요한 두 가지 베타 기능은 대화 중간 도구 변경과 기본 대체 모드입니다. 전자는 턴 사이에 도구를 추가하거나 제거할 수 있어 캐시 연속성을 깨뜨리지 않고 조율 마찰과 초기 비용을 줄입니다. 후자는 거부 처리 방식을 단순화하여 취약한 모델 목록을 유지하는 대신 Anthropic 권장 대체 모델로 범주를 매핑합니다. 낮아진 프롬프트 캐시 최소값과 100만 토큰 컨텍스트와 결합되어 Opus 5는 검색, 계획, 다중 에이전트 위임이 혼합된 장기 세션에 더 적합합니다.
중요한 행동 변화가 있습니다: 사고 비활성화는 노력 설정이 높음 이하일 때만 허용되며, 사고 비활성화와 xhigh 또는 max 조합은 400 오류를 반환합니다. 사고 비활성화 상태로 실행해야 한다면 도구 호출에서 더 취약한 동작과 가시 출력에 간헐적 내부 마크업이 나타날 수 있으니 설계 시 완화책과 검증 단계를 마련하세요. 나머지 사용자에게는 사고를 활성화 상태로 유지하고, 높은 노력에서 시작해 처리량을 위해 중간으로 낮추거나 어려운 문제에는 xhigh/max까지 올리며, 모델이 추론하고 행동할 공간을 확보하도록 max_tokens를 크게 설정할 것을 권장합니다.
실제로 이번 릴리스는 수동 프롬프트 스캐폴딩을 줄입니다. Opus 5는 더 자주 자체 검증하며 장기 코딩 및 문서 작업에서 불완전한 결과물을 피합니다. 중복된 검증 하위 에이전트와 스크립트화된 “최종 점검”을 제거한 후 품질과 지연 시간을 다시 측정하세요. 가격은 입력 토큰당 $5, 출력 토큰당 $25로 유지되며, Claude API에서 프리미엄 출력 요율의 빠른 모드를 선택할 수 있습니다. 주요 클라우드 전반에서 이용 가능하므로 단일 추론 프로필을 표준화하면서 사용 사례 계층에 맞게 노력을 조정할 수 있습니다—고객 대응 신뢰성에는 높음, 내부 생산성에는 중간, 예산 제한이 있는 최첨단 분석에는 max를 사용하세요.


