Opus 5 định hình lại cách bạn phân bổ ngân sách và thiết kế các hệ thống tác nhân. Tư duy giờ đây được bật mặc định, vì vậy mô hình tự động phân bổ token lý luận cho mỗi lượt, và cài đặt nỗ lực trở thành núm điều chỉnh chính về chất lượng–độ trễ–chi phí. Đổi lại, bạn nhận được phân tích đa bước ổn định hơn, vòng lặp sử dụng công cụ tốt hơn trên các khoảng thời gian dài, và xác minh mạnh mẽ hơn mà không cần hỗ trợ thủ công. Điều này cũng thay đổi cách bạn giới hạn đầu ra: max_tokens giờ giới hạn cả lý luận ẩn và văn bản hiển thị, vì vậy các nhóm di chuyển từ 4.8 nên xem lại các giới hạn trước đây giả định không có token tư duy.
Hai bản beta đặc biệt quan trọng cho sản xuất: thay đổi công cụ giữa cuộc trò chuyện và chế độ dự phòng mặc định. Bản đầu cho phép bạn thêm hoặc loại bỏ công cụ giữa các lượt mà không làm gián đoạn bộ nhớ đệm, giảm ma sát điều phối và chi phí khởi động lạnh. Bản sau đơn giản hóa xử lý từ chối bằng cách ánh xạ các danh mục sang các phương án dự phòng được Anthropic khuyến nghị thay vì duy trì danh sách mô hình dễ vỡ. Kết hợp với mức tối thiểu bộ nhớ đệm prompt thấp hơn và ngữ cảnh 1 triệu token, Opus 5 phù hợp hơn với các phiên làm việc dài kết hợp truy xuất, lập kế hoạch và phân công đa tác nhân.
Có một thay đổi hành vi quan trọng: việc tắt tư duy chỉ được phép khi nỗ lực ở mức cao hoặc thấp hơn; kết hợp tư duy: tắt với xhigh hoặc max sẽ trả về lỗi 400. Nếu bạn phải chạy với tư duy tắt, hãy chuẩn bị cho hành vi dễ vỡ hơn trong gọi công cụ và thỉnh thoảng có đánh dấu nội bộ trong đầu ra hiển thị—hãy thiết kế các biện pháp giảm thiểu và bước xác thực phù hợp. Với tất cả mọi người khác, hướng dẫn là giữ tư duy bật, bắt đầu với nỗ lực cao, và giảm xuống để tăng thông lượng hoặc tăng lên xhigh/max cho các vấn đề khó, với max_tokens lớn hơn để mô hình có không gian lý luận và hành động.
Thực tế, bản phát hành này giảm bớt việc xây dựng prompt thủ công. Opus 5 tự xác minh thường xuyên hơn và tránh các sản phẩm giao không hoàn chỉnh trong công việc mã hóa và tài liệu dài hạn. Loại bỏ các tác nhân phụ xác minh dư thừa và các “kiểm tra cuối cùng” theo kịch bản, sau đó đo lại chất lượng và độ trễ. Giá vẫn giữ ở mức 5 đô la cho mỗi triệu token đầu vào và 25 đô la cho mỗi triệu token đầu ra, với chế độ nhanh tùy chọn ở mức giá cao hơn trên API Claude. Khả năng có mặt trên các đám mây lớn giúp bạn chuẩn hóa một cấu hình lý luận duy nhất trong khi điều chỉnh nỗ lực theo các cấp độ sử dụng—cao cho độ tin cậy khách hàng, trung bình cho năng suất nội bộ, và max cho các phân tích tiên phong bị giới hạn bởi ngân sách.


