Claude Fable 5.1 được định vị là mô hình toàn diện nhất của Anthropic dành cho mã hóa, sử dụng máy tính và công việc tác nhân dài hạn—và nó thể hiện rõ ở những điểm quan trọng: các chuẩn đo lường tác nhân và chi phí mỗi nhiệm vụ được giải quyết. Điểm nổi bật không chỉ là điểm số cao hơn; mà còn là đường cong hiệu suất trên chi phí tốt hơn. Về mặt thực tiễn, các nhóm vận hành tác nhân terminal, vòng nghiên cứu có cấu trúc hoặc tự động hóa trình duyệt có thể đạt tỷ lệ hoàn thành cao hơn với ít token hơn khi tận dụng đọc bộ nhớ đệm và chọn đúng mức độ nỗ lực cho từng nhiệm vụ. Điều này mở ra các trường hợp sử dụng trước đây quá chậm hoặc quá tốn kém để chạy liên tục.
Trên các đánh giá nổi tiếng—các biến thể Terminal-Bench cho mã hóa tác nhân, CursorBench cho quy trình làm việc giống IDE, OSWorld cho sử dụng máy tính, AutomationBench cho nhiệm vụ kinh doanh, và Humanity’s Last Exam cho suy luận—Fable 5.1 thường vượt Opus 5 và cải thiện so với Fable 5, đặc biệt khi bật công cụ và nhiệm vụ chạy lâu hơn. Mô hình dường như tránh được các hành vi tắt đường tắt làm giảm độ tin cậy trong chuỗi đa bước, và các vòng xác minh thường xác định nguyên nhân gốc rễ thay vì che giấu triệu chứng. Độ tin cậy đó chuyển thành ít lần chạy lại hơn, điều quan trọng không kém token giá niêm yết khi vận hành tác nhân ở quy mô lớn.
Chi phí là điểm nâng cấp trở nên vận hành được. Việc Anthropic tập trung giá vào đọc bộ nhớ đệm rẻ hơn—kết hợp với khả năng tái sử dụng trạng thái hiệu quả của Fable 5.1—nghĩa là các khối lượng công việc tác nhân có thể đẩy nhiều kế hoạch, ngữ cảnh và sơ đồ công cụ vào bộ nhớ có thể tái sử dụng. Đối với người mua, tiết kiệm tăng lên khi bạn: 1) tải trước kế hoạch và ràng buộc vào các lời nhắc hệ thống được lưu trong bộ nhớ đệm; 2) giảm mức nỗ lực mặc định cho các bước thường xuyên; 3) tăng mức nỗ lực chỉ tại các cổng xác minh; và 4) giới hạn truy cập công cụ để mô hình thực hiện ít cuộc gọi khám phá hơn. Kết quả là thông lượng tốt hơn, hóa đơn hợp lý hơn và các SLO đơn giản hơn cho các công việc không giám sát.


