Claude Fable 5.1은 Anthropic의 코딩, 컴퓨터 활용, 장기 에이전트 작업에 가장 뛰어난 만능 모델로 자리매김했으며, 그 성과는 에이전트 벤치마크와 작업당 비용에서 확연히 드러납니다. 핵심은 단순히 점수가 높아진 것이 아니라, 비용 대비 성능 곡선이 개선되었다는 점입니다. 실질적으로 터미널 에이전트, 구조화된 연구 루프, 브라우저 자동화를 운영하는 팀은 캐시 읽기와 작업별 적절한 노력 수준을 활용할 때 더 적은 토큰으로 더 높은 완료율을 달성할 수 있습니다. 이는 이전에 너무 느리거나 비용이 많이 들어 지속 실행이 어려웠던 사용 사례를 가능하게 합니다.
잘 알려진 평가들—에이전트 코딩용 Terminal-Bench 변형, IDE 유사 워크플로우용 CursorBench, 컴퓨터 사용용 OSWorld, 비즈니스 작업용 AutomationBench, 그리고 추론용 Humanity’s Last Exam—에서 Fable 5.1은 대체로 Opus 5를 앞서며, 특히 도구가 활성화되고 작업이 장기 실행될 때 Fable 5 대비 향상된 성능을 보입니다. 이 모델은 다단계 체인에서 신뢰도를 떨어뜨리는 지름길 행동을 피하는 것으로 보이며, 검증 루프는 증상을 덮는 대신 근본 원인을 더 자주 찾아냅니다. 이러한 신뢰성은 재실행 횟수를 줄여 대규모 에이전트 운영 시 가격표 토큰만큼 중요한 요소가 됩니다.
비용 측면에서 이번 업그레이드는 실질적인 운영 개선을 가져옵니다. Anthropic의 저렴한 캐시 읽기 가격 정책과 Fable 5.1의 효과적인 상태 재사용 능력이 결합되어, 에이전트 워크로드는 더 많은 계획, 컨텍스트, 도구 스키마를 재사용 가능한 메모리에 밀어넣을 수 있습니다. 구매자 입장에서는 1) 계획과 제약 조건을 캐시된 시스템 프롬프트에 미리 로드하고, 2) 일상적인 단계는 기본 노력 수준을 낮추며, 3) 검증 단계에서만 노력을 높이고, 4) 도구 접근 범위를 제한해 탐색 호출을 줄일 때 비용 절감 효과가 누적됩니다. 결과적으로 처리량이 개선되고, 청구서가 합리화되며, 무인 작업의 SLO가 단순해집니다.


