Claude Fable 5.1 se posiciona como el modelo más capaz y versátil de Anthropic para codificación, uso de computadoras y trabajo agente prolongado, y se destaca donde importa: en benchmarks de agentes y costo por tarea resuelta. Lo destacado no son solo las puntuaciones más altas; es una mejor relación rendimiento-costo. En términos prácticos, los equipos que ejecutan agentes en terminal, ciclos de investigación estructurados o automatización de navegador pueden lograr tasas de finalización más altas con menos tokens al aprovechar las lecturas de caché y seleccionar el nivel de esfuerzo adecuado por tarea. Esto desbloquea casos de uso que antes eran demasiado lentos o costosos para ejecutarse continuamente.
En evaluaciones conocidas — variantes de Terminal-Bench para codificación agente, CursorBench para flujos de trabajo tipo IDE, OSWorld para uso de computadora, AutomationBench para tareas empresariales y Humanity’s Last Exam para razonamiento — Fable 5.1 generalmente supera a Opus 5 y mejora respecto a Fable 5, especialmente cuando las herramientas están habilitadas y las tareas se ejecutan por más tiempo. El modelo parece evitar comportamientos de atajo que afectan la confiabilidad en cadenas multi-paso, y sus ciclos de verificación localizan con mayor frecuencia las causas raíz en lugar de cubrir los síntomas. Esa confiabilidad se traduce en menos repeticiones, lo que importa tanto como los tokens al precio de lista cuando se operan agentes a gran escala.
El costo es donde la actualización se vuelve operativa. El énfasis en precios de Anthropic en lecturas de caché más baratas, combinado con la capacidad de Fable 5.1 para reutilizar el estado de manera efectiva, significa que las cargas de trabajo agente pueden almacenar más planes, contextos y esquemas de herramientas en memoria reutilizable. Para los compradores, los ahorros se acumulan cuando: 1) se cargan primero la planificación y restricciones en prompts de sistema cacheados; 2) se reduce el nivel de esfuerzo predeterminado para pasos rutinarios; 3) se escala el esfuerzo solo en puntos de verificación; y 4) se limita el acceso a herramientas para que el modelo realice menos llamadas exploratorias. El resultado es mejor rendimiento, facturas más razonables y SLOs más simples para trabajos sin supervisión.


