Opus 5 redéfinit la manière dont vous budgétez et concevez les systèmes agentiques. La pensée est désormais activée par défaut, ce qui permet au modèle d'allouer de manière autonome des tokens de raisonnement par tour, et le réglage de l'effort devient le principal levier qualité–latence–coût. En retour, vous obtenez une analyse multi-étapes plus stable, de meilleures boucles d'utilisation des outils sur de longs horizons, et une vérification renforcée sans assistance. Cela modifie également la manière dont vous plafonnez les sorties : max_tokens limite désormais à la fois le raisonnement caché et le texte visible, donc les équipes migrant depuis la version 4.8 doivent revoir les plafonds qui supposaient auparavant zéro token de pensée.
Deux versions bêta sont particulièrement importantes pour la production : les changements d'outils en cours de conversation et le mode de solutions de secours par défaut. La première vous permet d'ajouter ou de retirer des outils entre les tours sans rompre la continuité du cache, réduisant ainsi les frictions d'orchestration et les coûts de démarrage à froid. La seconde simplifie la gestion des refus en associant les catégories aux solutions de secours recommandées par Anthropic au lieu de maintenir une liste fragile de modèles. Combiné à un minimum de cache de prompt abaissé et à un contexte de 1 million de tokens, Opus 5 est mieux adapté aux sessions longues qui mêlent récupération, planification et délégation multi-agent.
Il y a un changement comportemental critique : désactiver la pensée n'est autorisé que lorsque l'effort est élevé ou inférieur ; associer pensée : désactivée avec xhigh ou max renvoie une erreur 400. Si vous devez exécuter avec la pensée désactivée, attendez-vous à un comportement plus fragile dans l'appel des outils et à des balises internes occasionnelles dans la sortie visible — concevez des mesures d'atténuation et des étapes de validation en conséquence. Pour tous les autres, la recommandation est de garder la pensée activée, de commencer avec un effort élevé, et de réduire pour le débit ou d'augmenter jusqu'à xhigh/max pour les problèmes complexes, avec un max_tokens plus grand pour que le modèle ait de la marge pour raisonner et agir.
Concrètement, cette version réduit la nécessité de structurer manuellement les prompts. Opus 5 s'auto-vérifie plus souvent et évite les livrables incomplets dans les travaux de codage et de documentation à long terme. Supprimez les sous-agents vérificateurs redondants et les « vérifications finales » scriptées, puis réévaluez la qualité et la latence. La tarification reste à 5 $/M tokens d'entrée et 25 $/M tokens de sortie, avec un mode rapide optionnel à des tarifs premium sur l'API Claude. La disponibilité sur les principaux clouds vous permet de standardiser un profil de raisonnement unique tout en adaptant l'effort aux niveaux d'utilisation — élevé pour la fiabilité client, moyen pour la productivité interne, et max pour les analyses de pointe soumises à budget.


