Opus 5 reformula como você orça e projeta sistemas agenciais. O pensamento agora está ativado por padrão, então o modelo aloca autonomamente tokens de raciocínio por turno, e a configuração de esforço torna-se o principal controle de qualidade–latência–custo. Em troca, você obtém análises multi-etapas mais estáveis, melhores ciclos de uso de ferramentas em horizontes longos e verificação mais robusta sem supervisão constante. Isso também altera como você limita as saídas: max_tokens agora limita tanto o raciocínio oculto quanto o texto visível, então equipes migrando do 4.8 devem revisar os tetos que antes assumiam zero tokens de pensamento.
Dois betas são particularmente importantes para produção: mudanças de ferramentas durante a conversa e o modo fallback padrão. O primeiro permite adicionar ou remover ferramentas entre turnos sem quebrar a continuidade do cache, reduzindo atritos de orquestração e custos de inicialização. O segundo simplifica o tratamento de recusas mapeando categorias para fallbacks recomendados pela Anthropic em vez de manter uma lista frágil de modelos. Combinado com um mínimo de cache de prompt menor e um contexto de 1M tokens, Opus 5 é mais adequado para sessões longas que misturam recuperação, planejamento e delegação multi-agente.
Há uma mudança comportamental crítica: desabilitar o pensamento só é permitido quando o esforço está alto ou abaixo; combinar pensamento: desabilitado com xhigh ou max retorna um erro 400. Se você precisar rodar com pensamento desabilitado, espere um comportamento mais frágil nas chamadas de ferramentas e marcações internas ocasionais na saída visível — projete mitigações e etapas de validação adequadas. Para todos os outros, a recomendação é manter o pensamento ativado, começar com esforço alto e ajustar para baixo para rendimento ou para xhigh/max para problemas difíceis, com max_tokens maiores para que o modelo tenha espaço para raciocinar e agir.
Na prática, esta versão reduz a necessidade de scaffolding manual de prompts. Opus 5 se auto-verifica com mais frequência e evita entregas incompletas em trabalhos de codificação e documentos de longo prazo. Remova subagentes verificadores redundantes e “checagens finais” roteirizadas, depois reavalie qualidade e latência. O preço permanece em $5/M tokens de entrada e $25/M tokens de saída, com um modo rápido opcional a taxas premium na API Claude. Disponível nas principais nuvens, você pode padronizar um perfil de raciocínio único enquanto ajusta o esforço por níveis de caso de uso — alto para confiabilidade voltada ao cliente, médio para produtividade interna e max para análises de fronteira limitadas por orçamento.


