Claude Opus 5 lento: o que checar antes de trocar de modelo

Claude Opus 5 lento quase nunca é culpa do modelo: na maioria das vezes é o esforço de raciocínio, a sessão inchada, um incidente no serviço ou o limite de uso do seu plano. O padrão de esforço do Opus 5 é high, o que significa mais raciocínio e mais latência por design. Antes de trocar de modelo, olhe o status oficial em status.claude.com, cheque o nível de esforço no cabeçalho da sessão, rode /context e /doctor no Claude Code e separe "lento" de "sem cota". Só depois disso a troca de modelo vira uma decisão de verdade.
Fala aí, beleza? Antes de culpar o modelo, respira: na esmagadora maioria dos casos o problema é a sessão, o nível de esforço ou o próprio serviço
O Opus 5 foi lançado pela Anthropic e está disponível em todos os planos pagos (Pro, Max, Team e Enterprise) e também na Claude API, com o mesmo preço do Opus 4.8
Ele é o modelo padrão no Claude Max e o mais forte disponível no Claude Pro, então muita gente migrou pra ele sem nem escolher
E tem um detalhe que muda TUDO na percepção de velocidade: o Opus 5 mudou de comportamento em relação à geração anterior
Domine o Claude Code do básico ao avançado
Você vai aprender a criar sistemas completos com Claude Code, sem precisar ser programador. Inscreva-se para ter acesso a um desconto de lançamento e bônus especiais!
As respostas padrão são mais longas, ele narra mais durante trabalho agêntico, anuncia o que vai fazer, verifica o próprio trabalho e delega mais pra subagents
Ou seja: parte do "ficou lento" é ele fazendo mais coisa antes de te entregar o resultado
Isso é bom pra qualidade, mas não te dispensa de conferir os fatos da resposta quando o assunto é sensível
Bora destrinchar sintoma por sintoma? 🙂
Sintoma 1: a resposta demora muito mais do que antes no mesmo tipo de tarefa
A causa número um aqui é o esforço de raciocínio
O Opus 5 tem um parâmetro de esforço (effort) com cinco níveis: low, medium, high, xhigh e max
E o padrão é high, tanto no Opus 5 quanto no Opus 4.8, inclusive no Claude Code e na Messages API
Que diferença isso faz? Em esforço mais alto o modelo pensa com mais frequência e mais profundidade, gastando mais tokens
É uma troca explícita: você paga em custo e latência pra ganhar em qualidade de resposta
Se tu não mexeu em nada, tu está rodando no high sem saber
Como ver e ajustar o esforço no Claude Code:
- Olhe o cabeçalho da sessão: o nível ativo aparece ali, do lado do nome do modelo (tipo "with low effort")
- Rode o comando sem argumento pra abrir o slider interativo
/effort
- Ou passe o nome do nível pra definir direto, sem slider
/effort low
- Se quiser voltar ao padrão do modelo, use o modo automático
/effort auto
O erro comum deste passo: achar que auto significa "o mais rápido"
Ele volta pro padrão do modelo, que é high… se tu queria velocidade, tu acabou de desfazer teu ajuste, haha
Dá pra fixar o esforço sem digitar toda vez?
Dá sim
O esforço também pode ser definido no frontmatter de skills e de subagents, e pela variável de ambiente CLAUDE_CODE_EFFORT_LEVEL
Assim tu deixa a skill pesada no esforço alto e o resto da sessão leve, sem ficar trocando na mão
Pra prevenir: a recomendação da Anthropic no Opus 5 é manter o raciocínio ligado e controlar custo e latência BAIXANDO o esforço, em vez de desligar o pensamento
Tome cuidado com essa parte: matar o thinking pra ganhar segundos é justamente o que a documentação pede pra não fazer
Sintoma 2: a sessão vai ficando lenta conforme a conversa cresce
Aqui a causa é contexto cheio
O Claude Code compacta o contexto automaticamente ao se aproximar do limite, e isso tem um custo de tempo
O comando /compact faz a mesma coisa sob demanda: ele resume a conversa e substitui o histórico completo pelo resumo
E se o resumo jogar fora justo o que eu precisava?
Por isso o /compact aceita uma instrução de foco
Assim o resumo preserva o que TU escolher, em vez do que a compactação automática julgar importante
/compact foque na implementação do módulo de pagamento e descarte as saídas de teste
Quando aparece "Autocompact is thrashing":
Se a mensagem Autocompact is thrashing: the context refilled to the limit aparecer, é sinal de que o contexto enche de novo logo depois de compactar
A orientação oficial pra esse caso:
- pedir a leitura de arquivos grandes em pedaços menores
- rodar
/compactcom um foco que descarte as saídas grandes - mover o trabalho de arquivo grande pra um subagent
- ou simplesmente rodar
/cleare começar limpo
Pra prevenir: acompanhe o /context de vez em quando e evite mandar a sessão engolir uma saída gigante inteira
Um cat de arquivo enorme dentro da sessão é o jeito mais rápido de transformar uma conversa leve em uma conversa arrastada
Sintoma 3: erro 529, falhas intermitentes ou lentidão que não é só sua
Às vezes não é tua sessão, não é teu esforço e não é tua máquina
O erro 529 (Overloaded) indica que os servidores não conseguem atender ao volume de requisições naquele momento
E incidente acontece: em agosto de 2026 houve registro no status oficial de erros elevados e desempenho degradado afetando o Claude Opus 5 junto com outros modelos, atingindo Claude.ai, Claude API e Claude Code, tudo já marcado como resolvido
O que fazer:
- Abra a página oficial de status em status.claude.com, que também responde como status.anthropic.com
- Veja se tem incidente aberto envolvendo os modelos ou o Claude Code
- Só depois disso volte a mexer em configuração
O erro comum deste passo: sair reinstalando o Claude Code e trocando de modelo no meio de um incidente
Tu gasta uma hora "consertando" o que já ia voltar sozinho…
Pra prevenir: faça do status o PRIMEIRO passo do diagnóstico, porque nenhum ajuste local conserta incidente do lado de lá
Sintoma 4: travou, parou no meio ou o terminal não responde
Quando o problema não é a resposta demorar e sim a coisa simplesmente empacar, a suspeita muda de lugar: instalação, plugin, servidor MCP, hook ou consumo de memória
Roteiro de diagnóstico:
- Dentro da sessão, rode a verificação automatizada de instalação, configurações, extensões e uso de contexto
/doctor
- Se a sessão nem responde mais, rode o equivalente direto no shell
claude doctor
- Reinicie em modo seguro pra isolar se é plugin, MCP ou hook a causa do problema de desempenho
claude --safe-mode
- Se o uso de memória continuar alto, grave um snapshot do heap JavaScript e o detalhamento de memória
/heapdump
O arquivo vai parar em ~/Desktop
- E o alívio que pouca gente sabe: fechar o terminal NÃO perde a conversa
claude --resume
Rodando no mesmo diretório, ele retoma a sessão
O erro comum deste passo: rodar o --resume em outra pasta e achar que a conversa evaporou
Pra prevenir: /context, /doctor, /hooks e /mcp mostram o que realmente foi carregado na sessão
É o jeito de descobrir que aquele MCP que tu instalou "pra testar" três semanas atrás ainda está lá, carregando junto toda vez 😅
Sintoma 5: parece lento, mas na verdade é limite de uso
Esse é o mais traiçoeiro, porque "lento" e "sem cota" se parecem MUITO na hora do aperto
Todo plano tem limite de uso que reseta em uma janela contínua de 5 horas
E os planos pagos somam limites semanais a isso
No plano Max, o limite semanal vale para todos os modelos, e ainda existe uma verificação de reset semanal separada pro Opus
Ou seja: dá pra estar com folga no limite geral e travado especificamente no Opus
E se for cota mesmo, o que muda de plano pra plano?
O Max 5x oferece cinco vezes mais uso por sessão que o Pro
O Max 20x oferece vinte vezes mais uso por sessão que o Pro
Pra prevenir: separe as duas coisas na cabeça antes de agir
Trocar de modelo não resolve limite de uso, e baixar esforço no meio de uma janela estourada também não vai fazer milagre
Quando vale ligar o Fast mode (e quando não vale)
Se a lentidão é real e tu não quer abrir mão do Opus 5, existe uma alavanca direta: o Fast mode
Ele roda em torno de 2,5x a velocidade do modo padrão
É suportado no Opus 5 e no Opus 4.8, e no Claude Code tu liga com um comando
/fast
Agora a parte que ninguém pode ignorar: o Fast mode custa o DOBRO do preço por token do modo padrão
Por isso ele não é a resposta pra tudo
| O que tu quer | Alavanca | O que muda | Custo |
|---|---|---|---|
| Velocidade sem abrir mão do Opus 5 | /fast |
roda em torno de 2,5x a velocidade padrão | 2x o preço por token |
| Menos latência sem pagar mais por token | /effort low ou /effort medium |
o modelo pensa com menos frequência e menos profundidade | não mexe no preço por token, mexe em quanto ele gasta pensando |
Os dois casos de uso na prática:
- Sessão interativa, tarefa complexa, prazo apertado: Fast mode faz sentido, tu está comprando tempo com dinheiro e mantendo o modelo forte
- Tarefa repetitiva, mecânica, de baixo risco: baixar o esforço resolve melhor, porque o gargalo é raciocínio sobrando pra uma tarefa que não pede tanto
- Rodada longa e cara em lote:
/fastno dobro do preço por token vira uma conta que tu não quer ver depois
Antes de trocar de modelo: a ordem de checagem que resolve
Recapitulando o roteiro, na ordem que economiza teu tempo:
- Status do serviço: a página oficial de status primeiro, sempre, porque incidente não se conserta com configuração local
- Esforço: olhe o cabeçalho da sessão e ajuste com
/effort, lembrando que o padrão éhigh - Contexto: rode
/context, use/compactcom instrução de foco e trate a mensagem de thrashing como o aviso que ela é - Instalação:
/doctor, depoisclaude --safe-modepra isolar plugin, MCP ou hook, e/heapdumpse a memória continuar alta - Limite de uso: confirme se não é a janela contínua de 5 horas ou o limite semanal batendo na porta
O próximo passo é bem concreto: abre a sessão, olha o cabeçalho pra ver o esforço ativo, roda /context e /doctor
Se depois disso a lentidão continuar do mesmo tamanho, aí sim vira uma decisão consciente sobre qual modelo usar em cada tarefa, e não um chute no escuro
Na maioria das vezes o modelo nunca foi o problema… era a sessão gorda e o esforço no talo, haha
Até o próximo post! 😀
Perguntas frequentes
O /effort auto deixa o Claude Opus 5 lento mais rápido?
Não. O modo auto só devolve o esforço para o padrão do modelo, que é high tanto no Opus 5 quanto no Opus 4.8. Se o objetivo é ganhar velocidade, o certo é usar /effort com um nível mais baixo, tipo low ou medium.
Qual a diferença entre o Opus 5 padrão e o Fast mode?
O Fast mode roda em torno de 2,5x mais rápido que o modo padrão, tanto no Opus 5 quanto no Opus 4.8. No Claude Code ele é ligado pelo comando /fast, mas custa o dobro do preço por token do modo padrão.
O Claude Opus 5 lento acontece só no Claude Code ou também na API?
O Opus 5 está disponível em todos os planos pagos (Pro, Max, Team e Enterprise) e também na Claude API, com o mesmo preço do Opus 4.8. Ou seja, o mesmo diagnóstico de esforço, contexto e status do serviço vale pra quem usa direto pela API.
Dá pra saber qual nível de esforço está ativo sem abrir o /effort?
Dá sim. O nível ativo aparece no próprio cabeçalho da sessão do Claude Code, ao lado do nome do modelo, algo como ‘with low effort’. É o jeito mais rápido de confirmar se tu está no high padrão ou já baixou o esforço.
O limite semanal do plano Max explica a lentidão no Opus 5?
Todo plano tem uma sessão contínua de 5 horas, e os planos pagos somam um limite semanal em cima disso. No Max esse limite semanal vale para todos os modelos, mas existe uma verificação de reset semanal separada só para o Opus, então vale checar as duas coisas antes de achar que é lentidão.
Perdi a sessão do Claude Code no meio do trabalho, dá pra recuperar a conversa?
Dá. Se o Claude Code não responder e tu fechar o terminal, a conversa não se perde. Basta rodar claude –resume no mesmo diretório do projeto para retomar de onde parou.
Formações
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
Blog | Mais populares
As diferenças de var, let e const
Como fazer redirecionamento com PHP
Neste artigo você vai aprender a como fazer redirecionamento com PHP, utilizaremos abordagens fáceis de entender e de aplicar Fala programador(a), beleza? Bora aprender mais […]
ChatGPT: o que é, como usar, dicas e como acessar login
ChatGPT é uma ferramenta de processamento de linguagem natural (NLP) baseada na arquitetura GPT-3.5, desenvolvida pela OpenAI. Sua criação representa um marco significativo no campo […]
