Fast mode do Claude Opus 5.5: quando vale a pena ligar e quando ele só encarece?

Comparativo de preço e velocidade do fast mode Claude Opus 5.5 no Claude Code
Resposta rápida

O fast mode Claude Opus 5.5 é o mesmo modelo rodando numa configuração de inferência mais rápida: até 2,5x mais tokens de saída por segundo, sem mudança de inteligência ou capacidades. Ele tem tabela de preço própria (no Claude Code, US$ 10 por MTok de entrada e US$ 50 de saída em Opus 5 e Opus 4.8, contra US$ 4/US$ 20 do preço padrão do Opus 5.5) e está em research preview, então preço e disponibilidade podem mudar. Compensa em iteração curta e protótipo, onde a espera é o gargalo. Atrapalha em contexto gigante já acumulado e em trabalho assíncrono

Velocidade não é de graça, ela tem tabela de preço própria

Fala aí, beleza? A Anthropic soltou o Opus 5.5 e junto veio de novo aquela chavinha que divide opinião: o fast mode, que entrega mais tokens por segundo rodando exatamente o mesmo modelo, só que numa faixa de cobrança bem diferente da padrão

E é aí que mora a decisão: ela não é técnica, é econômica

Não existe "modo mais inteligente" nessa história, existe "modo que te devolve a resposta mais cedo e cobra por isso". Então a pergunta certa não é se o fast mode é bom, é quanto a sua espera custa em dinheiro 🙂

O que é o fast mode e o que ele não muda

Segundo a documentação oficial do fast mode, é o mesmo modelo com uma configuração de inferência mais rápida

O número que importa: até 2,5x mais tokens de saída por segundo

E o número que NÃO existe: nenhum ganho de inteligência ou de capacidades. A doc é explícita nisso, não há mudança de inteligência nem de capacidades

Se você conhece aquela diferença entre trocar o processador e trocar o programador, é mais ou menos isso: o cara que escreve é o mesmo, ele só digita mais rápido

Formação Claude Code
Formação Recomendada

Formação Claude Code

Domine Claude Code do absoluto zero até o avançado

  • 120 aulas
  • 4 projetos
  • 9h 45min

E o status disso? Research preview

Essa parte muita gente pula e depois toma susto

O fast mode está em research preview, e a própria documentação avisa que recurso, preço e disponibilidade podem mudar conforme o feedback

Tem precedente, inclusive: o fast mode do Opus 4.7 foi descontinuado em 25 de junho de 2026 e removido de vez em 24 de julho de 2026

Ou seja, não é coisa pra amarrar um fluxo crítico de produção em cima e dormir tranquilo

Fast mode x modo padrão: preço, velocidade e limites lado a lado

Bora colocar os dois lado a lado nos eixos que realmente decidem a parada:

Eixo Modo padrão Fast mode
Velocidade de saída Velocidade normal do modelo Até 2,5x mais tokens de saída por segundo
Inteligência e capacidades Mesmo modelo Mesmo modelo, sem mudança de inteligência ou capacidades
Preço por MTok (Opus 5.5) US$ 4 entrada / US$ 20 saída Preço de fast mode não publicado
Preço por MTok (Opus 5) US$ 5 entrada / US$ 25 saída US$ 10 entrada / US$ 50 saída
Preço por MTok (Opus 4.8) Conforme tabela do modelo US$ 10 entrada / US$ 50 saída
Onde roda (Opus 5.5) Amplamente disponível Apenas na Claude API
Fora de – Amazon Bedrock, Claude Platform on AWS, Google Cloud, Microsoft Foundry
Incompatibilidades – Batch API e compromisso de Priority Tier
Rate limit Pool padrão Pool separado, compartilhado entre todos os Opus suportados
Status Estável Research preview

Repara numa coisa importante da tabela: a diferença de preço não é sutil

Os US$ 10 e US$ 50 por MTok estão documentados no Claude Code para Opus 5 e Opus 4.8, e o preço padrão do Opus 5.5 é US$ 4 de entrada e US$ 20 de saída

Eu não vou chutar o valor exato do fast mode no 5.5 porque ele não está publicado, e botar número por achismo é justamente o que eu não faço por aqui

Outro ponto: a página de fast mode do Claude Code lista suporte em Opus 5 e Opus 4.8, e diz que Sonnet, Haiku e os demais modelos ficam de fora

Já o fast mode do Opus 5.5 aparece documentado do lado da Claude API. Então, se você espera ligar o /fast com o 5.5 dentro do CLI, confira a doc antes em vez de assumir que já rola

Quando ligar o fast mode compensa

A regra mental é simples: o fast mode paga a conta quando VOCÊ é o gargalo esperando a resposta

Os cenários onde isso acontece de verdade:

  • Iteração curta com muita ida e volta: você pede, olha, corrige, pede de novo. São dezenas de ciclos numa hora, e cada segundo economizado por ciclo vira minuto no fim da sessão
  • Prototipagem: aquela fase de "mas e se fosse assim?", onde a resposta serve pra você decidir a próxima pergunta, não pra ir pra produção
  • Varredura de arquivos com saída volumosa: quando o modelo precisa CUSPIR muito texto, e o gargalo é literalmente o token por segundo
  • Sessão em que a espera quebra o fluxo: se a cada pausa de 40 segundos você troca pro navegador e perde o fio, o custo real não é o token, é o seu contexto mental evaporando

Tem um detalhe que joga a favor e quase ninguém comenta

O Opus 5.5 já gasta menos pra fazer a mesma coisa: num benchmark público de tarefas reais de linha de comando, ele resolveu mais que o Opus 5 usando cerca de 40% menos chamadas e metade dos tokens, e a Anthropic diz que ele custa cerca de 40% menos pra rodar que o Opus 5 em cargas típicas

Ou seja, a base sobre a qual o preço maior incide é menor do que era antes

Não é desculpa pra ligar e esquecer, mas muda a conta =)

Quando o fast mode só encarece a sessão

Agora o outro lado, que é onde a galera se queima

Contexto gigante já acumulado. Esse é o clássico. Na primeira vez que você liga o fast mode dentro de uma conversa, cobra-se o preço de entrada não cacheada do fast mode sobre TODO o contexto daquela conversa

Traduzindo: ligar no minuto 50 de uma sessão longa é o jeito mais caro possível de usar o recurso. Ligar desde o começo sai mais barato

Trabalho assíncrono. Se você dispara a tarefa e vai almoçar, esperar não te custa nada. Pagar pra ir mais rápido enquanto você nem está olhando a tela é dinheiro jogado fora, e a mesma lógica vale pra decidir quando não vale delegar tarefas em background

Pipelines com Batch API ou Priority Tier. Aqui nem é escolha: o fast mode não funciona com a Batch API nem com compromisso de Priority Tier

Modelo sem suporte. Sonnet, Haiku e os demais não têm fast mode. Não adianta insistir

E o mais importante de todos:

Ligar esperando resposta melhor. Não vai acontecer. É o mesmo modelo, mesma inteligência, mesmas capacidades. Se a saída veio errada no modo padrão, ela vem errada mais rápido no fast mode haha

Inclusive, velocidade maior costuma significar mais diff pra revisar no mesmo tempo, e aí o gargalo só muda de lugar. Vale ter um método pra revisar um diff que você não entende antes de acelerar a torneira

Como ligar (e desligar) o fast mode no Claude Code e na API

Seção curta, só o que está documentado

  1. No Claude Code, use o comando /fast. Ele alterna o fast mode entre ligado e desligado, e a escolha fica salva na configuração fastMode do seu arquivo de settings de usuário, assim:
{
  "fastMode": true
}

O erro comum deste passo: ligar no meio da conversa. Como a primeira ativação cobra o input não cacheado em preço fast sobre o contexto inteiro, o certo é decidir ANTES do primeiro prompt

  1. Na extensão do Claude Code pro VS Code, procure o comando Toggle fast mode. Ele aparece quando o modelo selecionado suporta fast mode

O erro comum deste passo: achar que o comando sumiu. Se o modelo escolhido não tem suporte, ele simplesmente não fica disponível. Segundo a doc do fast mode no Claude Code, o suporte está listado em Opus 5 e Opus 4.8, e não em Sonnet, Haiku ou demais

  1. Na Claude API, mande o parâmetro speed com valor fast junto do cabeçalho beta fast-mode-2026-02-01
curl https://api.anthropic.com/v1/messages \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-beta: fast-mode-2026-02-01" \
  -H "content-type: application/json" \
  -d '{
    "model": "claude-opus-5-5",
    "max_tokens": 1024,
    "speed": "fast",
    "messages": [{"role": "user", "content": "oi"}]
  }'

O erro comum deste passo: mandar só o speed e esquecer o header beta, ou tentar isso fora da Claude API. Pro Opus 5.5, o fast mode está disponível apenas na Claude API, e não em Amazon Bedrock, Claude Platform on AWS, Google Cloud ou Microsoft Foundry

  1. Pra desligar, é o mesmo caminho dos três passos acima: /fast de novo no Claude Code, Toggle fast mode de novo na extensão do VS Code, e na Claude API basta não mandar o parâmetro speed com valor fast na requisição

Erros e surpresas na conta: o que acontece quando os créditos acabam

Aqui vai o combo sintoma, causa e prevenção. Tome cuidado com esses, porque eles aparecem justamente quando você está no meio de algo

"Fast mode requires usage credits"

Sintoma: você roda o /fast e recebe essa mensagem em vez do modo ligando

Causa: em planos de assinatura (Pro, Max, Team e Enterprise), o fast mode exige usage credits habilitados na conta

Prevenção: habilite os créditos antes de contar com o recurso numa sessão de trabalho

A conta some do crédito mesmo com plano sobrando

Sintoma: você ainda tem uso disponível no plano, mas o saldo de usage credits está caindo

Causa: o consumo do fast mode sai direto dos usage credits, mesmo que ainda haja uso disponível no plano. Não é bug, é como funciona

Prevenção: tratar o fast mode como uma linha de custo separada do seu plano, e não como extensão dele

A sessão desacelera do nada no meio do trabalho

Sintoma: você estava voando e de repente voltou ao ritmo normal, sem aviso

Causa: segundo a doc do fast mode no Claude Code, o recurso tem limites de uso separados do Opus padrão, e todos os modelos Opus suportados compartilham o mesmo pool de rate limit do fast mode. Ao bater o limite, o Claude Code cai automaticamente pra velocidade padrão, sem cooldown

Prevenção: nenhuma, na real, e isso é até bom: você não fica travado, só volta ao normal

Requisição recusada e depois cobrada

Sintoma: os créditos acabaram no meio da sessão e a coisa continuou funcionando

Causa: a mesma doc do Claude Code explica que, quando os créditos acabam no meio, cada requisição recusada é repetida em velocidade e preço padrão

Prevenção: saber que isso existe já resolve o susto de ver requisição dupla no histórico

A fatura veio MUITO maior do que a conta de guardanapo

Sintoma: você fez a conta do output e o valor não bate

Causa: duas somadas. A ativação tardia cobrando o contexto inteiro em preço fast de entrada não cacheada, e os multiplicadores de prompt caching que incidem por cima do preço do fast mode. E o preço do fast mode vale em toda a janela de contexto, inclusive em requisições acima de 200 mil tokens de entrada

Prevenção: ligar desde o primeiro prompt, sempre. É a diferença entre pagar o fast sobre o que vem pela frente ou sobre tudo que já passou

Veredito: ligar por sessão, nunca por padrão

Minha leitura da documentação é essa: o fast mode é um interruptor de sessão, não uma configuração permanente

Você decide antes de abrir a conversa, olhando pro tipo de tarefa que vai fazer. Se for iteração curta com você grudado na tela, liga. Se for tarefa longa que roda sozinha, deixa desligado

O que nunca funciona é decidir no meio, porque a mecânica de cobrança da primeira ativação pune exatamente isso

Três coisas pra guardar antes de adotar:

  • O ganho real depende de quanto a sua espera custa em dinheiro. Se você não consegue responder isso, provavelmente não precisa do recurso ainda
  • Os limites de uso de cinco horas nos planos Pro, Max e Team aumentaram junto do Opus 5.5, então parte da dor que o fast mode resolveria pode já ter diminuído sozinha
  • O status de research preview pede cautela. Recurso, preço e disponibilidade podem mudar, e o fast mode do Opus 4.7 já mostrou que "pode mudar" às vezes significa "vai sumir"

Conclusão

O fast mode do Claude Opus 5.5 não te dá um modelo melhor, te dá o mesmo modelo entregando mais rápido, com tabela de preço própria e algumas armadilhas de cobrança que valem ser conhecidas antes

Próximo passo prático? Escolhe uma tarefa TÍPICA sua, dessas que você faz toda semana

Roda uma vez no modo padrão, roda outra com o fast mode ligado desde o primeiro prompt (nunca no meio!), e compara tempo total contra custo total

Se o tempo economizado valer mais que a diferença na conta, ótimo, você achou o seu caso de uso. Se não valer, você acabou de economizar uma fatura chata…

E vale acompanhar de perto, porque enquanto estiver em research preview, preço e disponibilidade podem mudar do dia pra noite

Até o próximo post! 😀

Perguntas frequentes

Como ativar o fast mode no Claude Code?

No Claude Code, o comando /fast liga e desliga o recurso, e essa escolha fica salva na configuração fastMode do arquivo de settings do usuário. Vale só pra Opus 5 e Opus 4.8, já que Sonnet, Haiku e os demais modelos não têm suporte.

Como ativar o fast mode direto na API da Anthropic?

Na API, você ativa com o parâmetro speed igual a fast, junto com o cabeçalho beta fast-mode-2026-02-01. Esse caminho é o único documentado pro fast mode do Opus 5.5, já que ele está disponível apenas na Claude API.

O fast mode do Claude Opus 5.5 funciona no Amazon Bedrock ou no Google Cloud?

Não. O fast mode do Opus 5.5 está disponível apenas na Claude API, e não em Amazon Bedrock, Claude Platform on AWS, Google Cloud ou Microsoft Foundry. Se seu fluxo roda numa dessas plataformas, o recurso simplesmente não aparece.

Por que o Claude Code diz que fast mode requer usage credits?

Porque em planos de assinatura (Pro, Max, Team e Enterprise) o fast mode exige usage credits habilitados na conta, exatamente como aparece na seção de erros do post. A prevenção é simples: habilite os créditos antes de contar com o recurso numa sessão de trabalho

Dá pra ligar o fast mode pela extensão do Claude Code no VS Code?

Sim, a extensão oferece o comando Toggle fast mode, mas ele só aparece quando o modelo selecionado suporta o recurso. Como Opus 5 e Opus 4.8 são os modelos suportados, o toggle some se você estiver usando Sonnet, Haiku ou outro modelo fora dessa lista.

O que acontece se o limite do fast mode acabar no meio de uma sessão?

Segundo a doc do fast mode no Claude Code, ele cai automaticamente pra velocidade padrão, sem cooldown pra esperar. E se os créditos acabarem no meio da sessão, cada requisição recusada é repetida em velocidade e preço padrão, ou seja, o trabalho continua, só que no ritmo normal



Escrito por | Matheus Battisti

Matheus Battisti
Fundador da Hora de Codar

Programador apaixonado pelo mundo das tecnologias, sempre buscando em aprender e se aprofundar em linguagens, frameworks e o que mais for necessário para executar um bom trabalho. Agora tem uma nova missão que é de passar seu conhecimento adiante para formar novos programadores e especializar mais os que já são.

Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted

Formações

Formação Vibe Coding

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

Blog | Mais populares