Claude Fable 5 tem 1 milhão de tokens de contexto: o que cabe nessa janela?

O Claude Fable 5 tem 1 milhão de tokens de contexto, e nos modelos com essa janela o 1M já é o padrão: sem header beta e com preço padrão em qualquer tamanho de requisição. A saída, essa sim, é limitada a 128 mil tokens por requisição. Na prática, é espaço pra base de código com mais de 75.000 linhas ou dezenas de artigos de pesquisa numa única requisição, segundo a referência da própria Anthropic. No Claude Code você acompanha o consumo com /context e calibra a compactação com /autocompact
Fala aí, beleza? Uma janela de 1 milhão de tokens não é "um pouco mais de espaço": ela muda a natureza do que dá pra colocar dentro de uma conversa só
O Claude Fable 5 tem janela de contexto de 1 milhão de tokens, e é isso que sustenta trabalho longo sem ficar recomeçando do zero a cada vinte minutos
Nesse post eu explico o que essa janela significa na prática: o que cabe lá dentro, quais modelos suportam esse tamanho no Claude Code, como acompanhar o consumo e quanto custa a brincadeira
Só com dado verificado, sem chute e sem "prompt mágico" 🙂
Formação Claude Code
Domine Claude Code do absoluto zero até o avançado
- 116 aulas
- 4 projetos
- 9h 23min
O que é a janela de contexto (e por que 1M é diferente de tudo que veio antes)
Janela de contexto é o total que cabe na mesma conversa: tudo que você mandou, tudo que o modelo respondeu, os arquivos anexados, o histórico inteiro
Se você conhece a memória RAM de um PC, a analogia serve bem: é o quanto de coisa fica "em cima da mesa" ao mesmo tempo pro modelo raciocinar
Quando lota, alguma coisa precisa sair
Entrada não é a mesma coisa que saída:
Esse é o ponto onde muita gente se confunde
O 1M de tokens é o tamanho da janela, e tudo que está na conversa ocupa esse espaço, inclusive o que o modelo escreve
Já o limite de saída do Fable 5 é de até 128 mil tokens por requisição
Ou seja, não são dois orçamentos separados: o teto de saída diz quanto pode sair de uma vez só, e essa resposta segue ocupando lugar dentro da janela igual ao resto da conversa
O detalhe operacional que importa:
Nos modelos com janela de 1M tokens, esse valor é o padrão
Não precisa de header beta pra ligar nada, e a requisição longa é cobrada pelo preço padrão, sem multiplicador de contexto longo
Isso é diferente do que já foi o caminho quando a 1M chegou no Sonnet 4, e é o tipo de mudança silenciosa que muda o custo do teu dia a dia
O que dá pra fazer com 1 milhão de tokens na mesma conversa
A referência que a Anthropic dá pro que cabe em 1 milhão de tokens de contexto é direta: bases de código com mais de 75.000 linhas ou dezenas de artigos de pesquisa em uma única requisição
Traduzindo pro que tu faz na segunda de manhã:
- Projeto inteiro de uma vez: em vez de mandar arquivo por arquivo e ficar explicando "lembra daquele service que te mostrei?", o código entra junto e o modelo enxerga as relações entre as partes
- Documentação junto do código: specs, README, changelog e os arquivos ficam disponíveis na mesma conversa, então a resposta nasce alinhada com a regra do projeto e não com a média da internet
- Leitura em massa: dezenas de artigos numa requisição só, pra comparar, cruzar e resumir sem quebrar em dez conversas separadas
- Tarefa longa sem recomeço: a sessão comprida deixa de esbarrar no limite a cada passo, e isso vale mais do que qualquer benchmark bonito
Repara que o ganho real não é "o modelo ficou mais inteligente"
O ganho é que o modelo para de trabalhar cego, sem enxergar metade do problema
E contexto cego é a origem de boa parte do código zoado que sai no modo 100% vibe coder 😛
Quais modelos suportam 1 milhão de tokens no Claude Code
O Fable 5 não é o único com essa janela dentro do Claude Code
Os modelos com janela de 1 milhão de tokens lá são:
- Fable 5
- Sonnet 5
- Opus 4.6 (e posteriores)
- Sonnet 4.6
E onde o Fable 5 roda?
Ele está disponível na API do Claude, no Amazon Bedrock, no Google Cloud Vertex AI e no Microsoft Foundry
Na API, o identificador do modelo é claude-fable-5
O Fable 5 foi lançado em 9 de junho de 2026, como o primeiro modelo de classe Mythos disponibilizado publicamente
Como acompanhar e controlar a janela de contexto no Claude Code
Ter 1M de janela é ótimo, mas voar às cegas dentro dela não é
O combo aqui é simples: ver quanto você já gastou, e decidir quando o Claude Code pode compactar a conversa
- Veja o consumo atual com
/context
/context
Esse comando mostra o uso atual da janela de contexto
Rode ele no meio de uma sessão longa, antes de despejar mais coisa dentro
Erro comum deste passo: olhar o /context só quando a sessão já está pesada. O número serve pra decidir ANTES, não pra lamentar depois
- Ajuste a janela de auto-compactação com
/autocompact
A janela de auto-compactação define o quanto o contexto pode encher antes de o Claude Code compactar a conversa
/autocompact 500k
Esse valor vale na sessão e é salvo nas configurações do usuário
O comando aceita de 100K a 1M
- Volte ao padrão do modelo quando quiser
/autocompact auto
Isso devolve o valor padrão do modelo, sem você precisar lembrar qual número tinha deixado lá semana passada
- Defina na inicialização, se você automatiza as coisas
Dá pra passar a flag direto na hora de subir o Claude Code:
claude --autocompact 500k
- Em scripts e ambientes de nuvem, use a variável de ambiente
CLAUDE_CODE_AUTO_COMPACT_WINDOW=500k
É o caminho pra padronizar o comportamento sem depender de alguém digitar comando na mão
Erro comum deste passo (e esse é o clássico): confundir a janela do modelo com a janela de auto-compactação. Uma é o teto do que cabe, a outra é o gatilho de quando o Claude Code resume a conversa pra continuar. Mexer no /autocompact não aumenta nem diminui a janela do modelo
Se você quer ir mais fundo na rotina de higiene de sessão, vale ver como gerenciar contexto no Claude Code no dia a dia
A referência completa desses comandos está na documentação de janela de contexto do Claude Code
Quanto custa usar essa janela e quem tem acesso
Agora a parte que faz o pessoal segurar o dedo antes de jogar o monorepo inteiro na conversa 😀
Os preços de API do Claude Fable 5:
| Item | Preço |
|---|---|
| Tokens de entrada | US$ 10 por milhão |
| Tokens de saída | US$ 50 por milhão |
| Leitura de cache (prompt caching) | US$ 1 por milhão (90% de desconto) |
O desconto de 90% em tokens de entrada com prompt caching é o detalhe que muda tudo
É ele que torna conversa longa sustentável: em vez de pagar o preço cheio pelo mesmo contexto a cada volta, a leitura de cache sai por uma fração
Acesso por plano:
Desde 20 de julho de 2026, o Fable 5 está incluído de forma permanente nos planos Max e Team Premium, limitado a 50% dos limites semanais de uso
Quem está no Pro e no Team Standard acessa o Fable 5 por créditos de uso, e recebeu um crédito único de US$ 100
A ressalva do roteamento (importante, presta atenção):
O Fable 5 saiu do ar em 12 de junho de 2026, após controles de exportação do governo dos EUA, e voltou globalmente em 1º de julho de 2026, com novos classificadores que bloqueiam mais tarefas de cibersegurança
Depois desse redeploy, prompts que caem nos classificadores de risco (cibersegurança, biologia, química e saúde) e algumas tarefas rotineiras de código e depuração são respondidos pelo Opus 4.8 em vez do Fable 5
Ou seja: nem toda mensagem que você manda vai necessariamente ser respondida pelo modelo que você escolheu
Tome cuidado com essa expectativa antes de planejar uma sessão gigante em cima de uma tarefa que pode ser roteada
Conclusão
O que a janela do Claude Fable 5 de 1 milhão de tokens entrega, na real, é espaço: base de código com mais de 75.000 linhas ou dezenas de artigos numa única requisição, tudo na mesma conversa
E entrega isso como padrão, sem header beta e sem multiplicador de preço por requisição longa, com o teto de saída em 128 mil tokens por requisição
O próximo passo prático é bem chato de tão simples: na tua próxima sessão longa, roda /context pra ver o consumo real e calibra o /autocompact ANTES de jogar a base de código inteira lá dentro
É a diferença entre usar a janela e ser atropelado por ela 😀
Até o próximo post!
Perguntas frequentes
Qual é o limite de tokens de saída do Claude Fable 5 por requisição?
O limite de saída do Fable 5 é de até 128 mil tokens por requisição. Esse teto vale para uma resposta de cada vez, e o que o modelo escreve continua ocupando espaço dentro da janela de contexto de 1 milhão de tokens, que é o total que cabe na conversa, entrada e saída somadas.
Precisa ativar algum header beta para usar 1 milhão de tokens no Fable 5?
Não. Nos modelos com janela de 1M tokens, esse tamanho já é o padrão, sem precisar de header beta. A requisição longa também é cobrada pelo preço padrão, sem multiplicador de contexto longo.
Quanto custa usar o Claude Fable 5 na API do Claude?
O Fable 5 cobra US$ 10 por milhão de tokens de entrada e US$ 50 por milhão de tokens de saída. Com prompt caching, a leitura de cache sai por US$ 1 por milhão de tokens, mantendo os 90% de desconto.
Quem tem acesso ao Fable 5 nos planos Max e Team Premium?
Desde 20 de julho de 2026, o Fable 5 está incluído de forma permanente nos planos Max e Team Premium, limitado a 50% dos limites semanais de uso. Não precisa de compra avulsa de créditos nesses planos.
E quem está no Pro ou Team Standard, como acessa o Fable 5?
Nesses planos o acesso é por créditos de uso, e os usuários receberam um crédito único de US$ 100 para testar o modelo. Fora esse crédito, o consumo é cobrado normalmente pelo uso.
Onde o Claude Fable 5 está disponível além da API do Claude?
O Fable 5 também está no Amazon Bedrock, no Google Cloud Vertex AI e no Microsoft Foundry. O identificador do modelo na API do Claude é claude-fable-5.
Formações
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
Blog | Mais populares
Vale a pena manter Fable 5.1 e GPT-6 Astra ao mesmo tempo ou escolher um só?
Fable 5.1 ou GPT-6 Astra: no preço empatam, mas cache, batch, modo Fast e sobretaxa mudam a conta real. Veja se vale manter os dois ou escolher só um.
Dá para voltar ao Claude Fable 5 se o 5.1 não se sair bem no seu fluxo?
Dá para voltar ao Claude Fable 5 se o 5.1 não funcionar no seu fluxo? Veja como reverter com segurança, riscos do tool_choice e prazo de aposentadoria.
Minha ferramenta ainda não tem o Claude Fable 5.1: o que dá para fazer agora?
Claude Fable 5.1 já está em GA mas sua ferramenta ainda não mostra? Veja como usar o modelo agora via ID, /model ou gateway, sem quebrar sua integração.
