Leitura de cache mais barata no Claude Fable 5.1: o que muda em agentes que rodam por horas?

O Claude Fable 5.1 chegou em 01/09/2026, junto com o Claude Mythos 5.1, e a mudança de preço não está onde todo mundo olha primeiro: entrada segue em US$ 10 por milhão de tokens e saída em US$ 50, iguais aos do Fable 5. O que mudou foi a leitura de cache, que caiu para US$ 0,25 por milhão contra US$ 1,00 no Fable 5, uma redução de 75%. A Anthropic estima cerca de 25% de queda no custo total em cargas típicas e até uns 45% em cargas altamente agênticas, ou seja, quem relê o mesmo contexto por horas é quem mais sente
Fala aí, beleza? A Anthropic mexeu no preço do Fable, mas não onde a maioria olha primeiro: o que ficou mais barato foi reler contexto, não a entrada nem a saída
O anúncio saiu em 01/09/2026, com o Claude Fable 5.1 e o Claude Mythos 5.1 chegando juntos
E isso é bem mais interessante do que parece à primeira vista, porque muda a economia de um tipo específico de uso: agente que fica rodando horas, relendo o mesmo prefixo de contexto turno após turno
Se é o teu caso, se liga nisso…
O que a Anthropic anunciou no Claude Fable 5.1
O posicionamento declarado do Fable 5.1 é justamente trabalho de longa duração: tarefas que levam horas e atravessam vários aplicativos, incluindo execução não supervisionada como agente gerenciado na Claude Platform
Na prática, é o modelo que a Anthropic aponta pra aquele cenário de "deixa rodando e volta depois"
Formação Claude Code
Domine Claude Code do absoluto zero até o avançado
- 120 aulas
- 4 projetos
- 9h 45min
Os números de ficha técnica:
| Item | Claude Fable 5.1 |
|---|---|
| Model ID | claude-fable-5-1 |
| Janela de contexto | 1M de tokens |
| Saída máxima | até 128k tokens |
| Entrada | US$ 10 por milhão de tokens |
| Saída | US$ 50 por milhão de tokens |
| Leitura de cache | US$ 0,25 por milhão de tokens |
Repara na linha de entrada e na de saída: são exatamente as mesmas do Fable 5
A única linha que mudou de patamar foi a leitura de cache, que no Fable 5 era US$ 1,00 por milhão e agora é US$ 0,25 por milhão, uma redução de 75%
E o Mythos 5.1? É o MESMO modelo, com níveis diferentes de salvaguardas
O Fable 5.1 é de disponibilidade geral, o Mythos 5.1 só sai via programas de acesso confiável
Então não é "o irmão mais forte", é a mesma coisa com outra régua de segurança em volta
Por que a leitura de cache pesa tanto em agente de longa duração
Aqui vale parar e explicar o porquê antes do como
Um agente que roda por horas não manda um prompt novo do zero a cada passo
Ele carrega sempre o mesmo bloco na frente: system prompt, definições de ferramentas, histórico da conversa, arquivos que já entraram no contexto
A cada turno, esse prefixo é lido de novo
E de novo
E de novo
Ou seja: numa sessão longa, a leitura de contexto não é uma linha da conta, é a linha que mais se repete na conta
A doc do Fable 5.1 dá o número que explica o tamanho da mudança: leituras de cache (hits e refreshes) custam 0,025x o preço base de entrada nesta geração, contra 0,1x nos demais modelos Claude
Sacou o efeito? O ganho é proporcional ao número de releituras, não ao tamanho da resposta que o modelo gera
É como um assinatura de academia: o preço da mensalidade importa pouco se tu vai uma vez por mês, mas se tu vai todo dia, é ele que define a conta
A própria Anthropic estima o impacto: redução de cerca de 25% no custo total em cargas típicas, e de até aproximadamente 45% em cargas altamente agênticas
A distância entre esses dois números é toda a história do post, e ela é definida por quanto o teu fluxo relê
O que muda para quem usa a API da Claude Platform
Agora o ponto operacional que decide se essa queda de 75% chega até você ou não
O cache de prompt na Claude Platform é opt-in
Que significa opt-in aqui? Significa que ele depende de cache_control na requisição, seja no nível do corpo da requisição, seja com breakpoint explícito em blocos de conteúdo
Sem nenhum campo cache_control, nada é cacheado
Cada requisição paga o preço normal de entrada, e a leitura mais barata simplesmente não te alcança
Tome cuidado com isso: dá pra rodar meses achando que está pegando o preço de leitura de cache e estar pagando entrada cheia o tempo todo
Dois detalhes que continuam valendo:
- TTLs disponíveis de 5 minutos e 1 hora
- Mínimo de 512 tokens pro prompt ser cacheável
E as escritas de cache não mudaram: US$ 12,50 por milhão de tokens na escrita de 5 minutos e US$ 20 por milhão na de 1 hora
O mínimo de 512 tokens também segue inalterado
Então a estrutura do cache é a mesma de antes, o que ficou diferente é só quanto custa ler o que já está lá
O que muda para quem usa o Claude Code
No Claude Code a história é bem mais simples: não tem configuração de cache pra fazer
Ele gerencia o cache de prompt sozinho (a menos que seja desativado)
Reaproveita o que já foi processado, cobra a releitura na tarifa de token cacheado e processa por inteiro só o que mudou
Só que existe um detalhe importante: algumas ações invalidam o cache, e quando isso acontece a resposta seguinte fica mais lenta e mais cara enquanto ele é reconstruído
Se você já sentiu uma resposta demorar do nada no meio de uma sessão longa, provavelmente foi isso
A compactação, por outro lado, foi montada pensando nisso
Ela usa o mesmo system prompt, contexto e definições de ferramentas da conversa pai, e anexa o prompt de compactação como uma nova mensagem no fim
Resultado: o prefixo cacheado é reutilizado em vez de jogado fora
Muito massa esse desenho, porque compactar é exatamente o momento em que tu não quer reconstruir cache do zero
E tem o requisito de versão, que é onde a galera trava:
- Fable 5.1 exige Claude Code na versão 2.1.250 ou superior
- Fable 5 exige 2.1.170 ou superior
Se o modelo não aparece pra você, checa a versão antes de qualquer outra coisa
Vale lembrar que preço de modelo e preço de plano são conversas diferentes, e se o teu problema é quanto o Claude Code custa por mês, a queda na leitura de cache resolve outro pedaço da equação
Em que tipo de fluxo o ganho aparece de verdade
Usando a estimativa da Anthropic como régua, dá pra separar bem os dois extremos
Onde o ganho puxa pro topo da faixa (perto dos ~45%):
- Agentes com muitos turnos sobre o mesmo contexto
- Loops longos que voltam sempre ao mesmo system prompt e às mesmas definições de ferramentas
- Execução não supervisionada, aquele agente gerenciado que roda por horas
- Sessões grandes de Claude Code, onde o histórico só cresce e é relido a cada passo
Onde o ganho é pequeno ou simplesmente não existe:
- Chamadas avulsas, uma pergunta e acabou
- Prompts curtos, abaixo do mínimo de 512 tokens pra ser cacheável
- Contexto que muda a cada requisição, sem prefixo estável pra reaproveitar
- Fluxos onde a maior parte do custo está na saída, e não na releitura de entrada
O padrão é claro: quanto mais repetitivo e mais longo o fluxo, mais a mudança pesa a teu favor
Se teu uso é pergunta solta no chat, essa notícia é quase irrelevante pra tua conta
E se você ainda está decidindo quando o Fable compensa pela tarefa, esse recorte muda um pouco o cálculo: o modelo continua caro na entrada e na saída, mas fica bem mais barato em cima de contexto repetido
Onde o Claude Fable 5.1 já está disponível
Pra quem usa por assinatura, o Fable 5.1 está nos planos pagos Pro, Max, Team e Enterprise
Como funciona o limite:
- Nos planos Max e nos assentos premium de Team/Enterprise: ao atingir 50% do limite semanal de uso em modelos Fable, dá pra seguir com créditos de uso ou trocar de modelo
- No Pro e nos assentos padrão: os modelos Fable rodam em créditos de uso pay-as-you-go desde o começo
Pra quem é desenvolvedor, o Fable 5.1 está disponível nativamente na Claude Platform e também na Amazon Web Services, no Google Cloud e no Microsoft Foundry
Um aviso honesto aqui: os preços que citei no post são os da Claude Platform
Não fui conferir a tabela de cada marketplace, então não afirmo que a leitura de cache mais barata chega igual na AWS, no Google Cloud ou no Foundry
Acho zoado botar isso por achismo, então fica o alerta: se você roda por um desses, confere na página de preço do provedor
Conclusão: vale migrar agora?
A resposta honesta é: depende de quanto o teu fluxo relê contexto
Essa mudança é de preço de releitura, não de comportamento do modelo
Entrada e saída continuam iguais às do Fable 5, então nada aqui promete resposta melhor ou mais rápida, só conta menor em cima de contexto repetido
Próximo passo concreto, dividido por onde você usa:
- Se você usa a API: abra o código que monta a requisição e confirme que
cache_controlestá realmente lá (no nível do corpo da requisição ou como breakpoint explícito em blocos de conteúdo). Sem esse campo, você paga entrada cheia e a queda de 75% não te alcança. O erro comum deste passo é assumir que o cache acontece sozinho só porque o modelo suporta cache - Ainda na API: verifique se o prefixo estável (system prompt + definições de ferramentas) passa dos 512 tokens. Abaixo disso o prompt não é cacheável e não adianta configurar nada. O erro comum aqui é cachear a parte que muda em vez da parte que se repete
- Se você usa o Claude Code: atualize pra versão 2.1.250 ou superior, que é o mínimo exigido pelo Fable 5.1. O erro comum deste passo é achar que o modelo não está liberado no seu plano quando na verdade é só a versão velha do CLI
- Ainda no Claude Code: em sessões longas, evite ações que invalidam o cache no meio do caminho, porque a resposta seguinte fica mais lenta e mais cara enquanto o cache é reconstruído
Resumindo em uma linha: se você roda agente por horas em cima do mesmo contexto, essa versão é uma das mudanças de preço mais relevantes do ano pro teu bolso
Se você usa o Claude pra pergunta avulsa, segue o baile igual 🙂
até o próximo post!
Perguntas frequentes
Claude Fable 5.1 ficou mais barato que o Fable 5?
Só na leitura de cache: caiu de US$ 1,00 para US$ 0,25 por milhão de tokens, uma redução de 75%. Entrada e saída continuam nos mesmos US$ 10 e US$ 50 por milhão de tokens do Fable 5.
Qual é o Model ID do Claude Fable 5.1 na API?
O identificador é claude-fable-5-1. Ele traz janela de contexto de 1M de tokens e saída máxima de até 128k tokens.
Preciso configurar alguma coisa para aproveitar a leitura de cache mais barata no Claude Code?
Não, o Claude Code gerencia o cache de prompt sozinho, a menos que seja desativado. Só fica de olho na versão: o Fable 5.1 exige Claude Code 2.1.250 ou superior.
O cache de prompt funciona automaticamente quando eu uso a API da Claude Platform?
Não, na Claude Platform o cache é opt-in e depende do campo cache_control na requisição, seja no nível do corpo da requisição, seja como breakpoint explícito em blocos de conteúdo. Sem esse campo, nada é cacheado e cada chamada paga o preço normal de entrada.
Qual a diferença entre Claude Fable 5.1 e Claude Mythos 5.1?
São o mesmo modelo, com níveis diferentes de salvaguardas. O Fable 5.1 é de disponibilidade geral, enquanto o Mythos 5.1 só sai via programas de acesso confiável.
Quanto tempo dura o cache de prompt no Claude Fable 5.1 e qual o tamanho mínimo pra cachear?
Os TTLs disponíveis seguem sendo 5 minutos e 1 hora, com escrita a US$ 12,50 e US$ 20 por milhão de tokens respectivamente. O mínimo pra um prompt ser cacheável continua em 512 tokens, sem mudança em relação ao Fable 5.
Formações
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
Blog | Mais populares
Vale a pena manter Fable 5.1 e GPT-6 Astra ao mesmo tempo ou escolher um só?
Fable 5.1 ou GPT-6 Astra: no preço empatam, mas cache, batch, modo Fast e sobretaxa mudam a conta real. Veja se vale manter os dois ou escolher só um.
Claude Fable 5 tem 1 milhão de tokens de contexto: o que cabe nessa janela?
Claude Fable 5 1 milhão de tokens: veja o que cabe na janela de contexto, os limites de saída e como acompanhar o uso no Claude Code com /context.
Fable 5.1 ou GPT-6 Astra: qual deles está disponível na ferramenta que você já usa?
Fable 5.1 ou GPT-6 Astra: veja qual já está liberado no Claude Code, Codex e Copilot, preço de API e versão mínima do CLI antes de decidir.
