Leitura de cache mais barata no Claude Fable 5.1: o que muda em agentes que rodam por horas?

Claude Fable 5.1 com leitura de cache mais barata para agentes de IA
Resposta rápida

O Claude Fable 5.1 chegou em 01/09/2026, junto com o Claude Mythos 5.1, e a mudança de preço não está onde todo mundo olha primeiro: entrada segue em US$ 10 por milhão de tokens e saída em US$ 50, iguais aos do Fable 5. O que mudou foi a leitura de cache, que caiu para US$ 0,25 por milhão contra US$ 1,00 no Fable 5, uma redução de 75%. A Anthropic estima cerca de 25% de queda no custo total em cargas típicas e até uns 45% em cargas altamente agênticas, ou seja, quem relê o mesmo contexto por horas é quem mais sente

Fala aí, beleza? A Anthropic mexeu no preço do Fable, mas não onde a maioria olha primeiro: o que ficou mais barato foi reler contexto, não a entrada nem a saída

O anúncio saiu em 01/09/2026, com o Claude Fable 5.1 e o Claude Mythos 5.1 chegando juntos

E isso é bem mais interessante do que parece à primeira vista, porque muda a economia de um tipo específico de uso: agente que fica rodando horas, relendo o mesmo prefixo de contexto turno após turno

Se é o teu caso, se liga nisso…

O que a Anthropic anunciou no Claude Fable 5.1

O posicionamento declarado do Fable 5.1 é justamente trabalho de longa duração: tarefas que levam horas e atravessam vários aplicativos, incluindo execução não supervisionada como agente gerenciado na Claude Platform

Na prática, é o modelo que a Anthropic aponta pra aquele cenário de "deixa rodando e volta depois"

Formação Claude Code
Formação Recomendada

Formação Claude Code

Domine Claude Code do absoluto zero até o avançado

  • 120 aulas
  • 4 projetos
  • 9h 45min

Os números de ficha técnica:

Item Claude Fable 5.1
Model ID claude-fable-5-1
Janela de contexto 1M de tokens
Saída máxima até 128k tokens
Entrada US$ 10 por milhão de tokens
Saída US$ 50 por milhão de tokens
Leitura de cache US$ 0,25 por milhão de tokens

Repara na linha de entrada e na de saída: são exatamente as mesmas do Fable 5

A única linha que mudou de patamar foi a leitura de cache, que no Fable 5 era US$ 1,00 por milhão e agora é US$ 0,25 por milhão, uma redução de 75%

E o Mythos 5.1? É o MESMO modelo, com níveis diferentes de salvaguardas

O Fable 5.1 é de disponibilidade geral, o Mythos 5.1 só sai via programas de acesso confiável

Então não é "o irmão mais forte", é a mesma coisa com outra régua de segurança em volta

Por que a leitura de cache pesa tanto em agente de longa duração

Aqui vale parar e explicar o porquê antes do como

Um agente que roda por horas não manda um prompt novo do zero a cada passo

Ele carrega sempre o mesmo bloco na frente: system prompt, definições de ferramentas, histórico da conversa, arquivos que já entraram no contexto

A cada turno, esse prefixo é lido de novo

E de novo

E de novo

Ou seja: numa sessão longa, a leitura de contexto não é uma linha da conta, é a linha que mais se repete na conta

A doc do Fable 5.1 dá o número que explica o tamanho da mudança: leituras de cache (hits e refreshes) custam 0,025x o preço base de entrada nesta geração, contra 0,1x nos demais modelos Claude

Sacou o efeito? O ganho é proporcional ao número de releituras, não ao tamanho da resposta que o modelo gera

É como um assinatura de academia: o preço da mensalidade importa pouco se tu vai uma vez por mês, mas se tu vai todo dia, é ele que define a conta

A própria Anthropic estima o impacto: redução de cerca de 25% no custo total em cargas típicas, e de até aproximadamente 45% em cargas altamente agênticas

A distância entre esses dois números é toda a história do post, e ela é definida por quanto o teu fluxo relê

O que muda para quem usa a API da Claude Platform

Agora o ponto operacional que decide se essa queda de 75% chega até você ou não

O cache de prompt na Claude Platform é opt-in

Que significa opt-in aqui? Significa que ele depende de cache_control na requisição, seja no nível do corpo da requisição, seja com breakpoint explícito em blocos de conteúdo

Sem nenhum campo cache_control, nada é cacheado

Cada requisição paga o preço normal de entrada, e a leitura mais barata simplesmente não te alcança

Tome cuidado com isso: dá pra rodar meses achando que está pegando o preço de leitura de cache e estar pagando entrada cheia o tempo todo

Dois detalhes que continuam valendo:

  • TTLs disponíveis de 5 minutos e 1 hora
  • Mínimo de 512 tokens pro prompt ser cacheável

E as escritas de cache não mudaram: US$ 12,50 por milhão de tokens na escrita de 5 minutos e US$ 20 por milhão na de 1 hora

O mínimo de 512 tokens também segue inalterado

Então a estrutura do cache é a mesma de antes, o que ficou diferente é só quanto custa ler o que já está lá

O que muda para quem usa o Claude Code

No Claude Code a história é bem mais simples: não tem configuração de cache pra fazer

Ele gerencia o cache de prompt sozinho (a menos que seja desativado)

Reaproveita o que já foi processado, cobra a releitura na tarifa de token cacheado e processa por inteiro só o que mudou

Só que existe um detalhe importante: algumas ações invalidam o cache, e quando isso acontece a resposta seguinte fica mais lenta e mais cara enquanto ele é reconstruído

Se você já sentiu uma resposta demorar do nada no meio de uma sessão longa, provavelmente foi isso

A compactação, por outro lado, foi montada pensando nisso

Ela usa o mesmo system prompt, contexto e definições de ferramentas da conversa pai, e anexa o prompt de compactação como uma nova mensagem no fim

Resultado: o prefixo cacheado é reutilizado em vez de jogado fora

Muito massa esse desenho, porque compactar é exatamente o momento em que tu não quer reconstruir cache do zero

E tem o requisito de versão, que é onde a galera trava:

  • Fable 5.1 exige Claude Code na versão 2.1.250 ou superior
  • Fable 5 exige 2.1.170 ou superior

Se o modelo não aparece pra você, checa a versão antes de qualquer outra coisa

Vale lembrar que preço de modelo e preço de plano são conversas diferentes, e se o teu problema é quanto o Claude Code custa por mês, a queda na leitura de cache resolve outro pedaço da equação

Em que tipo de fluxo o ganho aparece de verdade

Usando a estimativa da Anthropic como régua, dá pra separar bem os dois extremos

Onde o ganho puxa pro topo da faixa (perto dos ~45%):

  • Agentes com muitos turnos sobre o mesmo contexto
  • Loops longos que voltam sempre ao mesmo system prompt e às mesmas definições de ferramentas
  • Execução não supervisionada, aquele agente gerenciado que roda por horas
  • Sessões grandes de Claude Code, onde o histórico só cresce e é relido a cada passo

Onde o ganho é pequeno ou simplesmente não existe:

  • Chamadas avulsas, uma pergunta e acabou
  • Prompts curtos, abaixo do mínimo de 512 tokens pra ser cacheável
  • Contexto que muda a cada requisição, sem prefixo estável pra reaproveitar
  • Fluxos onde a maior parte do custo está na saída, e não na releitura de entrada

O padrão é claro: quanto mais repetitivo e mais longo o fluxo, mais a mudança pesa a teu favor

Se teu uso é pergunta solta no chat, essa notícia é quase irrelevante pra tua conta

E se você ainda está decidindo quando o Fable compensa pela tarefa, esse recorte muda um pouco o cálculo: o modelo continua caro na entrada e na saída, mas fica bem mais barato em cima de contexto repetido

Onde o Claude Fable 5.1 já está disponível

Pra quem usa por assinatura, o Fable 5.1 está nos planos pagos Pro, Max, Team e Enterprise

Como funciona o limite:

  • Nos planos Max e nos assentos premium de Team/Enterprise: ao atingir 50% do limite semanal de uso em modelos Fable, dá pra seguir com créditos de uso ou trocar de modelo
  • No Pro e nos assentos padrão: os modelos Fable rodam em créditos de uso pay-as-you-go desde o começo

Pra quem é desenvolvedor, o Fable 5.1 está disponível nativamente na Claude Platform e também na Amazon Web Services, no Google Cloud e no Microsoft Foundry

Um aviso honesto aqui: os preços que citei no post são os da Claude Platform

Não fui conferir a tabela de cada marketplace, então não afirmo que a leitura de cache mais barata chega igual na AWS, no Google Cloud ou no Foundry

Acho zoado botar isso por achismo, então fica o alerta: se você roda por um desses, confere na página de preço do provedor

Conclusão: vale migrar agora?

A resposta honesta é: depende de quanto o teu fluxo relê contexto

Essa mudança é de preço de releitura, não de comportamento do modelo

Entrada e saída continuam iguais às do Fable 5, então nada aqui promete resposta melhor ou mais rápida, só conta menor em cima de contexto repetido

Próximo passo concreto, dividido por onde você usa:

  1. Se você usa a API: abra o código que monta a requisição e confirme que cache_control está realmente lá (no nível do corpo da requisição ou como breakpoint explícito em blocos de conteúdo). Sem esse campo, você paga entrada cheia e a queda de 75% não te alcança. O erro comum deste passo é assumir que o cache acontece sozinho só porque o modelo suporta cache
  2. Ainda na API: verifique se o prefixo estável (system prompt + definições de ferramentas) passa dos 512 tokens. Abaixo disso o prompt não é cacheável e não adianta configurar nada. O erro comum aqui é cachear a parte que muda em vez da parte que se repete
  3. Se você usa o Claude Code: atualize pra versão 2.1.250 ou superior, que é o mínimo exigido pelo Fable 5.1. O erro comum deste passo é achar que o modelo não está liberado no seu plano quando na verdade é só a versão velha do CLI
  4. Ainda no Claude Code: em sessões longas, evite ações que invalidam o cache no meio do caminho, porque a resposta seguinte fica mais lenta e mais cara enquanto o cache é reconstruído

Resumindo em uma linha: se você roda agente por horas em cima do mesmo contexto, essa versão é uma das mudanças de preço mais relevantes do ano pro teu bolso

Se você usa o Claude pra pergunta avulsa, segue o baile igual 🙂

até o próximo post!

Perguntas frequentes

Claude Fable 5.1 ficou mais barato que o Fable 5?

Só na leitura de cache: caiu de US$ 1,00 para US$ 0,25 por milhão de tokens, uma redução de 75%. Entrada e saída continuam nos mesmos US$ 10 e US$ 50 por milhão de tokens do Fable 5.

Qual é o Model ID do Claude Fable 5.1 na API?

O identificador é claude-fable-5-1. Ele traz janela de contexto de 1M de tokens e saída máxima de até 128k tokens.

Preciso configurar alguma coisa para aproveitar a leitura de cache mais barata no Claude Code?

Não, o Claude Code gerencia o cache de prompt sozinho, a menos que seja desativado. Só fica de olho na versão: o Fable 5.1 exige Claude Code 2.1.250 ou superior.

O cache de prompt funciona automaticamente quando eu uso a API da Claude Platform?

Não, na Claude Platform o cache é opt-in e depende do campo cache_control na requisição, seja no nível do corpo da requisição, seja como breakpoint explícito em blocos de conteúdo. Sem esse campo, nada é cacheado e cada chamada paga o preço normal de entrada.

Qual a diferença entre Claude Fable 5.1 e Claude Mythos 5.1?

São o mesmo modelo, com níveis diferentes de salvaguardas. O Fable 5.1 é de disponibilidade geral, enquanto o Mythos 5.1 só sai via programas de acesso confiável.

Quanto tempo dura o cache de prompt no Claude Fable 5.1 e qual o tamanho mínimo pra cachear?

Os TTLs disponíveis seguem sendo 5 minutos e 1 hora, com escrita a US$ 12,50 e US$ 20 por milhão de tokens respectivamente. O mínimo pra um prompt ser cacheável continua em 512 tokens, sem mudança em relação ao Fable 5.



Escrito por | Matheus Battisti

Matheus Battisti
Fundador da Hora de Codar

Programador apaixonado pelo mundo das tecnologias, sempre buscando em aprender e se aprofundar em linguagens, frameworks e o que mais for necessário para executar um bom trabalho. Agora tem uma nova missão que é de passar seu conhecimento adiante para formar novos programadores e especializar mais os que já são.

Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted

Formações

Formação Vibe Coding

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

Blog | Mais populares