Fable 5.1 ou GPT-6 Astra: qual aguenta melhor arquivo gigante e tarefa longa?

Comparativo Fable 5.1 vs GPT-6 Astra para arquivo gigante e tarefa longa
Resposta rápida

Fable 5.1 vs GPT-6 Astra é quase empate na ficha técnica: 1 milhão de tokens de contexto contra 1.050.000, 128 mil tokens de saída nos dois e o mesmo preço de API (US$ 10 por milhão de entrada e US$ 50 de saída). A diferença aparece no cache (US$ 0,25 no Fable 5.1 contra US$ 1,00 no Astra) e, principalmente, na ferramenta: o Claude Code compacta a sessão em 200K por padrão e o Codex guarda notas pesquisáveis entre janelas, em modo experimental. Meça sua base antes de migrar 🙂

Você joga o arquivo gigante no modelo, ele começa lindo, e no meio do caminho a resposta corta ou o contexto estoura

Fala aí, beleza? A Anthropic soltou o Fable 5.1 no dia 1 de setembro de 2026 (junto com o Mythos 5.1, que é o mesmo modelo com salvaguardas diferentes), e três dias depois a OpenAI respondeu com o GPT-6 Astra, no dia 4

Os dois chegam prometendo janela de 1 milhão de tokens pra cima

Só que janela grande no papel não é a mesma coisa que tarefa longa que anda até o fim, beleza? O comportamento muda bastante quando o trabalho é grande de verdade

Então o recorte deste post é bem específico: quanto de entrada cabe, quanto de resposta sai de uma vez e onde cada um te obriga a fatiar o trabalho

Fable 5.1 x GPT-6 Astra: contexto, saída e preço lado a lado

O que pesa em tarefa longa Claude Fable 5.1 GPT-6 Astra
Janela de contexto 1 milhão de tokens, disponível por padrão 1.050.000 tokens
Saída máxima por requisição 128 mil tokens 128 mil tokens
Entrada na API US$ 10 por milhão de tokens US$ 10 por milhão de tokens
Saída na API US$ 50 por milhão de tokens US$ 50 por milhão de tokens
Cache leitura de cache a US$ 0,25 por milhão entrada em cache a US$ 1,00 por milhão
Corte de conhecimento junho de 2026 30 de abril de 2026
Controle de raciocínio adaptativo sempre ativo, nível de esforço padrão alto reasoning.effort aceita low, medium, high, xhigh e max
Tipos de entrada texto e imagem, com saída de texto posicionado como modelo de uso de computador (navegador, planilhas, apps de desktop e terminal)
Modo de velocidade não consta modo Fast: até 2x a velocidade do processamento padrão pelo dobro do preço
Onde roda Claude API, Amazon Bedrock, Google Cloud, Microsoft Foundry e Claude Platform na AWS, com o ID claude-fable-5-1 API, ChatGPT Work e Codex
Formação Claude Code
Formação Recomendada

Formação Claude Code

Domine Claude Code do absoluto zero até o avançado

  • 120 aulas
  • 4 projetos
  • 9h 45min

Onde é empate:

Entrada e saída custam exatamente o mesmo nos dois: US$ 10 e US$ 50 por milhão

O teto de resposta também é igual, 128 mil tokens por requisição

E os 50 mil tokens a mais de contexto do Astra são uma diferença que dificilmente decide alguma coisa no seu dia a dia

Onde a conta muda de verdade:

É no cache, e só quando a tarefa é longa E repetitiva

Se você lê o mesmo arquivo gigante vinte vezes na mesma sessão, a leitura de cache do Fable 5.1 sai a US$ 0,25 por milhão, contra US$ 1,00 por milhão de entrada em cache no Astra

Multiplica isso por um repositório inteiro reprocessado o dia todo e o número deixa de ser detalhe

Já o teto de 128 mil tokens de saída é o mesmo dos dois lados, então nenhum deles te salva de fatiar um entregável muito grande: vale entender o limite de saída do Astra antes de pedir o arquivo inteiro de uma vez

Onde cada um te obriga a fatiar o trabalho

Agora a parte que a ficha técnica não conta

Tarefa longa quase nunca quebra no limite do modelo, ela quebra no agente que você usa pra rodar a tarefa

Onde a tarefa longa quebra Claude Code com Fable 5.1 Codex com GPT-6 Astra
Fronteira de corte da sessão com auto compactação ligada, sessões em modelos de janela nativa de 1M compactam na fronteira de 200K com o gerenciamento de contexto experimental ligado, mantém notas entre janelas de contexto, em vez de comprimir o histórico num resumo único
Como você muda isso /autocompact 500k aceita de 100K a 1M, salva em autoCompactWindow e aplica na sessão atual; /autocompact auto volta ao padrão do modelo features.context_management.experimental_mode = true no config.toml, desligado por padrão e válido só pra conversas novas
Recuperar coisa antiga não consta também depende do modo experimental ligado: aí as janelas anteriores continuam pesquisáveis e dá pra recuperar requisito ou resultado de teste de mensagens e saídas de ferramenta antigas, mesmo fora das notas
Voltar ao comportamento antigo CLAUDE_CODE_DISABLE_1M_CONTEXT=1 mantém as sessões em 200K em todo modelo de janela nativa de 1M não consta
Seleção do modelo o alias fable resolve pro Fable 5.1, a menos que ANTHROPIC_DEFAULT_FABLE_MODEL esteja definido /model no Codex CLI escolhe modelo e nível de esforço; exige Codex CLI 0.153.0 ou mais recente
Teto de entrada por minuto não consta TPM por tier da API: 500.000 no Tier 1, 1 milhão no Tier 2, 2 milhões no Tier 3, 4 milhões no Tier 4 e 40 milhões no Tier 5
Restrição em conversa multi turno contas de API criadas a partir de 31 de agosto de 2026 não podem editar mensagens, ferramentas ou system prompt ao redor de um bloco de thinking (dá pra optar por remover os blocos) não consta

Repara na primeira linha, porque ela pega muita gente de surpresa

O modelo tem 1M de janela, mas a sessão do Claude Code compacta em 200K por padrão

Ou seja: tu tem 1 milhão contratado e 200 mil andando, até mexer no /autocompact

Do outro lado, o Astra no Codex ataca o mesmo problema por outro caminho: em vez de espremer tudo num resumo, ele mantém notas e deixa as janelas anteriores pesquisáveis

Na prática isso é o que resolve o clássico "o requisito estava na mensagem 3 e ele esqueceu na mensagem 300"

Só que esse gerenciamento de contexto está como modo experimental e vem desligado, então não conta com ele por padrão

Detalhe útil: o app de desktop do ChatGPT, o Codex CLI e a extensão de IDE usam o MESMO config.toml, então tu edita num lugar e vale nos três

E tem o teto por minuto

Se tu está no Tier 1 da API, com 500.000 TPM, um arquivo perto do limite de contexto já é uma mordida enorme do seu minuto

Janela grande não serve de nada se a vazão não deixa a entrada passar, né?

Como medir no seu caso antes de escolher

Não existe número mágico de "linhas de código viram X tokens", então a única saída honesta é medir na sua base

Bora ver na prática?

  1. Meça o tamanho real do seu arquivo ou repositório em tokens. Rode a mesma tarefa uma vez em cada modelo e olhe quanto de entrada foi contabilizado, aí compara com o teto de cada um: 1 milhão no Fable 5.1 e 1.050.000 no Astra. O erro comum deste passo é chutar o tamanho por número de linhas ou por tamanho em MB, e descobrir o estouro só no meio da tarefa
  1. No Claude Code, mexa na fronteira de compactação e observe onde a sessão corta. O padrão em modelos de janela nativa de 1M é compactar em 200K, e o comando aceita de 100K a 1M:
/autocompact 500k

O valor fica salvo em autoCompactWindow nas configurações do usuário e já vale na sessão atual. Se quiser voltar atrás, /autocompact auto devolve o padrão do modelo. O erro comum aqui é pedir uma janela maior que o contexto do modelo: o Claude Code limita a janela ao contexto do modelo, então não adianta forçar

  1. Repita a MESMA tarefa travado em 200K pra ter comparação. É o jeito de ver, no seu caso, quanto a janela maior muda o resultado:
CLAUDE_CODE_DISABLE_1M_CONTEXT=1

Com essa variável ligada, as sessões ficam em 200K em todo modelo de janela nativa de 1M. O erro comum é esquecer a variável ligada e depois jurar que o Fable 5.1 "não aguenta contexto grande"

  1. Confira qual modelo tu está rodando de fato. No Claude Code, o alias fable aponta pro Fable 5.1, a menos que ANTHROPIC_DEFAULT_FABLE_MODEL esteja definido. O erro comum é comparar dois modelos e, sem perceber, ter uma variável de ambiente antiga mandando na escolha
  1. No Codex, prepare o terreno antes de comparar. Confirme que sua versão do Codex CLI é a 0.153.0 ou mais recente, escolha modelo e nível de esforço com /model e ative o gerenciamento de contexto experimental no config.toml:
features.context_management.experimental_mode = true

Depois disso, inicie uma tarefa NOVA. O erro comum deste passo é clássico: ligar o modo experimental e continuar a conversa antiga, porque o recurso vale só pra conversas novas

  1. Teste se o entregável cabe em 128 mil tokens de saída. Os dois cortam no mesmo teto por requisição, então se a sua tarefa gera um arquivo enorme de uma vez, o plano de fatiar já entra no desenho da tarefa, não depois que a resposta morreu no meio. O erro comum é achar que contexto de 1M implica resposta de 1M
  1. Rode a mesma tarefa duas vezes seguidas e compare a conta. É aí que o cache aparece: US$ 0,25 por milhão de leitura no Fable 5.1 contra US$ 1,00 por milhão de entrada em cache no Astra. O erro comum é medir só a primeira execução, justamente a que não tem cache nenhum
  1. Se tu usa o Astra por plano do ChatGPT, esquece contar mensagem. A própria OpenAI diz que uma tarefa mais longa consome mais da sua cota do que uma tarefa curta, então número fixo de mensagens não é medida confiável do que resta. O erro comum é planejar o dia por "quantas mensagens eu ainda tenho"

Qual escolher para cada tipo de tarefa longa

Arquivo único gigante lido muitas vezes:

Aqui o cache é o fator de desempate, e ele pesa pro lado do Fable 5.1, com leitura a US$ 0,25 por milhão contra US$ 1,00 por milhão no Astra

Quanto mais repetitiva a tarefa, maior a diferença na fatura

Tarefa de várias horas com requisito lá do começo:

Aquele cenário em que a regra de negócio apareceu na primeira hora e precisa valer na última

É exatamente o que o Astra no Codex endereça com as notas entre janelas e as janelas anteriores pesquisáveis

Lembrando que isso ainda depende do modo experimental ligado

Controle fino de esforço de raciocínio:

Se tu quer decidir por tarefa quanto o modelo pensa, o Astra te dá cinco níveis no reasoning.effort: low, medium, high, xhigh e max

O Fable 5.1 vai por outro caminho: raciocínio adaptativo sempre ativo, com nível de esforço padrão alto

Um te dá volante, o outro te dá piloto automático puxado pra cima

Trabalho que sai do editor:

Navegador, planilha, app de desktop, terminal

O Astra é posicionado justamente como modelo de uso de computador, e não como modelo de chat comum

Entrada com imagem junto do texto:

O Fable 5.1 aceita entrada de texto e imagem, com saída de texto

Print de erro, diagrama, screenshot de tela quebrada: entra no mesmo fluxo

Quem depende do plano do ChatGPT:

O Astra está no ChatGPT Work e no Codex para Plus e Business, e no Chat a opção baseada em Astra aparece como GPT-6 Pro nos planos Pro, Business e Enterprise

Assentos Plus e Business Standard incluem uso limitado de Astra, com créditos opcionais pra uso adicional

E se o seu fluxo passa pelas mensagens Pro: Business Standard inclui 15 mensagens Pro por mês e Business Premium inclui 50 por semana, compartilhadas entre GPT-6 Pro e GPT-5.6 Sol Pro

Antes de trocar de ferramenta por causa disso, vale a pena pensar friamente se o Astra compensa pro tipo de tarefa que tu roda todo dia

Veredito: qual aguenta melhor arquivo gigante

Na ficha técnica é quase empate, e não adianta querer inventar vencedor

Mesmo preço de entrada e saída, mesmo teto de 128 mil tokens de resposta, janela praticamente do mesmo tamanho

A escolha se decide no AMBIENTE, não no modelo

Se você vive no Claude Code: o Fable 5.1 te dá 1M de contexto por padrão, sem header beta e cobrado no preço padrão, mais o cache barato pra tarefa repetitiva

O preço disso é lembrar de configurar /autocompact, senão a sua sessão vai continuar compactando em 200K e tu vai jurar que o modelo é fraco de contexto

Se você vive no Codex: o Astra te dá continuidade de contexto por notas pesquisáveis, que é o remédio certo pra tarefa de várias horas

O preço é aceitar que isso está em modo experimental, desligado por padrão e válido só pra conversas novas, e que a OpenAI fala em virar padrão "nas próximas semanas", sem data

E tem o que NÃO dá pra afirmar por aqui: qualidade de resposta com o contexto cheio

Isso depende do seu código, do seu prompt e da sua tarefa, e eu não vou botar número por achismo

Por isso o desempate honesto é o método da seção anterior, rodado na sua base

Pra começar do zero em comparação de modelos, este vídeo do canal coloca Kimi K3, GPT-5.6 Sol e Fable 5 num teste lado a lado:

Conclusão

A lição que fica é meio anticlimática, mas é a que economiza dinheiro: janela grande no papel não significa sessão grande na prática

A diferença real aparece na configuração da ferramenta, não no anúncio do modelo

Seu próximo passo é bem concreto: antes de migrar qualquer coisa, cheque em qual fronteira o seu Claude Code está compactando e confirme a versão do seu Codex CLI

Só depois disso rode a mesma tarefa nos dois e compare entrada, saída e conta

Comparativo novo saindo, eu volto aqui e conto…

até o próximo post! 😀

Perguntas frequentes

Fable 5.1 ou GPT-6 Astra aguenta mais tokens de contexto?

O GPT-6 Astra tem 1.050.000 tokens de contexto contra 1 milhão do Claude Fable 5.1. Na prática essa diferença de 50 mil tokens dificilmente muda o resultado de uma tarefa longa, então não é esse número que deve decidir a escolha.

Qual modelo entrega resposta mais longa em uma única requisição?

Nenhum dos dois se destaca aqui: Fable 5.1 e GPT-6 Astra têm o mesmo teto de 128 mil tokens de saída por requisição. Isso significa que um entregável muito grande, tipo um arquivo inteiro reescrito, provavelmente vai exigir fatiar o pedido nos dois modelos.

Fable 5.1 e GPT-6 Astra custam o mesmo na API?

Entrada e saída custam exatamente igual nos dois: US$ 10 por milhão de tokens de entrada e US$ 50 por milhão de saída. A diferença real aparece no cache: leitura de cache no Fable 5.1 sai a US$ 0,25 por milhão, enquanto a entrada em cache do Astra custa US$ 1,00 por milhão.

Como saber se estou usando o Fable 5.1 no Claude Code?

O alias fable no Claude Code resolve para o Fable 5.1, a menos que a variável ANTHROPIC_DEFAULT_FABLE_MODEL esteja definida apontando para outro modelo. Vale lembrar que mesmo com o alias certo, a sessão compacta na fronteira de 200K por padrão, então convém ajustar isso com /autocompact se a tarefa for longa.

Como funciona o novo gerenciamento de contexto do GPT-6 Astra no Codex?

Em vez de comprimir todo o histórico em um resumo único, o Astra mantém notas entre janelas de contexto e deixa as janelas anteriores pesquisáveis. Esse modo é experimental, vem desligado por padrão e só vale para conversas novas, então é preciso ativar features.context_management.experimental_mode no config.toml do Codex antes de começar a tarefa.

Em quais planos do ChatGPT dá para usar o GPT-6 Astra?

O Astra está disponível no ChatGPT Work e no Codex para Plus e Business, além de aparecer como GPT-6 Pro nos planos Pro, Business e Enterprise do Chat. Assentos Plus e Business Standard têm uso limitado do Astra incluído, com créditos opcionais para quem precisa de mais.




Escrito por | Matheus Battisti

Matheus Battisti
Fundador da Hora de Codar

Programador apaixonado pelo mundo das tecnologias, sempre buscando em aprender e se aprofundar em linguagens, frameworks e o que mais for necessário para executar um bom trabalho. Agora tem uma nova missão que é de passar seu conhecimento adiante para formar novos programadores e especializar mais os que já são.

Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted

Formações

Formação Vibe Coding

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

Blog | Mais populares