Fable 5.1 ou GPT-6 Astra: qual aguenta melhor arquivo gigante e tarefa longa?

Fable 5.1 vs GPT-6 Astra é quase empate na ficha técnica: 1 milhão de tokens de contexto contra 1.050.000, 128 mil tokens de saída nos dois e o mesmo preço de API (US$ 10 por milhão de entrada e US$ 50 de saída). A diferença aparece no cache (US$ 0,25 no Fable 5.1 contra US$ 1,00 no Astra) e, principalmente, na ferramenta: o Claude Code compacta a sessão em 200K por padrão e o Codex guarda notas pesquisáveis entre janelas, em modo experimental. Meça sua base antes de migrar 🙂
Você joga o arquivo gigante no modelo, ele começa lindo, e no meio do caminho a resposta corta ou o contexto estoura
Fala aí, beleza? A Anthropic soltou o Fable 5.1 no dia 1 de setembro de 2026 (junto com o Mythos 5.1, que é o mesmo modelo com salvaguardas diferentes), e três dias depois a OpenAI respondeu com o GPT-6 Astra, no dia 4
Os dois chegam prometendo janela de 1 milhão de tokens pra cima
Só que janela grande no papel não é a mesma coisa que tarefa longa que anda até o fim, beleza? O comportamento muda bastante quando o trabalho é grande de verdade
Então o recorte deste post é bem específico: quanto de entrada cabe, quanto de resposta sai de uma vez e onde cada um te obriga a fatiar o trabalho
Fable 5.1 x GPT-6 Astra: contexto, saída e preço lado a lado
| O que pesa em tarefa longa | Claude Fable 5.1 | GPT-6 Astra |
|---|---|---|
| Janela de contexto | 1 milhão de tokens, disponível por padrão | 1.050.000 tokens |
| Saída máxima por requisição | 128 mil tokens | 128 mil tokens |
| Entrada na API | US$ 10 por milhão de tokens | US$ 10 por milhão de tokens |
| Saída na API | US$ 50 por milhão de tokens | US$ 50 por milhão de tokens |
| Cache | leitura de cache a US$ 0,25 por milhão | entrada em cache a US$ 1,00 por milhão |
| Corte de conhecimento | junho de 2026 | 30 de abril de 2026 |
| Controle de raciocínio | adaptativo sempre ativo, nível de esforço padrão alto | reasoning.effort aceita low, medium, high, xhigh e max |
| Tipos de entrada | texto e imagem, com saída de texto | posicionado como modelo de uso de computador (navegador, planilhas, apps de desktop e terminal) |
| Modo de velocidade | não consta | modo Fast: até 2x a velocidade do processamento padrão pelo dobro do preço |
| Onde roda | Claude API, Amazon Bedrock, Google Cloud, Microsoft Foundry e Claude Platform na AWS, com o ID claude-fable-5-1 |
API, ChatGPT Work e Codex |
Formação Claude Code
Domine Claude Code do absoluto zero até o avançado
- 120 aulas
- 4 projetos
- 9h 45min
Onde é empate:
Entrada e saída custam exatamente o mesmo nos dois: US$ 10 e US$ 50 por milhão
O teto de resposta também é igual, 128 mil tokens por requisição
E os 50 mil tokens a mais de contexto do Astra são uma diferença que dificilmente decide alguma coisa no seu dia a dia
Onde a conta muda de verdade:
É no cache, e só quando a tarefa é longa E repetitiva
Se você lê o mesmo arquivo gigante vinte vezes na mesma sessão, a leitura de cache do Fable 5.1 sai a US$ 0,25 por milhão, contra US$ 1,00 por milhão de entrada em cache no Astra
Multiplica isso por um repositório inteiro reprocessado o dia todo e o número deixa de ser detalhe
Já o teto de 128 mil tokens de saída é o mesmo dos dois lados, então nenhum deles te salva de fatiar um entregável muito grande: vale entender o limite de saída do Astra antes de pedir o arquivo inteiro de uma vez
Onde cada um te obriga a fatiar o trabalho
Agora a parte que a ficha técnica não conta
Tarefa longa quase nunca quebra no limite do modelo, ela quebra no agente que você usa pra rodar a tarefa
| Onde a tarefa longa quebra | Claude Code com Fable 5.1 | Codex com GPT-6 Astra |
|---|---|---|
| Fronteira de corte da sessão | com auto compactação ligada, sessões em modelos de janela nativa de 1M compactam na fronteira de 200K | com o gerenciamento de contexto experimental ligado, mantém notas entre janelas de contexto, em vez de comprimir o histórico num resumo único |
| Como você muda isso | /autocompact 500k aceita de 100K a 1M, salva em autoCompactWindow e aplica na sessão atual; /autocompact auto volta ao padrão do modelo |
features.context_management.experimental_mode = true no config.toml, desligado por padrão e válido só pra conversas novas |
| Recuperar coisa antiga | não consta | também depende do modo experimental ligado: aí as janelas anteriores continuam pesquisáveis e dá pra recuperar requisito ou resultado de teste de mensagens e saídas de ferramenta antigas, mesmo fora das notas |
| Voltar ao comportamento antigo | CLAUDE_CODE_DISABLE_1M_CONTEXT=1 mantém as sessões em 200K em todo modelo de janela nativa de 1M |
não consta |
| Seleção do modelo | o alias fable resolve pro Fable 5.1, a menos que ANTHROPIC_DEFAULT_FABLE_MODEL esteja definido |
/model no Codex CLI escolhe modelo e nível de esforço; exige Codex CLI 0.153.0 ou mais recente |
| Teto de entrada por minuto | não consta | TPM por tier da API: 500.000 no Tier 1, 1 milhão no Tier 2, 2 milhões no Tier 3, 4 milhões no Tier 4 e 40 milhões no Tier 5 |
| Restrição em conversa multi turno | contas de API criadas a partir de 31 de agosto de 2026 não podem editar mensagens, ferramentas ou system prompt ao redor de um bloco de thinking (dá pra optar por remover os blocos) | não consta |
Repara na primeira linha, porque ela pega muita gente de surpresa
O modelo tem 1M de janela, mas a sessão do Claude Code compacta em 200K por padrão
Ou seja: tu tem 1 milhão contratado e 200 mil andando, até mexer no /autocompact
Do outro lado, o Astra no Codex ataca o mesmo problema por outro caminho: em vez de espremer tudo num resumo, ele mantém notas e deixa as janelas anteriores pesquisáveis
Na prática isso é o que resolve o clássico "o requisito estava na mensagem 3 e ele esqueceu na mensagem 300"
Só que esse gerenciamento de contexto está como modo experimental e vem desligado, então não conta com ele por padrão
Detalhe útil: o app de desktop do ChatGPT, o Codex CLI e a extensão de IDE usam o MESMO config.toml, então tu edita num lugar e vale nos três
E tem o teto por minuto
Se tu está no Tier 1 da API, com 500.000 TPM, um arquivo perto do limite de contexto já é uma mordida enorme do seu minuto
Janela grande não serve de nada se a vazão não deixa a entrada passar, né?
Como medir no seu caso antes de escolher
Não existe número mágico de "linhas de código viram X tokens", então a única saída honesta é medir na sua base
Bora ver na prática?
- Meça o tamanho real do seu arquivo ou repositório em tokens. Rode a mesma tarefa uma vez em cada modelo e olhe quanto de entrada foi contabilizado, aí compara com o teto de cada um: 1 milhão no Fable 5.1 e 1.050.000 no Astra. O erro comum deste passo é chutar o tamanho por número de linhas ou por tamanho em MB, e descobrir o estouro só no meio da tarefa
- No Claude Code, mexa na fronteira de compactação e observe onde a sessão corta. O padrão em modelos de janela nativa de 1M é compactar em 200K, e o comando aceita de 100K a 1M:
/autocompact 500k
O valor fica salvo em autoCompactWindow nas configurações do usuário e já vale na sessão atual. Se quiser voltar atrás, /autocompact auto devolve o padrão do modelo. O erro comum aqui é pedir uma janela maior que o contexto do modelo: o Claude Code limita a janela ao contexto do modelo, então não adianta forçar
- Repita a MESMA tarefa travado em 200K pra ter comparação. É o jeito de ver, no seu caso, quanto a janela maior muda o resultado:
CLAUDE_CODE_DISABLE_1M_CONTEXT=1
Com essa variável ligada, as sessões ficam em 200K em todo modelo de janela nativa de 1M. O erro comum é esquecer a variável ligada e depois jurar que o Fable 5.1 "não aguenta contexto grande"
- Confira qual modelo tu está rodando de fato. No Claude Code, o alias
fableaponta pro Fable 5.1, a menos queANTHROPIC_DEFAULT_FABLE_MODELesteja definido. O erro comum é comparar dois modelos e, sem perceber, ter uma variável de ambiente antiga mandando na escolha
- No Codex, prepare o terreno antes de comparar. Confirme que sua versão do Codex CLI é a 0.153.0 ou mais recente, escolha modelo e nível de esforço com
/modele ative o gerenciamento de contexto experimental noconfig.toml:
features.context_management.experimental_mode = true
Depois disso, inicie uma tarefa NOVA. O erro comum deste passo é clássico: ligar o modo experimental e continuar a conversa antiga, porque o recurso vale só pra conversas novas
- Teste se o entregável cabe em 128 mil tokens de saída. Os dois cortam no mesmo teto por requisição, então se a sua tarefa gera um arquivo enorme de uma vez, o plano de fatiar já entra no desenho da tarefa, não depois que a resposta morreu no meio. O erro comum é achar que contexto de 1M implica resposta de 1M
- Rode a mesma tarefa duas vezes seguidas e compare a conta. É aí que o cache aparece: US$ 0,25 por milhão de leitura no Fable 5.1 contra US$ 1,00 por milhão de entrada em cache no Astra. O erro comum é medir só a primeira execução, justamente a que não tem cache nenhum
- Se tu usa o Astra por plano do ChatGPT, esquece contar mensagem. A própria OpenAI diz que uma tarefa mais longa consome mais da sua cota do que uma tarefa curta, então número fixo de mensagens não é medida confiável do que resta. O erro comum é planejar o dia por "quantas mensagens eu ainda tenho"
Qual escolher para cada tipo de tarefa longa
Arquivo único gigante lido muitas vezes:
Aqui o cache é o fator de desempate, e ele pesa pro lado do Fable 5.1, com leitura a US$ 0,25 por milhão contra US$ 1,00 por milhão no Astra
Quanto mais repetitiva a tarefa, maior a diferença na fatura
Tarefa de várias horas com requisito lá do começo:
Aquele cenário em que a regra de negócio apareceu na primeira hora e precisa valer na última
É exatamente o que o Astra no Codex endereça com as notas entre janelas e as janelas anteriores pesquisáveis
Lembrando que isso ainda depende do modo experimental ligado
Controle fino de esforço de raciocínio:
Se tu quer decidir por tarefa quanto o modelo pensa, o Astra te dá cinco níveis no reasoning.effort: low, medium, high, xhigh e max
O Fable 5.1 vai por outro caminho: raciocínio adaptativo sempre ativo, com nível de esforço padrão alto
Um te dá volante, o outro te dá piloto automático puxado pra cima
Trabalho que sai do editor:
Navegador, planilha, app de desktop, terminal
O Astra é posicionado justamente como modelo de uso de computador, e não como modelo de chat comum
Entrada com imagem junto do texto:
O Fable 5.1 aceita entrada de texto e imagem, com saída de texto
Print de erro, diagrama, screenshot de tela quebrada: entra no mesmo fluxo
Quem depende do plano do ChatGPT:
O Astra está no ChatGPT Work e no Codex para Plus e Business, e no Chat a opção baseada em Astra aparece como GPT-6 Pro nos planos Pro, Business e Enterprise
Assentos Plus e Business Standard incluem uso limitado de Astra, com créditos opcionais pra uso adicional
E se o seu fluxo passa pelas mensagens Pro: Business Standard inclui 15 mensagens Pro por mês e Business Premium inclui 50 por semana, compartilhadas entre GPT-6 Pro e GPT-5.6 Sol Pro
Antes de trocar de ferramenta por causa disso, vale a pena pensar friamente se o Astra compensa pro tipo de tarefa que tu roda todo dia
Veredito: qual aguenta melhor arquivo gigante
Na ficha técnica é quase empate, e não adianta querer inventar vencedor
Mesmo preço de entrada e saída, mesmo teto de 128 mil tokens de resposta, janela praticamente do mesmo tamanho
A escolha se decide no AMBIENTE, não no modelo
Se você vive no Claude Code: o Fable 5.1 te dá 1M de contexto por padrão, sem header beta e cobrado no preço padrão, mais o cache barato pra tarefa repetitiva
O preço disso é lembrar de configurar /autocompact, senão a sua sessão vai continuar compactando em 200K e tu vai jurar que o modelo é fraco de contexto
Se você vive no Codex: o Astra te dá continuidade de contexto por notas pesquisáveis, que é o remédio certo pra tarefa de várias horas
O preço é aceitar que isso está em modo experimental, desligado por padrão e válido só pra conversas novas, e que a OpenAI fala em virar padrão "nas próximas semanas", sem data
E tem o que NÃO dá pra afirmar por aqui: qualidade de resposta com o contexto cheio
Isso depende do seu código, do seu prompt e da sua tarefa, e eu não vou botar número por achismo
Por isso o desempate honesto é o método da seção anterior, rodado na sua base
Pra começar do zero em comparação de modelos, este vídeo do canal coloca Kimi K3, GPT-5.6 Sol e Fable 5 num teste lado a lado:
Conclusão
A lição que fica é meio anticlimática, mas é a que economiza dinheiro: janela grande no papel não significa sessão grande na prática
A diferença real aparece na configuração da ferramenta, não no anúncio do modelo
Seu próximo passo é bem concreto: antes de migrar qualquer coisa, cheque em qual fronteira o seu Claude Code está compactando e confirme a versão do seu Codex CLI
Só depois disso rode a mesma tarefa nos dois e compare entrada, saída e conta
Comparativo novo saindo, eu volto aqui e conto…
até o próximo post! 😀
Perguntas frequentes
Fable 5.1 ou GPT-6 Astra aguenta mais tokens de contexto?
O GPT-6 Astra tem 1.050.000 tokens de contexto contra 1 milhão do Claude Fable 5.1. Na prática essa diferença de 50 mil tokens dificilmente muda o resultado de uma tarefa longa, então não é esse número que deve decidir a escolha.
Qual modelo entrega resposta mais longa em uma única requisição?
Nenhum dos dois se destaca aqui: Fable 5.1 e GPT-6 Astra têm o mesmo teto de 128 mil tokens de saída por requisição. Isso significa que um entregável muito grande, tipo um arquivo inteiro reescrito, provavelmente vai exigir fatiar o pedido nos dois modelos.
Fable 5.1 e GPT-6 Astra custam o mesmo na API?
Entrada e saída custam exatamente igual nos dois: US$ 10 por milhão de tokens de entrada e US$ 50 por milhão de saída. A diferença real aparece no cache: leitura de cache no Fable 5.1 sai a US$ 0,25 por milhão, enquanto a entrada em cache do Astra custa US$ 1,00 por milhão.
Como saber se estou usando o Fable 5.1 no Claude Code?
O alias fable no Claude Code resolve para o Fable 5.1, a menos que a variável ANTHROPIC_DEFAULT_FABLE_MODEL esteja definida apontando para outro modelo. Vale lembrar que mesmo com o alias certo, a sessão compacta na fronteira de 200K por padrão, então convém ajustar isso com /autocompact se a tarefa for longa.
Como funciona o novo gerenciamento de contexto do GPT-6 Astra no Codex?
Em vez de comprimir todo o histórico em um resumo único, o Astra mantém notas entre janelas de contexto e deixa as janelas anteriores pesquisáveis. Esse modo é experimental, vem desligado por padrão e só vale para conversas novas, então é preciso ativar features.context_management.experimental_mode no config.toml do Codex antes de começar a tarefa.
Em quais planos do ChatGPT dá para usar o GPT-6 Astra?
O Astra está disponível no ChatGPT Work e no Codex para Plus e Business, além de aparecer como GPT-6 Pro nos planos Pro, Business e Enterprise do Chat. Assentos Plus e Business Standard têm uso limitado do Astra incluído, com créditos opcionais para quem precisa de mais.
Formações
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
Blog | Mais populares
Vale a pena manter Fable 5.1 e GPT-6 Astra ao mesmo tempo ou escolher um só?
Fable 5.1 ou GPT-6 Astra: no preço empatam, mas cache, batch, modo Fast e sobretaxa mudam a conta real. Veja se vale manter os dois ou escolher só um.
Claude Fable 5 tem 1 milhão de tokens de contexto: o que cabe nessa janela?
Claude Fable 5 1 milhão de tokens: veja o que cabe na janela de contexto, os limites de saída e como acompanhar o uso no Claude Code com /context.
Fable 5.1 ou GPT-6 Astra: qual deles está disponível na ferramenta que você já usa?
Fable 5.1 ou GPT-6 Astra: veja qual já está liberado no Claude Code, Codex e Copilot, preço de API e versão mínima do CLI antes de decidir.
