GPT-6 Astra ou Fable: qual usar para escrever e qual usar para programar?

comparação entre GPT-6 Astra ou Fable para tarefas de escrita e programação
Resposta rápida

GPT-6 Astra ou Fable: a escolha muda conforme a tarefa. Nos números públicos, o Claude Fable 5.1 lidera o Artificial Analysis Intelligence Index (65,7 contra 61,2) e o Humanity’s Last Exam com ferramentas (65,0% contra 57,2%), o que pesa na escrita longa e no trabalho de conhecimento. Em código, o Coding Agent Index dá 70 ao Fable 5.1 (medido no Claude Code) e 67 ao Astra (medido no Codex), com o Astra empatando o Fable 5 a menos da metade do custo por tarefa. E o preço por token é igual nos dois: US$ 10 de entrada e US$ 50 de saída por 1 milhão

Escolher modelo por gosto pessoal é o jeito mais caro de trabalhar

Fala aí, beleza? A Anthropic soltou o Claude Fable 5.1 no dia 1 de setembro de 2026 e, dois dias depois, em 3 de setembro, a OpenAI respondeu com o GPT-6 Astra

Aí sobra a pergunta prática, que é a única que importa quando a fatura chega: GPT-6 Astra ou Fable pra escrever, e GPT-6 Astra ou Fable pra programar?

A resposta muda conforme a natureza da tarefa, e é justamente por isso que o velho "eu uso sempre o meu preferido" costuma sair pior do que parece 🙂

O que mudou nos últimos dias: GPT-6 Astra e Claude Fable 5.1

Os dois lançamentos caíram quase colados, e cada empresa se posicionou de um jeito bem diferente

A OpenAI apresentou o GPT-6 Astra em 3 de setembro de 2026 como o seu modelo de fronteira mais capaz para trabalho complexo: código, pesquisa, uso de computador e tarefas de múltiplos passos

A Anthropic, dois dias antes, posicionou o Claude Fable 5.1 como o modelo mais capaz para projetos de código ambiciosos: features que atravessam a base inteira, code review, trabalho de performance e sessões autônomas de vários dias

Repara que já são duas promessas diferentes, mesmo com as duas falando de "trabalho difícil"

Dá pra testar hoje?

Esse detalhe muda tudo na hora de decidir, então vale explicar

O rollout do Astra é escalonado: começou pelas empresas do programa de cibersegurança da OpenAI, com acesso via API, AWS e os planos ChatGPT Plus, Pro, Business e Enterprise anunciados para os dias seguintes

Ou seja, dependendo do seu plano, a comparação ainda é no papel e não no seu terminal

E teve um começo atípico: veículos de imprensa publicaram antes de a página oficial da OpenAI ficar acessível, e o post oficial ficou fora do ar por perto de uma hora

Nada que mude a qualidade do modelo, mas é bom saber que boa parte do que rolou nas primeiras horas veio de fonte secundária

Formação Claude Code
Formação Recomendada

Formação Claude Code

Domine Claude Code do absoluto zero até o avançado

  • 114 aulas
  • 4 projetos
  • 9h 18min

GPT-6 Astra vs Claude Fable 5.1: comparativo lado a lado

Se liga na ficha técnica, com o que dá pra afirmar de fonte pública hoje

Item GPT-6 Astra Claude Fable 5.1
Lançamento 03/09/2026 01/09/2026
Entrada (1 milhão de tokens) US$ 10 US$ 10
Saída (1 milhão de tokens) US$ 50 US$ 50
Leitura de cache não divulgado aqui US$ 0,25 por 1 milhão (caiu de US$ 1)
Janela de contexto (API) 1.050.000 tokens não divulgado aqui
Saída máxima (API) 128.000 tokens não divulgado aqui
Multiplicadores acima de 272K tokens de entrada: 2x nas taxas de entrada e cache e 1,5x na saída, para a requisição inteira; fast mode a 2x das taxas aplicáveis não divulgado aqui
Artificial Analysis Intelligence Index (max) 61,2 65,7
Artificial Analysis Coding Agent Index 67 (medido no harness Codex) 70 (medido no Claude Code)
Humanity’s Last Exam com ferramentas 57,2% 65,0%
FrontierMath Tier 4 (v2), autorreportado pela OpenAI 97,6% 87,8%
ScreenSpot-Pro, autorreportado pela OpenAI 92,7% sem dado do Fable 5.1 (a OpenAI comparou com o Fable 5: 87,3%)
ARC-AGI-3, autorreportado pela OpenAI 99,9% sem dado do Fable 5.1 (a OpenAI comparou com o Opus 5: 30,2%)
ExploitBench, autorreportado pela OpenAI 100% não divulgado aqui

Duas leituras importantes antes de você sair tirando conclusão dessa tabela

Primeira: as linhas marcadas como autorreportadas vêm do anúncio da própria OpenAI, então são o time jogando em casa e narrando o jogo

Segunda: preço por token IDÊNTICO nos dois muda o eixo da discussão

Quando o valor por token empata, o que decide a conta é quantos tokens o modelo gasta pra terminar a tarefa, não a tabela de preço 😀

E tem um detalhe da própria tabela: em ScreenSpot-Pro e ARC-AGI-3 a OpenAI não colocou o Fable 5.1 na comparação, colocou o Fable 5 e o Opus 5, então essas duas linhas não são Astra contra Fable 5.1 e o número equivalente do 5.1 simplesmente não existe publicamente

Pra referência, os outros pontos do Intelligence Index (max) ficam assim: Fable 5.1 com 65,7, Opus 5 com 63,1, Fable 5 com 62,1 e o Astra com 61,2

Quando a tarefa é escrever: qual dos dois escolher

Texto narrativo, redação longa e trabalho de conhecimento são um tipo de exigência bem específico

Aqui não interessa só acertar o resultado, interessa manter o fio da meada por muitas páginas sem ficar repetitivo

Nos índices gerais, quem está na frente hoje é o Claude Fable 5.1: 65,7 contra 61,2 no Intelligence Index, e 65,0% contra 57,2% no Humanity’s Last Exam com ferramentas

E esse segundo número é interessante porque vem dos dados divulgados no próprio anúncio do Astra, ou seja, é a OpenAI mostrando onde ainda fica atrás

A Anthropic, do lado dela, afirma que o Fable 5.1 permanece legível em tarefas longas de múltiplos passos e comunica de forma mais concisa que os modelos anteriores

É claim oficial, não é medição independente, mas casa direitinho com o perfil de quem escreve texto comprido

E a opinião de quem já colocou a mão?

Dan Shipper, do Every, testou o Astra em código, escrita e trabalho de conhecimento

A leitura dele foi de um grande salto sobre o GPT-5.6 Sol, porém com hábitos incômodos que impedem o Astra de igualar o Fable no topo

Simon Willison foi na mesma direção: chamou o Astra de concorrente direto do Fable, com resultados mistos, forte em ARC-AGI e em tarefas de segurança, e abaixo do Fable nas métricas gerais de inteligência

São opiniões públicas, não são benchmark, e é assim que você deve tratar

Onde o Astra ganha na escrita

Tem um cenário em que a conversa vira, e é o de volume bruto

A janela de contexto do Astra na API é de 1.050.000 tokens, com saída máxima de 128.000 tokens

Se o seu trabalho é jogar material gigante dentro do modelo (transcrição inteira, documentação completa, arquivo morto de projeto) e pedir um texto a partir dali, isso é vantagem real e não é discurso de marketing

Tome cuidado com um detalhe: acima de 272 mil tokens de entrada, a cobrança muda pra 2x nas taxas de entrada e cache e 1,5x na saída, valendo pra requisição inteira

Ou seja, a janela enorme é ótima, mas ela tem preço quando você usa de verdade

Se você quer o mapa mais amplo dessa divisão, eu abri melhor a ideia de qual modelo usar em cada tarefa em outro post

Quando a tarefa é programar: qual dos dois escolher

Aqui a pergunta "GPT-6 Astra ou Fable" só faz sentido se você separar o TIPO de tarefa técnica

Programar não é uma coisa só, e é aí que a maioria das comparações erra

Feature grande, code review e sessão longa

Esse é o território que a Anthropic reivindica explicitamente pro Fable 5.1: mudanças que atravessam a base inteira, revisão de código, trabalho de performance e sessões autônomas de vários dias

A empresa também diz que o Fable 5.1 resolve mais problemas de código que o Fable 5 e o Opus 5 em benchmarks internos, o que de novo é claim oficial

Tem um número que eu acho mais concreto que o discurso: usuários do Claude Code têm em média cerca de 60% menos intervenções por sessão vindas das salvaguardas de cibersegurança com o Fable 5.1, comparado às salvaguardas anteriores no Fable 5

Quem já rodou agente por horas sabe o quanto interrupção mata o fluxo, então isso é bem relevante numa sessão longa

Raciocínio pesado, segurança e uso de computador

Do outro lado, os números que a OpenAI escolheu divulgar apontam pra outro perfil de tarefa

FrontierMath Tier 4 (v2) com 97,6% contra 87,8% do Fable 5.1, ARC-AGI-3 com 99,9% contra 30,2% do Opus 5 e 7,8% do GPT-5.6 Sol, ScreenSpot-Pro com 92,7% contra 87,3% do Fable 5 e ExploitBench em 100%

Todos autorreportados, repito, porque isso muda o peso da informação

Mesmo descontando o viés, o desenho é claro: raciocínio matemático duro, segurança ofensiva e uso de computador aparecem como o terreno preferido do Astra

O argumento de custo (que é o mais subestimado)

No Coding Agent Index, o Astra marca 67 e o Fable 5.1 marca 70

Perdeu, certo? Calma

O mesmo levantamento do Coding Agent Index mostra o Astra com pontuação equivalente à do Fable 5, a geração anterior, a menos da metade do custo por tarefa, por ganho de eficiência de tokens

Repara bem em duas coisas: esse empate de custo é contra o Fable 5, não contra o 5.1, e ele sai de uma medição própria do Coding Agent Index, separada do custo por tarefa que o Artificial Analysis mede no Intelligence Index

Com preço por token igual entre os dois, eficiência de token vira o verdadeiro campo de batalha, e não a tabela da API

E tem uma pegadinha metodológica que quase ninguém menciona: o 67 do Astra foi medido no harness Codex e o 70 do Fable 5.1 foi medido no Claude Code

São ferramentas diferentes rodando o mesmo tipo de prova, então a diferença de 3 pontos não é só "modelo contra modelo", é também ferramenta contra ferramenta

A propósito, o Astra roda dentro do Codex, o agente de código da OpenAI, que ganhou junto um mecanismo novo de preservar e recuperar contexto quando a janela enche: em vez de comprimir tudo num resumo único, ele mantém notas entre janelas de contexto

Pra tarefa longa isso importa MUITO mais do que meio ponto de benchmark

E vale a inversa também: nem toda tarefa pede modelo de fronteira, tem bastante coisa em que um modelo mais barato entrega igual

O que aprendi testando os dois lados na prática

Agora a parte honesta: meu teste em vídeo foi da geração ANTERIOR, GPT-5.6 Sol contra Claude Fable 5, e não do Astra

Então não tome como veredito sobre o Astra, e sim como padrão de comportamento, que é o que decide a escolha por tipo de tarefa no dia a dia

Eu coloquei os dois no mesmo projeto (um sistema de análise de feedback de clientes que identifica reclamações e sugere soluções ou produtos novos), com os mesmos prompts e configurações equivalentes, cada um rodando na ferramenta oficial da própria empresa

Um dos prompts pedia uma landing page completa: hero, barra de prova social, seção de como funciona, features, depoimentos, tabela de preços, FAQ, CTA final, mais animações, microinterações, responsividade, texto em português do Brasil e boa performance

Completão, né? haha

O que aconteceu com o relógio na mão: o modelo da OpenAI terminou a primeira entrega em 11 minutos

Quando fui checar o outro lado, o Claude estava rodando havia 12 minutos, e passou de 20 minutos sem entrega final

Enquanto isso, a cota que começou em 100% caiu pra 83% no meio do teste, e eu tinha 4 rounds planejados

Depois de estourar o limite, sobraram 3 resets pra mim

Tive que reduzir o nível de raciocínio dos dois no meio da gravação pra conseguir terminar em tempo razoável, e essa foi a lição mais firme que eu tirei: raciocínio máximo custa muito tempo e muita cota sem ganho de qualidade perceptível

Outras coisas que anotei enquanto rodava:

  • vi o modelo da OpenAI disparar dois subagentes ao mesmo tempo, enquanto o outro ainda estava na etapa de pensamento
  • me incomodou o Claude não mostrar a lista do que ainda falta executar, só o que está fazendo agora (eu gosto de ver o que RESTA)
  • rodei os dois ignorando permissões pra execução não travar
  • tomei um problema de porta: o modelo da OpenAI tentou subir na 3000, que já estava ocupada por outro projeto meu, e eu precisei pedir pra iniciar em outra. Caso apareça esse erro aí no teu, é isso mesmo, não é bug do modelo
  • comparando as duas landing pages, a estrutura ficou parecida, mas a da OpenAI veio mais trabalhada: SVGs próprios pros logos, uma interface simulada em HTML imitando print do sistema e logos das empresas parceiras
  • o Claude entregou uma versão mais simples, com uma estrela padrão no lugar do logo e os dados posicionados abaixo
  • gostei mais do gráfico e do esquema de cores da versão da OpenAI

A conclusão que eu levo desse teste é chata mas útil: velocidade de entrega e consumo de cota são variáveis de decisão tão reais quanto benchmark

De nada adianta meio ponto a mais no índice se você fica 20 minutos olhando pro terminal e queima a cota do dia num round só 😛

No vídeo acima eu mostro esse teste completo da geração anterior, com a ficha técnica em slides antes da prática, os rounds dentro de um projeto único e a comparação visual das duas landing pages lado a lado

Veredito: escolha pela tarefa, não pelo modelo favorito

Bora fechar sem enrolação

Pra escrever texto longo, narrativo e trabalho de conhecimento, os dados públicos favorecem o Claude Fable 5.1 hoje: 65,7 contra 61,2 no Intelligence Index e 65,0% contra 57,2% no Humanity’s Last Exam com ferramentas

Pra projeto de código grande, code review e sessão autônoma comprida, o Fable 5.1 também está à frente no Coding Agent Index, 70 contra 67, com a ressalva do harness diferente

Pra raciocínio matemático duro, segurança e uso de computador, os números do Astra são impressionantes, e ao mesmo tempo são autorreportados pela OpenAI, o que pede um pé atrás saudável

Pra volume bruto de contexto, o Astra tem 1.050.000 tokens de janela, e isso resolve um problema que nenhum ponto de benchmark resolve

E pra custo, o ponto mais interessante: como o preço por token é igual (US$ 10 de entrada e US$ 50 de saída por 1 milhão nos dois), a decisão migra pra eficiência de token, harness e tipo de tarefa

No Coding Agent Index, o levantamento mostra o Astra empatando com o Fable 5 a menos da metade do custo por tarefa

Já numa medição diferente, o custo por tarefa do Intelligence Index nos modelos da Anthropic ficou em US$ 3,69 no Fable 5.1 (max), US$ 3,14 no Fable 5 (max) e US$ 2,34 no Opus 5 (max), e são índices distintos, então não dá pra somar as duas coisas na mesma frase

O que eu NÃO consigo cravar: o rollout do Astra ainda é escalonado, e eu não rodei o Astra no meu próprio fluxo

Então qualquer pessoa dizendo veredito definitivo dois dias depois do lançamento está vendendo confiança que os dados não dão

Ah, e sobre o hype: Greg Brockman, cofundador e presidente da OpenAI, chamou o Astra de salto geracional e disse acreditar pessoalmente que a empresa pode ter alcançado AGI com esse lançamento

Isso é declaração da empresa em coletiva de imprensa, não é resultado medido, e é assim que entra na sua planilha de decisão… com aspas 🙂

Conclusão

A disputa GPT-6 Astra ou Fable não se resolve escolhendo um vencedor e casando com ele

Se resolve escolhendo por tarefa: escrita longa e legibilidade de um lado, raciocínio pesado, segurança e contexto gigante do outro, com código no meio dependendo do tamanho da mudança

O próximo passo prático é simples: separa dois ou três tipos de tarefa que você repete toda semana, roda o MESMO prompt nos dois e compara três coisas, entrega, custo e retrabalho

Retrabalho é o que mais some das comparações e é o que mais dói na conta

E antes de migrar teu fluxo inteiro, acompanha a ampliação do acesso ao Astra, porque decidir arquitetura com base num modelo que você ainda não consegue rodar é receita de dor de cabeça

Bora testar e depois tu me conta o que deu no teu caso… até o próximo post!

Perguntas frequentes

GPT-6 Astra ou Fable é melhor para programar?

No Artificial Analysis Coding Agent Index, o Claude Fable 5.1 marca 70 pontos (medido no Claude Code) contra 67 do GPT-6 Astra (medido no harness Codex). O Astra tem um trunfo de eficiência nesse mesmo levantamento: ele iguala a pontuação do Fable 5, a geração anterior, gastando menos da metade do custo por tarefa. Ou seja, pra qualidade pura o Fable 5.1 lidera, mas o Astra compensa em economia quando a nota já é suficiente.

Quanto custa usar o GPT-6 Astra pela API da OpenAI?

O GPT-6 Astra sai a US$ 10 por 1 milhão de tokens de entrada e US$ 50 por 1 milhão de tokens de saída. Acima de 272 mil tokens de entrada numa mesma requisição, a cobrança sobe para 2x nas taxas de entrada e cache e 1,5x na saída, valendo pra requisição inteira. O modo rápido (fast mode) também cobra 2x das taxas aplicáveis.

O Claude Fable 5.1 é mais caro ou mais barato que o GPT-6 Astra?

Por token, é igual: US$ 10 de entrada e US$ 50 de saída por 1 milhão de tokens nos dois modelos. A diferença aparece na leitura de cache, que no Fable 5.1 caiu de US$ 1 para US$ 0,25 por 1 milhão de tokens. Como o preço por token empata, quem decide a conta final é quantos tokens cada modelo consome pra terminar a tarefa.

Já dá para usar o GPT-6 Astra no ChatGPT hoje?

Depende do seu plano. O rollout começou pelas empresas do programa de cibersegurança da OpenAI, com acesso via API e AWS, e a chegada aos planos ChatGPT Plus, Pro, Business e Enterprise foi anunciada apenas para os dias seguintes ao lançamento de 3 de setembro de 2026. Então a comparação prática ainda depende de quando o acesso liberar pro seu plano específico.

O GPT-6 Astra vence o Fable em algum benchmark divulgado?

Sim, mas são números autorreportados pela própria OpenAI no anúncio. O Astra marcou 97,6% no FrontierMath Tier 4 (v2) contra 87,8% do Fable 5.1, 99,9% no ARC-AGI-3 contra 30,2% do Opus 5, 92,7% no ScreenSpot-Pro contra 87,3% do Fable 5, e 100% no ExploitBench. Repara que nessas duas últimas a comparação não é com o Fable 5.1, e sim com Opus 5 e Fable 5, porque o dado equivalente do 5.1 não foi divulgado. Fora dessas métricas específicas, o Fable 5.1 lidera no Intelligence Index geral (65,7 contra 61,2) e no Humanity’s Last Exam com ferramentas (65,0% contra 57,2%).

Qual a janela de contexto do GPT-6 Astra e isso importa na escolha?

Na API, o GPT-6 Astra opera com contexto de 1.050.000 tokens e saída máxima de 128.000 tokens. Isso é vantagem real quando a tarefa envolve jogar um volume gigante de material dentro do modelo de uma vez, como uma transcrição inteira ou uma documentação completa. Só que passar de 272 mil tokens de entrada aciona o multiplicador de cobrança, então vale calcular o custo antes de usar a janela cheia.




Escrito por | Matheus Battisti

Matheus Battisti
Fundador da Hora de Codar

Programador apaixonado pelo mundo das tecnologias, sempre buscando em aprender e se aprofundar em linguagens, frameworks e o que mais for necessário para executar um bom trabalho. Agora tem uma nova missão que é de passar seu conhecimento adiante para formar novos programadores e especializar mais os que já são.

Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted

Formações

Formação Vibe Coding

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

Blog | Mais populares