GPT-6 Astra ou Fable: qual usar para escrever e qual usar para programar?

GPT-6 Astra ou Fable: a escolha muda conforme a tarefa. Nos números públicos, o Claude Fable 5.1 lidera o Artificial Analysis Intelligence Index (65,7 contra 61,2) e o Humanity’s Last Exam com ferramentas (65,0% contra 57,2%), o que pesa na escrita longa e no trabalho de conhecimento. Em código, o Coding Agent Index dá 70 ao Fable 5.1 (medido no Claude Code) e 67 ao Astra (medido no Codex), com o Astra empatando o Fable 5 a menos da metade do custo por tarefa. E o preço por token é igual nos dois: US$ 10 de entrada e US$ 50 de saída por 1 milhão
Escolher modelo por gosto pessoal é o jeito mais caro de trabalhar
Fala aí, beleza? A Anthropic soltou o Claude Fable 5.1 no dia 1 de setembro de 2026 e, dois dias depois, em 3 de setembro, a OpenAI respondeu com o GPT-6 Astra
Aí sobra a pergunta prática, que é a única que importa quando a fatura chega: GPT-6 Astra ou Fable pra escrever, e GPT-6 Astra ou Fable pra programar?
A resposta muda conforme a natureza da tarefa, e é justamente por isso que o velho "eu uso sempre o meu preferido" costuma sair pior do que parece 🙂
O que mudou nos últimos dias: GPT-6 Astra e Claude Fable 5.1
Os dois lançamentos caíram quase colados, e cada empresa se posicionou de um jeito bem diferente
A OpenAI apresentou o GPT-6 Astra em 3 de setembro de 2026 como o seu modelo de fronteira mais capaz para trabalho complexo: código, pesquisa, uso de computador e tarefas de múltiplos passos
A Anthropic, dois dias antes, posicionou o Claude Fable 5.1 como o modelo mais capaz para projetos de código ambiciosos: features que atravessam a base inteira, code review, trabalho de performance e sessões autônomas de vários dias
Repara que já são duas promessas diferentes, mesmo com as duas falando de "trabalho difícil"
Dá pra testar hoje?
Esse detalhe muda tudo na hora de decidir, então vale explicar
O rollout do Astra é escalonado: começou pelas empresas do programa de cibersegurança da OpenAI, com acesso via API, AWS e os planos ChatGPT Plus, Pro, Business e Enterprise anunciados para os dias seguintes
Ou seja, dependendo do seu plano, a comparação ainda é no papel e não no seu terminal
E teve um começo atípico: veículos de imprensa publicaram antes de a página oficial da OpenAI ficar acessível, e o post oficial ficou fora do ar por perto de uma hora
Nada que mude a qualidade do modelo, mas é bom saber que boa parte do que rolou nas primeiras horas veio de fonte secundária
Formação Claude Code
Domine Claude Code do absoluto zero até o avançado
- 114 aulas
- 4 projetos
- 9h 18min
GPT-6 Astra vs Claude Fable 5.1: comparativo lado a lado
Se liga na ficha técnica, com o que dá pra afirmar de fonte pública hoje
| Item | GPT-6 Astra | Claude Fable 5.1 |
|---|---|---|
| Lançamento | 03/09/2026 | 01/09/2026 |
| Entrada (1 milhão de tokens) | US$ 10 | US$ 10 |
| Saída (1 milhão de tokens) | US$ 50 | US$ 50 |
| Leitura de cache | não divulgado aqui | US$ 0,25 por 1 milhão (caiu de US$ 1) |
| Janela de contexto (API) | 1.050.000 tokens | não divulgado aqui |
| Saída máxima (API) | 128.000 tokens | não divulgado aqui |
| Multiplicadores | acima de 272K tokens de entrada: 2x nas taxas de entrada e cache e 1,5x na saída, para a requisição inteira; fast mode a 2x das taxas aplicáveis | não divulgado aqui |
| Artificial Analysis Intelligence Index (max) | 61,2 | 65,7 |
| Artificial Analysis Coding Agent Index | 67 (medido no harness Codex) | 70 (medido no Claude Code) |
| Humanity’s Last Exam com ferramentas | 57,2% | 65,0% |
| FrontierMath Tier 4 (v2), autorreportado pela OpenAI | 97,6% | 87,8% |
| ScreenSpot-Pro, autorreportado pela OpenAI | 92,7% | sem dado do Fable 5.1 (a OpenAI comparou com o Fable 5: 87,3%) |
| ARC-AGI-3, autorreportado pela OpenAI | 99,9% | sem dado do Fable 5.1 (a OpenAI comparou com o Opus 5: 30,2%) |
| ExploitBench, autorreportado pela OpenAI | 100% | não divulgado aqui |
Duas leituras importantes antes de você sair tirando conclusão dessa tabela
Primeira: as linhas marcadas como autorreportadas vêm do anúncio da própria OpenAI, então são o time jogando em casa e narrando o jogo
Segunda: preço por token IDÊNTICO nos dois muda o eixo da discussão
Quando o valor por token empata, o que decide a conta é quantos tokens o modelo gasta pra terminar a tarefa, não a tabela de preço 😀
E tem um detalhe da própria tabela: em ScreenSpot-Pro e ARC-AGI-3 a OpenAI não colocou o Fable 5.1 na comparação, colocou o Fable 5 e o Opus 5, então essas duas linhas não são Astra contra Fable 5.1 e o número equivalente do 5.1 simplesmente não existe publicamente
Pra referência, os outros pontos do Intelligence Index (max) ficam assim: Fable 5.1 com 65,7, Opus 5 com 63,1, Fable 5 com 62,1 e o Astra com 61,2
Quando a tarefa é escrever: qual dos dois escolher
Texto narrativo, redação longa e trabalho de conhecimento são um tipo de exigência bem específico
Aqui não interessa só acertar o resultado, interessa manter o fio da meada por muitas páginas sem ficar repetitivo
Nos índices gerais, quem está na frente hoje é o Claude Fable 5.1: 65,7 contra 61,2 no Intelligence Index, e 65,0% contra 57,2% no Humanity’s Last Exam com ferramentas
E esse segundo número é interessante porque vem dos dados divulgados no próprio anúncio do Astra, ou seja, é a OpenAI mostrando onde ainda fica atrás
A Anthropic, do lado dela, afirma que o Fable 5.1 permanece legível em tarefas longas de múltiplos passos e comunica de forma mais concisa que os modelos anteriores
É claim oficial, não é medição independente, mas casa direitinho com o perfil de quem escreve texto comprido
E a opinião de quem já colocou a mão?
Dan Shipper, do Every, testou o Astra em código, escrita e trabalho de conhecimento
A leitura dele foi de um grande salto sobre o GPT-5.6 Sol, porém com hábitos incômodos que impedem o Astra de igualar o Fable no topo
Simon Willison foi na mesma direção: chamou o Astra de concorrente direto do Fable, com resultados mistos, forte em ARC-AGI e em tarefas de segurança, e abaixo do Fable nas métricas gerais de inteligência
São opiniões públicas, não são benchmark, e é assim que você deve tratar
Onde o Astra ganha na escrita
Tem um cenário em que a conversa vira, e é o de volume bruto
A janela de contexto do Astra na API é de 1.050.000 tokens, com saída máxima de 128.000 tokens
Se o seu trabalho é jogar material gigante dentro do modelo (transcrição inteira, documentação completa, arquivo morto de projeto) e pedir um texto a partir dali, isso é vantagem real e não é discurso de marketing
Tome cuidado com um detalhe: acima de 272 mil tokens de entrada, a cobrança muda pra 2x nas taxas de entrada e cache e 1,5x na saída, valendo pra requisição inteira
Ou seja, a janela enorme é ótima, mas ela tem preço quando você usa de verdade
Se você quer o mapa mais amplo dessa divisão, eu abri melhor a ideia de qual modelo usar em cada tarefa em outro post
Quando a tarefa é programar: qual dos dois escolher
Aqui a pergunta "GPT-6 Astra ou Fable" só faz sentido se você separar o TIPO de tarefa técnica
Programar não é uma coisa só, e é aí que a maioria das comparações erra
Feature grande, code review e sessão longa
Esse é o território que a Anthropic reivindica explicitamente pro Fable 5.1: mudanças que atravessam a base inteira, revisão de código, trabalho de performance e sessões autônomas de vários dias
A empresa também diz que o Fable 5.1 resolve mais problemas de código que o Fable 5 e o Opus 5 em benchmarks internos, o que de novo é claim oficial
Tem um número que eu acho mais concreto que o discurso: usuários do Claude Code têm em média cerca de 60% menos intervenções por sessão vindas das salvaguardas de cibersegurança com o Fable 5.1, comparado às salvaguardas anteriores no Fable 5
Quem já rodou agente por horas sabe o quanto interrupção mata o fluxo, então isso é bem relevante numa sessão longa
Raciocínio pesado, segurança e uso de computador
Do outro lado, os números que a OpenAI escolheu divulgar apontam pra outro perfil de tarefa
FrontierMath Tier 4 (v2) com 97,6% contra 87,8% do Fable 5.1, ARC-AGI-3 com 99,9% contra 30,2% do Opus 5 e 7,8% do GPT-5.6 Sol, ScreenSpot-Pro com 92,7% contra 87,3% do Fable 5 e ExploitBench em 100%
Todos autorreportados, repito, porque isso muda o peso da informação
Mesmo descontando o viés, o desenho é claro: raciocínio matemático duro, segurança ofensiva e uso de computador aparecem como o terreno preferido do Astra
O argumento de custo (que é o mais subestimado)
No Coding Agent Index, o Astra marca 67 e o Fable 5.1 marca 70
Perdeu, certo? Calma
O mesmo levantamento do Coding Agent Index mostra o Astra com pontuação equivalente à do Fable 5, a geração anterior, a menos da metade do custo por tarefa, por ganho de eficiência de tokens
Repara bem em duas coisas: esse empate de custo é contra o Fable 5, não contra o 5.1, e ele sai de uma medição própria do Coding Agent Index, separada do custo por tarefa que o Artificial Analysis mede no Intelligence Index
Com preço por token igual entre os dois, eficiência de token vira o verdadeiro campo de batalha, e não a tabela da API
E tem uma pegadinha metodológica que quase ninguém menciona: o 67 do Astra foi medido no harness Codex e o 70 do Fable 5.1 foi medido no Claude Code
São ferramentas diferentes rodando o mesmo tipo de prova, então a diferença de 3 pontos não é só "modelo contra modelo", é também ferramenta contra ferramenta
A propósito, o Astra roda dentro do Codex, o agente de código da OpenAI, que ganhou junto um mecanismo novo de preservar e recuperar contexto quando a janela enche: em vez de comprimir tudo num resumo único, ele mantém notas entre janelas de contexto
Pra tarefa longa isso importa MUITO mais do que meio ponto de benchmark
E vale a inversa também: nem toda tarefa pede modelo de fronteira, tem bastante coisa em que um modelo mais barato entrega igual
O que aprendi testando os dois lados na prática
Agora a parte honesta: meu teste em vídeo foi da geração ANTERIOR, GPT-5.6 Sol contra Claude Fable 5, e não do Astra
Então não tome como veredito sobre o Astra, e sim como padrão de comportamento, que é o que decide a escolha por tipo de tarefa no dia a dia
Eu coloquei os dois no mesmo projeto (um sistema de análise de feedback de clientes que identifica reclamações e sugere soluções ou produtos novos), com os mesmos prompts e configurações equivalentes, cada um rodando na ferramenta oficial da própria empresa
Um dos prompts pedia uma landing page completa: hero, barra de prova social, seção de como funciona, features, depoimentos, tabela de preços, FAQ, CTA final, mais animações, microinterações, responsividade, texto em português do Brasil e boa performance
Completão, né? haha
O que aconteceu com o relógio na mão: o modelo da OpenAI terminou a primeira entrega em 11 minutos
Quando fui checar o outro lado, o Claude estava rodando havia 12 minutos, e passou de 20 minutos sem entrega final
Enquanto isso, a cota que começou em 100% caiu pra 83% no meio do teste, e eu tinha 4 rounds planejados
Depois de estourar o limite, sobraram 3 resets pra mim
Tive que reduzir o nível de raciocínio dos dois no meio da gravação pra conseguir terminar em tempo razoável, e essa foi a lição mais firme que eu tirei: raciocínio máximo custa muito tempo e muita cota sem ganho de qualidade perceptível
Outras coisas que anotei enquanto rodava:
- vi o modelo da OpenAI disparar dois subagentes ao mesmo tempo, enquanto o outro ainda estava na etapa de pensamento
- me incomodou o Claude não mostrar a lista do que ainda falta executar, só o que está fazendo agora (eu gosto de ver o que RESTA)
- rodei os dois ignorando permissões pra execução não travar
- tomei um problema de porta: o modelo da OpenAI tentou subir na 3000, que já estava ocupada por outro projeto meu, e eu precisei pedir pra iniciar em outra. Caso apareça esse erro aí no teu, é isso mesmo, não é bug do modelo
- comparando as duas landing pages, a estrutura ficou parecida, mas a da OpenAI veio mais trabalhada: SVGs próprios pros logos, uma interface simulada em HTML imitando print do sistema e logos das empresas parceiras
- o Claude entregou uma versão mais simples, com uma estrela padrão no lugar do logo e os dados posicionados abaixo
- gostei mais do gráfico e do esquema de cores da versão da OpenAI
A conclusão que eu levo desse teste é chata mas útil: velocidade de entrega e consumo de cota são variáveis de decisão tão reais quanto benchmark
De nada adianta meio ponto a mais no índice se você fica 20 minutos olhando pro terminal e queima a cota do dia num round só 😛
No vídeo acima eu mostro esse teste completo da geração anterior, com a ficha técnica em slides antes da prática, os rounds dentro de um projeto único e a comparação visual das duas landing pages lado a lado
Veredito: escolha pela tarefa, não pelo modelo favorito
Bora fechar sem enrolação
Pra escrever texto longo, narrativo e trabalho de conhecimento, os dados públicos favorecem o Claude Fable 5.1 hoje: 65,7 contra 61,2 no Intelligence Index e 65,0% contra 57,2% no Humanity’s Last Exam com ferramentas
Pra projeto de código grande, code review e sessão autônoma comprida, o Fable 5.1 também está à frente no Coding Agent Index, 70 contra 67, com a ressalva do harness diferente
Pra raciocínio matemático duro, segurança e uso de computador, os números do Astra são impressionantes, e ao mesmo tempo são autorreportados pela OpenAI, o que pede um pé atrás saudável
Pra volume bruto de contexto, o Astra tem 1.050.000 tokens de janela, e isso resolve um problema que nenhum ponto de benchmark resolve
E pra custo, o ponto mais interessante: como o preço por token é igual (US$ 10 de entrada e US$ 50 de saída por 1 milhão nos dois), a decisão migra pra eficiência de token, harness e tipo de tarefa
No Coding Agent Index, o levantamento mostra o Astra empatando com o Fable 5 a menos da metade do custo por tarefa
Já numa medição diferente, o custo por tarefa do Intelligence Index nos modelos da Anthropic ficou em US$ 3,69 no Fable 5.1 (max), US$ 3,14 no Fable 5 (max) e US$ 2,34 no Opus 5 (max), e são índices distintos, então não dá pra somar as duas coisas na mesma frase
O que eu NÃO consigo cravar: o rollout do Astra ainda é escalonado, e eu não rodei o Astra no meu próprio fluxo
Então qualquer pessoa dizendo veredito definitivo dois dias depois do lançamento está vendendo confiança que os dados não dão
Ah, e sobre o hype: Greg Brockman, cofundador e presidente da OpenAI, chamou o Astra de salto geracional e disse acreditar pessoalmente que a empresa pode ter alcançado AGI com esse lançamento
Isso é declaração da empresa em coletiva de imprensa, não é resultado medido, e é assim que entra na sua planilha de decisão… com aspas 🙂
Conclusão
A disputa GPT-6 Astra ou Fable não se resolve escolhendo um vencedor e casando com ele
Se resolve escolhendo por tarefa: escrita longa e legibilidade de um lado, raciocínio pesado, segurança e contexto gigante do outro, com código no meio dependendo do tamanho da mudança
O próximo passo prático é simples: separa dois ou três tipos de tarefa que você repete toda semana, roda o MESMO prompt nos dois e compara três coisas, entrega, custo e retrabalho
Retrabalho é o que mais some das comparações e é o que mais dói na conta
E antes de migrar teu fluxo inteiro, acompanha a ampliação do acesso ao Astra, porque decidir arquitetura com base num modelo que você ainda não consegue rodar é receita de dor de cabeça
Bora testar e depois tu me conta o que deu no teu caso… até o próximo post!
Perguntas frequentes
GPT-6 Astra ou Fable é melhor para programar?
No Artificial Analysis Coding Agent Index, o Claude Fable 5.1 marca 70 pontos (medido no Claude Code) contra 67 do GPT-6 Astra (medido no harness Codex). O Astra tem um trunfo de eficiência nesse mesmo levantamento: ele iguala a pontuação do Fable 5, a geração anterior, gastando menos da metade do custo por tarefa. Ou seja, pra qualidade pura o Fable 5.1 lidera, mas o Astra compensa em economia quando a nota já é suficiente.
Quanto custa usar o GPT-6 Astra pela API da OpenAI?
O GPT-6 Astra sai a US$ 10 por 1 milhão de tokens de entrada e US$ 50 por 1 milhão de tokens de saída. Acima de 272 mil tokens de entrada numa mesma requisição, a cobrança sobe para 2x nas taxas de entrada e cache e 1,5x na saída, valendo pra requisição inteira. O modo rápido (fast mode) também cobra 2x das taxas aplicáveis.
O Claude Fable 5.1 é mais caro ou mais barato que o GPT-6 Astra?
Por token, é igual: US$ 10 de entrada e US$ 50 de saída por 1 milhão de tokens nos dois modelos. A diferença aparece na leitura de cache, que no Fable 5.1 caiu de US$ 1 para US$ 0,25 por 1 milhão de tokens. Como o preço por token empata, quem decide a conta final é quantos tokens cada modelo consome pra terminar a tarefa.
Já dá para usar o GPT-6 Astra no ChatGPT hoje?
Depende do seu plano. O rollout começou pelas empresas do programa de cibersegurança da OpenAI, com acesso via API e AWS, e a chegada aos planos ChatGPT Plus, Pro, Business e Enterprise foi anunciada apenas para os dias seguintes ao lançamento de 3 de setembro de 2026. Então a comparação prática ainda depende de quando o acesso liberar pro seu plano específico.
O GPT-6 Astra vence o Fable em algum benchmark divulgado?
Sim, mas são números autorreportados pela própria OpenAI no anúncio. O Astra marcou 97,6% no FrontierMath Tier 4 (v2) contra 87,8% do Fable 5.1, 99,9% no ARC-AGI-3 contra 30,2% do Opus 5, 92,7% no ScreenSpot-Pro contra 87,3% do Fable 5, e 100% no ExploitBench. Repara que nessas duas últimas a comparação não é com o Fable 5.1, e sim com Opus 5 e Fable 5, porque o dado equivalente do 5.1 não foi divulgado. Fora dessas métricas específicas, o Fable 5.1 lidera no Intelligence Index geral (65,7 contra 61,2) e no Humanity’s Last Exam com ferramentas (65,0% contra 57,2%).
Qual a janela de contexto do GPT-6 Astra e isso importa na escolha?
Na API, o GPT-6 Astra opera com contexto de 1.050.000 tokens e saída máxima de 128.000 tokens. Isso é vantagem real quando a tarefa envolve jogar um volume gigante de material dentro do modelo de uma vez, como uma transcrição inteira ou uma documentação completa. Só que passar de 272 mil tokens de entrada aciona o multiplicador de cobrança, então vale calcular o custo antes de usar a janela cheia.
Formações
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
Blog | Mais populares
Como usar o GPT-6 Astra para entender um repositório legado que ninguém documentou
O GPT-6 Astra promete entender repositórios legados sem documentação. Veja o passo a passo com 1 milhão de tokens de contexto e como validar cada resposta.
GPT-6 Astra ou Gemini: qual modelo usar para código no dia a dia?
GPT-6 Astra ou Gemini: qual escolher para código no dia a dia? Compare preço, limite de saída e casos de uso e veja o veredito sem enrolação.
Por que o GPT-6 Astra demora para responder e o que fazer na sua aplicação
GPT-6 Astra lento? Entenda por que modelos de raciocínio pensam antes de responder e veja como ajustar reasoning.effort, contexto e cache na aplicação.
