Fable 5.1 vs GPT-6 Astra: como montar um teste pareado com as tarefas do seu projeto

Comparação Fable 5.1 vs GPT-6 Astra em um teste pareado com tarefas reais de código
Resposta rápida

Fable 5.1 vs GPT-6 Astra é o tipo de comparação que ninguém deveria fechar por impressão, ainda mais porque os dois têm o mesmo preço de tabela: US$ 10 por milhão de entrada e US$ 50 de saída. O caminho honesto é montar uma bateria pequena com tarefas reais do seu repositório, congelar o commit base, escrever o prompt uma vez só e reusar literalmente nos dois lados, com rubrica definida antes de rodar. Aqui você vê o passo a passo, os comandos de troca de modelo no Claude Code e no Codex, e os números públicos que servem de contexto, não de veredito

Fala aí, beleza? A OpenAI liberou o GPT-6 Astra em 3 de setembro de 2026, primeiro como preview limitado para parceiros e no dia seguinte em versão restrita para usuários pagos, e do outro lado a Anthropic tem o Claude Fable 5.1 rodando firme, lançado junto com o Claude Mythos 5.1

Aí vem a pergunta óbvia: qual dos dois é melhor pro seu projeto?

E a resposta honesta é que ninguém de fora sabe isso

Repara num detalhe que muda o jogo: os dois custam exatamente o mesmo de tabela, US$ 10 por milhão de tokens de entrada e US$ 50 por milhão de saída

Quando o preço empata, o desempate não pode vir de print de benchmark de terceiro nem de thread empolgada

Ele tem que vir das SUAS tarefas

Então bora montar isso direito: bateria pequena, mesmo prompt nos dois lados, critério fixo escrito antes de rodar

O que você precisa antes de começar o teste pareado:

Antes de sair rodando prompt, garanta os dois acessos, senão você testa um lado só e chama de comparação 🙂

O Claude Fable 5.1 está disponível na Claude API, na Amazon Web Services, no Google Cloud e no Microsoft Foundry, além dos planos Pro, Max, Team e Enterprise do Claude

O GPT-6 Astra está no ChatGPT Plus, Pro, Business e Enterprise, na API da OpenAI, no Microsoft Foundry (Azure) e no AWS Bedrock

Formação Claude Code
Formação Recomendada

Formação Claude Code

Domine Claude Code do absoluto zero até o avançado

  • 120 aulas
  • 4 projetos
  • 9h 45min

Os bloqueios que aparecem antes do primeiro round:

Tome cuidado com esses três, porque eles travam o teste no pior momento (no meio dele):

  • Em workspace Enterprise, o acesso ao GPT-6 Astra vem desligado por padrão: o administrador do workspace precisa habilitar manualmente
  • No plano Pro do Claude, os modelos Fable funcionam com créditos de uso pay-as-you-go desde o início, porque não estão inclusos nos limites do plano
  • No plano Max, ao atingir 50% dos limites semanais em modelos Fable, é preciso continuar com créditos de uso ou trocar para outro modelo Claude

Os identificadores de modelo:

Anota esses nomes, porque é o que vai na chamada de API e na configuração das plataformas:

  • claude-fable-5-1 na Claude API, no Google Cloud e no Microsoft Foundry
  • anthropic.claude-fable-5-1 no Amazon Bedrock
  • gpt-6-astra na API da OpenAI

Um detalhe pra não confundir na hora de escolher: o Mythos 5.1 (claude-mythos-5-1) saiu junto com o Fable 5.1 e compartilha o mesmo modelo base, mas quem entra no teste pareado aqui é o Fable 5.1

E mais duas coisas bem sem graça, porém essenciais: repositório em git limpo (nada de arquivo solto no working tree) e uma planilha ou arquivo de anotação pra registrar cada rodada

Se você não anotar na hora, no terceiro round vira memória afetiva, não dado

Passo a passo: montando a bateria de tarefas pareadas

A lógica é a mesma de um experimento controlado: só uma variável muda, que é o modelo

Tudo o resto fica congelado

  1. Escolha de 4 a 6 tarefas reais do seu repositório e congele o commit base. Nada de tarefa inventada de tutorial: pega um bug de verdade, um refactor, uma feature pequena e uma leitura de código legado. O erro comum deste passo é escolher só tarefa fácil, aí os dois modelos acertam tudo e você não desempata nada
  1. Escreva o prompt UMA vez e reuse literalmente nos dois lados. Detalha o que você espera (padrão do projeto, arquivos que pode tocar, o que não pode quebrar) e salva esse texto num arquivo. O erro comum aqui é o mais traiçoeiro de todos: você roda no primeiro modelo, vê que faltou contexto, melhora o prompt e roda o segundo com a versão boa. Pronto, contaminou a comparação
  1. Defina a rubrica ANTES de rodar. Critério fixo, cinco itens que dá pra marcar sem discussão: compila e roda, resolve o que foi pedido, respeita o padrão do projeto, quantidade de idas e voltas até chegar lá, legibilidade do diff. O erro comum é criar o critério depois de ver o resultado, e aí você só está justificando a sua preferência
  1. Rode cada round isolado, trocando o modelo pelo comando da própria ferramenta. No Claude Code, /model abre o seletor, e dá pra passar o modelo direto:
# dentro da sessão do Claude Code
/model
/model fable

Repara que esse /model fable é o atalho do próprio seletor do Claude Code, não o identificador completo da API: os nomes da lista lá de cima valem pra chamada de API e pra configuração nas plataformas

Também dá pra iniciar já apontando o modelo com a flag claude --model

Do lado do Codex, os três caminhos são estes:

# inicia a sessão já no modelo
codex -m gpt-6-astra

# troca no meio da sessão interativa
/model

# execução não interativa
codex exec --model gpt-6-astra

Um ponto que pega gente desatenta: no Claude Code o modelo escolhido fica salvo nas configurações do usuário e vale para as próximas sessões. Já me ferrei com esse tipo de coisa: você acha que voltou pro padrão, mas continua no modelo do round anterior

  1. Resete o estado entre as rodadas. Antes de cada round, volta pro commit base e limpa o que sobrou:
git reset --hard <commit-base>
git clean -fd

O erro comum deste passo é deixar arquivo do round anterior no disco, aí o segundo modelo "resolve" um problema que já estava resolvido e você acha que ele foi mais rápido

  1. Registre tempo de parede, custo e nível de esforço usado. Cronômetro na mão mesmo, e anota o nível de raciocínio que você deixou ligado em cada lado. Se você mudar o esforço no meio da bateria, mude nos DOIS, senão a comparação morre ali
  1. Feche a nota por tarefa antes de olhar o agregado. Nota tarefa por tarefa, sem olhar o placar geral. Depois você soma. O erro comum é olhar o total no meio e começar a puxar a sardinha pro modelo que você já gostava

O que aprendi rodando essa bateria na prática

Esse método não saiu da minha cabeça em teoria, ele saiu de um teste que eu gravei com a geração anterior desses modelos (GPT-5.6 Sol de um lado, Fable 5 do outro)

Ou seja: os números abaixo são daquela bateria, não valem como veredito sobre Fable 5.1 nem sobre o Astra

O que vale aqui é o MÉTODO, e as ciladas que eu levei na cara

Quando testei, montei tudo pareado: mesmo projeto, mesmos prompts, mesmas configurações sempre que possível, cada modelo rodando no software oficial da própria empresa

Deixei os dois no nível máximo de raciocínio disponível em cada um, e até deixei de ligar um recurso extra de entrega rápida que existia só de um lado, justamente porque o outro não tinha equivalente

Eram 4 rounds planejados, e entre as dimensões avaliadas estavam design (landing page), autenticação e sistema base, e integração com IA pra processar dados

O projeto era único e concreto: um sistema que recebe feedback de clientes, entende reclamações e sugere soluções

E aí a realidade bateu:

  • O GPT fechou o round da landing page em 11 minutos
  • Do outro lado, quando fui checar o andamento no Claude, o cronômetro estava em 12 minutos rodando, e aquele mesmo round acabou passando de 20 minutos sem entregar
  • A cota caiu de 100% para 83% em UM round só, com 3 resets ainda disponíveis
  • A porta 3000 já estava ocupada por outro projeto na minha máquina, e o round travou por causa disso

Vi também um dos modelos rodando 2 subagentes em paralelo enquanto o outro ainda estava pensando, e um dos lados mostra lista de tarefas com o que falta enquanto o outro só diz o que está fazendo (isso atrapalha MUITO acompanhar o progresso)

Teve tropeço bobo de execução também, comando errado na hora de montar a estrutura de pastas

No meio do vídeo eu precisei baixar o nível de raciocínio dos dois pra conseguir terminar a bateria em tempo viável, e baixei nos dois, simétrico

Inclusive é a conclusão que eu levo pro dia a dia: raciocínio máximo nem sempre compensa. Costumo usar o nível alto, às vezes o extra alto, porque entrega mais rápido, com qualidade que eu não vejo cair e com consumo menor

Vira lição de método, então: cronometre cada round, cheque a cota antes e depois e libere a porta antes de subir o projeto

Senão você confunde falha de ambiente com falha de modelo, e joga fora um round inteiro

Os números públicos dos dois modelos (use como contexto, não como veredito)

Esses dados servem pra você calibrar a conta ANTES de rodar a bateria, não pra decidir no lugar dela

Item Claude Fable 5.1 GPT-6 Astra
Entrada (por 1M tokens) US$ 10 US$ 10
Saída (por 1M tokens) US$ 50 US$ 50
Leitura de cache US$ 0,25 (queda de 75%) US$ 1
Escrita de cache não coberto neste post US$ 12,50
Batch US$ 5 entrada / US$ 25 saída metade da tarifa padrão
Outros modos não coberto neste post flex pela metade, fast pelo dobro
Acima de 272K de entrada não coberto neste post requisição inteira a US$ 20 / US$ 2 / US$ 25 / US$ 75
Intelligence Index (esforço máximo) 57 55
Custo combinado por 1M de tokens US$ 7,17 US$ 7,70

No GPT-6 Astra o índice varia por nível de esforço: 55 no max, 54 no xhigh, 53 no high, 52 no medium e 49 no low

E o que é esse índice, afinal? O Artificial Analysis Intelligence Index na versão v4.2 é um composto de dez avaliações (AA-Briefcase, GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity’s Last Exam, GDP.pdf, CritPt, AA-Omniscience e AA-LCR v1.1)

Ou seja: é uma média de coisas variadas, e nenhuma delas é o seu repositório 😀

Agora a ressalva que mais importa pro seu bolso: o Artificial Analysis mediu que os cinco níveis de esforço do Fable 5.1 variam 11 vezes no consumo de tokens de saída, de 13,1M no esforço baixo a 143,7M no máximo

E mediu também que o Fable 5.1 sai 20% mais caro por tarefa que o Fable 5, apesar da leitura de cache mais barata

Por isso a conta real depende da sua bateria: preço de tabela empatado não significa fatura empatada

Quando o teste pareado vale a pena (e o que ele não resolve)

O método compensa em situações bem específicas, e nelas ele paga o tempo investido:

  • Escolher o modelo padrão do time, pra parar a discussão de gosto pessoal na daily
  • Justificar custo pra quem paga a conta, com tempo, tokens e nota por tarefa na mão
  • Decidir o nível de esforço por tipo de tarefa, porque bug pequeno raramente precisa de raciocínio máximo
  • Avaliar se vale o batch no trabalho não interativo, já que a tarifa cai pela metade dos dois lados
  • Preparar um rollout gradual em produção, usando a bateria como porta de entrada antes de virar a chave pra todo mundo

Agora, o que a rubrica NÃO resolve

Restrição de política não aparece na sua nota de legibilidade de diff

A versão pública do GPT-6 Astra recusa tarefas ofensivas avançadas de cibersegurança, tipo gerar exploits de prova de conceito, e a OpenAI afirma que vai afrouxar essas restrições para defensores verificados por meio do programa OpenAI Daybreak nas próximas semanas

E tem o contexto maior: o Astra é o primeiro modelo da OpenAI a atingir o nível Crítico de capacidade em cibersegurança no Preparedness Framework

Isso não é item de rubrica, é decisão de contexto de uso

Se o seu trabalho encosta nesse tipo de tarefa, testa isso separado, antes de fechar qualquer escolha

Conclusão: sua bateria vale mais que qualquer ranking

Na discussão Fable 5.1 vs GPT-6 Astra, o dado que decide é o que sai do SEU repositório

Mesmo prompt, mesmo commit base, critério fixo escrito antes, tudo anotado

Benchmark público entra como contexto pra calibrar custo, e só

Próximo passo prático, dá pra fazer hoje: escolhe 4 tarefas reais, congela o commit, roda o primeiro round nos dois modelos e guarda tempo, custo e nota numa planilha

Guarda mesmo, porque modelo novo aparece toda hora, e quando aparecer você roda a mesma bateria de novo em vez de recomeçar a discussão do zero

Aí sim a escolha para de ser achismo…

até o próximo post!

Perguntas frequentes

Fable 5.1 e GPT-6 Astra custam a mesma coisa na API?

Sim, no preço de tabela os dois cobram US$ 10 por milhão de tokens de entrada e US$ 50 por milhão de saída. A diferença aparece em cache: o Fable 5.1 lê cache a US$ 0,25 por milhão (75% mais barato que o Fable 5), enquanto o Astra cobra US$ 1 de entrada em cache e US$ 12,50 de escrita de cache no tier padrão.

Como saber se o GPT-6 Astra está liberado no meu workspace antes de montar o teste?

Em workspace Enterprise, o acesso ao GPT-6 Astra vem desligado por padrão desde o lançamento. O administrador do workspace precisa habilitar manualmente, então confirme isso antes de agendar a bateria, senão o round trava no meio.

Preciso trocar de plano Claude pra testar o Fable 5.1?

Não precisa trocar de plano, mas precisa entender a cota. No plano Pro os modelos Fable já funcionam com créditos de uso pay-as-you-go desde o início, porque não entram nos limites do plano. No Max, ao bater 50% dos limites semanais em modelos Fable, você segue com créditos de uso ou troca para outro modelo Claude.

Dá pra trocar entre Fable 5.1 e GPT-6 Astra sem sair do terminal?

Dá sim. No Claude Code, o comando /model abre o seletor (dá pra passar direto com /model fable) ou você já inicia com a flag claude –model. No Codex, é codex -m gpt-6-astra pra iniciar, /model pra trocar no meio da sessão e codex exec –model gpt-6-astra pra rodar sem interação. Os identificadores completos, tipo claude-fable-5-1 e gpt-6-astra, são o que vai na chamada de API e na configuração das plataformas.

O Fable 5.1 é o mesmo modelo do Mythos 5.1?

Os dois foram lançados juntos pela Anthropic e o Mythos 5.1 (claude-mythos-5-1) compartilha o mesmo modelo base do Fable 5.1. Pra efeito de teste pareado contra o GPT-6 Astra, o que importa comparar é o Fable 5.1 mesmo, já que é ele que tem o identificador claude-fable-5-1 nas plataformas.

Por que o Fable 5.1 saiu mais caro por tarefa se a leitura de cache ficou mais barata?

Segundo a medição pública do Artificial Analysis, o corte de 75% no cache não compensa o consumo de tokens de saída em esforço alto: os cinco níveis de esforço do Fable 5.1 variam 11 vezes na saída, de 13,1 milhões de tokens no esforço baixo a 143,7 milhões no máximo, e o custo por tarefa ficou 20% maior que no Fable 5. Isso é medição de terceiro, serve como contexto pra calibrar a sua conta, não como veredito sobre o seu repositório.




Escrito por | Matheus Battisti

Matheus Battisti
Fundador da Hora de Codar

Programador apaixonado pelo mundo das tecnologias, sempre buscando em aprender e se aprofundar em linguagens, frameworks e o que mais for necessário para executar um bom trabalho. Agora tem uma nova missão que é de passar seu conhecimento adiante para formar novos programadores e especializar mais os que já são.

Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted

Formações

Formação Vibe Coding

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

Blog | Mais populares