Fable 5.1 vs GPT-6 Astra: como montar um teste pareado com as tarefas do seu projeto

Fable 5.1 vs GPT-6 Astra é o tipo de comparação que ninguém deveria fechar por impressão, ainda mais porque os dois têm o mesmo preço de tabela: US$ 10 por milhão de entrada e US$ 50 de saída. O caminho honesto é montar uma bateria pequena com tarefas reais do seu repositório, congelar o commit base, escrever o prompt uma vez só e reusar literalmente nos dois lados, com rubrica definida antes de rodar. Aqui você vê o passo a passo, os comandos de troca de modelo no Claude Code e no Codex, e os números públicos que servem de contexto, não de veredito
Fala aí, beleza? A OpenAI liberou o GPT-6 Astra em 3 de setembro de 2026, primeiro como preview limitado para parceiros e no dia seguinte em versão restrita para usuários pagos, e do outro lado a Anthropic tem o Claude Fable 5.1 rodando firme, lançado junto com o Claude Mythos 5.1
Aí vem a pergunta óbvia: qual dos dois é melhor pro seu projeto?
E a resposta honesta é que ninguém de fora sabe isso
Repara num detalhe que muda o jogo: os dois custam exatamente o mesmo de tabela, US$ 10 por milhão de tokens de entrada e US$ 50 por milhão de saída
Quando o preço empata, o desempate não pode vir de print de benchmark de terceiro nem de thread empolgada
Ele tem que vir das SUAS tarefas
Então bora montar isso direito: bateria pequena, mesmo prompt nos dois lados, critério fixo escrito antes de rodar
O que você precisa antes de começar o teste pareado:
Antes de sair rodando prompt, garanta os dois acessos, senão você testa um lado só e chama de comparação 🙂
O Claude Fable 5.1 está disponível na Claude API, na Amazon Web Services, no Google Cloud e no Microsoft Foundry, além dos planos Pro, Max, Team e Enterprise do Claude
O GPT-6 Astra está no ChatGPT Plus, Pro, Business e Enterprise, na API da OpenAI, no Microsoft Foundry (Azure) e no AWS Bedrock
Formação Claude Code
Domine Claude Code do absoluto zero até o avançado
- 120 aulas
- 4 projetos
- 9h 45min
Os bloqueios que aparecem antes do primeiro round:
Tome cuidado com esses três, porque eles travam o teste no pior momento (no meio dele):
- Em workspace Enterprise, o acesso ao GPT-6 Astra vem desligado por padrão: o administrador do workspace precisa habilitar manualmente
- No plano Pro do Claude, os modelos Fable funcionam com créditos de uso pay-as-you-go desde o início, porque não estão inclusos nos limites do plano
- No plano Max, ao atingir 50% dos limites semanais em modelos Fable, é preciso continuar com créditos de uso ou trocar para outro modelo Claude
Os identificadores de modelo:
Anota esses nomes, porque é o que vai na chamada de API e na configuração das plataformas:
claude-fable-5-1na Claude API, no Google Cloud e no Microsoft Foundryanthropic.claude-fable-5-1no Amazon Bedrockgpt-6-astrana API da OpenAI
Um detalhe pra não confundir na hora de escolher: o Mythos 5.1 (claude-mythos-5-1) saiu junto com o Fable 5.1 e compartilha o mesmo modelo base, mas quem entra no teste pareado aqui é o Fable 5.1
E mais duas coisas bem sem graça, porém essenciais: repositório em git limpo (nada de arquivo solto no working tree) e uma planilha ou arquivo de anotação pra registrar cada rodada
Se você não anotar na hora, no terceiro round vira memória afetiva, não dado
Passo a passo: montando a bateria de tarefas pareadas
A lógica é a mesma de um experimento controlado: só uma variável muda, que é o modelo
Tudo o resto fica congelado
- Escolha de 4 a 6 tarefas reais do seu repositório e congele o commit base. Nada de tarefa inventada de tutorial: pega um bug de verdade, um refactor, uma feature pequena e uma leitura de código legado. O erro comum deste passo é escolher só tarefa fácil, aí os dois modelos acertam tudo e você não desempata nada
- Escreva o prompt UMA vez e reuse literalmente nos dois lados. Detalha o que você espera (padrão do projeto, arquivos que pode tocar, o que não pode quebrar) e salva esse texto num arquivo. O erro comum aqui é o mais traiçoeiro de todos: você roda no primeiro modelo, vê que faltou contexto, melhora o prompt e roda o segundo com a versão boa. Pronto, contaminou a comparação
- Defina a rubrica ANTES de rodar. Critério fixo, cinco itens que dá pra marcar sem discussão: compila e roda, resolve o que foi pedido, respeita o padrão do projeto, quantidade de idas e voltas até chegar lá, legibilidade do diff. O erro comum é criar o critério depois de ver o resultado, e aí você só está justificando a sua preferência
- Rode cada round isolado, trocando o modelo pelo comando da própria ferramenta. No Claude Code,
/modelabre o seletor, e dá pra passar o modelo direto:
# dentro da sessão do Claude Code
/model
/model fable
Repara que esse /model fable é o atalho do próprio seletor do Claude Code, não o identificador completo da API: os nomes da lista lá de cima valem pra chamada de API e pra configuração nas plataformas
Também dá pra iniciar já apontando o modelo com a flag claude --model
Do lado do Codex, os três caminhos são estes:
# inicia a sessão já no modelo
codex -m gpt-6-astra
# troca no meio da sessão interativa
/model
# execução não interativa
codex exec --model gpt-6-astra
Um ponto que pega gente desatenta: no Claude Code o modelo escolhido fica salvo nas configurações do usuário e vale para as próximas sessões. Já me ferrei com esse tipo de coisa: você acha que voltou pro padrão, mas continua no modelo do round anterior
- Resete o estado entre as rodadas. Antes de cada round, volta pro commit base e limpa o que sobrou:
git reset --hard <commit-base>
git clean -fd
O erro comum deste passo é deixar arquivo do round anterior no disco, aí o segundo modelo "resolve" um problema que já estava resolvido e você acha que ele foi mais rápido
- Registre tempo de parede, custo e nível de esforço usado. Cronômetro na mão mesmo, e anota o nível de raciocínio que você deixou ligado em cada lado. Se você mudar o esforço no meio da bateria, mude nos DOIS, senão a comparação morre ali
- Feche a nota por tarefa antes de olhar o agregado. Nota tarefa por tarefa, sem olhar o placar geral. Depois você soma. O erro comum é olhar o total no meio e começar a puxar a sardinha pro modelo que você já gostava
O que aprendi rodando essa bateria na prática
Esse método não saiu da minha cabeça em teoria, ele saiu de um teste que eu gravei com a geração anterior desses modelos (GPT-5.6 Sol de um lado, Fable 5 do outro)
Ou seja: os números abaixo são daquela bateria, não valem como veredito sobre Fable 5.1 nem sobre o Astra
O que vale aqui é o MÉTODO, e as ciladas que eu levei na cara
Quando testei, montei tudo pareado: mesmo projeto, mesmos prompts, mesmas configurações sempre que possível, cada modelo rodando no software oficial da própria empresa
Deixei os dois no nível máximo de raciocínio disponível em cada um, e até deixei de ligar um recurso extra de entrega rápida que existia só de um lado, justamente porque o outro não tinha equivalente
Eram 4 rounds planejados, e entre as dimensões avaliadas estavam design (landing page), autenticação e sistema base, e integração com IA pra processar dados
O projeto era único e concreto: um sistema que recebe feedback de clientes, entende reclamações e sugere soluções
E aí a realidade bateu:
- O GPT fechou o round da landing page em 11 minutos
- Do outro lado, quando fui checar o andamento no Claude, o cronômetro estava em 12 minutos rodando, e aquele mesmo round acabou passando de 20 minutos sem entregar
- A cota caiu de 100% para 83% em UM round só, com 3 resets ainda disponíveis
- A porta 3000 já estava ocupada por outro projeto na minha máquina, e o round travou por causa disso
Vi também um dos modelos rodando 2 subagentes em paralelo enquanto o outro ainda estava pensando, e um dos lados mostra lista de tarefas com o que falta enquanto o outro só diz o que está fazendo (isso atrapalha MUITO acompanhar o progresso)
Teve tropeço bobo de execução também, comando errado na hora de montar a estrutura de pastas
No meio do vídeo eu precisei baixar o nível de raciocínio dos dois pra conseguir terminar a bateria em tempo viável, e baixei nos dois, simétrico
Inclusive é a conclusão que eu levo pro dia a dia: raciocínio máximo nem sempre compensa. Costumo usar o nível alto, às vezes o extra alto, porque entrega mais rápido, com qualidade que eu não vejo cair e com consumo menor
Vira lição de método, então: cronometre cada round, cheque a cota antes e depois e libere a porta antes de subir o projeto
Senão você confunde falha de ambiente com falha de modelo, e joga fora um round inteiro
Os números públicos dos dois modelos (use como contexto, não como veredito)
Esses dados servem pra você calibrar a conta ANTES de rodar a bateria, não pra decidir no lugar dela
| Item | Claude Fable 5.1 | GPT-6 Astra |
|---|---|---|
| Entrada (por 1M tokens) | US$ 10 | US$ 10 |
| Saída (por 1M tokens) | US$ 50 | US$ 50 |
| Leitura de cache | US$ 0,25 (queda de 75%) | US$ 1 |
| Escrita de cache | não coberto neste post | US$ 12,50 |
| Batch | US$ 5 entrada / US$ 25 saída | metade da tarifa padrão |
| Outros modos | não coberto neste post | flex pela metade, fast pelo dobro |
| Acima de 272K de entrada | não coberto neste post | requisição inteira a US$ 20 / US$ 2 / US$ 25 / US$ 75 |
| Intelligence Index (esforço máximo) | 57 | 55 |
| Custo combinado por 1M de tokens | US$ 7,17 | US$ 7,70 |
No GPT-6 Astra o índice varia por nível de esforço: 55 no max, 54 no xhigh, 53 no high, 52 no medium e 49 no low
E o que é esse índice, afinal? O Artificial Analysis Intelligence Index na versão v4.2 é um composto de dez avaliações (AA-Briefcase, GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity’s Last Exam, GDP.pdf, CritPt, AA-Omniscience e AA-LCR v1.1)
Ou seja: é uma média de coisas variadas, e nenhuma delas é o seu repositório 😀
Agora a ressalva que mais importa pro seu bolso: o Artificial Analysis mediu que os cinco níveis de esforço do Fable 5.1 variam 11 vezes no consumo de tokens de saída, de 13,1M no esforço baixo a 143,7M no máximo
E mediu também que o Fable 5.1 sai 20% mais caro por tarefa que o Fable 5, apesar da leitura de cache mais barata
Por isso a conta real depende da sua bateria: preço de tabela empatado não significa fatura empatada
Quando o teste pareado vale a pena (e o que ele não resolve)
O método compensa em situações bem específicas, e nelas ele paga o tempo investido:
- Escolher o modelo padrão do time, pra parar a discussão de gosto pessoal na daily
- Justificar custo pra quem paga a conta, com tempo, tokens e nota por tarefa na mão
- Decidir o nível de esforço por tipo de tarefa, porque bug pequeno raramente precisa de raciocínio máximo
- Avaliar se vale o batch no trabalho não interativo, já que a tarifa cai pela metade dos dois lados
- Preparar um rollout gradual em produção, usando a bateria como porta de entrada antes de virar a chave pra todo mundo
Agora, o que a rubrica NÃO resolve
Restrição de política não aparece na sua nota de legibilidade de diff
A versão pública do GPT-6 Astra recusa tarefas ofensivas avançadas de cibersegurança, tipo gerar exploits de prova de conceito, e a OpenAI afirma que vai afrouxar essas restrições para defensores verificados por meio do programa OpenAI Daybreak nas próximas semanas
E tem o contexto maior: o Astra é o primeiro modelo da OpenAI a atingir o nível Crítico de capacidade em cibersegurança no Preparedness Framework
Isso não é item de rubrica, é decisão de contexto de uso
Se o seu trabalho encosta nesse tipo de tarefa, testa isso separado, antes de fechar qualquer escolha
Conclusão: sua bateria vale mais que qualquer ranking
Na discussão Fable 5.1 vs GPT-6 Astra, o dado que decide é o que sai do SEU repositório
Mesmo prompt, mesmo commit base, critério fixo escrito antes, tudo anotado
Benchmark público entra como contexto pra calibrar custo, e só
Próximo passo prático, dá pra fazer hoje: escolhe 4 tarefas reais, congela o commit, roda o primeiro round nos dois modelos e guarda tempo, custo e nota numa planilha
Guarda mesmo, porque modelo novo aparece toda hora, e quando aparecer você roda a mesma bateria de novo em vez de recomeçar a discussão do zero
Aí sim a escolha para de ser achismo…
até o próximo post!
Perguntas frequentes
Fable 5.1 e GPT-6 Astra custam a mesma coisa na API?
Sim, no preço de tabela os dois cobram US$ 10 por milhão de tokens de entrada e US$ 50 por milhão de saída. A diferença aparece em cache: o Fable 5.1 lê cache a US$ 0,25 por milhão (75% mais barato que o Fable 5), enquanto o Astra cobra US$ 1 de entrada em cache e US$ 12,50 de escrita de cache no tier padrão.
Como saber se o GPT-6 Astra está liberado no meu workspace antes de montar o teste?
Em workspace Enterprise, o acesso ao GPT-6 Astra vem desligado por padrão desde o lançamento. O administrador do workspace precisa habilitar manualmente, então confirme isso antes de agendar a bateria, senão o round trava no meio.
Preciso trocar de plano Claude pra testar o Fable 5.1?
Não precisa trocar de plano, mas precisa entender a cota. No plano Pro os modelos Fable já funcionam com créditos de uso pay-as-you-go desde o início, porque não entram nos limites do plano. No Max, ao bater 50% dos limites semanais em modelos Fable, você segue com créditos de uso ou troca para outro modelo Claude.
Dá pra trocar entre Fable 5.1 e GPT-6 Astra sem sair do terminal?
Dá sim. No Claude Code, o comando /model abre o seletor (dá pra passar direto com /model fable) ou você já inicia com a flag claude –model. No Codex, é codex -m gpt-6-astra pra iniciar, /model pra trocar no meio da sessão e codex exec –model gpt-6-astra pra rodar sem interação. Os identificadores completos, tipo claude-fable-5-1 e gpt-6-astra, são o que vai na chamada de API e na configuração das plataformas.
O Fable 5.1 é o mesmo modelo do Mythos 5.1?
Os dois foram lançados juntos pela Anthropic e o Mythos 5.1 (claude-mythos-5-1) compartilha o mesmo modelo base do Fable 5.1. Pra efeito de teste pareado contra o GPT-6 Astra, o que importa comparar é o Fable 5.1 mesmo, já que é ele que tem o identificador claude-fable-5-1 nas plataformas.
Por que o Fable 5.1 saiu mais caro por tarefa se a leitura de cache ficou mais barata?
Segundo a medição pública do Artificial Analysis, o corte de 75% no cache não compensa o consumo de tokens de saída em esforço alto: os cinco níveis de esforço do Fable 5.1 variam 11 vezes na saída, de 13,1 milhões de tokens no esforço baixo a 143,7 milhões no máximo, e o custo por tarefa ficou 20% maior que no Fable 5. Isso é medição de terceiro, serve como contexto pra calibrar a sua conta, não como veredito sobre o seu repositório.
Formações
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
Blog | Mais populares
Vale a pena manter Fable 5.1 e GPT-6 Astra ao mesmo tempo ou escolher um só?
Fable 5.1 ou GPT-6 Astra: no preço empatam, mas cache, batch, modo Fast e sobretaxa mudam a conta real. Veja se vale manter os dois ou escolher só um.
Claude Fable 5 tem 1 milhão de tokens de contexto: o que cabe nessa janela?
Claude Fable 5 1 milhão de tokens: veja o que cabe na janela de contexto, os limites de saída e como acompanhar o uso no Claude Code com /context.
Fable 5.1 ou GPT-6 Astra: qual deles está disponível na ferramenta que você já usa?
Fable 5.1 ou GPT-6 Astra: veja qual já está liberado no Claude Code, Codex e Copilot, preço de API e versão mínima do CLI antes de decidir.
