Benchmark da OpenAI ou ranking independente: em qual confiar para avaliar o GPT-6 Astra?

Saiu benchmark do GPT-6 Astra por todo lado e os números não batem: a OpenAI anuncia 100% no ExploitBench e 98% no FrontierMath Tier 4, enquanto o Artificial Analysis, avaliador independente, dá 61 no Intelligence Index, a mesma nota do GPT-5.6 Sol e atrás do Claude Fable 5.1 (max), com 66
Nenhum dos dois está mentindo, eles respondem perguntas diferentes
Aqui você vê os dois conjuntos lado a lado e as perguntas que separam número útil de número decorativo: qual harness rodou, qual nível de esforço, o que entra na média e quanto custou pra chegar lá
Fala aí, beleza? A OpenAI apresentou o GPT-6 Astra com 100% no ExploitBench, e o avaliador independente colocou esse mesmo modelo empatado com o antecessor no índice geral de inteligência
Dois números, o mesmo modelo, a mesma semana
O anúncio saiu em 3 de setembro de 2026, com rollout em fases: primeiro um conjunto restrito de organizações, depois o resto do mundo
E aí começa a chuva de print de gráfico no seu feed
Esse post não é sobre qual dos números é o verdadeiro
É sobre COMO julgar a fonte antes de sair repetindo o valor por aí 😀
O que a OpenAI anunciou no GPT-6 Astra:
O anúncio oficial do GPT-6 Astra é de 3 de setembro de 2026
A empresa apresenta o modelo como o mais inteligente e alinhado do mundo
Guarde essa frase: ela é da OpenAI, não é resultado de terceiro
O acesso não abriu pra todo mundo de uma vez
O rollout foi escalonado: primeiro organizações do programa de cibersegurança, depois planos pagos e API, chegando ao longo dos dias seguintes ao ChatGPT Plus, Pro, Business e Enterprise
Formação Claude Code
Domine Claude Code do absoluto zero até o avançado
- 114 aulas
- 4 projetos
- 9h 18min
Na API da OpenAI, o preço é US$ 10 por milhão de tokens de entrada e US$ 50 por milhão de tokens de saída
Isso é 2,5x o GPT-5.6 Sol, que estava em US$ 4 / US$ 20
Esse mesmo preço aparece confirmado na página viva do modelo no Artificial Analysis, US$ 10,00 de input e US$ 50,00 de output na versão max
Repara no detalhe: preço é um dado que bate nas duas fontes
Quando fabricante e avaliador independente dizem a mesma coisa, você pode seguir a vida tranquilo
O barulho começa quando eles medem coisas diferentes e chamam tudo de benchmark
Se o custo da API é o que vai pesar aí na sua equipe, vale entender antes a diferença entre contratar por assinatura ou pela API, porque a conta muda bastante de forma
Os números da OpenAI e os do avaliador independente, lado a lado:
A tabela abaixo separa cada número por quem mediu
Essa é a leitura que importa, mais do que o valor em si
| Benchmark | Número do GPT-6 Astra | Quem mediu | O que esse número prova |
|---|---|---|---|
| ExploitBench | 100%, contra 78,5% do GPT-5.6 Sol | OpenAI | Capacidade específica em segurança ofensiva, na régua escolhida pela própria empresa |
| OSWorld 2.0 (simulação de latência) | 72,6% em cerca de 40 min por tarefa, contra 65,7% em cerca de 75 min do GPT-5.6 Sol | OpenAI | Que o modelo resolve mais tarefa de computador e em menos tempo que o antecessor, no cenário montado pela empresa |
| FrontierMath Tier 4 | 98%, descrito pela própria OpenAI como saturação do benchmark | OpenAI | Que esse teste chegou perto do teto e para de diferenciar modelo daqui pra frente |
| Artificial Analysis Intelligence Index | 61 (max), mesma pontuação do GPT-5.6 Sol (max), atrás do Claude Fable 5.1 (max) com 66 | Artificial Analysis | Onde o modelo cai numa média padronizada, comparado com concorrentes na mesma régua |
| Coding Agent Index | 67, empate aproximado com Claude Opus 5, Fable 5 no Claude Code e Muse Spark 1.3 no Muse Code, com Fable 5.1 no Claude Code liderando em 70 | Artificial Analysis | Como ele se sai em tarefa de agente de código, que é bem diferente de responder pergunta solta |
| AA-Omniscience (alucinação) | Taxa cai de 92% para 51% no esforço max | Artificial Analysis | Ganho real em resposta inventada, medido por quem não vende o modelo |
| Custo por tarefa | 75% mais caro que o GPT-5.6 Sol no esforço max | Artificial Analysis | Que ele fica atrás do antecessor na fronteira inteligência versus custo por tarefa |
| Eficiência de tokens | Um terço dos tokens do GPT-5.6 Sol (max) no harness Codex e um quinto do Claude Opus 5 (xhigh) | Artificial Analysis | Que ele fala menos pra fazer a mesma coisa, o que muda sua conta mesmo com token mais caro |
Deu pra sentir a diferença de perguntas?
A OpenAI mostra teto de capacidade
O Artificial Analysis mostra posição relativa e preço da brincadeira
As perguntas que revelam a qualidade de um benchmark:
Essa é a parte que eu queria que todo mundo levasse pra vida, não só pro Astra
São seis perguntas, e cada uma tem um exemplo real desse lançamento
Qual harness rodou o teste?
Harness é o "chão" onde o modelo pisa durante o teste: como ele recebe o problema, o que ele consegue guardar, o que ele pode reusar entre uma chamada e outra
E isso muda MUITO o resultado
O ARC Prize publicou o Astra no ARC-AGI-3 Semi-Private com dois harnesses diferentes
Com o harness Standard: 62,7%, por cerca de US$ 26 mil
Com o harness Provider Adapter: 99,9%, por cerca de US$ 19 mil
Mesmo modelo, mesmo teste, e uma distância enorme entre os dois
A diferença operacional é o que explica: o Standard permite ao modelo carregar notas que ele mesmo escolhe manter no ambiente, enquanto o Provider Adapter preserva estado opaco de raciocínio entre requisições e usa compactação em conversas longas, o que deixa ele reaproveitar trabalho anterior
Aí quando alguém te mostra só o 99,9%, você já sabe qual pergunta fazer 😉
Ainda nesse teste, com o Provider Adapter, o Astra usou menos ações que a linha de base humana em 96,0% dos níveis, e 51,7% menos ações por nível na média
Número bonito, mas continua colado no harness que o produziu
Qual nível de esforço estava configurado?
Modelo de raciocínio tem regulagem, e a nota anda junto com ela
No Artificial Analysis, a pontuação do Astra no Intelligence Index varia por nível de esforço:
- max: 61
- xhigh: 61
- high: 60
- medium: 59
- low: 57
- versão sem raciocínio: 55
São 6 pontos de diferença entre o topo e a versão sem raciocínio
Se o print que você viu não diz qual esforço rodou, o print está incompleto
O que entra na média do índice?
Índice é média, e média esconde coisa
O Artificial Analysis Intelligence Index v4.1.1 é composto por 9 avaliações: GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity’s Last Exam, GPQA Diamond, CritPt, AA-Omniscience e AA-LCR
Se o seu trabalho é terminal e código, duas dessas pesam pra você e as outras sete diluem o sinal
Por isso um modelo pode empatar na média geral e ainda ser a melhor escolha pro SEU caso
Quanto custou pra chegar naquele número?
Pontuação sem custo do lado é só metade da informação
Segundo o avaliador independente, o Astra sai 75% mais caro por tarefa que o GPT-5.6 Sol no esforço max, ficando atrás do antecessor na fronteira de inteligência versus custo por tarefa
Ou seja: a nota empatou, a conta subiu
Esse é exatamente o tipo de dado que a página do fabricante não tem obrigação nenhuma de te mostrar
Alguém pode pagar pra aparecer bem?
Pergunta chata, pergunta necessária
O Artificial Analysis é uma organização de benchmarking independente, sem afiliação a provedores, e roda as avaliações com metodologia própria padronizada
No FAQ de metodologia deles está escrito que provedores não podem pagar por resultados, por mudanças de metodologia nem por listagem no site
Procure esse tipo de declaração antes de tratar um ranking como neutro
Se o site não fala sobre isso, você já tem sua resposta
Existe verificação de terceiro?
Tem um passo além do avaliador independente: alguém checando o avaliador
O ARC Prize mantém o ARC Prize Verified, um programa que soma verificação certificada de pontuação e um painel acadêmico terceiro pra auditar e abrir o processo de teste
É o nível mais alto de confiança que dá pra pedir hoje de um número de benchmark
Quando existir, é nele que você se apoia
Como usar as duas fontes na hora de escolher o modelo:
A regra prática é simples
O número do fabricante te diz o que o modelo CONSEGUE no melhor cenário e em capacidade específica
O número do avaliador independente te diz como ele se compara com as alternativas na mesma régua, e quanto custa cada tarefa
Aí vai por caso de uso:
Se o seu dia é agente de código, o que importa é o Coding Agent Index, onde o Astra marca 67 e o topo está em 70 com o Fable 5.1 rodando no Claude Code
Empate técnico com Claude Opus 5, Fable 5 no Claude Code e Muse Spark 1.3 no Muse Code, então aqui a decisão volta pra preço, ferramenta e fluxo, não pro gráfico
Se o que te incomoda é resposta inventada com cara de certeza, olhe a queda de alucinação no AA-Omniscience, de 92% para 51% no esforço max
Esse é um dos ganhos mais concretos medidos por terceiro nesse lançamento
E se é você quem paga a conta, os números são US$ 10 / US$ 50 por milhão de tokens e o custo por tarefa 75% maior que o antecessor no max
Com um contrapeso: o Astra usa um terço dos tokens do GPT-5.6 Sol (max) no harness Codex e um quinto do Claude Opus 5 (xhigh), então token mais caro não significa automaticamente fatura maior
Antes de mandar isso pra frente, vale checar os pontos práticos de pagar ferramenta de IA pela empresa, porque a parte burocrática costuma travar mais que a técnica
Pra fechar a leitura, o Simon Willison publicou uma avaliação independente do Astra que resume bem o clima: concorrente do Fable com resultados mistos, forte em ARC-AGI e segurança, abaixo do Fable em métricas gerais de inteligência
Misto não é ruim
Misto é o que acontece quando você para de olhar um número só
Vídeo: agentes de IA na prática
Número de benchmark é uma coisa
Comportamento do modelo dentro de um fluxo real de agentes é outra bem diferente
Pra começar do zero nesse assunto, esse vídeo do canal mostra a montagem de uma empresa inteira de agentes de IA com Paperclip + Claude Code
Conclusão
Nenhuma das duas fontes é mentira
A OpenAI mede teto de capacidade em testes que ela escolheu, e isso tem valor: 100% no ExploitBench e 98% no FrontierMath Tier 4 dizem alguma coisa real sobre o modelo
O avaliador independente mede posição relativa e preço: 61 no Intelligence Index, empatado com o antecessor e atrás do Fable 5.1 (max) com 66
São perguntas diferentes, com respostas diferentes, e as duas cabem na mesma cabeça
O que melhora de verdade a sua decisão é a rotina de perguntar harness, nível de esforço, composição do índice e custo por tarefa ANTES de repetir o número
Próximo passo prático: abra a página viva do modelo no Artificial Analysis, compare com o material do fabricante, e só então decida se troca o modelo do seu fluxo
Leva uns cinco minutos e evita muita troca precipitada… 🙂
até o próximo post!
Perguntas frequentes
GPT-6 Astra é mais inteligente que o Claude Fable 5.1?
Segundo o Artificial Analysis Intelligence Index, não: o Claude Fable 5.1 (max) lidera com 66 pontos, contra 61 do GPT-6 Astra (max). O Astra fica empatado com seu próprio antecessor, o GPT-5.6 Sol (max), que também marca 61 nesse índice independente.
Quanto custa usar o GPT-6 Astra na API da OpenAI?
US$ 10 por milhão de tokens de entrada e US$ 50 por milhão de tokens de saída, valor confirmado também na página do modelo no Artificial Analysis. Isso é 2,5x o preço do GPT-5.6 Sol, que custava US$ 4 de entrada e US$ 20 de saída.
O GPT-6 Astra já está disponível para todo mundo?
Não de imediato. O rollout anunciado em 3 de setembro de 2026 foi escalonado: primeiro organizações do programa de cibersegurança, depois planos pagos e API, chegando ao longo dos dias seguintes ao ChatGPT Plus, Pro, Business e Enterprise.
O que é o Artificial Analysis e por que ele é citado como fonte independente?
É uma organização de benchmarking sem afiliação a provedores de IA, que roda suas próprias avaliações com metodologia padronizada. Segundo o FAQ da própria organização, provedores não podem pagar por resultado, por mudança de metodologia nem por listagem no site.
O GPT-6 Astra alucina menos que o GPT-5.6 Sol?
Sim, segundo o avaliador independente. No AA-Omniscience, a taxa de alucinação cai de 92% para 51% no esforço max, um ganho real medido fora da própria OpenAI.
O GPT-6 Astra vale a pena para tarefas de código?
No Coding Agent Index do Artificial Analysis, o Astra marca 67, aproximadamente empatado com Claude Opus 5, Fable 5 no Claude Code e Muse Spark 1.3 no Muse Code, atrás do Fable 5.1 no Claude Code, que lidera com 70. Por outro lado, ele é bem econômico em tokens: usa um terço dos tokens do GPT-5.6 Sol (max) no harness Codex e um quinto dos tokens do Claude Opus 5 (xhigh).
Formações
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
Blog | Mais populares
Contaminação de benchmark: o modelo já viu a prova antes do teste?
Contaminação de benchmark explica por que rankings de IA podem enganar: dados de teste vazam no treino e inflam a nota. Veja os 4 níveis e casos reais.
O que significa “ChatGPT network error” e como resolver
O “ChatGPT Network Error” é uma ocorrência frequente na rotina de muitos usuários do ChatGPT. Porém, poucos compreendem seu significado, quando esse erro surge, etc. […]
