Benchmark da OpenAI ou ranking independente: em qual confiar para avaliar o GPT-6 Astra?

comparação do benchmark do GPT-6 Astra entre a OpenAI e o ranking independente Artificial Analysis
Resposta rápida

Saiu benchmark do GPT-6 Astra por todo lado e os números não batem: a OpenAI anuncia 100% no ExploitBench e 98% no FrontierMath Tier 4, enquanto o Artificial Analysis, avaliador independente, dá 61 no Intelligence Index, a mesma nota do GPT-5.6 Sol e atrás do Claude Fable 5.1 (max), com 66

Nenhum dos dois está mentindo, eles respondem perguntas diferentes

Aqui você vê os dois conjuntos lado a lado e as perguntas que separam número útil de número decorativo: qual harness rodou, qual nível de esforço, o que entra na média e quanto custou pra chegar lá

Fala aí, beleza? A OpenAI apresentou o GPT-6 Astra com 100% no ExploitBench, e o avaliador independente colocou esse mesmo modelo empatado com o antecessor no índice geral de inteligência

Dois números, o mesmo modelo, a mesma semana

O anúncio saiu em 3 de setembro de 2026, com rollout em fases: primeiro um conjunto restrito de organizações, depois o resto do mundo

E aí começa a chuva de print de gráfico no seu feed

Esse post não é sobre qual dos números é o verdadeiro

É sobre COMO julgar a fonte antes de sair repetindo o valor por aí 😀

O que a OpenAI anunciou no GPT-6 Astra:

O anúncio oficial do GPT-6 Astra é de 3 de setembro de 2026

A empresa apresenta o modelo como o mais inteligente e alinhado do mundo

Guarde essa frase: ela é da OpenAI, não é resultado de terceiro

O acesso não abriu pra todo mundo de uma vez

O rollout foi escalonado: primeiro organizações do programa de cibersegurança, depois planos pagos e API, chegando ao longo dos dias seguintes ao ChatGPT Plus, Pro, Business e Enterprise

Formação Claude Code
Formação Recomendada

Formação Claude Code

Domine Claude Code do absoluto zero até o avançado

  • 114 aulas
  • 4 projetos
  • 9h 18min

Na API da OpenAI, o preço é US$ 10 por milhão de tokens de entrada e US$ 50 por milhão de tokens de saída

Isso é 2,5x o GPT-5.6 Sol, que estava em US$ 4 / US$ 20

Esse mesmo preço aparece confirmado na página viva do modelo no Artificial Analysis, US$ 10,00 de input e US$ 50,00 de output na versão max

Repara no detalhe: preço é um dado que bate nas duas fontes

Quando fabricante e avaliador independente dizem a mesma coisa, você pode seguir a vida tranquilo

O barulho começa quando eles medem coisas diferentes e chamam tudo de benchmark

Se o custo da API é o que vai pesar aí na sua equipe, vale entender antes a diferença entre contratar por assinatura ou pela API, porque a conta muda bastante de forma

Os números da OpenAI e os do avaliador independente, lado a lado:

A tabela abaixo separa cada número por quem mediu

Essa é a leitura que importa, mais do que o valor em si

Benchmark Número do GPT-6 Astra Quem mediu O que esse número prova
ExploitBench 100%, contra 78,5% do GPT-5.6 Sol OpenAI Capacidade específica em segurança ofensiva, na régua escolhida pela própria empresa
OSWorld 2.0 (simulação de latência) 72,6% em cerca de 40 min por tarefa, contra 65,7% em cerca de 75 min do GPT-5.6 Sol OpenAI Que o modelo resolve mais tarefa de computador e em menos tempo que o antecessor, no cenário montado pela empresa
FrontierMath Tier 4 98%, descrito pela própria OpenAI como saturação do benchmark OpenAI Que esse teste chegou perto do teto e para de diferenciar modelo daqui pra frente
Artificial Analysis Intelligence Index 61 (max), mesma pontuação do GPT-5.6 Sol (max), atrás do Claude Fable 5.1 (max) com 66 Artificial Analysis Onde o modelo cai numa média padronizada, comparado com concorrentes na mesma régua
Coding Agent Index 67, empate aproximado com Claude Opus 5, Fable 5 no Claude Code e Muse Spark 1.3 no Muse Code, com Fable 5.1 no Claude Code liderando em 70 Artificial Analysis Como ele se sai em tarefa de agente de código, que é bem diferente de responder pergunta solta
AA-Omniscience (alucinação) Taxa cai de 92% para 51% no esforço max Artificial Analysis Ganho real em resposta inventada, medido por quem não vende o modelo
Custo por tarefa 75% mais caro que o GPT-5.6 Sol no esforço max Artificial Analysis Que ele fica atrás do antecessor na fronteira inteligência versus custo por tarefa
Eficiência de tokens Um terço dos tokens do GPT-5.6 Sol (max) no harness Codex e um quinto do Claude Opus 5 (xhigh) Artificial Analysis Que ele fala menos pra fazer a mesma coisa, o que muda sua conta mesmo com token mais caro

Deu pra sentir a diferença de perguntas?

A OpenAI mostra teto de capacidade

O Artificial Analysis mostra posição relativa e preço da brincadeira

As perguntas que revelam a qualidade de um benchmark:

Essa é a parte que eu queria que todo mundo levasse pra vida, não só pro Astra

São seis perguntas, e cada uma tem um exemplo real desse lançamento

Qual harness rodou o teste?

Harness é o "chão" onde o modelo pisa durante o teste: como ele recebe o problema, o que ele consegue guardar, o que ele pode reusar entre uma chamada e outra

E isso muda MUITO o resultado

O ARC Prize publicou o Astra no ARC-AGI-3 Semi-Private com dois harnesses diferentes

Com o harness Standard: 62,7%, por cerca de US$ 26 mil

Com o harness Provider Adapter: 99,9%, por cerca de US$ 19 mil

Mesmo modelo, mesmo teste, e uma distância enorme entre os dois

A diferença operacional é o que explica: o Standard permite ao modelo carregar notas que ele mesmo escolhe manter no ambiente, enquanto o Provider Adapter preserva estado opaco de raciocínio entre requisições e usa compactação em conversas longas, o que deixa ele reaproveitar trabalho anterior

Aí quando alguém te mostra só o 99,9%, você já sabe qual pergunta fazer 😉

Ainda nesse teste, com o Provider Adapter, o Astra usou menos ações que a linha de base humana em 96,0% dos níveis, e 51,7% menos ações por nível na média

Número bonito, mas continua colado no harness que o produziu

Qual nível de esforço estava configurado?

Modelo de raciocínio tem regulagem, e a nota anda junto com ela

No Artificial Analysis, a pontuação do Astra no Intelligence Index varia por nível de esforço:

  • max: 61
  • xhigh: 61
  • high: 60
  • medium: 59
  • low: 57
  • versão sem raciocínio: 55

São 6 pontos de diferença entre o topo e a versão sem raciocínio

Se o print que você viu não diz qual esforço rodou, o print está incompleto

O que entra na média do índice?

Índice é média, e média esconde coisa

O Artificial Analysis Intelligence Index v4.1.1 é composto por 9 avaliações: GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity’s Last Exam, GPQA Diamond, CritPt, AA-Omniscience e AA-LCR

Se o seu trabalho é terminal e código, duas dessas pesam pra você e as outras sete diluem o sinal

Por isso um modelo pode empatar na média geral e ainda ser a melhor escolha pro SEU caso

Quanto custou pra chegar naquele número?

Pontuação sem custo do lado é só metade da informação

Segundo o avaliador independente, o Astra sai 75% mais caro por tarefa que o GPT-5.6 Sol no esforço max, ficando atrás do antecessor na fronteira de inteligência versus custo por tarefa

Ou seja: a nota empatou, a conta subiu

Esse é exatamente o tipo de dado que a página do fabricante não tem obrigação nenhuma de te mostrar

Alguém pode pagar pra aparecer bem?

Pergunta chata, pergunta necessária

O Artificial Analysis é uma organização de benchmarking independente, sem afiliação a provedores, e roda as avaliações com metodologia própria padronizada

No FAQ de metodologia deles está escrito que provedores não podem pagar por resultados, por mudanças de metodologia nem por listagem no site

Procure esse tipo de declaração antes de tratar um ranking como neutro

Se o site não fala sobre isso, você já tem sua resposta

Existe verificação de terceiro?

Tem um passo além do avaliador independente: alguém checando o avaliador

O ARC Prize mantém o ARC Prize Verified, um programa que soma verificação certificada de pontuação e um painel acadêmico terceiro pra auditar e abrir o processo de teste

É o nível mais alto de confiança que dá pra pedir hoje de um número de benchmark

Quando existir, é nele que você se apoia

Como usar as duas fontes na hora de escolher o modelo:

A regra prática é simples

O número do fabricante te diz o que o modelo CONSEGUE no melhor cenário e em capacidade específica

O número do avaliador independente te diz como ele se compara com as alternativas na mesma régua, e quanto custa cada tarefa

Aí vai por caso de uso:

Se o seu dia é agente de código, o que importa é o Coding Agent Index, onde o Astra marca 67 e o topo está em 70 com o Fable 5.1 rodando no Claude Code

Empate técnico com Claude Opus 5, Fable 5 no Claude Code e Muse Spark 1.3 no Muse Code, então aqui a decisão volta pra preço, ferramenta e fluxo, não pro gráfico

Se o que te incomoda é resposta inventada com cara de certeza, olhe a queda de alucinação no AA-Omniscience, de 92% para 51% no esforço max

Esse é um dos ganhos mais concretos medidos por terceiro nesse lançamento

E se é você quem paga a conta, os números são US$ 10 / US$ 50 por milhão de tokens e o custo por tarefa 75% maior que o antecessor no max

Com um contrapeso: o Astra usa um terço dos tokens do GPT-5.6 Sol (max) no harness Codex e um quinto do Claude Opus 5 (xhigh), então token mais caro não significa automaticamente fatura maior

Antes de mandar isso pra frente, vale checar os pontos práticos de pagar ferramenta de IA pela empresa, porque a parte burocrática costuma travar mais que a técnica

Pra fechar a leitura, o Simon Willison publicou uma avaliação independente do Astra que resume bem o clima: concorrente do Fable com resultados mistos, forte em ARC-AGI e segurança, abaixo do Fable em métricas gerais de inteligência

Misto não é ruim

Misto é o que acontece quando você para de olhar um número só

Vídeo: agentes de IA na prática

Número de benchmark é uma coisa

Comportamento do modelo dentro de um fluxo real de agentes é outra bem diferente

Pra começar do zero nesse assunto, esse vídeo do canal mostra a montagem de uma empresa inteira de agentes de IA com Paperclip + Claude Code

Conclusão

Nenhuma das duas fontes é mentira

A OpenAI mede teto de capacidade em testes que ela escolheu, e isso tem valor: 100% no ExploitBench e 98% no FrontierMath Tier 4 dizem alguma coisa real sobre o modelo

O avaliador independente mede posição relativa e preço: 61 no Intelligence Index, empatado com o antecessor e atrás do Fable 5.1 (max) com 66

São perguntas diferentes, com respostas diferentes, e as duas cabem na mesma cabeça

O que melhora de verdade a sua decisão é a rotina de perguntar harness, nível de esforço, composição do índice e custo por tarefa ANTES de repetir o número

Próximo passo prático: abra a página viva do modelo no Artificial Analysis, compare com o material do fabricante, e só então decida se troca o modelo do seu fluxo

Leva uns cinco minutos e evita muita troca precipitada… 🙂

até o próximo post!

Perguntas frequentes

GPT-6 Astra é mais inteligente que o Claude Fable 5.1?

Segundo o Artificial Analysis Intelligence Index, não: o Claude Fable 5.1 (max) lidera com 66 pontos, contra 61 do GPT-6 Astra (max). O Astra fica empatado com seu próprio antecessor, o GPT-5.6 Sol (max), que também marca 61 nesse índice independente.

Quanto custa usar o GPT-6 Astra na API da OpenAI?

US$ 10 por milhão de tokens de entrada e US$ 50 por milhão de tokens de saída, valor confirmado também na página do modelo no Artificial Analysis. Isso é 2,5x o preço do GPT-5.6 Sol, que custava US$ 4 de entrada e US$ 20 de saída.

O GPT-6 Astra já está disponível para todo mundo?

Não de imediato. O rollout anunciado em 3 de setembro de 2026 foi escalonado: primeiro organizações do programa de cibersegurança, depois planos pagos e API, chegando ao longo dos dias seguintes ao ChatGPT Plus, Pro, Business e Enterprise.

O que é o Artificial Analysis e por que ele é citado como fonte independente?

É uma organização de benchmarking sem afiliação a provedores de IA, que roda suas próprias avaliações com metodologia padronizada. Segundo o FAQ da própria organização, provedores não podem pagar por resultado, por mudança de metodologia nem por listagem no site.

O GPT-6 Astra alucina menos que o GPT-5.6 Sol?

Sim, segundo o avaliador independente. No AA-Omniscience, a taxa de alucinação cai de 92% para 51% no esforço max, um ganho real medido fora da própria OpenAI.

O GPT-6 Astra vale a pena para tarefas de código?

No Coding Agent Index do Artificial Analysis, o Astra marca 67, aproximadamente empatado com Claude Opus 5, Fable 5 no Claude Code e Muse Spark 1.3 no Muse Code, atrás do Fable 5.1 no Claude Code, que lidera com 70. Por outro lado, ele é bem econômico em tokens: usa um terço dos tokens do GPT-5.6 Sol (max) no harness Codex e um quinto dos tokens do Claude Opus 5 (xhigh).




Escrito por | Matheus Battisti

Matheus Battisti
Fundador da Hora de Codar

Programador apaixonado pelo mundo das tecnologias, sempre buscando em aprender e se aprofundar em linguagens, frameworks e o que mais for necessário para executar um bom trabalho. Agora tem uma nova missão que é de passar seu conhecimento adiante para formar novos programadores e especializar mais os que já são.

Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted

Formações

Formação Vibe Coding

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

Blog | Mais populares