Como ler o benchmark do GPT-6 Astra sem se enganar: o que a tabela de resultados não mostra

tabela de resultados do benchmark do GPT-6 Astra mostrando níveis de esforço e harness diferentes
Resposta rápida

Ler um benchmark do GPT-6 Astra pela linha do topo do ranking é o jeito mais rápido de errar decisão com dado certo. O placar esconde quatro coisas: qual nível de esforço de raciocínio rodou (55, 54, 53 ou 52 no Artificial Analysis), qual harness foi usado (62,7% no Standard contra 99,9% no Provider Adapter no ARC-AGI-3), quantas tentativas o modelo teve (88,0% pass@1 e 99,2% pass@4 no SRE-Bench) e quais ferramentas ele tinha na mão. Este post é um manual de leitura de tabela, não um review do modelo

Escolher modelo olhando só a primeira linha do ranking é o jeito mais rápido de tomar decisão errada usando dado certo

A OpenAI lançou o GPT-6 Astra em 3 de setembro de 2026, com acesso escalonado: preview limitado para organizações selecionadas e depois rollout para ChatGPT Plus, Pro, Business e Enterprise, além de API, Microsoft Azure e AWS Bedrock

E aí veio o de sempre: print de tabela pra todo lado, porcentagem gigante, ranking novo

Se liga que este post não é review do modelo

É um manual de leitura de tabela: o que fica FORA do placar (prompt, tentativas, ferramentas, harness, custo) e como cada uma dessas coisas muda a leitura do número que tu tá vendo

O que aconteceu: GPT-6 Astra chegou e a tabela virou pauta

O lançamento foi em 3 de setembro de 2026, com aquele rollout escalonado que já virou padrão da casa

Na página viva do Artificial Analysis, o GPT-6 Astra (max) marca 55 no Artificial Analysis Intelligence Index e fica em segundo lugar entre os MODELOS, atrás do Claude Fable 5.1, da Anthropic

E tem um segundo recorte na mesma página, que não é o mesmo ranking: olhando por laboratório, e não por modelo, a Meta aparece como terceira colocada

Formação Claude Code
Formação Recomendada

Formação Claude Code

Domine Claude Code do absoluto zero até o avançado

  • 120 aulas
  • 4 projetos
  • 9h 45min

São duas classificações diferentes, com critérios diferentes, e misturar as duas é o primeiro tropeço da leitura apressada

Repara nos nomes também, porque eles voltam mais pra frente: no Intelligence Index, quem lidera é o Claude Fable 5.1; lá no ARC-AGI-3, o resultado publicado da Anthropic aparece com outro nome, Claude Opus 5

Nomes diferentes, tabelas diferentes, então não dá pra tratar as duas linhas como se fossem a mesma coisa

Ou seja: o modelo mais comentado da semana não é o número 1 do índice mais citado da semana… e mesmo assim metade dos posts que tu viu tratou o placar como se fosse

Tem também a coluna que quase ninguém printa junto, o preço

Modelo Entrada (por milhão de tokens) Saída (por milhão de tokens)
GPT-6 Astra US$ 10 US$ 50
GPT-5.6 Sol US$ 4 US$ 20

Guarda esses dois valores aí, porque eles voltam lá no fim, quando a gente for ler os números com as perguntas certas

O que a tabela de resultados não mostra (e muda tudo)

Um placar de benchmark é um resumo

E todo resumo joga coisa fora

O problema é que, nesse caso, o que foi jogado fora costuma ser exatamente o que decide se aquele número vale pra TUA tarefa

Qual nível de esforço de raciocínio foi testado?

Esse é o primeiro buraco, e é o mais fácil de cair

O mesmo modelo pontua diferente conforme o nível de esforço de raciocínio testado

No Artificial Analysis, se liga nisso:

Variante Intelligence Index
Astra (max) 55
Astra (xhigh) 54
Astra (high) 53
Astra (medium) 52

É o mesmo modelo, com o mesmo nome, em quatro linhas diferentes

E a nota metodológica da divulgação de benchmarks da OpenAI é explícita: os resultados publicados são o melhor score de cada modelo em qualquer nível de esforço de raciocínio

Traduzindo: o número que tu vê é o teto, não a média, e muito menos o piso

Então a primeira pergunta que tu faz pra qualquer linha de tabela é: esse resultado é de qual configuração?

Se a tabela não responde, ela não é comparável com nada

O harness importa mais do que parece: o caso do ARC-AGI-3

Aqui mora o exemplo mais didático do lançamento inteiro

O ARC-AGI-3 é operado pela ARC Prize, que publica resultados verificados no próprio site e, olha que legal, distingue o harness usado em cada run

"Que harness?"

É o arreio em volta do modelo: como o teste alimenta contexto, o que ele deixa o modelo carregar de uma tentativa pra outra, como o estado é preservado

No ARC-AGI-3 Semi-Private, o Astra marca:

Harness Score Rodado como Custo aproximado
Standard 62,7% Astra max US$ 26 mil
Provider Adapter 99,9% Astra high US$ 19 mil

Mesmo benchmark, mesmo modelo, 62,7% contra 99,9%

A diferença está no tratamento de memória e contexto: o Standard permite que o modelo carregue adiante apenas anotações que ele escolhe manter, enquanto o Provider Adapter preserva o estado opaco de raciocínio entre requisições e usa compactação em conversas longas, o que permite reaproveitar trabalho anterior

E não para no score

Nos 167 pares jogo/raciocínio resolvidos pelos DOIS harnesses, as runs no Provider Adapter foram cerca de 3,66x mais rápidas em tempo agregado e usaram 49% menos tokens no total

Repara na inversão: a configuração que marcou mais também custou menos (US$ 19 mil contra US$ 26 mil) e rodou com o nível high, não com o max

Ou seja, o arreio mexeu mais no resultado do que o esforço de raciocínio

Tome cuidado com print de porcentagem sem legenda, beleza? 62,7% e 99,9% são o mesmo modelo no mesmo teste

Quantas tentativas o modelo teve? pass@1 e pass@4 não são a mesma coisa

Outro detalhe que some quando a tabela vira imagem no feed

No SRE-Bench, os números divulgados são estes:

Modelo pass@1 pass@4
GPT-6 Astra 88,0% 99,2%
GPT-5.6 Sol 55,9% 68,7%

pass@1 é acertar de primeira

pass@4 é ter até quatro tentativas e valer se qualquer uma delas der certo

São perguntas diferentes sobre o mundo

pass@4 responde "o modelo consegue chegar lá?"

pass@1 responde "o modelo chega lá na hora que eu preciso, sem eu ficar rodando de novo?"

Se a tua aplicação chama o modelo uma vez e usa a resposta, o número que interessa é o da primeira coluna

E olha o tamanho do salto: 88,0% pra 99,2% no Astra, 55,9% pra 68,7% no Sol

Um placar que mistura as duas colunas sem dizer qual é qual não tá comparando modelo, tá comparando critério

O modelo tinha ferramentas na mão?

Esse é sutil e passa MUITO

No subconjunto Vision2Code do BenchCAD, com 1.000 arquivos, o resultado divulgado do Astra é 95,9% com ferramentas Python disponíveis ao modelo, contra 84,3% do Fable 5.1 e 83,3% do Sol

A parte em negrito não é detalhe de rodapé, é metade do experimento

Modelo com ferramenta pode executar, checar e corrigir

Modelo sem ferramenta responde de cabeça

São duas habilidades diferentes, e as duas são úteis, mas só uma delas se parece com o que tu monta no teu projeto… depende de como tu monta o teu projeto

Então a pergunta é: o que o modelo tinha à disposição quando marcou esse número, e eu vou dar as mesmas coisas pra ele?

O que a nota de rodapé diz sobre o ambiente do teste

Aqui é o fecho da seção, e é o ponto mais importante de todos

A mesma nota metodológica da OpenAI informa que os ambientes de pesquisa e o ChatGPT usam prompts de sistema, ferramentas e configurações de inferência diferentes

Lê de novo com calma

O ambiente onde o número foi produzido não é o ambiente onde tu vai usar o modelo

Isso não é pegadinha nem má fé, é como benchmark funciona: pra medir uma coisa, tu isola essa coisa

Mas significa que o score é um limite superior em condição de laboratório, não uma promessa do que vai sair no teu chat ou na tua API

Quem lê o placar como previsão de experiência de uso vai se frustrar

Quem lê como "esse modelo tem essa capacidade quando bem configurado" tá lendo certo

Quatro números do lançamento lidos com as perguntas certas

Bora aplicar o método em caso real? Mesmos dados do lançamento, só que passando pelo filtro

ARC-AGI-3 no Standard: a comparação que vale

No ARC-AGI-3 com o Standard harness, os resultados verificados ficam assim:

Modelo ARC-AGI-3 (Standard harness)
GPT-6 Astra 62,7%
Claude Opus 5 30,2%
GPT-5.6 Sol 7,8%

E aqui volta o papo dos nomes: o modelo da Anthropic que aparece nessa tabela é o Claude Opus 5, que não é o mesmo nome que lidera o Intelligence Index lá em cima (lá é o Claude Fable 5.1)

São linhas de tabelas diferentes, com nomes diferentes, então nada de juntar as duas na mesma frase como se fosse um modelo só

Essa comparação é legítima porque as três linhas estão no MESMO harness

E é justamente por isso que o 99,9% do Provider Adapter não entra nessa tabela

Comparar 99,9% do Astra no Provider Adapter com 30,2% do Opus 5 no Standard seria comparar duas coisas diferentes e chamar de ranking

Regra prática: só compare modelos dentro do mesmo harness, do mesmo critério e da mesma configuração

Se tu não sabe qual harness rodou, tu não sabe o que a linha significa

OSWorld 2.0: score sem custo de tempo é meio número

No OSWorld 2.0, o Astra marca 72,6% com cerca de 40 minutos por tarefa, contra 65,7% e cerca de 75 minutos por tarefa do GPT-5.6 Sol

Repara que aqui a tabela trouxe a coluna certa junto: tempo

Sem ela, tu leria "72,6% contra 65,7%" e pensaria em uma vantagem modesta

Com ela, a leitura muda de assunto: são quase 40 minutos por tarefa em um caso e cerca de 75 no outro

Pra qualquer coisa que roda dentro de um fluxo com gente esperando, esse é o número que decide, e vale entender por que o Astra demora pra responder antes de plugar ele numa aplicação com usuário do outro lado

Benchmark de agente sem tempo ao lado é meio número

DeepSWE v1.1: diferença pequena em amostra pequena é quase empate

O DeepSWE v1.1, benchmark de coding agêntico citado na tabela de lançamento, tem 113 tarefas

O Astra marca 74,1% e o GPT-5.6 Sol marca 72,7%

Em 113 tarefas, 1,4 ponto percentual é coisa de pouquíssimas tarefas trocando de lado

Isso não é "o Astra é melhor em coding agêntico"

Isso é "os dois ficaram na mesma faixa nesse teste"

Sempre olha o tamanho da amostra antes de transformar diferença pequena em manchete, beleza?

Custo por run: a coluna que quase nunca aparece no placar

Volta lá no ARC-AGI-3: 62,7% custaram cerca de US$ 26 mil e 99,9% custaram cerca de US$ 19 mil

Custo de run faz parte do resultado, não é nota de rodapé

E na ponta da API a conta é a mesma lógica: US$ 10 por milhão de tokens de entrada e US$ 50 por milhão de saída no Astra, contra US$ 4 e US$ 20 no GPT-5.6 Sol

Um placar que mostra só o score te dá metade da decisão

A outra metade é quanto custa pra chegar naquele score, e em boa parte das tarefas do dia a dia vale mais perguntar quando um modelo mais barato basta do que subir de tier por causa de uma linha de tabela

Quando o próprio placar muda: números revisados e índices que se atualizam

Até aqui a gente tratou o placar como algo estável

E não é 😅

Números publicados na página de lançamento do Astra foram alterados depois da publicação: a taxa de alucinação saiu de 4,2% para 2% em um snapshot posterior e depois voltou para 4,2% (com o Sol de volta a 12,2%)

A Fortune identificou cinco métricas alteradas ao comparar snapshots arquivados da página

Tem também o caso do ExploitBench: a OpenAI reconheceu que o score de 11,5% atribuído ao GPT-5.6 Sol refletia um nível de raciocínio que não está disponível comercialmente, contra 5,5% na configuração comercial padrão, e disse estar avaliando reverter o número

É o mesmo problema da primeira seção, agora do outro lado da tabela: o número existia, mas em uma configuração que ninguém consegue contratar

E não é só a página do laboratório que se mexe

O Artificial Analysis publicou a versão 4.2 do Intelligence Index, com mudança de método: dados de teste privados passaram a 40% do peso (o dobro da v4.1), o GPQA-Diamond foi removido por saturação e entraram o AA-Briefcase (trabalho de conhecimento no mundo real) e o GDP.pdf, da Surge AI (análise de documentos PDF)

Quando o índice muda de composição, comparar score de versões diferentes deixa de fazer sentido

Ranking é foto viva, não placa de mármore

Então, sempre que tu citar um número: diz a versão do índice, a data da consulta e o nome exato do modelo que apareceu ali

Já me ferrei com print antigo, e não é uma sensação boa quando alguém aparece com a página atualizada nos comentários haha

Vídeo relacionado do canal

Pra começar do zero com IA aplicada a código, este vídeo do canal mostra uma skill que faz a IA ler o teu código e desenhar a arquitetura sozinha, usando o Archify

Conclusão: como usar essa leitura na próxima escolha de modelo

O checklist é curto e cabe em uma linha de cada:

  • Esforço de raciocínio: qual variante rodou? (55, 54, 53 e 52 são o mesmo modelo)
  • Harness: qual arreio? (62,7% e 99,9% também são o mesmo modelo)
  • Tentativas: pass@1 ou pass@4?
  • Ferramentas: o modelo tinha ferramenta na mão ou respondeu de cabeça?
  • Custo: quanto custou a run, e quanto custa o token na tua ponta?
  • Data, versão e nome: qual índice, em qual versão, consultado quando, e qual modelo exato tá na linha?

Passou nesses seis, tu tem uma leitura honesta de qualquer benchmark do GPT-6 Astra ou de qualquer outro modelo

O próximo passo é o de sempre, e não tem atalho: compare os candidatos DENTRO do mesmo benchmark e da mesma configuração, e depois roda a tua tarefa real com os dois

Porque a tabela mede o que a tabela decidiu medir

O teu projeto é que decide o que importa 😀

até o próximo post!

Perguntas frequentes

Por que os números do lançamento do GPT-6 Astra mudaram depois de publicados?

Porque a própria página de lançamento foi editada mais de uma vez. A taxa de alucinação saiu de 4,2% para 2% num snapshot posterior e depois voltou para 4,2% (com o Sol de volta a 12,2%), e a Fortune identificou cinco métricas alteradas ao comparar versões arquivadas da página. Isso não é rumor: é diferença entre snapshots reais da mesma página.

O caso do ExploitBench prova que a OpenAI infla benchmark?

Prova que vale checar em qual configuração o número foi tirado. A OpenAI reconheceu que os 11,5% do GPT-5.6 Sol no ExploitBench vieram de um nível de raciocínio que não está disponível comercialmente, contra 5,5% na configuração que qualquer pessoa realmente usa, e disse estar avaliando reverter o número.

Dá pra comparar o GPT-6 Astra com o Claude Opus 5 direto no ARC-AGI-3?

Só se for o mesmo harness. No Standard harness do ARC-AGI-3, o Claude Opus 5 marcou 30,2% e o GPT-5.6 Sol marcou 7,8%, enquanto o Astra ficou em 62,7% nesse mesmo harness. Comparar isso com o 99,9% do Astra no Provider Adapter seria misturar dois testes diferentes. E repara no nome: quem lidera o Artificial Analysis Intelligence Index é o Claude Fable 5.1, outro nome, em outra tabela.

Qual modelo lidera o Artificial Analysis Intelligence Index?

Na página viva do Artificial Analysis, o líder entre os modelos é o Claude Fable 5.1, da Anthropic, com o GPT-6 Astra (max) em segundo lugar e 55 pontos no índice. Tem também um recorte por laboratório, que é outra classificação: nele a Meta aparece como terceira. São critérios diferentes, então não dá pra ler as duas listas como se fossem a mesma tabela.

O que mudou na versão 4.2 do Artificial Analysis Intelligence Index?

Os dados de teste privados passaram a valer 40% do peso, o dobro da versão anterior, e o GPQA-Diamond saiu do índice por estar saturado. Entraram no lugar o AA-Briefcase, focado em trabalho de conhecimento do mundo real, e o GDP.pdf, da Surge AI, voltado pra análise de documentos PDF.

O preço mais alto da API do Astra se justifica pelos benchmarks?

Depende de qual número tu usa pra justificar. A API do Astra custa US$ 10 por milhão de tokens de entrada e US$ 50 de saída, contra US$ 4 e US$ 20 do GPT-5.6 Sol, e o ganho de desempenho varia bastante conforme o benchmark e a configuração testada. Vale olhar caso a caso em vez de generalizar pelo Intelligence Index sozinho.

Onde ver os resultados verificados do ARC-AGI-3 sem depender de print de rede social?

O ARC-AGI-3 é operado pela ARC Prize, que publica os resultados verificados no próprio site e distingue qual harness foi usado em cada run. É lá que dá pra conferir os 62,7% do Standard e os 99,9% do Provider Adapter com o contexto completo, em vez de um número solto.




Escrito por | Matheus Battisti

Matheus Battisti
Fundador da Hora de Codar

Programador apaixonado pelo mundo das tecnologias, sempre buscando em aprender e se aprofundar em linguagens, frameworks e o que mais for necessário para executar um bom trabalho. Agora tem uma nova missão que é de passar seu conhecimento adiante para formar novos programadores e especializar mais os que já são.

Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted

Formações

Formação Vibe Coding

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

Blog | Mais populares