Como ler o benchmark do GPT-6 Astra sem se enganar: o que a tabela de resultados não mostra

Ler um benchmark do GPT-6 Astra pela linha do topo do ranking é o jeito mais rápido de errar decisão com dado certo. O placar esconde quatro coisas: qual nível de esforço de raciocínio rodou (55, 54, 53 ou 52 no Artificial Analysis), qual harness foi usado (62,7% no Standard contra 99,9% no Provider Adapter no ARC-AGI-3), quantas tentativas o modelo teve (88,0% pass@1 e 99,2% pass@4 no SRE-Bench) e quais ferramentas ele tinha na mão. Este post é um manual de leitura de tabela, não um review do modelo
Escolher modelo olhando só a primeira linha do ranking é o jeito mais rápido de tomar decisão errada usando dado certo
A OpenAI lançou o GPT-6 Astra em 3 de setembro de 2026, com acesso escalonado: preview limitado para organizações selecionadas e depois rollout para ChatGPT Plus, Pro, Business e Enterprise, além de API, Microsoft Azure e AWS Bedrock
E aí veio o de sempre: print de tabela pra todo lado, porcentagem gigante, ranking novo
Se liga que este post não é review do modelo
É um manual de leitura de tabela: o que fica FORA do placar (prompt, tentativas, ferramentas, harness, custo) e como cada uma dessas coisas muda a leitura do número que tu tá vendo
O que aconteceu: GPT-6 Astra chegou e a tabela virou pauta
O lançamento foi em 3 de setembro de 2026, com aquele rollout escalonado que já virou padrão da casa
Na página viva do Artificial Analysis, o GPT-6 Astra (max) marca 55 no Artificial Analysis Intelligence Index e fica em segundo lugar entre os MODELOS, atrás do Claude Fable 5.1, da Anthropic
E tem um segundo recorte na mesma página, que não é o mesmo ranking: olhando por laboratório, e não por modelo, a Meta aparece como terceira colocada
Formação Claude Code
Domine Claude Code do absoluto zero até o avançado
- 120 aulas
- 4 projetos
- 9h 45min
São duas classificações diferentes, com critérios diferentes, e misturar as duas é o primeiro tropeço da leitura apressada
Repara nos nomes também, porque eles voltam mais pra frente: no Intelligence Index, quem lidera é o Claude Fable 5.1; lá no ARC-AGI-3, o resultado publicado da Anthropic aparece com outro nome, Claude Opus 5
Nomes diferentes, tabelas diferentes, então não dá pra tratar as duas linhas como se fossem a mesma coisa
Ou seja: o modelo mais comentado da semana não é o número 1 do índice mais citado da semana… e mesmo assim metade dos posts que tu viu tratou o placar como se fosse
Tem também a coluna que quase ninguém printa junto, o preço
| Modelo | Entrada (por milhão de tokens) | Saída (por milhão de tokens) |
|---|---|---|
| GPT-6 Astra | US$ 10 | US$ 50 |
| GPT-5.6 Sol | US$ 4 | US$ 20 |
Guarda esses dois valores aí, porque eles voltam lá no fim, quando a gente for ler os números com as perguntas certas
O que a tabela de resultados não mostra (e muda tudo)
Um placar de benchmark é um resumo
E todo resumo joga coisa fora
O problema é que, nesse caso, o que foi jogado fora costuma ser exatamente o que decide se aquele número vale pra TUA tarefa
Qual nível de esforço de raciocínio foi testado?
Esse é o primeiro buraco, e é o mais fácil de cair
O mesmo modelo pontua diferente conforme o nível de esforço de raciocínio testado
No Artificial Analysis, se liga nisso:
| Variante | Intelligence Index |
|---|---|
| Astra (max) | 55 |
| Astra (xhigh) | 54 |
| Astra (high) | 53 |
| Astra (medium) | 52 |
É o mesmo modelo, com o mesmo nome, em quatro linhas diferentes
E a nota metodológica da divulgação de benchmarks da OpenAI é explícita: os resultados publicados são o melhor score de cada modelo em qualquer nível de esforço de raciocínio
Traduzindo: o número que tu vê é o teto, não a média, e muito menos o piso
Então a primeira pergunta que tu faz pra qualquer linha de tabela é: esse resultado é de qual configuração?
Se a tabela não responde, ela não é comparável com nada
O harness importa mais do que parece: o caso do ARC-AGI-3
Aqui mora o exemplo mais didático do lançamento inteiro
O ARC-AGI-3 é operado pela ARC Prize, que publica resultados verificados no próprio site e, olha que legal, distingue o harness usado em cada run
"Que harness?"
É o arreio em volta do modelo: como o teste alimenta contexto, o que ele deixa o modelo carregar de uma tentativa pra outra, como o estado é preservado
No ARC-AGI-3 Semi-Private, o Astra marca:
| Harness | Score | Rodado como | Custo aproximado |
|---|---|---|---|
| Standard | 62,7% | Astra max | US$ 26 mil |
| Provider Adapter | 99,9% | Astra high | US$ 19 mil |
Mesmo benchmark, mesmo modelo, 62,7% contra 99,9%
A diferença está no tratamento de memória e contexto: o Standard permite que o modelo carregue adiante apenas anotações que ele escolhe manter, enquanto o Provider Adapter preserva o estado opaco de raciocínio entre requisições e usa compactação em conversas longas, o que permite reaproveitar trabalho anterior
E não para no score
Nos 167 pares jogo/raciocínio resolvidos pelos DOIS harnesses, as runs no Provider Adapter foram cerca de 3,66x mais rápidas em tempo agregado e usaram 49% menos tokens no total
Repara na inversão: a configuração que marcou mais também custou menos (US$ 19 mil contra US$ 26 mil) e rodou com o nível high, não com o max
Ou seja, o arreio mexeu mais no resultado do que o esforço de raciocínio
Tome cuidado com print de porcentagem sem legenda, beleza? 62,7% e 99,9% são o mesmo modelo no mesmo teste
Quantas tentativas o modelo teve? pass@1 e pass@4 não são a mesma coisa
Outro detalhe que some quando a tabela vira imagem no feed
No SRE-Bench, os números divulgados são estes:
| Modelo | pass@1 | pass@4 |
|---|---|---|
| GPT-6 Astra | 88,0% | 99,2% |
| GPT-5.6 Sol | 55,9% | 68,7% |
pass@1 é acertar de primeira
pass@4 é ter até quatro tentativas e valer se qualquer uma delas der certo
São perguntas diferentes sobre o mundo
pass@4 responde "o modelo consegue chegar lá?"
pass@1 responde "o modelo chega lá na hora que eu preciso, sem eu ficar rodando de novo?"
Se a tua aplicação chama o modelo uma vez e usa a resposta, o número que interessa é o da primeira coluna
E olha o tamanho do salto: 88,0% pra 99,2% no Astra, 55,9% pra 68,7% no Sol
Um placar que mistura as duas colunas sem dizer qual é qual não tá comparando modelo, tá comparando critério
O modelo tinha ferramentas na mão?
Esse é sutil e passa MUITO
No subconjunto Vision2Code do BenchCAD, com 1.000 arquivos, o resultado divulgado do Astra é 95,9% com ferramentas Python disponíveis ao modelo, contra 84,3% do Fable 5.1 e 83,3% do Sol
A parte em negrito não é detalhe de rodapé, é metade do experimento
Modelo com ferramenta pode executar, checar e corrigir
Modelo sem ferramenta responde de cabeça
São duas habilidades diferentes, e as duas são úteis, mas só uma delas se parece com o que tu monta no teu projeto… depende de como tu monta o teu projeto
Então a pergunta é: o que o modelo tinha à disposição quando marcou esse número, e eu vou dar as mesmas coisas pra ele?
O que a nota de rodapé diz sobre o ambiente do teste
Aqui é o fecho da seção, e é o ponto mais importante de todos
A mesma nota metodológica da OpenAI informa que os ambientes de pesquisa e o ChatGPT usam prompts de sistema, ferramentas e configurações de inferência diferentes
Lê de novo com calma
O ambiente onde o número foi produzido não é o ambiente onde tu vai usar o modelo
Isso não é pegadinha nem má fé, é como benchmark funciona: pra medir uma coisa, tu isola essa coisa
Mas significa que o score é um limite superior em condição de laboratório, não uma promessa do que vai sair no teu chat ou na tua API
Quem lê o placar como previsão de experiência de uso vai se frustrar
Quem lê como "esse modelo tem essa capacidade quando bem configurado" tá lendo certo
Quatro números do lançamento lidos com as perguntas certas
Bora aplicar o método em caso real? Mesmos dados do lançamento, só que passando pelo filtro
ARC-AGI-3 no Standard: a comparação que vale
No ARC-AGI-3 com o Standard harness, os resultados verificados ficam assim:
| Modelo | ARC-AGI-3 (Standard harness) |
|---|---|
| GPT-6 Astra | 62,7% |
| Claude Opus 5 | 30,2% |
| GPT-5.6 Sol | 7,8% |
E aqui volta o papo dos nomes: o modelo da Anthropic que aparece nessa tabela é o Claude Opus 5, que não é o mesmo nome que lidera o Intelligence Index lá em cima (lá é o Claude Fable 5.1)
São linhas de tabelas diferentes, com nomes diferentes, então nada de juntar as duas na mesma frase como se fosse um modelo só
Essa comparação é legítima porque as três linhas estão no MESMO harness
E é justamente por isso que o 99,9% do Provider Adapter não entra nessa tabela
Comparar 99,9% do Astra no Provider Adapter com 30,2% do Opus 5 no Standard seria comparar duas coisas diferentes e chamar de ranking
Regra prática: só compare modelos dentro do mesmo harness, do mesmo critério e da mesma configuração
Se tu não sabe qual harness rodou, tu não sabe o que a linha significa
OSWorld 2.0: score sem custo de tempo é meio número
No OSWorld 2.0, o Astra marca 72,6% com cerca de 40 minutos por tarefa, contra 65,7% e cerca de 75 minutos por tarefa do GPT-5.6 Sol
Repara que aqui a tabela trouxe a coluna certa junto: tempo
Sem ela, tu leria "72,6% contra 65,7%" e pensaria em uma vantagem modesta
Com ela, a leitura muda de assunto: são quase 40 minutos por tarefa em um caso e cerca de 75 no outro
Pra qualquer coisa que roda dentro de um fluxo com gente esperando, esse é o número que decide, e vale entender por que o Astra demora pra responder antes de plugar ele numa aplicação com usuário do outro lado
Benchmark de agente sem tempo ao lado é meio número
DeepSWE v1.1: diferença pequena em amostra pequena é quase empate
O DeepSWE v1.1, benchmark de coding agêntico citado na tabela de lançamento, tem 113 tarefas
O Astra marca 74,1% e o GPT-5.6 Sol marca 72,7%
Em 113 tarefas, 1,4 ponto percentual é coisa de pouquíssimas tarefas trocando de lado
Isso não é "o Astra é melhor em coding agêntico"
Isso é "os dois ficaram na mesma faixa nesse teste"
Sempre olha o tamanho da amostra antes de transformar diferença pequena em manchete, beleza?
Custo por run: a coluna que quase nunca aparece no placar
Volta lá no ARC-AGI-3: 62,7% custaram cerca de US$ 26 mil e 99,9% custaram cerca de US$ 19 mil
Custo de run faz parte do resultado, não é nota de rodapé
E na ponta da API a conta é a mesma lógica: US$ 10 por milhão de tokens de entrada e US$ 50 por milhão de saída no Astra, contra US$ 4 e US$ 20 no GPT-5.6 Sol
Um placar que mostra só o score te dá metade da decisão
A outra metade é quanto custa pra chegar naquele score, e em boa parte das tarefas do dia a dia vale mais perguntar quando um modelo mais barato basta do que subir de tier por causa de uma linha de tabela
Quando o próprio placar muda: números revisados e índices que se atualizam
Até aqui a gente tratou o placar como algo estável
E não é 😅
Números publicados na página de lançamento do Astra foram alterados depois da publicação: a taxa de alucinação saiu de 4,2% para 2% em um snapshot posterior e depois voltou para 4,2% (com o Sol de volta a 12,2%)
A Fortune identificou cinco métricas alteradas ao comparar snapshots arquivados da página
Tem também o caso do ExploitBench: a OpenAI reconheceu que o score de 11,5% atribuído ao GPT-5.6 Sol refletia um nível de raciocínio que não está disponível comercialmente, contra 5,5% na configuração comercial padrão, e disse estar avaliando reverter o número
É o mesmo problema da primeira seção, agora do outro lado da tabela: o número existia, mas em uma configuração que ninguém consegue contratar
E não é só a página do laboratório que se mexe
O Artificial Analysis publicou a versão 4.2 do Intelligence Index, com mudança de método: dados de teste privados passaram a 40% do peso (o dobro da v4.1), o GPQA-Diamond foi removido por saturação e entraram o AA-Briefcase (trabalho de conhecimento no mundo real) e o GDP.pdf, da Surge AI (análise de documentos PDF)
Quando o índice muda de composição, comparar score de versões diferentes deixa de fazer sentido
Ranking é foto viva, não placa de mármore
Então, sempre que tu citar um número: diz a versão do índice, a data da consulta e o nome exato do modelo que apareceu ali
Já me ferrei com print antigo, e não é uma sensação boa quando alguém aparece com a página atualizada nos comentários haha
Vídeo relacionado do canal
Pra começar do zero com IA aplicada a código, este vídeo do canal mostra uma skill que faz a IA ler o teu código e desenhar a arquitetura sozinha, usando o Archify
Conclusão: como usar essa leitura na próxima escolha de modelo
O checklist é curto e cabe em uma linha de cada:
- Esforço de raciocínio: qual variante rodou? (55, 54, 53 e 52 são o mesmo modelo)
- Harness: qual arreio? (62,7% e 99,9% também são o mesmo modelo)
- Tentativas: pass@1 ou pass@4?
- Ferramentas: o modelo tinha ferramenta na mão ou respondeu de cabeça?
- Custo: quanto custou a run, e quanto custa o token na tua ponta?
- Data, versão e nome: qual índice, em qual versão, consultado quando, e qual modelo exato tá na linha?
Passou nesses seis, tu tem uma leitura honesta de qualquer benchmark do GPT-6 Astra ou de qualquer outro modelo
O próximo passo é o de sempre, e não tem atalho: compare os candidatos DENTRO do mesmo benchmark e da mesma configuração, e depois roda a tua tarefa real com os dois
Porque a tabela mede o que a tabela decidiu medir
O teu projeto é que decide o que importa 😀
até o próximo post!
Perguntas frequentes
Por que os números do lançamento do GPT-6 Astra mudaram depois de publicados?
Porque a própria página de lançamento foi editada mais de uma vez. A taxa de alucinação saiu de 4,2% para 2% num snapshot posterior e depois voltou para 4,2% (com o Sol de volta a 12,2%), e a Fortune identificou cinco métricas alteradas ao comparar versões arquivadas da página. Isso não é rumor: é diferença entre snapshots reais da mesma página.
O caso do ExploitBench prova que a OpenAI infla benchmark?
Prova que vale checar em qual configuração o número foi tirado. A OpenAI reconheceu que os 11,5% do GPT-5.6 Sol no ExploitBench vieram de um nível de raciocínio que não está disponível comercialmente, contra 5,5% na configuração que qualquer pessoa realmente usa, e disse estar avaliando reverter o número.
Dá pra comparar o GPT-6 Astra com o Claude Opus 5 direto no ARC-AGI-3?
Só se for o mesmo harness. No Standard harness do ARC-AGI-3, o Claude Opus 5 marcou 30,2% e o GPT-5.6 Sol marcou 7,8%, enquanto o Astra ficou em 62,7% nesse mesmo harness. Comparar isso com o 99,9% do Astra no Provider Adapter seria misturar dois testes diferentes. E repara no nome: quem lidera o Artificial Analysis Intelligence Index é o Claude Fable 5.1, outro nome, em outra tabela.
Qual modelo lidera o Artificial Analysis Intelligence Index?
Na página viva do Artificial Analysis, o líder entre os modelos é o Claude Fable 5.1, da Anthropic, com o GPT-6 Astra (max) em segundo lugar e 55 pontos no índice. Tem também um recorte por laboratório, que é outra classificação: nele a Meta aparece como terceira. São critérios diferentes, então não dá pra ler as duas listas como se fossem a mesma tabela.
O que mudou na versão 4.2 do Artificial Analysis Intelligence Index?
Os dados de teste privados passaram a valer 40% do peso, o dobro da versão anterior, e o GPQA-Diamond saiu do índice por estar saturado. Entraram no lugar o AA-Briefcase, focado em trabalho de conhecimento do mundo real, e o GDP.pdf, da Surge AI, voltado pra análise de documentos PDF.
O preço mais alto da API do Astra se justifica pelos benchmarks?
Depende de qual número tu usa pra justificar. A API do Astra custa US$ 10 por milhão de tokens de entrada e US$ 50 de saída, contra US$ 4 e US$ 20 do GPT-5.6 Sol, e o ganho de desempenho varia bastante conforme o benchmark e a configuração testada. Vale olhar caso a caso em vez de generalizar pelo Intelligence Index sozinho.
Onde ver os resultados verificados do ARC-AGI-3 sem depender de print de rede social?
O ARC-AGI-3 é operado pela ARC Prize, que publica os resultados verificados no próprio site e distingue qual harness foi usado em cada run. É lá que dá pra conferir os 62,7% do Standard e os 99,9% do Provider Adapter com o contexto completo, em vez de um número solto.
Formações
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
Blog | Mais populares
Como testar o GPT-6 Astra no seu projeto antes de migrar (passo a passo)
Testar o GPT-6 Astra antes de migrar: monte de 10 a 20 tarefas reais do seu produto, compare com seu modelo atual e veja nota, tokens e custo lado a lado.
Como migrar seu projeto para o GPT-6 Astra sem quebrar o que já funciona: checklist antes de trocar o modelo
Migrar para o GPT-6 Astra sem quebrar o que já funciona: checklist com baseline, rota por vez, parâmetros revisados e rollback pronto antes de trocar o modelo.
Por que o GPT-6 Astra corta a resposta no meio? O limite de 128 mil tokens de saída e como fatiar tarefas longas
O GPT-6 Astra lê até 1 milhão de tokens, mas o limite de tokens de saída é 128 mil por resposta. Veja por que ele corta e como fatiar tarefas longas.
