Grok 4.6 empata com o GPT-5.6 Sol no Artificial Analysis Intelligence Index: o que esse empate significa na prática

Grok 4.6 empatado com GPT-5.6 Sol no Artificial Analysis Intelligence Index
Resposta rápida

O Grok 4.6 chegou empatando com o GPT-5.6 Sol no Artificial Analysis Intelligence Index, com 61 pontos cada um, segundo a análise da própria Artificial Analysis. Acima deles ficam Claude Opus 5 (max) com 63 e Claude Fable 5 com 62, e o Grok 4.6 fica logo à frente do Kimi K3. O índice é uma média ponderada de nove avaliações, com peso maior em tarefas agênticas, e tem intervalo de confiança estimado em menos de ±1%. Ou seja: 61 contra 61 não separa nada, é empate técnico mesmo, e o resto da decisão passa por preço, variante testada e o seu tipo de tarefa

Empate técnico no papel não é empate no seu terminal

A SpaceXAI, criadora do Grok, publicou no site oficial x.ai/news/grok-4-6 que o Grok 4.6 iguala o GPT-5.6 Sol no Artificial Analysis Intelligence Index, descrito no próprio anúncio como um score composto de nove benchmarks

E aí todo mundo já saiu falando em vencedor, em "agora sim", em ranking

Calma

Este post faz a leitura honesta do que esse empate diz, e principalmente do que ele NÃO diz 🙂

O que é o Artificial Analysis Intelligence Index e como ele é calculado

Antes do placar, o porquê do placar

O Artificial Analysis Intelligence Index é publicado e mantido pela Artificial Analysis, uma empresa independente de benchmarking, com página viva de dados por modelo

"Página viva" quer dizer o quê? Que aquilo é atualizado conforme novos modelos entram, não é um PDF congelado que você imprime e pendura na parede

Formação Claude Code
Formação Recomendada

Formação Claude Code

Domine Claude Code do absoluto zero até o avançado

  • 114 aulas
  • 4 projetos
  • 9h 18min

A versão atual é a v4.1.1 e ela reúne nove avaliações:

  • GDPval-AA v2
  • τ³-Banking
  • Terminal-Bench v2.1
  • SciCode
  • Humanity’s Last Exam
  • GPQA Diamond
  • CritPt
  • AA-Omniscience
  • AA-LCR

Só que essas nove não valem a mesma coisa

O índice é uma média ponderada por quatro categorias, assim:

  • Agentes: 34%
  • Código: 24%
  • Raciocínio científico: 24%
  • Geral: 18%

Se você conhece nota final de faculdade com pesos diferentes por prova, é exatamente isso: a prova que vale mais puxa o resultado

E aqui a prova que vale mais é tarefa agêntica, com 34%

Então quando um modelo sobe nesse índice, a primeira pergunta honesta é: ele subiu ONDE? Porque um ganho em agentes mexe muito mais no número final do que um ganho na categoria geral

Como fica a tabela: pontuação, variante testada e preço de API

Os números verificados, lado a lado, sem veredito de melhor ou pior:

Modelo (variante) Intelligence Index Preço API (1M entrada / 1M saída)
Claude Opus 5 (max) 63 US$ 5 / US$ 25
Claude Fable 5 (max with fallback) 62 não consta nessa comparação de preço
Grok 4.6 (high) 61 US$ 2 / US$ 6
GPT-5.6 Sol (max) 61 US$ 5 / US$ 30

O modelo da SpaceXAI aparece logo à frente do Kimi K3 nessa mesma leitura

A diferença de preço de tabela é o dado que mais salta: US$ 2 na entrada, contra US$ 5 do Claude Opus 5 e do GPT-5.6 Sol, e US$ 6 na saída, contra US$ 25 e US$ 30 desses mesmos dois

A variante fast custa o dobro desses US$ 2 e US$ 6 do anúncio oficial

A janela de contexto é de 500 mil tokens, inalterada em relação ao Grok 4.5

Uma nota que muita manchete esquece: repare nos parênteses da tabela

A comparação é entre CONFIGURAÇÕES específicas, não entre nomes genéricos

É "Grok 4.6 (high)" contra "GPT-5.6 Sol (max)", com o Claude Opus 5 em "(max)" e o Claude Fable 5 em "(max with fallback)"

Mudou a variante, mudou o jogo, e o print que circula por aí quase nunca conta qual variante estava rodando

O que esse empate garante e o que ele não garante no dia a dia

Começa pelo mais importante: a própria Artificial Analysis estima intervalo de confiança de 95% em menos de ±1% para o Intelligence Index v4.1.1, e avisa que avaliações individuais podem ter intervalos mais largos

Traduzindo pro português: 61 contra 61 não separa os dois modelos

Não é "empatou por pouco", é empate mesmo, dentro da margem

Debaixo do agregado é que a coisa fica interessante, porque tem recorte:

  • GDPval-AA v2: Elo de 1753, atrás apenas do Claude Opus 5, com intervalos de confiança sobrepostos aos do Claude Fable 5 e do Qwen3.8 Max
  • τ³-Banking: 50,7%, entre os dois melhores
  • Terminal-Bench v2.1: 88,4%

Olha o detalhe do GDPval-AA v2: intervalos SOBREPOSTOS de novo

Ou seja, mais um lugar onde o número maior não vira superioridade declarada

Tem também um dado que ninguém coloca em manchete e que na prática pesa no bolso: a Artificial Analysis mediu que o Grok 4.6 resolve tarefas em cerca de 53 turnos e ~0,5 bilhão de tokens de entrada em média, contra ~103 turnos e ~2,0 bilhões de tokens do Claude Opus 5 (max)

Isso é consumo pra chegar no resultado, não é qualidade do resultado

Mas junte com o preço de tabela e você entende por que essa linha importa mais do que 1 ponto pra cima ou pra baixo no índice

E contra a própria geração anterior o salto é claro: +5 pontos sobre o Grok 4.5 (que marcava 56) e +23 pontos sobre o Grok 4.3

Esse tipo de comparação, aliás, é a mais confiável de todas, porque é o mesmo índice medindo a mesma família

Segundo o anúncio oficial, o modelo está disponível no Cursor e no Grok Build, além da API e de parceiros como OpenRouter, Vercel e Cloudflare

Índice empatado não conta como o modelo se comporta no seu projeto

Aqui eu falo do que eu vi com a mão na massa, e já aviso de cara: NÃO testei o Grok 4.6

O que vem abaixo não é sobre ele, é sobre o QUANTO um score agregado consegue te contar

O que eu testei foram dois outros modelos que aparecem nessa mesma conversa de índice, o GPT-5.6 Sol e o Fable 5, no mesmo projeto, com os mesmos prompts e configurações equivalentes, os dois no nível máximo de raciocínio

E olha que engraçado: antes de rodar qualquer coisa eu montei a ficha técnica dos dois e os benchmarks DISCORDAVAM entre si

Um índice geral apontava um vencedor, o benchmark focado em código apontava o outro

Pra mim foi exatamente por isso que valia testar na prática, em vez de aceitar o ranking e seguir a vida

O teste foi dividido em 4 rodadas: landing page, autenticação e base do sistema, integração com IA e regra de negócio, e no fim um jogo 3D em um prompt só

O que apareceu logo na primeira etapa:

  • o GPT-5.6 Sol concluiu em 11 minutos
  • o Fable 5 ainda estava rodando a MESMA etapa passando de 20 minutos
  • minha cota caiu de 100% para 83% nesse pedaço
  • somando as etapas que comentei no fim do trecho, o GPT-5.6 Sol ficou em 11 minutos mais 40 minutos

No primeiro round eu preferi o resultado do GPT-5.6 Sol: ele gerou SVGs pro logo, uma simulação de interface do sistema em HTML e um esquema de cores que eu achei melhor

O Fable ficou mais simples ali, com ícone padrão e cards menos trabalhados, ainda que a estrutura fosse parecida

E mesmo assim a diferença entre as duas landing pages não foi gritante, viu? Foi detalhe de acabamento e animação, não abismo

Teve o percalço clássico também: o GPT-5.6 Sol subiu o projeto na porta 3000, que já estava ocupada por outro projeto na minha máquina, e eu tive que mandar ele usar outra porta 😅

O tempo de espera no raciocínio máximo me irritou o bastante pra eu baixar o effort dos dois pro nível alto a partir da segunda rodada, pra entregar mais rápido e queimar menos token

Outra diferença que nenhum índice mede: um dos ambientes mostrava a lista de tarefas em execução e o outro só narrava o que estava fazendo, sem me dar noção do que faltava

Isso é experiência de uso pura, e muda MUITO como você se sente esperando

Nada disso é benchmark, beleza? É observação de uso, em um projeto, com os meus prompts, e com dois modelos que não são o par que empatou lá em cima

Mas serve pra mostrar o buraco que existe entre "empatou no score agregado" e "é a mesma coisa pra trabalhar"

Se dois modelos que os índices tratavam como equivalentes se comportaram tão diferente no MEU projeto, o empate de 61 pontos também é uma hipótese pra você testar, não uma conclusão sobre como o modelo vai se sair no teu código

Vale lembrar ainda que parte dos dados de benchmark que circulam é autorreportada pelas próprias empresas

Avalie o prático junto com os números, sempre

Bora ver na prática? No vídeo acima eu mostro as 4 rodadas, os prompts e o que cada modelo entregou, e reforçando: esse teste é GPT-5.6 Sol contra Fable 5, o Grok não entra nele

Como usar essa informação sem cair na leitura fácil

Recapitulando o que a gente viu

O Grok 4.6 marca 61 pontos no Artificial Analysis Intelligence Index, em linha com o GPT-5.6 Sol (max), com Claude Opus 5 (max) em 63 e Claude Fable 5 em 62 acima dele

Esse 61 é um dado AGREGADO de nove avaliações, com pesos diferentes por categoria e margem estimada em menos de ±1%

Não é selo de superioridade, não é "o melhor modelo", não é ordem de compra

O próximo passo prático, se você está pensando em trocar de modelo:

  1. Olhe as avaliações individuais que pesam no SEU tipo de tarefa. Se o seu dia é terminal e agente, Terminal-Bench v2.1 e τ³-Banking te dizem mais do que a média final
  2. Confira a variante exata que foi testada. "Grok 4.6 (high)" e "GPT-5.6 Sol (max)" não são o botão padrão de lugar nenhum, e o erro comum aqui é comparar o print do ranking com a configuração que você realmente usa
  3. Coloque preço e janela na conta. US$ 2 e US$ 6 por 1M de tokens contra US$ 5 e US$ 30, mais os 500 mil tokens de contexto, mexem no seu custo mensal muito mais do que 1 ponto de índice
  4. Teste no seu projeto antes de migrar de vez. Um projeto real seu vale mais que qualquer tabela, inclusive a que está aqui em cima 😀

E lembra que a página do índice é viva: entra modelo novo, a ordem se mexe

O que vale hoje pode não valer daqui a pouco…

Até o próximo post!

Perguntas frequentes

Quanto custa a API do Grok 4.6?

O anúncio oficial em x.ai/news/grok-4-6, assinado pela SpaceXAI, traz US$ 2 por 1 milhão de tokens de entrada e US$ 6 por 1 milhão de tokens de saída. A variante fast custa o dobro desses valores. Na comparação de tabela, o Claude Opus 5 fica em US$ 5 / US$ 25 e o GPT-5.6 Sol em US$ 5 / US$ 30.

Qual é a janela de contexto do Grok 4.6?

São 500 mil tokens, o mesmo tamanho que já vinha do Grok 4.5. Ou seja, nesse quesito específico não houve mudança na nova versão.

Onde dá pra usar o Grok 4.6 hoje?

Segundo o anúncio oficial publicado em x.ai/news/grok-4-6, o modelo está disponível no Cursor e no Grok Build, além da API própria. Também aparece em parceiros como OpenRouter, Vercel e Cloudflare.

Grok 4.6 é melhor que Claude Opus 5 e Claude Fable 5?

Não, pelo menos não no Intelligence Index: Claude Opus 5 (max) marca 63 pontos e Claude Fable 5 (max with fallback) marca 62, contra 61 da variante Grok 4.6 (high). A Artificial Analysis estima intervalo de confiança de 95% em menos de ±1% pra esse índice, então essa diferença de 1 a 2 pontos já fica dentro da margem de erro.

O que quer dizer o Grok 4.6 ter empatado com o GPT-5.6 Sol no Intelligence Index?

Os dois marcaram 61 pontos na comparação entre as variantes Grok 4.6 (high) e GPT-5.6 Sol (max), publicada pela própria Artificial Analysis. Como a margem estatística estimada do índice é menor que ±1%, esse resultado é um empate real, não um empate técnico que esconde um vencedor. O que ele não diz é como cada um se comporta no seu projeto, isso só o teste na prática responde.

Quanto o Grok 4.6 evoluiu em relação às versões anteriores?

No Intelligence Index, o modelo ganhou 5 pontos sobre o Grok 4.5, que marcava 56, e 23 pontos sobre o Grok 4.3. É a comparação mais confiável das citadas, porque é o mesmo índice medindo modelos da mesma família.




Escrito por | Matheus Battisti

Matheus Battisti
Fundador da Hora de Codar

Programador apaixonado pelo mundo das tecnologias, sempre buscando em aprender e se aprofundar em linguagens, frameworks e o que mais for necessário para executar um bom trabalho. Agora tem uma nova missão que é de passar seu conhecimento adiante para formar novos programadores e especializar mais os que já são.

Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted

Formações

Formação Vibe Coding

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

Blog | Mais populares