Grok 4.6 empata com o GPT-5.6 Sol no Artificial Analysis Intelligence Index: o que esse empate significa na prática

O Grok 4.6 chegou empatando com o GPT-5.6 Sol no Artificial Analysis Intelligence Index, com 61 pontos cada um, segundo a análise da própria Artificial Analysis. Acima deles ficam Claude Opus 5 (max) com 63 e Claude Fable 5 com 62, e o Grok 4.6 fica logo à frente do Kimi K3. O índice é uma média ponderada de nove avaliações, com peso maior em tarefas agênticas, e tem intervalo de confiança estimado em menos de ±1%. Ou seja: 61 contra 61 não separa nada, é empate técnico mesmo, e o resto da decisão passa por preço, variante testada e o seu tipo de tarefa
Empate técnico no papel não é empate no seu terminal
A SpaceXAI, criadora do Grok, publicou no site oficial x.ai/news/grok-4-6 que o Grok 4.6 iguala o GPT-5.6 Sol no Artificial Analysis Intelligence Index, descrito no próprio anúncio como um score composto de nove benchmarks
E aí todo mundo já saiu falando em vencedor, em "agora sim", em ranking
Calma
Este post faz a leitura honesta do que esse empate diz, e principalmente do que ele NÃO diz 🙂
O que é o Artificial Analysis Intelligence Index e como ele é calculado
Antes do placar, o porquê do placar
O Artificial Analysis Intelligence Index é publicado e mantido pela Artificial Analysis, uma empresa independente de benchmarking, com página viva de dados por modelo
"Página viva" quer dizer o quê? Que aquilo é atualizado conforme novos modelos entram, não é um PDF congelado que você imprime e pendura na parede
Formação Claude Code
Domine Claude Code do absoluto zero até o avançado
- 114 aulas
- 4 projetos
- 9h 18min
A versão atual é a v4.1.1 e ela reúne nove avaliações:
- GDPval-AA v2
- τ³-Banking
- Terminal-Bench v2.1
- SciCode
- Humanity’s Last Exam
- GPQA Diamond
- CritPt
- AA-Omniscience
- AA-LCR
Só que essas nove não valem a mesma coisa
O índice é uma média ponderada por quatro categorias, assim:
- Agentes: 34%
- Código: 24%
- Raciocínio científico: 24%
- Geral: 18%
Se você conhece nota final de faculdade com pesos diferentes por prova, é exatamente isso: a prova que vale mais puxa o resultado
E aqui a prova que vale mais é tarefa agêntica, com 34%
Então quando um modelo sobe nesse índice, a primeira pergunta honesta é: ele subiu ONDE? Porque um ganho em agentes mexe muito mais no número final do que um ganho na categoria geral
Como fica a tabela: pontuação, variante testada e preço de API
Os números verificados, lado a lado, sem veredito de melhor ou pior:
| Modelo (variante) | Intelligence Index | Preço API (1M entrada / 1M saída) |
|---|---|---|
| Claude Opus 5 (max) | 63 | US$ 5 / US$ 25 |
| Claude Fable 5 (max with fallback) | 62 | não consta nessa comparação de preço |
| Grok 4.6 (high) | 61 | US$ 2 / US$ 6 |
| GPT-5.6 Sol (max) | 61 | US$ 5 / US$ 30 |
O modelo da SpaceXAI aparece logo à frente do Kimi K3 nessa mesma leitura
A diferença de preço de tabela é o dado que mais salta: US$ 2 na entrada, contra US$ 5 do Claude Opus 5 e do GPT-5.6 Sol, e US$ 6 na saída, contra US$ 25 e US$ 30 desses mesmos dois
A variante fast custa o dobro desses US$ 2 e US$ 6 do anúncio oficial
A janela de contexto é de 500 mil tokens, inalterada em relação ao Grok 4.5
Uma nota que muita manchete esquece: repare nos parênteses da tabela
A comparação é entre CONFIGURAÇÕES específicas, não entre nomes genéricos
É "Grok 4.6 (high)" contra "GPT-5.6 Sol (max)", com o Claude Opus 5 em "(max)" e o Claude Fable 5 em "(max with fallback)"
Mudou a variante, mudou o jogo, e o print que circula por aí quase nunca conta qual variante estava rodando
O que esse empate garante e o que ele não garante no dia a dia
Começa pelo mais importante: a própria Artificial Analysis estima intervalo de confiança de 95% em menos de ±1% para o Intelligence Index v4.1.1, e avisa que avaliações individuais podem ter intervalos mais largos
Traduzindo pro português: 61 contra 61 não separa os dois modelos
Não é "empatou por pouco", é empate mesmo, dentro da margem
Debaixo do agregado é que a coisa fica interessante, porque tem recorte:
- GDPval-AA v2: Elo de 1753, atrás apenas do Claude Opus 5, com intervalos de confiança sobrepostos aos do Claude Fable 5 e do Qwen3.8 Max
- τ³-Banking: 50,7%, entre os dois melhores
- Terminal-Bench v2.1: 88,4%
Olha o detalhe do GDPval-AA v2: intervalos SOBREPOSTOS de novo
Ou seja, mais um lugar onde o número maior não vira superioridade declarada
Tem também um dado que ninguém coloca em manchete e que na prática pesa no bolso: a Artificial Analysis mediu que o Grok 4.6 resolve tarefas em cerca de 53 turnos e ~0,5 bilhão de tokens de entrada em média, contra ~103 turnos e ~2,0 bilhões de tokens do Claude Opus 5 (max)
Isso é consumo pra chegar no resultado, não é qualidade do resultado
Mas junte com o preço de tabela e você entende por que essa linha importa mais do que 1 ponto pra cima ou pra baixo no índice
E contra a própria geração anterior o salto é claro: +5 pontos sobre o Grok 4.5 (que marcava 56) e +23 pontos sobre o Grok 4.3
Esse tipo de comparação, aliás, é a mais confiável de todas, porque é o mesmo índice medindo a mesma família
Segundo o anúncio oficial, o modelo está disponível no Cursor e no Grok Build, além da API e de parceiros como OpenRouter, Vercel e Cloudflare
Índice empatado não conta como o modelo se comporta no seu projeto
Aqui eu falo do que eu vi com a mão na massa, e já aviso de cara: NÃO testei o Grok 4.6
O que vem abaixo não é sobre ele, é sobre o QUANTO um score agregado consegue te contar
O que eu testei foram dois outros modelos que aparecem nessa mesma conversa de índice, o GPT-5.6 Sol e o Fable 5, no mesmo projeto, com os mesmos prompts e configurações equivalentes, os dois no nível máximo de raciocínio
E olha que engraçado: antes de rodar qualquer coisa eu montei a ficha técnica dos dois e os benchmarks DISCORDAVAM entre si
Um índice geral apontava um vencedor, o benchmark focado em código apontava o outro
Pra mim foi exatamente por isso que valia testar na prática, em vez de aceitar o ranking e seguir a vida
O teste foi dividido em 4 rodadas: landing page, autenticação e base do sistema, integração com IA e regra de negócio, e no fim um jogo 3D em um prompt só
O que apareceu logo na primeira etapa:
- o GPT-5.6 Sol concluiu em 11 minutos
- o Fable 5 ainda estava rodando a MESMA etapa passando de 20 minutos
- minha cota caiu de 100% para 83% nesse pedaço
- somando as etapas que comentei no fim do trecho, o GPT-5.6 Sol ficou em 11 minutos mais 40 minutos
No primeiro round eu preferi o resultado do GPT-5.6 Sol: ele gerou SVGs pro logo, uma simulação de interface do sistema em HTML e um esquema de cores que eu achei melhor
O Fable ficou mais simples ali, com ícone padrão e cards menos trabalhados, ainda que a estrutura fosse parecida
E mesmo assim a diferença entre as duas landing pages não foi gritante, viu? Foi detalhe de acabamento e animação, não abismo
Teve o percalço clássico também: o GPT-5.6 Sol subiu o projeto na porta 3000, que já estava ocupada por outro projeto na minha máquina, e eu tive que mandar ele usar outra porta 😅
O tempo de espera no raciocínio máximo me irritou o bastante pra eu baixar o effort dos dois pro nível alto a partir da segunda rodada, pra entregar mais rápido e queimar menos token
Outra diferença que nenhum índice mede: um dos ambientes mostrava a lista de tarefas em execução e o outro só narrava o que estava fazendo, sem me dar noção do que faltava
Isso é experiência de uso pura, e muda MUITO como você se sente esperando
Nada disso é benchmark, beleza? É observação de uso, em um projeto, com os meus prompts, e com dois modelos que não são o par que empatou lá em cima
Mas serve pra mostrar o buraco que existe entre "empatou no score agregado" e "é a mesma coisa pra trabalhar"
Se dois modelos que os índices tratavam como equivalentes se comportaram tão diferente no MEU projeto, o empate de 61 pontos também é uma hipótese pra você testar, não uma conclusão sobre como o modelo vai se sair no teu código
Vale lembrar ainda que parte dos dados de benchmark que circulam é autorreportada pelas próprias empresas
Avalie o prático junto com os números, sempre
Bora ver na prática? No vídeo acima eu mostro as 4 rodadas, os prompts e o que cada modelo entregou, e reforçando: esse teste é GPT-5.6 Sol contra Fable 5, o Grok não entra nele
Como usar essa informação sem cair na leitura fácil
Recapitulando o que a gente viu
O Grok 4.6 marca 61 pontos no Artificial Analysis Intelligence Index, em linha com o GPT-5.6 Sol (max), com Claude Opus 5 (max) em 63 e Claude Fable 5 em 62 acima dele
Esse 61 é um dado AGREGADO de nove avaliações, com pesos diferentes por categoria e margem estimada em menos de ±1%
Não é selo de superioridade, não é "o melhor modelo", não é ordem de compra
O próximo passo prático, se você está pensando em trocar de modelo:
- Olhe as avaliações individuais que pesam no SEU tipo de tarefa. Se o seu dia é terminal e agente, Terminal-Bench v2.1 e τ³-Banking te dizem mais do que a média final
- Confira a variante exata que foi testada. "Grok 4.6 (high)" e "GPT-5.6 Sol (max)" não são o botão padrão de lugar nenhum, e o erro comum aqui é comparar o print do ranking com a configuração que você realmente usa
- Coloque preço e janela na conta. US$ 2 e US$ 6 por 1M de tokens contra US$ 5 e US$ 30, mais os 500 mil tokens de contexto, mexem no seu custo mensal muito mais do que 1 ponto de índice
- Teste no seu projeto antes de migrar de vez. Um projeto real seu vale mais que qualquer tabela, inclusive a que está aqui em cima 😀
E lembra que a página do índice é viva: entra modelo novo, a ordem se mexe
O que vale hoje pode não valer daqui a pouco…
Até o próximo post!
Perguntas frequentes
Quanto custa a API do Grok 4.6?
O anúncio oficial em x.ai/news/grok-4-6, assinado pela SpaceXAI, traz US$ 2 por 1 milhão de tokens de entrada e US$ 6 por 1 milhão de tokens de saída. A variante fast custa o dobro desses valores. Na comparação de tabela, o Claude Opus 5 fica em US$ 5 / US$ 25 e o GPT-5.6 Sol em US$ 5 / US$ 30.
Qual é a janela de contexto do Grok 4.6?
São 500 mil tokens, o mesmo tamanho que já vinha do Grok 4.5. Ou seja, nesse quesito específico não houve mudança na nova versão.
Onde dá pra usar o Grok 4.6 hoje?
Segundo o anúncio oficial publicado em x.ai/news/grok-4-6, o modelo está disponível no Cursor e no Grok Build, além da API própria. Também aparece em parceiros como OpenRouter, Vercel e Cloudflare.
Grok 4.6 é melhor que Claude Opus 5 e Claude Fable 5?
Não, pelo menos não no Intelligence Index: Claude Opus 5 (max) marca 63 pontos e Claude Fable 5 (max with fallback) marca 62, contra 61 da variante Grok 4.6 (high). A Artificial Analysis estima intervalo de confiança de 95% em menos de ±1% pra esse índice, então essa diferença de 1 a 2 pontos já fica dentro da margem de erro.
O que quer dizer o Grok 4.6 ter empatado com o GPT-5.6 Sol no Intelligence Index?
Os dois marcaram 61 pontos na comparação entre as variantes Grok 4.6 (high) e GPT-5.6 Sol (max), publicada pela própria Artificial Analysis. Como a margem estatística estimada do índice é menor que ±1%, esse resultado é um empate real, não um empate técnico que esconde um vencedor. O que ele não diz é como cada um se comporta no seu projeto, isso só o teste na prática responde.
Quanto o Grok 4.6 evoluiu em relação às versões anteriores?
No Intelligence Index, o modelo ganhou 5 pontos sobre o Grok 4.5, que marcava 56, e 23 pontos sobre o Grok 4.3. É a comparação mais confiável das citadas, porque é o mesmo índice medindo modelos da mesma família.
Formações
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
Blog | Mais populares
Grok tem limite de uso? Como funcionam as cotas de mensagens e recursos
Grok tem limite de uso no plano gratuito com cotas dinâmicas de ~10 mensagens a cada 2 horas. Entenda como funciona o throttling e o que muda nos planos pagos.
Grok é grátis? Como usar a IA do Elon Musk sem pagar
Grok grátis existe e dá pra usar sem cartão. Veja o que está liberado no plano gratuito, os limites de uso e quando vale migrar para o SuperGrok ou Heavy.
Grok premium apk ou SuperGrok: qual é o caminho oficial para os recursos pagos do Grok?
Quem busca grok premium apk deve saber: esse não é o caminho oficial. Veja como assinar o SuperGrok, preços em dólar e os recursos pagos do Grok.
