O que os benchmarks do Gemini 4 Argon realmente medem: DeepSWE, Vals Index, LVBench e CWE-bench explicados

Comparação dos benchmarks do Gemini 4 Argon: DeepSWE, Vals Index, LVBench e CWE-bench
Resposta rápida

Os benchmarks do Gemini 4 Argon medem coisas bem diferentes: o DeepSWE avalia agentes de código mexendo em vários arquivos (77,9%, número do anúncio do Google, com harness próprio), o Vals Index agrega tarefas reais de finanças, programação, jurídico e tributário ponderadas pelo PIB dos EUA (1º lugar com 68,9%, direto do operador), o LVBench mede compreensão de vídeo longo (91,7%) e o CWE-bench mede correção de vulnerabilidades (68%, empate no topo), então o número que importa é o do benchmark mais parecido com o seu projeto, e o acesso ao modelo ainda é restrito

O Gemini 4 Argon chegou com placar de líder, mas cada número desse placar mede uma coisa bem diferente

Fala aí, beleza? O Google DeepMind anunciou o Gemini 4 Argon em 30/09/2026 como seu novo modelo de fronteira, e a tabela veio bonita: pelos números do próprio Google, ele lidera sozinho em 12 de 18 benchmarks contra GPT-6 Astra, Claude Opus 5.5 e Claude Fable 5.1, e ainda empata no primeiro lugar em 1

Esse placar de 12 de 18 é contra esses três modelos

Mas alguns testes específicos trazem outros nomes na disputa: o CWE-bench tem o Grok 4.7 no topo junto com o Argon, e a Vals AI compara a eficiência do Argon com o Sonnet 5.5 (que é outro modelo, não o Opus 5.5)

Massa, né? Só que "lidera em 12 de 18" não diz se ele é o melhor pro SEU projeto 🙂

Então a proposta aqui é fazer uma leitura crítica de quatro avaliações citadas no lançamento: DeepSWE, Vals Index, LVBench e CWE-bench

Pra cada uma, bora ver qual capacidade ela tenta medir, de onde veio o número do Argon e o que um resultado bom ali diz (e não diz) sobre o que você constrói

Gemini 4 Argon: o que foi anunciado e quem já pode usar

Formação Claude Code
Formação Recomendada

Formação Claude Code

Domine Claude Code do absoluto zero até o avançado

  • 120 aulas
  • 4 projetos
  • 9h 45min

Antes dos números, um detalhe importante: quase ninguém consegue usar o Argon hoje

Por enquanto ele só está liberado para defensores de cibersegurança confiáveis do Fairwind Program e para equipes internas do Google

Ele NÃO está no app Gemini nem na API pública (Google AI Studio / Vertex AI)

O plano do Google é abrir o acesso começando por clientes pagos da API e assinantes do Google AI Ultra, mas sem data definida

No lado de custo e capacidade, o que se sabe:

  • Preço introdutório anunciado por Logan Kilpatrick: US$ 2 de entrada e US$ 10 de saída
  • Limite de saída: 1 milhão de tokens

E aqui vem o ponto que importa pra leitura dos benchmarks: por enquanto você não consegue conferir nenhum desses números na prática

Tudo o que vem abaixo é leitura de resultado publicado, não experiência de uso… por isso vale entender BEM o que cada teste mede

O que o DeepSWE mede e como ler os 77,9% do Argon

O DeepSWE é mantido pela Datacurve (repositório datacurve-ai/deep-swe e site deepswe.datacurve.ai)

A pergunta que ele responde é: um agente, trabalhando sozinho dentro de um repositório, consegue produzir a mudança pedida a partir de uma descrição curta da tarefa?

E não é mudancinha de uma linha não haha

Normalmente é uma alteração grande, em vários arquivos, e a correção funcional é conferida por um verificador

O foco são tarefas de engenharia originais e de longo horizonte, aquelas que exigem planejar, navegar pelo código e ir ajustando por várias etapas

Como o DeepSWE é montado?

São 113 tarefas em TypeScript, Go, Python, JavaScript e Rust, tiradas de 91 repositórios open source ativos

O diferencial é o cuidado contra contaminação (quando o modelo já "viu" a resposta no treino):

  • As tarefas são escritas do zero, não adaptadas de commits ou PRs existentes
  • A avaliação usa verificadores funcionais escritos à mão, não testes herdados de pull requests
  • As soluções de referência mexem em 5,5x mais código que benchmarks comparáveis

Se liga nisso: benchmark montado em cima de PR antigo corre o risco de premiar memória, e o DeepSWE tenta fugir exatamente disso

O placar reportado pelo Google

No DeepSWE v1.1, o Google reportou:

  • Gemini 4 Argon: 77,9%
  • Claude Opus 5.5: 74,2%
  • GPT-6 Astra: 74,1%

Tome cuidado com dois detalhes aqui

Primeiro: essa tabela comparando os três foi montada pelo Google no anúncio e não aparece confirmada na página viva do leaderboard do DeepSWE

Segundo: o Google calculou os scores do Argon com seu próprio harness, o mini-swe-agent, e puxou os números dos concorrentes de leaderboards públicos e de relatórios dos próprios modelos

Ou seja, cada número tem uma origem, mas a comparação lado a lado é do Google e ninguém reproduziu ela no leaderboard vivo até agora

Que harness? É a "estrutura" que roda o modelo como agente: como ele recebe a tarefa, quais ferramentas pode chamar, quantas voltas dá e por aí vai

Trocar o harness pode mudar o resultado, então comparar um número rodado em casa com números rodados em outros lugares complica a comparação direta

O contraponto: FrontierSWE v2

Em outro benchmark de código, o FrontierSWE v2, o quadro inverte: o Argon fez 55,0%, contra 65,5% do GPT-6 Astra

Ou seja, "melhor em código" depende de qual teste de código você olha

O que o DeepSWE diz (e não diz) sobre o seu projeto

Diz: se o seu uso é um agente autônomo mexendo em vários arquivos de um repositório real, esse é um dos testes que mais se aproxima do seu dia a dia

Não diz: como o modelo se sai dentro da SUA ferramenta, com o seu harness, o seu repositório e as suas convenções

E, enquanto o número não aparece no leaderboard público, ele é uma afirmação do Google, não uma medição independente

O que é o Vals Index e por que o 1º lugar do Argon importa

Das quatro leituras deste post, o Vals Index é a única que vem direto do operador do benchmark

Quem opera é a Vals AI, uma plataforma independente de benchmarks

O que o Vals Index mede?

Ele é uma média ponderada do desempenho em tarefas reais de finanças, programação, jurídico e tributário

O peso de cada setor é proporcional à fatia dele no PIB dos EUA

Por baixo, ele agrega seis benchmarks privados e dois públicos

A versão atual é a v2.1, que trocou o Terminal-Bench 2.1 pelo Terminal-Bench 4 na parte de programação e adicionou o Tax Agent Benchmark (proprietário) como categoria própria, também ponderada pelo PIB

O resultado do Argon no Vals Index

O Argon ficou em 1º lugar com 68,9%, a primeira vez que um Gemini lidera o índice

Se liga num detalhe: o Argon segue fechado pro público, mas a Vals publicou resultado e dados de uso dele, então o operador teve algum acesso ao modelo antes da abertura geral

Como esse acesso foi dado, as fontes não explicam, beleza?

Os dados de eficiência que ela trouxe:

  • Custo médio de US$ 15,68 por tarefa
  • Usa cerca de um quarto dos tokens de saída e um terço dos de entrada do Sonnet 5.5 (aqui a comparação da Vals é com o Sonnet 5.5, não com o Opus 5.5 da tabela do Google)
  • No Terminal-Bench 4.0 foi de 19,0% (Gemini 3.8) para 57,6%
  • Fica no top 5 em 20 dos 22 benchmarks testados pela Vals

Esse salto no Terminal-Bench é absurdo e é justamente a parte de programação do índice 😀

Como ler esse número sem se enganar

O Vals Index é um índice AGREGADO, com peso econômico americano

Isso significa que um número alto não te conta qual setor puxou o resultado pra cima

Se você só programa, o 68,9% mistura seu uso com jurídico, finanças e tributário, que podem não ter nada a ver com o seu projeto

Nesse caso, o que interessa é olhar a fatia de programação (como o Terminal-Bench) em vez do número geral

Agora, se você trabalha com análise em finanças, jurídico ou tributário, aí o índice conversa MUITO mais com a sua realidade

O que o LVBench mede: compreensão de vídeo longo

Mudando completamente de assunto: o LVBench não tem nada a ver com código

Ele vive no repositório zai-org/LVBench e no site lvbench.github.io, e foi apresentado no ICCV 2025

O que o LVBench avalia?

Compreensão de vídeos extremamente longos, de até cerca de duas horas

São seis capacidades:

  • Localização temporal (achar QUANDO algo acontece)
  • Resumo
  • Raciocínio
  • Reconhecimento de entidades
  • Compreensão de eventos
  • Recuperação de informação-chave

A base tem 103 vídeos públicos do YouTube, cerca de 117 horas no total, todos com mais de 30 minutos (média de 68,4 minutos)

O score do Argon no LVBench

O Argon fez 91,7%, apresentado pelo Google como estado da arte em compreensão de vídeo longo

Como não há números de concorrentes confirmados pra esse teste, não dá pra dizer de quanto é a vantagem

O que isso diz sobre o seu projeto

Se você processa aula gravada, reunião longa, live ou qualquer conteúdo em vídeo, esse é o número pra prestar atenção

Se o seu uso é só código, pode pular: um LVBench alto não diz nada sobre como o modelo mexe no seu repositório

O que o CWE-bench mede e por que pass@1 não conta a história toda

O CWE-bench é operado pela Collinear AI (site cwe-bench.com)

Ele mede se agentes de programação conseguem encontrar e corrigir vulnerabilidades conhecidas em código real de projetos open source, em tarefas de auditoria e patch

O foco é CORRIGIR, não explorar

Como o CWE-bench evita decoreba

Ele usa código real fixado em commits reais, com vulnerabilidades inseridas que a correção publicada nunca cobriu

A ideia é justamente evitar que o modelo só lembre de um advisory que já leu por aí

O patch é checado com provas de conceito programáticas e rubricas, e a cobertura segue a taxonomia CWE e as dez categorias OWASP 2025

O resultado: empate no topo

No CWE-bench v1, o Argon fez 68%, empatado no primeiro lugar com GPT-6 Astra e Grok 4.7, segundo o Google

No leaderboard da Collinear, o Claude Opus 5.5 aparece com 67%

Ou seja: praticamente todo mundo colado lá em cima

E o que é pass@1 e pass@4?

pass@1 é quando o modelo tem UMA tentativa por tarefa, pass@4 é quando ele tem quatro e conta se acertou em alguma delas

E aqui o quadro muda bastante:

  • Com quatro tentativas, o Grok 4.7 resolve 81% das tarefas
  • O GPT-6 Astra é quase tudo ou nada e sobe só 6 pontos do pass@1 para o pass@4
  • Os modelos não resolvem os mesmos problemas: o Grok 4.7 resolve 20 tarefas que o Astra nunca resolve, e o Astra resolve 12 que o Grok nunca resolve

A lição é que empate no topo esconde perfis BEM diferentes

Um modelo que melhora muito tentando de novo e outro que acerta de primeira ou não acerta nunca pedem estratégias diferentes no seu pipeline

E faz sentido esse benchmark aparecer com destaque: o primeiro público com acesso ao Argon é justamente o de defensores de cibersegurança do Fairwind Program

Tabela: os quatro benchmarks do Argon lado a lado

Benchmark Quem opera O que mede Score do Argon De onde vem o número Principal ressalva
DeepSWE v1.1 Datacurve Agente sozinho num repositório fazendo mudança grande em vários arquivos 77,9% Anúncio do Google Harness próprio (mini-swe-agent), não confirmado no leaderboard vivo
Vals Index v2.1 Vals AI Tarefas reais de finanças, programação, jurídico e tributário 68,9% (1º lugar) Operador do benchmark Índice agregado ponderado pelo PIB dos EUA
LVBench zai-org Compreensão de vídeo longo (até cerca de duas horas) 91,7% Google Só vídeo longo, nada sobre código
CWE-bench v1 Collinear AI Encontrar e corrigir vulnerabilidades em código real 68% (empate no topo) Google e leaderboard da Collinear pass@1 esconde a diferença que aparece no pass@4

Qual benchmark olhar de acordo com o seu projeto

Os benchmarks do Gemini 4 Argon só fazem sentido quando você cruza com o que você faz de verdade

Um mapa rápido:

  • Agente de código mexendo em vários arquivos: olhe o DeepSWE, mas cruze com o FrontierSWE v2, onde o GPT-6 Astra ficou na frente
  • Trabalho de escritório e análise em finanças, jurídico ou tributário: o Vals Index é o que mais se aproxima, e ainda vem de operador independente
  • Análise de vídeos longos, aulas, reuniões: LVBench
  • Auditoria e correção de segurança: CWE-bench, olhando também o resultado com múltiplas tentativas e não só o pass@1

Mas se liga: benchmark é filtro inicial, beleza?

Ele ajuda a decidir QUAIS modelos valem o seu tempo, mas não substitui testar no seu próprio código quando o acesso abrir

Veredito: o Argon é o melhor modelo? O que os números permitem afirmar

Os resultados são fortes, isso é fato

O 1º lugar no Vals Index, com o salto no Terminal-Bench e o custo por tarefa, vem direto de um operador independente, e esse é o dado mais sólido do pacote

Agora, dá pra cravar que ele é "o melhor"? Será?

  • O placar de 12 de 18 é do próprio Google
  • O DeepSWE foi rodado com harness próprio e não está confirmado no leaderboard
  • No FrontierSWE v2, o GPT-6 Astra aparece à frente
  • No CWE-bench é empate no topo

A leitura independente do Artificial Analysis, segundo o The Decoder, vai na mesma linha: coloca o Argon no nível de ponta, em 1º no AutomationBench-AA com 77,5%, mas sem liderança clara em todos os benchmarks

Resumindo: o Argon entrou no pelotão da frente, e em algumas frentes lidera, mas "melhor em tudo" os números não sustentam

O que muda pra você agora que o Gemini 4 Argon foi anunciado

Na prática, hoje quase nada muda no seu dia a dia haha

O acesso segue restrito ao Fairwind Program e às equipes internas do Google, e a abertura prevista (clientes pagos da API e assinantes do Google AI Ultra) não tem data

O que dá pra fazer enquanto isso:

  1. Separe algumas tarefas reais do seu projeto que você usaria pra comparar modelos (um bug chato, uma refatoração em vários arquivos, um documento longo, um vídeo)
  2. Anote qual dos quatro benchmarks mais se aproxima de cada tarefa
  3. Acompanhe os leaderboards públicos (deepswe.datacurve.ai, cwe-bench.com e lvbench.github.io) pra ver se os números do anúncio se confirmam em medição independente

Assim, quando o acesso abrir, você já tem seu mini teste pronto e não fica refém do placar de ninguém 😉

Pra quem está chegando agora no ecossistema Gemini, este vídeo do canal mostra na prática um recurso que o Gemini liberou pra todo mundo: criar arquivos editáveis

Conclusão: leia o benchmark antes de ler o placar

Cada número do Argon responde uma pergunta diferente: código em repositório (DeepSWE), trabalho econômico agregado (Vals Index), vídeo longo (LVBench) e correção de vulnerabilidade (CWE-bench)

E a origem do número importa tanto quanto o valor: anúncio do próprio Google é uma coisa, operador independente é outra

O próximo passo é simples: escolha o benchmark mais parecido com o seu trabalho, monte um conjunto pequeno de tarefas próprias e teste quando o acesso abrir

É isso, até o próximo post! 🙂

Perguntas frequentes

Dá pra testar o Gemini 4 Argon hoje no app Gemini ou na API?

Não, pelo menos não por enquanto

O acesso está liberado só para defensores de cibersegurança confiáveis do Fairwind Program e para equipes internas do Google

Ele não está no app Gemini nem na API pública (Google AI Studio / Vertex AI), e o plano de expansão começa por clientes pagos da API e assinantes do Google AI Ultra, sem data definida

O que o LVBench mede no Gemini 4 Argon?

Mede compreensão de vídeos extremamente longos, de até cerca de duas horas, avaliando localização temporal, resumo, raciocínio, reconhecimento de entidades, compreensão de eventos e recuperação de informação-chave

O Argon fez 91,7%, apresentado pelo Google como estado da arte nessa tarefa

O conjunto de teste tem 103 vídeos públicos do YouTube, cerca de 117 horas no total, todos com mais de 30 minutos

O CWE-bench testa se a IA explora vulnerabilidades ou se corrige?

O foco é corrigir, não explorar

O CWE-bench, operado pela Collinear AI, checa se agentes de programação encontram e corrigem vulnerabilidades conhecidas em código real de projetos open source, usando provas de conceito programáticas e rubricas

No v1, o Argon marcou 68%, empatado com GPT-6 Astra e Grok 4.7 segundo o Google, enquanto o leaderboard da Collinear mostra o Claude Opus 5.5 com 67%

Por que o placar do CWE-bench muda quando o modelo tem mais de uma tentativa?

Porque pass@1 (uma tentativa) e pass@4 (quatro tentativas) contam histórias diferentes

Com quatro tentativas, o Grok 4.7 resolve 81% das tarefas, enquanto o GPT-6 Astra é quase tudo ou nada e sobe só 6 pontos do pass@1 pro pass@4

E os dois nem resolvem os mesmos problemas: o Grok 4.7 acerta 20 tarefas que o Astra nunca acerta, e o Astra acerta 12 que o Grok nunca acerta

Uma avaliação independente confirma a liderança do Gemini 4 Argon em tudo?

Não exatamente

Segundo o The Decoder, o Artificial Analysis coloca o Argon no nível de ponta e em 1º no AutomationBench-AA com 77,5%, mas sem liderança clara em todos os benchmarks

Ou seja, a leitura independente confirma que o modelo é forte, só que não replica o placar de 12 em 18 do anúncio do próprio Google

Por que o Gemini 4 Argon lidera o DeepSWE mas perde no FrontierSWE v2?

Porque são dois testes de código diferentes, com metodologias diferentes

No DeepSWE v1.1, o Argon fez 77,9% contra 74,2% do Claude Opus 5.5 e 74,1% do GPT-6 Astra, mas esse número saiu do harness próprio do Google (mini-swe-agent), enquanto os concorrentes vieram de leaderboards públicos

Já no FrontierSWE v2 o quadro inverte: o Argon fez 55,0% contra 65,5% do GPT-6 Astra, mostrando que ‘melhor em código’ depende de qual benchmark você está olhando




Escrito por | Matheus Battisti

Matheus Battisti
Fundador da Hora de Codar

Programador apaixonado pelo mundo das tecnologias, sempre buscando em aprender e se aprofundar em linguagens, frameworks e o que mais for necessário para executar um bom trabalho. Agora tem uma nova missão que é de passar seu conhecimento adiante para formar novos programadores e especializar mais os que já são.

Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted

Formações

Formação Vibe Coding

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

Blog | Mais populares