O que os benchmarks do Gemini 4 Argon realmente medem: DeepSWE, Vals Index, LVBench e CWE-bench explicados

Os benchmarks do Gemini 4 Argon medem coisas bem diferentes: o DeepSWE avalia agentes de código mexendo em vários arquivos (77,9%, número do anúncio do Google, com harness próprio), o Vals Index agrega tarefas reais de finanças, programação, jurídico e tributário ponderadas pelo PIB dos EUA (1º lugar com 68,9%, direto do operador), o LVBench mede compreensão de vídeo longo (91,7%) e o CWE-bench mede correção de vulnerabilidades (68%, empate no topo), então o número que importa é o do benchmark mais parecido com o seu projeto, e o acesso ao modelo ainda é restrito
O Gemini 4 Argon chegou com placar de líder, mas cada número desse placar mede uma coisa bem diferente
Fala aí, beleza? O Google DeepMind anunciou o Gemini 4 Argon em 30/09/2026 como seu novo modelo de fronteira, e a tabela veio bonita: pelos números do próprio Google, ele lidera sozinho em 12 de 18 benchmarks contra GPT-6 Astra, Claude Opus 5.5 e Claude Fable 5.1, e ainda empata no primeiro lugar em 1
Esse placar de 12 de 18 é contra esses três modelos
Mas alguns testes específicos trazem outros nomes na disputa: o CWE-bench tem o Grok 4.7 no topo junto com o Argon, e a Vals AI compara a eficiência do Argon com o Sonnet 5.5 (que é outro modelo, não o Opus 5.5)
Massa, né? Só que "lidera em 12 de 18" não diz se ele é o melhor pro SEU projeto 🙂
Então a proposta aqui é fazer uma leitura crítica de quatro avaliações citadas no lançamento: DeepSWE, Vals Index, LVBench e CWE-bench
Pra cada uma, bora ver qual capacidade ela tenta medir, de onde veio o número do Argon e o que um resultado bom ali diz (e não diz) sobre o que você constrói
Gemini 4 Argon: o que foi anunciado e quem já pode usar
Formação Claude Code
Domine Claude Code do absoluto zero até o avançado
- 120 aulas
- 4 projetos
- 9h 45min
Antes dos números, um detalhe importante: quase ninguém consegue usar o Argon hoje
Por enquanto ele só está liberado para defensores de cibersegurança confiáveis do Fairwind Program e para equipes internas do Google
Ele NÃO está no app Gemini nem na API pública (Google AI Studio / Vertex AI)
O plano do Google é abrir o acesso começando por clientes pagos da API e assinantes do Google AI Ultra, mas sem data definida
No lado de custo e capacidade, o que se sabe:
- Preço introdutório anunciado por Logan Kilpatrick: US$ 2 de entrada e US$ 10 de saída
- Limite de saída: 1 milhão de tokens
E aqui vem o ponto que importa pra leitura dos benchmarks: por enquanto você não consegue conferir nenhum desses números na prática
Tudo o que vem abaixo é leitura de resultado publicado, não experiência de uso… por isso vale entender BEM o que cada teste mede
O que o DeepSWE mede e como ler os 77,9% do Argon
O DeepSWE é mantido pela Datacurve (repositório datacurve-ai/deep-swe e site deepswe.datacurve.ai)
A pergunta que ele responde é: um agente, trabalhando sozinho dentro de um repositório, consegue produzir a mudança pedida a partir de uma descrição curta da tarefa?
E não é mudancinha de uma linha não haha
Normalmente é uma alteração grande, em vários arquivos, e a correção funcional é conferida por um verificador
O foco são tarefas de engenharia originais e de longo horizonte, aquelas que exigem planejar, navegar pelo código e ir ajustando por várias etapas
Como o DeepSWE é montado?
São 113 tarefas em TypeScript, Go, Python, JavaScript e Rust, tiradas de 91 repositórios open source ativos
O diferencial é o cuidado contra contaminação (quando o modelo já "viu" a resposta no treino):
- As tarefas são escritas do zero, não adaptadas de commits ou PRs existentes
- A avaliação usa verificadores funcionais escritos à mão, não testes herdados de pull requests
- As soluções de referência mexem em 5,5x mais código que benchmarks comparáveis
Se liga nisso: benchmark montado em cima de PR antigo corre o risco de premiar memória, e o DeepSWE tenta fugir exatamente disso
O placar reportado pelo Google
No DeepSWE v1.1, o Google reportou:
- Gemini 4 Argon: 77,9%
- Claude Opus 5.5: 74,2%
- GPT-6 Astra: 74,1%
Tome cuidado com dois detalhes aqui
Primeiro: essa tabela comparando os três foi montada pelo Google no anúncio e não aparece confirmada na página viva do leaderboard do DeepSWE
Segundo: o Google calculou os scores do Argon com seu próprio harness, o mini-swe-agent, e puxou os números dos concorrentes de leaderboards públicos e de relatórios dos próprios modelos
Ou seja, cada número tem uma origem, mas a comparação lado a lado é do Google e ninguém reproduziu ela no leaderboard vivo até agora
Que harness? É a "estrutura" que roda o modelo como agente: como ele recebe a tarefa, quais ferramentas pode chamar, quantas voltas dá e por aí vai
Trocar o harness pode mudar o resultado, então comparar um número rodado em casa com números rodados em outros lugares complica a comparação direta
O contraponto: FrontierSWE v2
Em outro benchmark de código, o FrontierSWE v2, o quadro inverte: o Argon fez 55,0%, contra 65,5% do GPT-6 Astra
Ou seja, "melhor em código" depende de qual teste de código você olha
O que o DeepSWE diz (e não diz) sobre o seu projeto
Diz: se o seu uso é um agente autônomo mexendo em vários arquivos de um repositório real, esse é um dos testes que mais se aproxima do seu dia a dia
Não diz: como o modelo se sai dentro da SUA ferramenta, com o seu harness, o seu repositório e as suas convenções
E, enquanto o número não aparece no leaderboard público, ele é uma afirmação do Google, não uma medição independente
O que é o Vals Index e por que o 1º lugar do Argon importa
Das quatro leituras deste post, o Vals Index é a única que vem direto do operador do benchmark
Quem opera é a Vals AI, uma plataforma independente de benchmarks
O que o Vals Index mede?
Ele é uma média ponderada do desempenho em tarefas reais de finanças, programação, jurídico e tributário
O peso de cada setor é proporcional à fatia dele no PIB dos EUA
Por baixo, ele agrega seis benchmarks privados e dois públicos
A versão atual é a v2.1, que trocou o Terminal-Bench 2.1 pelo Terminal-Bench 4 na parte de programação e adicionou o Tax Agent Benchmark (proprietário) como categoria própria, também ponderada pelo PIB
O resultado do Argon no Vals Index
O Argon ficou em 1º lugar com 68,9%, a primeira vez que um Gemini lidera o índice
Se liga num detalhe: o Argon segue fechado pro público, mas a Vals publicou resultado e dados de uso dele, então o operador teve algum acesso ao modelo antes da abertura geral
Como esse acesso foi dado, as fontes não explicam, beleza?
Os dados de eficiência que ela trouxe:
- Custo médio de US$ 15,68 por tarefa
- Usa cerca de um quarto dos tokens de saída e um terço dos de entrada do Sonnet 5.5 (aqui a comparação da Vals é com o Sonnet 5.5, não com o Opus 5.5 da tabela do Google)
- No Terminal-Bench 4.0 foi de 19,0% (Gemini 3.8) para 57,6%
- Fica no top 5 em 20 dos 22 benchmarks testados pela Vals
Esse salto no Terminal-Bench é absurdo e é justamente a parte de programação do índice 😀
Como ler esse número sem se enganar
O Vals Index é um índice AGREGADO, com peso econômico americano
Isso significa que um número alto não te conta qual setor puxou o resultado pra cima
Se você só programa, o 68,9% mistura seu uso com jurídico, finanças e tributário, que podem não ter nada a ver com o seu projeto
Nesse caso, o que interessa é olhar a fatia de programação (como o Terminal-Bench) em vez do número geral
Agora, se você trabalha com análise em finanças, jurídico ou tributário, aí o índice conversa MUITO mais com a sua realidade
O que o LVBench mede: compreensão de vídeo longo
Mudando completamente de assunto: o LVBench não tem nada a ver com código
Ele vive no repositório zai-org/LVBench e no site lvbench.github.io, e foi apresentado no ICCV 2025
O que o LVBench avalia?
Compreensão de vídeos extremamente longos, de até cerca de duas horas
São seis capacidades:
- Localização temporal (achar QUANDO algo acontece)
- Resumo
- Raciocínio
- Reconhecimento de entidades
- Compreensão de eventos
- Recuperação de informação-chave
A base tem 103 vídeos públicos do YouTube, cerca de 117 horas no total, todos com mais de 30 minutos (média de 68,4 minutos)
O score do Argon no LVBench
O Argon fez 91,7%, apresentado pelo Google como estado da arte em compreensão de vídeo longo
Como não há números de concorrentes confirmados pra esse teste, não dá pra dizer de quanto é a vantagem
O que isso diz sobre o seu projeto
Se você processa aula gravada, reunião longa, live ou qualquer conteúdo em vídeo, esse é o número pra prestar atenção
Se o seu uso é só código, pode pular: um LVBench alto não diz nada sobre como o modelo mexe no seu repositório
O que o CWE-bench mede e por que pass@1 não conta a história toda
O CWE-bench é operado pela Collinear AI (site cwe-bench.com)
Ele mede se agentes de programação conseguem encontrar e corrigir vulnerabilidades conhecidas em código real de projetos open source, em tarefas de auditoria e patch
O foco é CORRIGIR, não explorar
Como o CWE-bench evita decoreba
Ele usa código real fixado em commits reais, com vulnerabilidades inseridas que a correção publicada nunca cobriu
A ideia é justamente evitar que o modelo só lembre de um advisory que já leu por aí
O patch é checado com provas de conceito programáticas e rubricas, e a cobertura segue a taxonomia CWE e as dez categorias OWASP 2025
O resultado: empate no topo
No CWE-bench v1, o Argon fez 68%, empatado no primeiro lugar com GPT-6 Astra e Grok 4.7, segundo o Google
No leaderboard da Collinear, o Claude Opus 5.5 aparece com 67%
Ou seja: praticamente todo mundo colado lá em cima
E o que é pass@1 e pass@4?
pass@1 é quando o modelo tem UMA tentativa por tarefa, pass@4 é quando ele tem quatro e conta se acertou em alguma delas
E aqui o quadro muda bastante:
- Com quatro tentativas, o Grok 4.7 resolve 81% das tarefas
- O GPT-6 Astra é quase tudo ou nada e sobe só 6 pontos do pass@1 para o pass@4
- Os modelos não resolvem os mesmos problemas: o Grok 4.7 resolve 20 tarefas que o Astra nunca resolve, e o Astra resolve 12 que o Grok nunca resolve
A lição é que empate no topo esconde perfis BEM diferentes
Um modelo que melhora muito tentando de novo e outro que acerta de primeira ou não acerta nunca pedem estratégias diferentes no seu pipeline
E faz sentido esse benchmark aparecer com destaque: o primeiro público com acesso ao Argon é justamente o de defensores de cibersegurança do Fairwind Program
Tabela: os quatro benchmarks do Argon lado a lado
| Benchmark | Quem opera | O que mede | Score do Argon | De onde vem o número | Principal ressalva |
|---|---|---|---|---|---|
| DeepSWE v1.1 | Datacurve | Agente sozinho num repositório fazendo mudança grande em vários arquivos | 77,9% | Anúncio do Google | Harness próprio (mini-swe-agent), não confirmado no leaderboard vivo |
| Vals Index v2.1 | Vals AI | Tarefas reais de finanças, programação, jurídico e tributário | 68,9% (1º lugar) | Operador do benchmark | Índice agregado ponderado pelo PIB dos EUA |
| LVBench | zai-org | Compreensão de vídeo longo (até cerca de duas horas) | 91,7% | Só vídeo longo, nada sobre código | |
| CWE-bench v1 | Collinear AI | Encontrar e corrigir vulnerabilidades em código real | 68% (empate no topo) | Google e leaderboard da Collinear | pass@1 esconde a diferença que aparece no pass@4 |
Qual benchmark olhar de acordo com o seu projeto
Os benchmarks do Gemini 4 Argon só fazem sentido quando você cruza com o que você faz de verdade
Um mapa rápido:
- Agente de código mexendo em vários arquivos: olhe o DeepSWE, mas cruze com o FrontierSWE v2, onde o GPT-6 Astra ficou na frente
- Trabalho de escritório e análise em finanças, jurídico ou tributário: o Vals Index é o que mais se aproxima, e ainda vem de operador independente
- Análise de vídeos longos, aulas, reuniões: LVBench
- Auditoria e correção de segurança: CWE-bench, olhando também o resultado com múltiplas tentativas e não só o pass@1
Mas se liga: benchmark é filtro inicial, beleza?
Ele ajuda a decidir QUAIS modelos valem o seu tempo, mas não substitui testar no seu próprio código quando o acesso abrir
Veredito: o Argon é o melhor modelo? O que os números permitem afirmar
Os resultados são fortes, isso é fato
O 1º lugar no Vals Index, com o salto no Terminal-Bench e o custo por tarefa, vem direto de um operador independente, e esse é o dado mais sólido do pacote
Agora, dá pra cravar que ele é "o melhor"? Será?
- O placar de 12 de 18 é do próprio Google
- O DeepSWE foi rodado com harness próprio e não está confirmado no leaderboard
- No FrontierSWE v2, o GPT-6 Astra aparece à frente
- No CWE-bench é empate no topo
A leitura independente do Artificial Analysis, segundo o The Decoder, vai na mesma linha: coloca o Argon no nível de ponta, em 1º no AutomationBench-AA com 77,5%, mas sem liderança clara em todos os benchmarks
Resumindo: o Argon entrou no pelotão da frente, e em algumas frentes lidera, mas "melhor em tudo" os números não sustentam
O que muda pra você agora que o Gemini 4 Argon foi anunciado
Na prática, hoje quase nada muda no seu dia a dia haha
O acesso segue restrito ao Fairwind Program e às equipes internas do Google, e a abertura prevista (clientes pagos da API e assinantes do Google AI Ultra) não tem data
O que dá pra fazer enquanto isso:
- Separe algumas tarefas reais do seu projeto que você usaria pra comparar modelos (um bug chato, uma refatoração em vários arquivos, um documento longo, um vídeo)
- Anote qual dos quatro benchmarks mais se aproxima de cada tarefa
- Acompanhe os leaderboards públicos (deepswe.datacurve.ai, cwe-bench.com e lvbench.github.io) pra ver se os números do anúncio se confirmam em medição independente
Assim, quando o acesso abrir, você já tem seu mini teste pronto e não fica refém do placar de ninguém 😉
Pra quem está chegando agora no ecossistema Gemini, este vídeo do canal mostra na prática um recurso que o Gemini liberou pra todo mundo: criar arquivos editáveis
Conclusão: leia o benchmark antes de ler o placar
Cada número do Argon responde uma pergunta diferente: código em repositório (DeepSWE), trabalho econômico agregado (Vals Index), vídeo longo (LVBench) e correção de vulnerabilidade (CWE-bench)
E a origem do número importa tanto quanto o valor: anúncio do próprio Google é uma coisa, operador independente é outra
O próximo passo é simples: escolha o benchmark mais parecido com o seu trabalho, monte um conjunto pequeno de tarefas próprias e teste quando o acesso abrir
É isso, até o próximo post! 🙂
Perguntas frequentes
Dá pra testar o Gemini 4 Argon hoje no app Gemini ou na API?
Não, pelo menos não por enquanto
O acesso está liberado só para defensores de cibersegurança confiáveis do Fairwind Program e para equipes internas do Google
Ele não está no app Gemini nem na API pública (Google AI Studio / Vertex AI), e o plano de expansão começa por clientes pagos da API e assinantes do Google AI Ultra, sem data definida
O que o LVBench mede no Gemini 4 Argon?
Mede compreensão de vídeos extremamente longos, de até cerca de duas horas, avaliando localização temporal, resumo, raciocínio, reconhecimento de entidades, compreensão de eventos e recuperação de informação-chave
O Argon fez 91,7%, apresentado pelo Google como estado da arte nessa tarefa
O conjunto de teste tem 103 vídeos públicos do YouTube, cerca de 117 horas no total, todos com mais de 30 minutos
O CWE-bench testa se a IA explora vulnerabilidades ou se corrige?
O foco é corrigir, não explorar
O CWE-bench, operado pela Collinear AI, checa se agentes de programação encontram e corrigem vulnerabilidades conhecidas em código real de projetos open source, usando provas de conceito programáticas e rubricas
No v1, o Argon marcou 68%, empatado com GPT-6 Astra e Grok 4.7 segundo o Google, enquanto o leaderboard da Collinear mostra o Claude Opus 5.5 com 67%
Por que o placar do CWE-bench muda quando o modelo tem mais de uma tentativa?
Porque pass@1 (uma tentativa) e pass@4 (quatro tentativas) contam histórias diferentes
Com quatro tentativas, o Grok 4.7 resolve 81% das tarefas, enquanto o GPT-6 Astra é quase tudo ou nada e sobe só 6 pontos do pass@1 pro pass@4
E os dois nem resolvem os mesmos problemas: o Grok 4.7 acerta 20 tarefas que o Astra nunca acerta, e o Astra acerta 12 que o Grok nunca acerta
Uma avaliação independente confirma a liderança do Gemini 4 Argon em tudo?
Não exatamente
Segundo o The Decoder, o Artificial Analysis coloca o Argon no nível de ponta e em 1º no AutomationBench-AA com 77,5%, mas sem liderança clara em todos os benchmarks
Ou seja, a leitura independente confirma que o modelo é forte, só que não replica o placar de 12 em 18 do anúncio do próprio Google
Por que o Gemini 4 Argon lidera o DeepSWE mas perde no FrontierSWE v2?
Porque são dois testes de código diferentes, com metodologias diferentes
No DeepSWE v1.1, o Argon fez 77,9% contra 74,2% do Claude Opus 5.5 e 74,1% do GPT-6 Astra, mas esse número saiu do harness próprio do Google (mini-swe-agent), enquanto os concorrentes vieram de leaderboards públicos
Já no FrontierSWE v2 o quadro inverte: o Argon fez 55,0% contra 65,5% do GPT-6 Astra, mostrando que ‘melhor em código’ depende de qual benchmark você está olhando
Formações
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
Blog | Mais populares
Gemini Pro vale a pena para estudante? O que muda de verdade na rotina de estudo
Gemini Pro estudante: veja o preço atual do Google AI Pro, o que muda na rotina de estudo e se vale migrar do plano gratuito para universitários em 2026.
Como excluir sua conta do Gemini e o que acontece com seus dados
Como excluir conta Gemini: apague só o histórico ou encerre a Conta Google inteira. Saiba exatamente o que acontece com seus dados antes de decidir.
Gemini e NotebookLM: qual a relação entre as duas ferramentas de IA do Google?
Gemini e NotebookLM viraram uma dupla: em julho/2026 o Google renomeou o NotebookLM para Gemini Notebook. Veja a diferença e quando usar cada um.
