Mistral Large 4 para agentic coding: o que muda em entendimento de repositório e no terminal?

Resposta rápida

O Mistral Large 4 entrou em prévia pública em 6 de outubro de 2026 e a Mistral o posiciona para engenharia de software: entendimento de repositório, debugging, tarefas no estilo terminal e agentes de software. É um MoE com cerca de 1 trilhão de parâmetros no total e 49 bilhões ativos. A Mistral divulga 61,7% no DeepSWE v1.1, 59,4% no SWE-Atlas-QnA e 28,3% no Terminal-Bench 4, todos autodeclarados. Dá para acessar pela API de prévia no Mistral Studio ou pelo OpenRouter, a US$ 0,68 por milhão de tokens de entrada e US$ 2,09 na saída. Os pesos e a licença ainda não saíram, prometidos para o fim de outubro

Fala aí, beleza? A Mistral não está vendendo o Large 4 como mais um gerador de código, e sim como um modelo pra entender repositório inteiro e trabalhar no terminal 👀

A prévia pública foi anunciada em 6 de outubro de 2026, e a própria Mistral apresenta o modelo como o maior e mais capaz que ela já fez

Mas o que esse foco em agentic coding muda na prática? E como saber se ele entrega no SEU código, e não só no slide?

É isso que a gente vai destrinchar aqui, bora? 😀

Formação Claude Code
Formação Recomendada

Formação Claude Code

Domine Claude Code do absoluto zero até o avançado

  • 120 aulas
  • 4 projetos
  • 9h 45min

O que a Mistral anunciou no Large 4 para engenharia de software?

O recado da Mistral é bem direto: engenharia de software, entendimento de repositório e fluxos complexos de terminal estão entre os pontos fortes do modelo

Os casos de uso que ela cita são estes:

  • Geração de código
  • Análise de repositório
  • Debugging
  • Tarefas no estilo terminal
  • Agentes de software

Repara que só o primeiro item é o clássico "me escreve uma função"

O resto é trabalho de agente, aquele que lê, roda, quebra e conserta 🙂

Qual a arquitetura do Mistral Large 4?

É um modelo multimodal nativo do tipo mixture-of-experts (MoE), com cerca de 1 trilhão de parâmetros no total e 49 bilhões ativos

Tem também um encoder de visão de 1,6 bilhão de parâmetros

Que MoE? Pensa numa equipe de especialistas: o modelo é enorme, mas a cada token só uma parte dele trabalha, por isso o número de parâmetros ativos é bem menor que o total

Os pesos já estão abertos?

Ainda não

Hoje não tem checkpoint pra baixar, não tem arquivo de licença e não tem repositório publicado

A Mistral promete os pesos para o fim de outubro de 2026 e diz que vai publicar a licença, os detalhes de arquitetura e os métodos de pós-treino junto com eles

E um detalhe importante pra tudo que vem a seguir: os resultados de benchmark são divulgados pela própria Mistral, beleza?

Por que entender um repositório é diferente de gerar um snippet isolado?

Snippet isolado é prompt fechado: você descreve o que quer, o modelo devolve um bloco de código e acabou

Tudo que ele precisa saber está ali no prompt

Agentic coding é outro bicho

O agente precisa navegar por vários arquivos, rastrear por onde a execução passa, entender por que a arquitetura foi montada daquele jeito, rodar o software, ler o erro e tentar de novo

E isso ao longo de muitos passos, não de uma resposta só

É como a diferença entre pedir pra alguém escrever uma função num papel e jogar essa pessoa no projeto da empresa no primeiro dia: ela vai ter que ler código dos outros, descobrir onde as coisas moram e não quebrar nada no caminho haha

Como os benchmarks capturam essa diferença?

O SWE-Atlas Codebase QnA, da Scale AI, é um ótimo exemplo concreto

O agente recebe um repositório real dentro de um container Docker e precisa responder perguntas técnicas sobre ele: rastrear caminhos de execução, explicar decisões de arquitetura, rodar o software e cruzar vários arquivos

Não tem como acertar só "lembrando" código, tem que investigar

Já o Terminal-Bench mede se o agente consegue usar um terminal real pra concluir tarefas de engenharia e de sistemas

Isso inclui escrever e depurar código, configurar ambiente e se recuperar de falhas, tudo sem interface gráfica

Se recuperar de falha é a parte que mais separa agente de autocomplete

Inclusive é por isso que ferramentas de agente se diferenciam tanto no jeito de mexer no repositório: o modelo importa, mas como ele explora e age no projeto importa tanto quanto

Os benchmarks do Large 4: o que cada um mede e o resultado divulgado

Se liga na tabela:

Benchmark O que mede Formato Resultado do Large 4 (segundo a Mistral)
DeepSWE v1.1 Agentes de código em tarefas de engenharia originais e de longo horizonte Paper publicado no arXiv 61,7%
SWE-Atlas-QnA Compreensão profunda de código em repositórios reais Benchmark da Scale AI, 124 tarefas em 11 repositórios open source (Go, Python, C, TypeScript), repositório num container Docker 59,4%
Terminal-Bench 4 Uso de um terminal real para tarefas de engenharia e sistemas, sem interface gráfica 66 tarefas, 5 tentativas por tarefa, timeout de 8 horas por agente, em tbench.ai 28,3%

Um detalhe sobre o SWE Atlas: a suíte completa tem três fluxos, Codebase QA (124 tarefas), Test Writing (90) e Refactoring (70)

O número divulgado pela Mistral é do QnA, então nada de assumir nota pros outros dois

Como ler esses números com honestidade?

Primeiro: são números autodeclarados, divulgados pela própria Mistral no anúncio

Segundo: cada benchmark mede uma coisa diferente, com formato diferente, então NÃO dá pra comparar 61,7% com 28,3% como se fosse a mesma régua

Terceiro: o 28,3% no Terminal-Bench 4 é um lembrete de que fluxo longo de terminal segue difícil

Agente que configura ambiente, roda, quebra e se recupera por horas ainda é o chefão final dessa história 😛

Como avaliar o Mistral Large 4 no seu próprio repositório?

Benchmark é um ponto de partida, mas o que importa é como o modelo se comporta no código que você mantém

A boa notícia é que dá pra usar o próprio desenho dos benchmarks como roteiro de avaliação

Que tipo de tarefa usar no teste?

Fuja do "me escreve uma função de ordenação" e vá pro que dói no dia a dia:

  • Perguntas que exigem cruzar arquivos ("onde esse valor é validado antes de chegar no banco?")
  • Rastrear um fluxo de execução do começo ao fim ("o que acontece quando o usuário clica em salvar?")
  • Rodar e depurar um teste que falha de verdade no projeto
  • Tarefas longas, em que algo vai dar errado no meio e o modelo precisa se recuperar sozinho

E compare sempre com o modelo que você já usa, seja Claude, GPT ou uma opção mais em conta tipo o GLM-5.3-Flash no Coding Plan

Mesmas perguntas, mesmo repositório, aí sim dá pra ter opinião própria

Onde acessar o Large 4 hoje?

Por enquanto, pela API de prévia pública no Mistral Studio

Ele também aparece no OpenRouter com o identificador mistralai/mistral-large-4-0

O identificador oficial na API da própria Mistral ainda não está confirmado na documentação, então confira direto no Studio antes de sair hardcodando nome de modelo por aí

Quanto custa rodar tarefas agênticas na prévia?

Durante a prévia, o preço é metade do de tabela: US$ 0,68 por milhão de tokens de entrada e US$ 2,09 por milhão de tokens de saída

O preço de tabela é US$ 1,36 na entrada e US$ 4,18 na saída

E por que isso pesa tanto em agentic coding?

Porque agente lê MUITO: abre arquivo, roda comando, lê log, tenta de novo

Cada passo desses é token entrando e saindo, então uma tarefa agêntica custa muiiito mais que um snippet isolado

Tome cuidado: se você validar o custo só no preço de prévia, a conta muda quando ele voltar pro preço de tabela

Dá pra pensar em self-hosting?

Ainda não

Sem pesos e sem licença publicada, não tem o que baixar nem termos pra checar se o seu uso é permitido

Por enquanto o Large 4 é um modelo de API, e planejar infra própria em cima dele agora é colocar a carroça na frente dos bois

E o Mistral Vibe, entra nessa história?

O Mistral Vibe é o agente de código open source da Mistral que roda no terminal

Ele tem chat interativo, lê, escreve e aplica patch em arquivos, executa comandos no shell, faz busca recursiva com grep e mantém lista de tarefas, além de integrar com JetBrains e Zed via Agent Communication Protocol

Só que ele é movido a Devstral

Se o Large 4 já funciona dentro dele não está confirmado, então não conte com isso por enquanto

Vale testar o Mistral Large 4 para agentic coding agora?

No papel, a proposta é forte: o foco declarado é repositório e terminal, e os números divulgados batem com essa narrativa

Porém, são números autodeclarados, os benchmarks não conversam entre si e a prévia ainda não tem pesos nem licença

Então o próximo passo concreto é simples: aproveitar o preço de prévia, rodar suas próprias perguntas de repositório e tarefas de terminal e comparar com o modelo que você já usa

E ficar de olho na publicação dos pesos, prometida para o fim de outubro de 2026, que é quando a parte "aberta" da história vai poder ser checada de verdade

Alguém aí já colocou ele pra brigar no próprio projeto? Bora trocar uma ideia nos comentários 😀

Até o próximo post!

Perguntas frequentes

Quando o Mistral Large 4 vai liberar os pesos para download?

A Mistral promete os pesos para o fim de outubro de 2026, junto com a licença, os detalhes de arquitetura e os métodos de pós-treino. Até agora não existe checkpoint, arquivo de licença nem repositório publicado. Hoje o acesso é só pela API de prévia no Mistral Studio

Quanto custa usar o Mistral Large 4 pela API durante a prévia?

Durante a prévia, o preço é de US$ 0,68 por milhão de tokens de entrada e US$ 2,09 por milhão de tokens de saída, metade do valor de tabela. O preço de tabela é US$ 1,36 na entrada e US$ 4,18 na saída. Então vale aproveitar a janela de prévia se o caso de uso for compatível

O Large 4 da Mistral já aparece no OpenRouter?

Sim, o modelo está listado no OpenRouter com o slug mistralai/mistral-large-4-0. Isso facilita testar o modelo ao lado de outras opções na mesma plataforma

Dá pra usar o Large 4 com um agente de terminal da própria Mistral?

A Mistral mantém o Mistral Vibe, um CLI de código open source movido a Devstral, com chat interativo, leitura e escrita de arquivos, execução de comandos no shell e busca com grep. Ele também integra com JetBrains e Zed via Agent Communication Protocol. Não tem, nos fatos divulgados, confirmação de troca do modelo por trás do Vibe para o Large 4

O Large 4 da Mistral é um modelo multimodal?

Sim, é um modelo multimodal nativo do tipo mixture-of-experts, com cerca de 1 trilhão de parâmetros no total e 49 bilhões ativos. Ele tem ainda um encoder de visão de 1,6 bilhão de parâmetros

Os números do Mistral Large 4 em benchmark foram verificados por alguém de fora?

Não, os resultados em DeepSWE v1.1 (61,7%), SWE-Atlas-QnA (59,4%) e Terminal-Bench 4 (28,3%) são divulgados pela própria Mistral no anúncio. Não há validação independente publicada até o momento, então o ideal é tratar esses números como ponto de partida e testar no seu próprio repositório




Escrito por | Matheus Battisti

Matheus Battisti
Fundador da Hora de Codar

Programador apaixonado pelo mundo das tecnologias, sempre buscando em aprender e se aprofundar em linguagens, frameworks e o que mais for necessário para executar um bom trabalho. Agora tem uma nova missão que é de passar seu conhecimento adiante para formar novos programadores e especializar mais os que já são.

Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted

Formações

Formação Vibe Coding

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

Blog | Mais populares