Mistral Large 4 para agentic coding: o que muda em entendimento de repositório e no terminal?
O Mistral Large 4 entrou em prévia pública em 6 de outubro de 2026 e a Mistral o posiciona para engenharia de software: entendimento de repositório, debugging, tarefas no estilo terminal e agentes de software. É um MoE com cerca de 1 trilhão de parâmetros no total e 49 bilhões ativos. A Mistral divulga 61,7% no DeepSWE v1.1, 59,4% no SWE-Atlas-QnA e 28,3% no Terminal-Bench 4, todos autodeclarados. Dá para acessar pela API de prévia no Mistral Studio ou pelo OpenRouter, a US$ 0,68 por milhão de tokens de entrada e US$ 2,09 na saída. Os pesos e a licença ainda não saíram, prometidos para o fim de outubro
Fala aí, beleza? A Mistral não está vendendo o Large 4 como mais um gerador de código, e sim como um modelo pra entender repositório inteiro e trabalhar no terminal 👀
A prévia pública foi anunciada em 6 de outubro de 2026, e a própria Mistral apresenta o modelo como o maior e mais capaz que ela já fez
Mas o que esse foco em agentic coding muda na prática? E como saber se ele entrega no SEU código, e não só no slide?
É isso que a gente vai destrinchar aqui, bora? 😀
Formação Claude Code
Domine Claude Code do absoluto zero até o avançado
- 120 aulas
- 4 projetos
- 9h 45min
O que a Mistral anunciou no Large 4 para engenharia de software?
O recado da Mistral é bem direto: engenharia de software, entendimento de repositório e fluxos complexos de terminal estão entre os pontos fortes do modelo
Os casos de uso que ela cita são estes:
- Geração de código
- Análise de repositório
- Debugging
- Tarefas no estilo terminal
- Agentes de software
Repara que só o primeiro item é o clássico "me escreve uma função"
O resto é trabalho de agente, aquele que lê, roda, quebra e conserta 🙂
Qual a arquitetura do Mistral Large 4?
É um modelo multimodal nativo do tipo mixture-of-experts (MoE), com cerca de 1 trilhão de parâmetros no total e 49 bilhões ativos
Tem também um encoder de visão de 1,6 bilhão de parâmetros
Que MoE? Pensa numa equipe de especialistas: o modelo é enorme, mas a cada token só uma parte dele trabalha, por isso o número de parâmetros ativos é bem menor que o total
Os pesos já estão abertos?
Ainda não
Hoje não tem checkpoint pra baixar, não tem arquivo de licença e não tem repositório publicado
A Mistral promete os pesos para o fim de outubro de 2026 e diz que vai publicar a licença, os detalhes de arquitetura e os métodos de pós-treino junto com eles
E um detalhe importante pra tudo que vem a seguir: os resultados de benchmark são divulgados pela própria Mistral, beleza?
Por que entender um repositório é diferente de gerar um snippet isolado?
Snippet isolado é prompt fechado: você descreve o que quer, o modelo devolve um bloco de código e acabou
Tudo que ele precisa saber está ali no prompt
Agentic coding é outro bicho
O agente precisa navegar por vários arquivos, rastrear por onde a execução passa, entender por que a arquitetura foi montada daquele jeito, rodar o software, ler o erro e tentar de novo
E isso ao longo de muitos passos, não de uma resposta só
É como a diferença entre pedir pra alguém escrever uma função num papel e jogar essa pessoa no projeto da empresa no primeiro dia: ela vai ter que ler código dos outros, descobrir onde as coisas moram e não quebrar nada no caminho haha
Como os benchmarks capturam essa diferença?
O SWE-Atlas Codebase QnA, da Scale AI, é um ótimo exemplo concreto
O agente recebe um repositório real dentro de um container Docker e precisa responder perguntas técnicas sobre ele: rastrear caminhos de execução, explicar decisões de arquitetura, rodar o software e cruzar vários arquivos
Não tem como acertar só "lembrando" código, tem que investigar
Já o Terminal-Bench mede se o agente consegue usar um terminal real pra concluir tarefas de engenharia e de sistemas
Isso inclui escrever e depurar código, configurar ambiente e se recuperar de falhas, tudo sem interface gráfica
Se recuperar de falha é a parte que mais separa agente de autocomplete
Inclusive é por isso que ferramentas de agente se diferenciam tanto no jeito de mexer no repositório: o modelo importa, mas como ele explora e age no projeto importa tanto quanto
Os benchmarks do Large 4: o que cada um mede e o resultado divulgado
Se liga na tabela:
| Benchmark | O que mede | Formato | Resultado do Large 4 (segundo a Mistral) |
|---|---|---|---|
| DeepSWE v1.1 | Agentes de código em tarefas de engenharia originais e de longo horizonte | Paper publicado no arXiv | 61,7% |
| SWE-Atlas-QnA | Compreensão profunda de código em repositórios reais | Benchmark da Scale AI, 124 tarefas em 11 repositórios open source (Go, Python, C, TypeScript), repositório num container Docker | 59,4% |
| Terminal-Bench 4 | Uso de um terminal real para tarefas de engenharia e sistemas, sem interface gráfica | 66 tarefas, 5 tentativas por tarefa, timeout de 8 horas por agente, em tbench.ai | 28,3% |
Um detalhe sobre o SWE Atlas: a suíte completa tem três fluxos, Codebase QA (124 tarefas), Test Writing (90) e Refactoring (70)
O número divulgado pela Mistral é do QnA, então nada de assumir nota pros outros dois
Como ler esses números com honestidade?
Primeiro: são números autodeclarados, divulgados pela própria Mistral no anúncio
Segundo: cada benchmark mede uma coisa diferente, com formato diferente, então NÃO dá pra comparar 61,7% com 28,3% como se fosse a mesma régua
Terceiro: o 28,3% no Terminal-Bench 4 é um lembrete de que fluxo longo de terminal segue difícil
Agente que configura ambiente, roda, quebra e se recupera por horas ainda é o chefão final dessa história 😛
Como avaliar o Mistral Large 4 no seu próprio repositório?
Benchmark é um ponto de partida, mas o que importa é como o modelo se comporta no código que você mantém
A boa notícia é que dá pra usar o próprio desenho dos benchmarks como roteiro de avaliação
Que tipo de tarefa usar no teste?
Fuja do "me escreve uma função de ordenação" e vá pro que dói no dia a dia:
- Perguntas que exigem cruzar arquivos ("onde esse valor é validado antes de chegar no banco?")
- Rastrear um fluxo de execução do começo ao fim ("o que acontece quando o usuário clica em salvar?")
- Rodar e depurar um teste que falha de verdade no projeto
- Tarefas longas, em que algo vai dar errado no meio e o modelo precisa se recuperar sozinho
E compare sempre com o modelo que você já usa, seja Claude, GPT ou uma opção mais em conta tipo o GLM-5.3-Flash no Coding Plan
Mesmas perguntas, mesmo repositório, aí sim dá pra ter opinião própria
Onde acessar o Large 4 hoje?
Por enquanto, pela API de prévia pública no Mistral Studio
Ele também aparece no OpenRouter com o identificador mistralai/mistral-large-4-0
O identificador oficial na API da própria Mistral ainda não está confirmado na documentação, então confira direto no Studio antes de sair hardcodando nome de modelo por aí
Quanto custa rodar tarefas agênticas na prévia?
Durante a prévia, o preço é metade do de tabela: US$ 0,68 por milhão de tokens de entrada e US$ 2,09 por milhão de tokens de saída
O preço de tabela é US$ 1,36 na entrada e US$ 4,18 na saída
E por que isso pesa tanto em agentic coding?
Porque agente lê MUITO: abre arquivo, roda comando, lê log, tenta de novo
Cada passo desses é token entrando e saindo, então uma tarefa agêntica custa muiiito mais que um snippet isolado
Tome cuidado: se você validar o custo só no preço de prévia, a conta muda quando ele voltar pro preço de tabela
Dá pra pensar em self-hosting?
Ainda não
Sem pesos e sem licença publicada, não tem o que baixar nem termos pra checar se o seu uso é permitido
Por enquanto o Large 4 é um modelo de API, e planejar infra própria em cima dele agora é colocar a carroça na frente dos bois
E o Mistral Vibe, entra nessa história?
O Mistral Vibe é o agente de código open source da Mistral que roda no terminal
Ele tem chat interativo, lê, escreve e aplica patch em arquivos, executa comandos no shell, faz busca recursiva com grep e mantém lista de tarefas, além de integrar com JetBrains e Zed via Agent Communication Protocol
Só que ele é movido a Devstral
Se o Large 4 já funciona dentro dele não está confirmado, então não conte com isso por enquanto
Vale testar o Mistral Large 4 para agentic coding agora?
No papel, a proposta é forte: o foco declarado é repositório e terminal, e os números divulgados batem com essa narrativa
Porém, são números autodeclarados, os benchmarks não conversam entre si e a prévia ainda não tem pesos nem licença
Então o próximo passo concreto é simples: aproveitar o preço de prévia, rodar suas próprias perguntas de repositório e tarefas de terminal e comparar com o modelo que você já usa
E ficar de olho na publicação dos pesos, prometida para o fim de outubro de 2026, que é quando a parte "aberta" da história vai poder ser checada de verdade
Alguém aí já colocou ele pra brigar no próprio projeto? Bora trocar uma ideia nos comentários 😀
Até o próximo post!
Perguntas frequentes
Quando o Mistral Large 4 vai liberar os pesos para download?
A Mistral promete os pesos para o fim de outubro de 2026, junto com a licença, os detalhes de arquitetura e os métodos de pós-treino. Até agora não existe checkpoint, arquivo de licença nem repositório publicado. Hoje o acesso é só pela API de prévia no Mistral Studio
Quanto custa usar o Mistral Large 4 pela API durante a prévia?
Durante a prévia, o preço é de US$ 0,68 por milhão de tokens de entrada e US$ 2,09 por milhão de tokens de saída, metade do valor de tabela. O preço de tabela é US$ 1,36 na entrada e US$ 4,18 na saída. Então vale aproveitar a janela de prévia se o caso de uso for compatível
O Large 4 da Mistral já aparece no OpenRouter?
Sim, o modelo está listado no OpenRouter com o slug mistralai/mistral-large-4-0. Isso facilita testar o modelo ao lado de outras opções na mesma plataforma
Dá pra usar o Large 4 com um agente de terminal da própria Mistral?
A Mistral mantém o Mistral Vibe, um CLI de código open source movido a Devstral, com chat interativo, leitura e escrita de arquivos, execução de comandos no shell e busca com grep. Ele também integra com JetBrains e Zed via Agent Communication Protocol. Não tem, nos fatos divulgados, confirmação de troca do modelo por trás do Vibe para o Large 4
O Large 4 da Mistral é um modelo multimodal?
Sim, é um modelo multimodal nativo do tipo mixture-of-experts, com cerca de 1 trilhão de parâmetros no total e 49 bilhões ativos. Ele tem ainda um encoder de visão de 1,6 bilhão de parâmetros
Os números do Mistral Large 4 em benchmark foram verificados por alguém de fora?
Não, os resultados em DeepSWE v1.1 (61,7%), SWE-Atlas-QnA (59,4%) e Terminal-Bench 4 (28,3%) são divulgados pela própria Mistral no anúncio. Não há validação independente publicada até o momento, então o ideal é tratar esses números como ponto de partida e testar no seu próprio repositório
Formações
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
Blog | Mais populares
Como acessar o Mistral Large 4 pela API de preview no Mistral Studio (e o que checar antes de levar pra produção)
Veja como acessar o Mistral Large 4 API no Mistral Studio: criar chave, configurar MISTRAL_API_KEY e chamar o endpoint em preview.

Checklist de segurança n8n VPS pública: guia essencial para proteger sua instalação
Checklist de segurança n8n VPS pública: guia essencial para proteger sua instalação A popularidade da automação de processos com o n8n está em alta, principalmente […]
O que significa “ChatGPT network error” e como resolver
O “ChatGPT Network Error” é uma ocorrência frequente na rotina de muitos usuários do ChatGPT. Porém, poucos compreendem seu significado, quando esse erro surge, etc. […]
