O que é o SWE-2 da Cognition e o que ele faz na prática?

O SWE-2 é o modelo de codificação mais avançado da Cognition, anunciado em 10 de setembro de 2026 no post ‘Introducing SWE-2: Pushing the Pareto Frontier’. Ele foi pós-treinado a partir do Kimi K3, modelo de pesos abertos da Moonshot AI com 2,8 trilhões de parâmetros, e é o primeiro da Cognition com níveis de esforço configuráveis (medium, high e max), treinados em um único run de reinforcement learning. Marca 50,0% no FrontierCode 1.1 Main, menos de um ponto abaixo do Fable 5.1 custando 64% menos, segundo a Cognition. Roda no Devin Desktop e no Devin CLI, grátis até 10/10/2026.
Um modelo de codificação que encosta no topo do benchmark e cobra uma fração do preço dos rivais: é exatamente essa a proposta do SWE-2
Fala aí, beleza? No dia 10 de setembro de 2026 a Cognition anunciou o SWE-2, o modelo de codificação mais avançado dela, no post Introducing SWE-2: Pushing the Pareto Frontier
Se você só ouviu o nome por aí e ficou na dúvida do que é essa coisa, esse post é pra te situar
Bora entender o que ele é, o que muda de verdade e onde ele roda hoje 🙂
Formação Claude Code
Domine Claude Code do absoluto zero até o avançado
- 116 aulas
- 4 projetos
- 9h 23min
Quem é a Cognition e de onde veio o SWE-2
A Cognition é a empresa por trás do Devin, então o SWE-2 não nasce solto no vácuo: ele nasce dentro de um ecossistema de agente de código que já existe
E tem um detalhe MUITO interessante na origem dele
O SWE-2 foi pós-treinado a partir do Kimi K3, o modelo aberto da Moonshot AI
O Kimi K3 tem 2,8 trilhões de parâmetros e teve os pesos publicados pela Moonshot em 26 de julho de 2026
O que significa "pós-treinado a partir de um modelo aberto"?
Boa pergunta, porque muita gente lê isso e acha que a Cognition treinou um modelo do zero
Não é isso
Pensa assim: se você conhece fork de projeto open source, a lógica é parecida
Alguém publica a base, outra empresa pega essa base e faz uma nova rodada de treinamento em cima, mirando num objetivo específico
No caso, o objetivo é desempenho agentic: modelo que não fica só cuspindo texto bonito, e sim trabalhando em tarefa de código por vários passos
Níveis de esforço configuráveis: a novidade técnica do SWE-2
Esse é o ponto central, e vale ler devagar
O SWE-2 é o primeiro modelo da Cognition com níveis de esforço de raciocínio configuráveis: medium, high e max
E a sacada não é só existir três níveis, é COMO eles foram treinados
A Cognition usou um algoritmo de reinforcement learning que treina todos os níveis de esforço em um único run, avançando a curva de custo/desempenho inteira de uma vez
Por que isso importa pra quem usa?
Porque na prática você passa a escolher quanto raciocínio quer pagar por tarefa
Renomear um monte de variável e ajustar um teste chato não precisa do mesmo esforço de uma refatoração que atravessa meia aplicação
Antes a escolha era basicamente trocar de modelo
Agora a escolha vira um botão de intensidade dentro do mesmo modelo, e isso é bem massa pra quem olha fatura no fim do mês
SWE-2 nos benchmarks: score e custo lado a lado
O benchmark da casa é o FrontierCode, e os números divulgados são estes:
| Modelo / nível | FrontierCode 1.1 Main | Custo por tarefa | Posicionamento segundo a Cognition |
|---|---|---|---|
| SWE-2 | 50,0% | 64% menor que o do Fable 5.1 | menos de 1 ponto percentual abaixo do Fable 5.1 |
| Fable 5.1 Medium | 50,9% | US$ 3,28 | valor do leaderboard vivo do FrontierCode |
| Fable 5.1 Max | 50,3% | US$ 12,83 | valor do leaderboard vivo do FrontierCode |
O posicionamento frente aos concorrentes, ainda segundo a Cognition, considerando o FrontierCode 1.1 Main e o DeepSWE 1.1:
- supera o SWE-1.7 e o Grok 4.6 em score E em custo
- fica no mesmo patamar do GPT-5.6 Sol e do Fable 5 e 5.1 por uma fração do preço, mesmo com o score do leaderboard ficando a menos de 1 ponto abaixo do Fable 5.1
- fica a poucos pontos do GPT-6 Astra por cerca de um quarto do custo
E o nível medium, como se sai?
Aqui ficam os números mais impressionantes da comparação com a geração anterior:
| SWE-2 medium comparado ao SWE-1.7 | Dado divulgado |
|---|---|
| Score no FrontierCode 1.1 Main | superior ao SWE-1.7 |
| Turnos usados | 58% menos |
| Custo médio | 81% menor |
| Primeira edição real de código | mediana de 18 passos, contra 48 do SWE-1.7 |
Esse último item é o que mais muda a sensação de uso: o modelo começa a mexer no código bem mais cedo, em vez de ficar 48 passos rodando em círculo antes de encostar num arquivo
O que esses números realmente dizem (e o que não dizem)
Agora a parte honesta, porque número solto engana
O FrontierCode é benchmark da PRÓPRIA Cognition
Isso não invalida nada, e tem um ponto a favor: existe um leaderboard público do FrontierCode, operado pela Cognition, onde o SWE-2 e o Claude Fable 5.1 já aparecem
Mas as comparações de posicionamento contra GPT-6 Astra, GPT-5.6 Sol, Grok 4.6 e companhia são afirmações da Cognition sobre o próprio modelo, e vale ler com esse filtro ligado
E tem outra: o argumento forte do SWE-2 não é score absoluto
Olha a tabela de novo, os 50,0% ficam ABAIXO do Fable 5.1 Medium
O argumento é custo por resultado: praticamente o mesmo patamar de score pagando bem menos
Quem decide por "qual é o melhor número" não vai se impressionar
Quem decide por "quanto custa resolver minhas tarefas do dia" tem motivo real pra prestar atenção
Onde o SWE-2 está disponível hoje no ecossistema do Devin
Desde o lançamento, o SWE-2 está no Devin Desktop e no Devin CLI
O rollout para o Devin Web e para o Devin Fusion foi anunciado como em andamento
E aqui vem a parte que interessa pra quem quer só experimentar: o SWE-2 e os modelos open source estão gratuitos no Devin Desktop e no Devin CLI até 10 de outubro de 2026
E quanto custa o Devin depois disso?
Os planos pagos hoje são estes:
- Pro: US$ 20/mês (algo em torno de R$ 102 no câmbio de US$ 1 = R$ 5,1013, do fechamento de 11/09/2026)
- Max: US$ 200/mês
- Teams: US$ 80/mês mais US$ 40/mês por assento completo
- Enterprise: sob consulta
Como selecionar o SWE-2 no Devin CLI
Se liga que é rapidinho, e os passos abaixo valem pro Devin CLI (a documentação de modelos do Devin CLI é a referência):
- Abra o seletor interativo de modelos dentro da sessão, digitando o comando sem nenhum argumento:
/model
Erro comum deste passo: passar um argumento junto achando que precisa
É justamente o /model SEM argumento que abre o seletor
- Quer fixar o SWE-2 como padrão e parar de escolher toda hora? Edite o arquivo de configuração
~/.config/devin/config.json(no Windows,%APPDATA%\devin\config.json):
{
"agent": {
"model": "swe-2"
}
}
Erro comum deste passo: procurar o arquivo no caminho do Linux/macOS estando no Windows
São caminhos diferentes, confere qual é o teu antes de sair criando arquivo em lugar errado
- Durante a sessão, alterne o nível de thinking com
Alt+T(no macOS,Opt+T)
O atalho cicla o nível de raciocínio nos modelos que suportam esforço configurável
- Tome cuidado com os apelidos curtos de modelo:
swe,opus,sonnet,codexegemini
Erro comum deste passo: achar que o apelido fixa uma versão específica
Ele sempre resolve pra última versão da família correspondente
Se você quer uma versão específica, escreva o nome específico, e não o apelido
Medium, high ou max: quando usar cada nível de esforço
Essa é a pergunta prática que todo mundo faz depois de entender o conceito
Medium como padrão do dia a dia
Pelos dados divulgados, o medium já é um ponto de partida bem defensável
Ele supera o SWE-1.7 no FrontierCode 1.1 Main usando 58% menos turnos, com custo médio 81% menor, e começa a editar código após mediana de 18 passos
Pra tarefa de rotina (ajuste pontual, bug conhecido, mexer num arquivo que você já entende) esse perfil cai como uma luva
High e max quando vale pagar mais raciocínio
A lógica aqui é orçamento e complexidade, simples assim
Quando a tarefa é aberta, atravessa vários arquivos ou depende de o agente entender um contexto grande antes de agir, subir o esforço é o movimento natural
E o ponto prático é esse: o nível existe justamente pra você decidir a régua tarefa a tarefa, em vez de pagar sempre o preço máximo
Vale testar o SWE-2 agora?
Recapitulando o que interessa: o SWE-2 é o modelo de codificação mais avançado da Cognition, pós-treinado em cima do Kimi K3, com esforço de raciocínio configurável em medium, high e max, treinados num único run de RL
Ele marca 50,0% no FrontierCode 1.1 Main, a menos de um ponto do Fable 5.1 e com custo 64% menor, segundo a própria Cognition
O ponto forte é esse: custo por resultado, não troféu de benchmark
E o próximo passo é bem concreto
Enquanto está gratuito no Devin Desktop e no Devin CLI, até 10 de outubro de 2026, dá pra rodar nas tuas tarefas reais e tirar tua própria conclusão
Depois é só cruzar com os números do leaderboard público do FrontierCode e ver se a conta fecha pro teu caso
Faça o teste e tira a limpo… até o próximo post! 😀
Perguntas frequentes
SWE-2 é gratuito para usar no Devin?
Sim, por tempo limitado. O SWE-2 e os modelos open source estão gratuitos no Devin Desktop e no Devin CLI até 10 de outubro de 2026. Depois dessa data, o acesso passa pelos planos pagos do Devin, que começam no Pro por US$ 20/mês
Qual a diferença entre os níveis medium, high e max do SWE-2?
Os três níveis representam quanto esforço de raciocínio o modelo aplica em cada tarefa, e foram treinados juntos num único run de reinforcement learning que avançou a curva de custo e desempenho inteira de uma vez. Na prática, medium tende a resolver tarefas simples gastando bem menos, enquanto high e max aplicam mais raciocínio nas tarefas mais complexas. É a primeira vez que a Cognition lança um modelo com esforço configurável desse jeito
Como trocar o nível de thinking do SWE-2 durante uma sessão no Devin CLI?
Basta usar o atalho Alt+T durante a sessão (no macOS é Opt+T), que cicla entre os níveis de thinking disponíveis para modelos com raciocínio configurável, caso do SWE-2. Não precisa reiniciar a sessão nem digitar nenhum comando
O apelido ‘swe’ no Devin CLI sempre seleciona o SWE-2?
Apelidos curtos como swe, opus, sonnet, codex e gemini resolvem sempre para a versão mais recente da família correspondente. Como o SWE-2 é hoje o modelo de codificação mais avançado da Cognition, digitar swe no seletor de modelos aponta para ele
O SWE-2 é um modelo de código aberto?
Não exatamente. Quem tem pesos abertos é a base dele, o Kimi K3, da Moonshot AI, modelo com 2,8 trilhões de parâmetros publicado em 26 de julho de 2026. O SWE-2 é o resultado do pós-treinamento da Cognition em cima dessa base, e roda como parte do ecossistema Devin
O SWE-2 é melhor que o Claude Fable 5.1?
Em score puro, não: o SWE-2 marca 50,0% no FrontierCode 1.1 Main, contra 50,9% do Fable 5.1 Medium e 50,3% do Fable 5.1 Max, segundo o leaderboard da Cognition. A diferença é de menos de 1 ponto percentual, mas o SWE-2 custa 64% menos, então o argumento dele é custo por resultado, não o maior número do benchmark
Formações
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
Blog | Mais populares
O que significa “ChatGPT network error” e como resolver
O “ChatGPT Network Error” é uma ocorrência frequente na rotina de muitos usuários do ChatGPT. Porém, poucos compreendem seu significado, quando esse erro surge, etc. […]

Checklist de segurança n8n VPS pública: guia essencial para proteger sua instalação
Checklist de segurança n8n VPS pública: guia essencial para proteger sua instalação A popularidade da automação de processos com o n8n está em alta, principalmente […]

Como usar o Antigravity do Google: guia completo do zero ao primeiro app
Aprenda neste guia prático como usar o Antigravity do Google: descubra a instalação, configuração, criação de projetos com o Agent Manager e o primeiro deploy, […]
