O que é o SWE-2 da Cognition e o que ele faz na prática?

ilustração explicando o que é o SWE-2 da Cognition e seus níveis de esforço no Devin
Resposta rápida

O SWE-2 é o modelo de codificação mais avançado da Cognition, anunciado em 10 de setembro de 2026 no post ‘Introducing SWE-2: Pushing the Pareto Frontier’. Ele foi pós-treinado a partir do Kimi K3, modelo de pesos abertos da Moonshot AI com 2,8 trilhões de parâmetros, e é o primeiro da Cognition com níveis de esforço configuráveis (medium, high e max), treinados em um único run de reinforcement learning. Marca 50,0% no FrontierCode 1.1 Main, menos de um ponto abaixo do Fable 5.1 custando 64% menos, segundo a Cognition. Roda no Devin Desktop e no Devin CLI, grátis até 10/10/2026.

Um modelo de codificação que encosta no topo do benchmark e cobra uma fração do preço dos rivais: é exatamente essa a proposta do SWE-2

Fala aí, beleza? No dia 10 de setembro de 2026 a Cognition anunciou o SWE-2, o modelo de codificação mais avançado dela, no post Introducing SWE-2: Pushing the Pareto Frontier

Se você só ouviu o nome por aí e ficou na dúvida do que é essa coisa, esse post é pra te situar

Bora entender o que ele é, o que muda de verdade e onde ele roda hoje 🙂

Formação Claude Code
Formação Recomendada

Formação Claude Code

Domine Claude Code do absoluto zero até o avançado

  • 116 aulas
  • 4 projetos
  • 9h 23min

Quem é a Cognition e de onde veio o SWE-2

A Cognition é a empresa por trás do Devin, então o SWE-2 não nasce solto no vácuo: ele nasce dentro de um ecossistema de agente de código que já existe

E tem um detalhe MUITO interessante na origem dele

O SWE-2 foi pós-treinado a partir do Kimi K3, o modelo aberto da Moonshot AI

O Kimi K3 tem 2,8 trilhões de parâmetros e teve os pesos publicados pela Moonshot em 26 de julho de 2026

O que significa "pós-treinado a partir de um modelo aberto"?

Boa pergunta, porque muita gente lê isso e acha que a Cognition treinou um modelo do zero

Não é isso

Pensa assim: se você conhece fork de projeto open source, a lógica é parecida

Alguém publica a base, outra empresa pega essa base e faz uma nova rodada de treinamento em cima, mirando num objetivo específico

No caso, o objetivo é desempenho agentic: modelo que não fica só cuspindo texto bonito, e sim trabalhando em tarefa de código por vários passos

Níveis de esforço configuráveis: a novidade técnica do SWE-2

Esse é o ponto central, e vale ler devagar

O SWE-2 é o primeiro modelo da Cognition com níveis de esforço de raciocínio configuráveis: medium, high e max

E a sacada não é só existir três níveis, é COMO eles foram treinados

A Cognition usou um algoritmo de reinforcement learning que treina todos os níveis de esforço em um único run, avançando a curva de custo/desempenho inteira de uma vez

Por que isso importa pra quem usa?

Porque na prática você passa a escolher quanto raciocínio quer pagar por tarefa

Renomear um monte de variável e ajustar um teste chato não precisa do mesmo esforço de uma refatoração que atravessa meia aplicação

Antes a escolha era basicamente trocar de modelo

Agora a escolha vira um botão de intensidade dentro do mesmo modelo, e isso é bem massa pra quem olha fatura no fim do mês

SWE-2 nos benchmarks: score e custo lado a lado

O benchmark da casa é o FrontierCode, e os números divulgados são estes:

Modelo / nível FrontierCode 1.1 Main Custo por tarefa Posicionamento segundo a Cognition
SWE-2 50,0% 64% menor que o do Fable 5.1 menos de 1 ponto percentual abaixo do Fable 5.1
Fable 5.1 Medium 50,9% US$ 3,28 valor do leaderboard vivo do FrontierCode
Fable 5.1 Max 50,3% US$ 12,83 valor do leaderboard vivo do FrontierCode

O posicionamento frente aos concorrentes, ainda segundo a Cognition, considerando o FrontierCode 1.1 Main e o DeepSWE 1.1:

  • supera o SWE-1.7 e o Grok 4.6 em score E em custo
  • fica no mesmo patamar do GPT-5.6 Sol e do Fable 5 e 5.1 por uma fração do preço, mesmo com o score do leaderboard ficando a menos de 1 ponto abaixo do Fable 5.1
  • fica a poucos pontos do GPT-6 Astra por cerca de um quarto do custo

E o nível medium, como se sai?

Aqui ficam os números mais impressionantes da comparação com a geração anterior:

SWE-2 medium comparado ao SWE-1.7 Dado divulgado
Score no FrontierCode 1.1 Main superior ao SWE-1.7
Turnos usados 58% menos
Custo médio 81% menor
Primeira edição real de código mediana de 18 passos, contra 48 do SWE-1.7

Esse último item é o que mais muda a sensação de uso: o modelo começa a mexer no código bem mais cedo, em vez de ficar 48 passos rodando em círculo antes de encostar num arquivo

O que esses números realmente dizem (e o que não dizem)

Agora a parte honesta, porque número solto engana

O FrontierCode é benchmark da PRÓPRIA Cognition

Isso não invalida nada, e tem um ponto a favor: existe um leaderboard público do FrontierCode, operado pela Cognition, onde o SWE-2 e o Claude Fable 5.1 já aparecem

Mas as comparações de posicionamento contra GPT-6 Astra, GPT-5.6 Sol, Grok 4.6 e companhia são afirmações da Cognition sobre o próprio modelo, e vale ler com esse filtro ligado

E tem outra: o argumento forte do SWE-2 não é score absoluto

Olha a tabela de novo, os 50,0% ficam ABAIXO do Fable 5.1 Medium

O argumento é custo por resultado: praticamente o mesmo patamar de score pagando bem menos

Quem decide por "qual é o melhor número" não vai se impressionar

Quem decide por "quanto custa resolver minhas tarefas do dia" tem motivo real pra prestar atenção

Onde o SWE-2 está disponível hoje no ecossistema do Devin

Desde o lançamento, o SWE-2 está no Devin Desktop e no Devin CLI

O rollout para o Devin Web e para o Devin Fusion foi anunciado como em andamento

E aqui vem a parte que interessa pra quem quer só experimentar: o SWE-2 e os modelos open source estão gratuitos no Devin Desktop e no Devin CLI até 10 de outubro de 2026

E quanto custa o Devin depois disso?

Os planos pagos hoje são estes:

  • Pro: US$ 20/mês (algo em torno de R$ 102 no câmbio de US$ 1 = R$ 5,1013, do fechamento de 11/09/2026)
  • Max: US$ 200/mês
  • Teams: US$ 80/mês mais US$ 40/mês por assento completo
  • Enterprise: sob consulta

Como selecionar o SWE-2 no Devin CLI

Se liga que é rapidinho, e os passos abaixo valem pro Devin CLI (a documentação de modelos do Devin CLI é a referência):

  1. Abra o seletor interativo de modelos dentro da sessão, digitando o comando sem nenhum argumento:
/model

Erro comum deste passo: passar um argumento junto achando que precisa

É justamente o /model SEM argumento que abre o seletor

  1. Quer fixar o SWE-2 como padrão e parar de escolher toda hora? Edite o arquivo de configuração ~/.config/devin/config.json (no Windows, %APPDATA%\devin\config.json):
{
  "agent": {
    "model": "swe-2"
  }
}

Erro comum deste passo: procurar o arquivo no caminho do Linux/macOS estando no Windows

São caminhos diferentes, confere qual é o teu antes de sair criando arquivo em lugar errado

  1. Durante a sessão, alterne o nível de thinking com Alt+T (no macOS, Opt+T)

O atalho cicla o nível de raciocínio nos modelos que suportam esforço configurável

  1. Tome cuidado com os apelidos curtos de modelo: swe, opus, sonnet, codex e gemini

Erro comum deste passo: achar que o apelido fixa uma versão específica

Ele sempre resolve pra última versão da família correspondente

Se você quer uma versão específica, escreva o nome específico, e não o apelido

Medium, high ou max: quando usar cada nível de esforço

Essa é a pergunta prática que todo mundo faz depois de entender o conceito

Medium como padrão do dia a dia

Pelos dados divulgados, o medium já é um ponto de partida bem defensável

Ele supera o SWE-1.7 no FrontierCode 1.1 Main usando 58% menos turnos, com custo médio 81% menor, e começa a editar código após mediana de 18 passos

Pra tarefa de rotina (ajuste pontual, bug conhecido, mexer num arquivo que você já entende) esse perfil cai como uma luva

High e max quando vale pagar mais raciocínio

A lógica aqui é orçamento e complexidade, simples assim

Quando a tarefa é aberta, atravessa vários arquivos ou depende de o agente entender um contexto grande antes de agir, subir o esforço é o movimento natural

E o ponto prático é esse: o nível existe justamente pra você decidir a régua tarefa a tarefa, em vez de pagar sempre o preço máximo

Vale testar o SWE-2 agora?

Recapitulando o que interessa: o SWE-2 é o modelo de codificação mais avançado da Cognition, pós-treinado em cima do Kimi K3, com esforço de raciocínio configurável em medium, high e max, treinados num único run de RL

Ele marca 50,0% no FrontierCode 1.1 Main, a menos de um ponto do Fable 5.1 e com custo 64% menor, segundo a própria Cognition

O ponto forte é esse: custo por resultado, não troféu de benchmark

E o próximo passo é bem concreto

Enquanto está gratuito no Devin Desktop e no Devin CLI, até 10 de outubro de 2026, dá pra rodar nas tuas tarefas reais e tirar tua própria conclusão

Depois é só cruzar com os números do leaderboard público do FrontierCode e ver se a conta fecha pro teu caso

Faça o teste e tira a limpo… até o próximo post! 😀

Perguntas frequentes

SWE-2 é gratuito para usar no Devin?

Sim, por tempo limitado. O SWE-2 e os modelos open source estão gratuitos no Devin Desktop e no Devin CLI até 10 de outubro de 2026. Depois dessa data, o acesso passa pelos planos pagos do Devin, que começam no Pro por US$ 20/mês

Qual a diferença entre os níveis medium, high e max do SWE-2?

Os três níveis representam quanto esforço de raciocínio o modelo aplica em cada tarefa, e foram treinados juntos num único run de reinforcement learning que avançou a curva de custo e desempenho inteira de uma vez. Na prática, medium tende a resolver tarefas simples gastando bem menos, enquanto high e max aplicam mais raciocínio nas tarefas mais complexas. É a primeira vez que a Cognition lança um modelo com esforço configurável desse jeito

Como trocar o nível de thinking do SWE-2 durante uma sessão no Devin CLI?

Basta usar o atalho Alt+T durante a sessão (no macOS é Opt+T), que cicla entre os níveis de thinking disponíveis para modelos com raciocínio configurável, caso do SWE-2. Não precisa reiniciar a sessão nem digitar nenhum comando

O apelido ‘swe’ no Devin CLI sempre seleciona o SWE-2?

Apelidos curtos como swe, opus, sonnet, codex e gemini resolvem sempre para a versão mais recente da família correspondente. Como o SWE-2 é hoje o modelo de codificação mais avançado da Cognition, digitar swe no seletor de modelos aponta para ele

O SWE-2 é um modelo de código aberto?

Não exatamente. Quem tem pesos abertos é a base dele, o Kimi K3, da Moonshot AI, modelo com 2,8 trilhões de parâmetros publicado em 26 de julho de 2026. O SWE-2 é o resultado do pós-treinamento da Cognition em cima dessa base, e roda como parte do ecossistema Devin

O SWE-2 é melhor que o Claude Fable 5.1?

Em score puro, não: o SWE-2 marca 50,0% no FrontierCode 1.1 Main, contra 50,9% do Fable 5.1 Medium e 50,3% do Fable 5.1 Max, segundo o leaderboard da Cognition. A diferença é de menos de 1 ponto percentual, mas o SWE-2 custa 64% menos, então o argumento dele é custo por resultado, não o maior número do benchmark



Escrito por | Matheus Battisti

Matheus Battisti
Fundador da Hora de Codar

Programador apaixonado pelo mundo das tecnologias, sempre buscando em aprender e se aprofundar em linguagens, frameworks e o que mais for necessário para executar um bom trabalho. Agora tem uma nova missão que é de passar seu conhecimento adiante para formar novos programadores e especializar mais os que já são.

Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted

Formações

Formação Vibe Coding

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

Blog | Mais populares