Por que o SWE-2 segue melhor o que você pede? O papel dos ambientes de RL e dos overlays de instruction-following

modelo SWE-2 da Cognition seguindo instruções com ambientes de RL e overlays de instruction-following
Resposta rápida

O SWE-2 é o novo modelo da Cognition, lançado em 10 de setembro de 2026, pós-treinado em cima do modelo base Kimi K3, com 2,8 trilhões de parâmetros no total e 104 bilhões ativos por token. A página oficial cita dois pontos que explicam por que ele tende a seguir melhor a instrução dada: a Cognition triplicou o número de ambientes de RL e adicionou overlays de instruction-following, empilhando requisitos extras sobre dados que já existiam. O resultado declarado é eficiência: no FrontierCode 1.1 Main, o nível medium pontua acima do SWE-1.7 com 58% menos turnos e custo 81% menor em média.

Fala aí, beleza? Sabe aquele momento em que você escreve um prompt com três regras bem claras, o agente cumpre a primeira, refatora um arquivo que ninguém pediu pra mexer e esquece completamente a terceira?

Esse é o tipo de dor que prompt bonito não resolve sozinho, o lugar de atacar isso é o treino do modelo

A Cognition lançou o SWE-2 em 10 de setembro de 2026, apresentado como um modelo que empurra a fronteira de Pareto entre custo e desempenho em engenharia de software

E tem dois itens na página oficial do lançamento que a empresa aponta como o trabalho feito justamente nesse ponto: a triplicação do número de ambientes de RL e os overlays de instruction-following

Bora destrinchar os dois? 😀

O que é o SWE-2 e de onde ele vem

O SWE-2 é o modelo da Cognition voltado pra engenharia de software, posicionado pela própria empresa como quem melhora a relação entre custo e desempenho em vez de só empilhar pontuação

Ele não nasceu do zero

É um pós-treinamento da Cognition em cima do modelo base Kimi K3

Formação Claude Code
Formação Recomendada

Formação Claude Code

Domine Claude Code do absoluto zero até o avançado

  • 120 aulas
  • 4 projetos
  • 9h 45min

"Pós-treinamento?" É quando você pega um modelo base já existente e continua treinando ele pra um comportamento específico, no caso aqui, agir como agente de código

Os números de tamanho: 2,8 trilhões de parâmetros no total, com 104 bilhões ativos por token, numa arquitetura MoE

Se você nunca viu essa sigla, MoE é aquela ideia de ter um modelo gigante mas acionar só uma fatia dele por token, em vez de rodar a coisa inteira o tempo todo

E tem um detalhe que a Cognition faz questão de marcar: essa é a primeira vez que eles escalam RL no regime de múltiplos trilhões de parâmetros

Ou seja, não é só um modelo maior, é o processo de treino deles rodando numa escala que ainda não tinha rodado

Triplicar os ambientes de RL: o que isso significa na prática

Primeiro recurso citado pela página oficial: no trabalho de dados de treino, a Cognition triplicou o número de ambientes de RL e expandiu a distribuição de repositórios usados como fonte

Agora, o que é um ambiente de RL, afinal?

É o cenário onde o modelo pratica: um repositório, uma tarefa pra cumprir e uma forma de verificar se ele cumpriu mesmo

O modelo tenta, erra, recebe sinal de que errou, tenta de novo

Se você conhece aquele esquema de treinar alguém com exercícios corrigidos em vez de só entregar apostila pra ler, é mais ou menos isso

Triplicar a quantidade desses cenários muda o quê?

Variedade

Um modelo que só praticou num punhado de situações aprende os padrões daquele punhado

Quando ele encontra um repositório com outra estrutura, outro estilo, outra bagunça, ele tende a cair no comportamento genérico dele em vez de seguir o contexto que está na frente

Ampliar a distribuição de repositórios ataca exatamente isso: mais tipo de código real, menos chance de o modelo estar operando no piloto automático

Vale o aviso: a Cognition divulgou o "triplicou", não o número absoluto de ambientes nem quais repositórios entraram

Então dá pra entender a direção do trabalho, não dá pra dimensionar o tamanho dele

Overlays de instruction-following: empilhar requisitos na mesma tarefa

Esse aqui é o recurso que casa mais direto com a dor da abertura

A Cognition adicionou overlays de instruction-following

A mecânica descrita é simples de entender: eles pegaram dados de treino que já existiam e introduziram requisitos adicionais sobre eles

A tarefa original continua lá, mas agora com regras empilhadas por cima

O objetivo declarado é treinar o modelo a manter várias instruções em contexto sem perder de vista a tarefa original

Se liga no porquê isso importa

O comportamento chato de agente de código quase nunca é "não sabe programar"

É "sabe programar e resolveu programar do jeito dele"

Você pede pra corrigir um bug sem trocar a biblioteca de datas, e ele troca a biblioteca de datas

É o mesmo padrão de quando o modelo devolve um input nativo no lugar do componente que você pediu: a tarefa foi "resolvida", só que não do jeito combinado

Overlay de instrução é o treino dizendo pro modelo que cumprir 2 de 3 regras não é vitória parcial, é falha

Agora, sendo honesto: a Cognition descreve isso de forma qualitativa

Não tem score isolado de instruction-following publicado pra medir o tamanho do ganho

Então a leitura correta é "a empresa treinou explicitamente pra isso", e não "o problema acabou"

O flywheel dos verificadores e o problema do reward hacking

Tem um terceiro pilar que fecha a lógica dos outros dois, e ele é meio invisível pra quem só usa o produto

A Cognition construiu um flywheel em que checkpoints anteriores do próprio SWE-2 são usados pra endurecer os verificadores

Na prática, versões antigas do modelo inspecionam rollouts de treino pra achar e corrigir falsos positivos e falsos negativos

O alvo disso é o reward hacking

"Que reward hacking?" É quando o modelo descobre um atalho que engana o corretor em vez de resolver o problema

O teste passou, o objetivo não foi cumprido

E aqui está o ponto que liga tudo: de nada adianta empilhar requisitos extras numa tarefa se o verificador aceita qualquer resposta que pareça certa

Um verificador frouxo premia justamente o modelo que finge ter cumprido a instrução

O treino ensinaria o comportamento errado com todo empenho do mundo 😛

Endurecer o verificador é o que faz o overlay de instrução valer alguma coisa

Sem isso, você treina um modelo muito bom em parecer obediente

Menos passos, menos custo: o que aparece nos números

Agora a parte que dá pra medir

O SWE-2 tem níveis de esforço de raciocínio: medium, high e max

E tem um detalhe interessante de engenharia: todos foram treinados numa única execução de RL, em vez de virarem modelos separados por tipo de tarefa

A média de passos por execução em cada nível ficou assim:

  • medium: 53 passos
  • high: 80 passos
  • max: 98 passos
  • SWE-1.7 (o modelo anterior): 127 passos

Ou seja, até o nível max gasta menos passos que a geração anterior

No FrontierCode 1.1 Main, o nível medium pontua acima do SWE-1.7 usando 58% menos turnos e com custo 81% menor em média

E tem um número que traduz bem o comportamento no dia a dia: a mediana de passos até a primeira edição de código real é de 18 no SWE-2 medium, contra 48 no SWE-1.7

Pensa no que isso significa sentado na cadeira

Menos tempo assistindo o agente ler arquivo, listar pasta, ler de novo, pensar alto

Menos passos até a primeira edição também é menos superfície pra ele se distrair no caminho e voltar com algo que você não pediu

SWE-2 frente a Fable 5.1 e GPT-6 Astra: pontuação e custo

As pontuações divulgadas pela Cognition para o SWE-2:

Benchmark Pontuação do SWE-2
FrontierCode 1.1 Main 50,0
DeepSWE 1.1 73,0
Terminal-Bench 2.1 92,8
Terminal-Bench 4.0 27,3

E a comparação com os concorrentes, no FrontierCode 1.1 Main:

Modelo FrontierCode 1.1 Main Custo relativo (segundo a Cognition)
SWE-2 (Cognition) 50,0 referência
Fable 5.1 (Anthropic) 50,9 SWE-2 custa 64% menos para a mesma pontuação
GPT-6 Astra (OpenAI) 53,3 SWE-2 custa cerca de um quarto

Como ler essa tabela: são números da própria fabricante, divulgados no post de lançamento

Não é leaderboard independente, não é auditoria de terceiro

A postura saudável aqui é a mesma de quando você confere os números que a IA devolve: número em tela não vira verdade só porque veio formatado bonitinho

O que a tabela mostra com clareza é o posicionamento escolhido: pontuação na mesma faixa dos concorrentes, com a briga sendo travada no custo

Quando um agente que segue instrução faz diferença no seu dia

Onde manter várias instruções em contexto realmente pesa? Alguns cenários bem comuns:

Prompt com restrição de stack e padrão de projeto

Você diz: usa o ORM que já está no projeto, não adiciona dependência nova, segue o padrão de nomes das pastas existentes

São três regras que precisam sobreviver até o final da execução, não só até o terceiro turno

Tarefa de escopo fechado

"Mexe só nesse arquivo"

Clássico

O agente abre o arquivo, vê uma função feia num arquivo vizinho e decide melhorar a vida de todo mundo

Aí você abre o diff e leva um susto

Fluxo longo de terminal

Quanto mais passos, mais chance da instrução do começo se perder no meio do caminho

É exatamente aí que a média de passos menor ajuda de tabela: uma execução mais curta tem menos oportunidade de desvio

Trabalho em cima de código legado

Código antigo costuma ter regra não óbvia que só você sabe, e que vai no prompt como "não toca nisso aqui"

Se o modelo perde essa linha, o estrago é grande

Isso é projeção de uso baseada no que a Cognition descreve do treino, e não promessa de resultado

O jeito de saber é rodar na sua base de código, com as suas manias 🙂

Vale a pena? O que o SWE-2 entrega e o que ainda falta saber

Vamos ao veredito honesto

O que o SWE-2 entrega, segundo os dados publicados, é eficiência

Menos turnos, menos passos até a primeira edição, custo bem menor que os concorrentes na mesma faixa de pontuação

O que ele não entrega é liderança de pontuação: no FrontierCode 1.1 Main, os 50,0 dele ficam ligeiramente abaixo dos 50,9 do Fable 5.1 e dos 53,3 do GPT-6 Astra

Se o seu critério é "o teto mais alto possível", esse não é o argumento de venda dele

Se o seu critério é "resolve bem e não queima orçamento", aí a conversa muda

Agora as lacunas, que são relevantes:

  • a Cognition declara custo apenas em termos relativos, em percentual frente ao Fable 5.1, ao GPT-6 Astra e ao SWE-1.7, sem tabela de preço por token publicada
  • não há API standalone publicada nem pesos abertos para o SWE-2
  • os benchmarks citados são da própria fabricante

Sem preço por token, aquele "64% menos" é uma afirmação que você não consegue conferir com calculadora na mão

Dá pra acreditar? Dá

Dá pra verificar? Ainda não

Onde usar o SWE-2 hoje

Desde o lançamento, o SWE-2 está disponível no Devin Desktop e no Devin CLI

O rollout no Devin Web e no Fusion estava em andamento na data do anúncio, sem data de conclusão divulgada

Fora dos produtos da Cognition, não há caminho anunciado: sem API standalone, sem preço por token, sem pesos abertos

Então, se você já está dentro do ecossistema Devin, é onde o modelo aparece pra você hoje

Se não está, por enquanto é acompanhar de fora

Conclusão

Os dois recursos que a página oficial cita não são detalhe de release notes, eles miram o sintoma mais chato de agente de código

Triplicar os ambientes de RL amplia a variedade de situações onde o modelo praticou

Os overlays de instruction-following treinam ele a segurar várias instruções ao mesmo tempo sem largar a tarefa original

E o flywheel dos verificadores existe pra que nada disso seja premiado no grito, com o modelo fingindo ter cumprido

Prova de que a dor da abertura acabou? Não tem, e a própria Cognition não publicou score isolado disso

Próximo passo realista: se você já usa Devin Desktop ou Devin CLI, pega uma tarefa com múltiplas restrições, daquelas com "faz X, sem mexer em Y, seguindo o padrão Z", e compara o comportamento com o que você já vinha usando

Se ainda não usa, vale acompanhar o rollout no Devin Web e no Fusion e ver se sai uma publicação de preço por token, porque hoje o custo só existe em percentual

E me conta nos comentários: qual agente melhor respeita instrução no seu fluxo hoje? Bora trocar uma ideia

Até o próximo post! 😀

Perguntas frequentes

Onde já dá pra usar o SWE-2 hoje?

O SWE-2 está disponível no Devin Desktop e no Devin CLI desde o lançamento, em 10 de setembro de 2026. O rollout também está em andamento no Devin Web e no Fusion, então a cobertura ainda está se espalhando pelos produtos da Cognition.

O SWE-2 tem API própria ou pesos abertos pra rodar fora do Devin?

Não. A Cognition não publicou API standalone, preço por token nem pesos abertos pro SWE-2. Ou seja, hoje o acesso passa pelos produtos da própria empresa, não por um endpoint separado.

Quanto custa usar o SWE-2 comparado a outros modelos?

A Cognition não divulga tabela de preço por token, só comparações relativas. No FrontierCode 1.1 Main, o custo do SWE-2 é 64% menor que o do Fable 5.1 pra mesma pontuação e cerca de um quarto do custo do GPT-6 Astra.

Como o SWE-2 se compara ao Fable 5.1 e ao GPT-6 Astra no FrontierCode 1.1 Main?

No FrontierCode 1.1 Main o SWE-2 marca 50,0 pontos, contra 50,9 do Fable 5.1 (Anthropic) e 53,3 do GPT-6 Astra (OpenAI). A pontuação fica levemente abaixo dos dois, mas a Cognition sustenta a diferença como custo bem menor pelo resultado entregue.

Qual a diferença entre os níveis medium, high e max do SWE-2?

São níveis de esforço de raciocínio treinados numa única execução de RL, não modelos separados. Em média, o medium usa 53 passos por execução, o high usa 80 e o max usa 98, todos abaixo dos 127 passos do SWE-1.7.

Quantos passos o SWE-2 leva até fazer a primeira edição de código real?

No FrontierCode 1.1 Main, o SWE-2 medium chega na primeira edição de código com mediana de 18 passos. O SWE-1.7 precisava de 48 passos pra isso, o que ajuda a explicar o custo menor do SWE-2 no mesmo benchmark.



Escrito por | Matheus Battisti

Matheus Battisti
Fundador da Hora de Codar

Programador apaixonado pelo mundo das tecnologias, sempre buscando em aprender e se aprofundar em linguagens, frameworks e o que mais for necessário para executar um bom trabalho. Agora tem uma nova missão que é de passar seu conhecimento adiante para formar novos programadores e especializar mais os que já são.

Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted

Formações

Formação Vibe Coding

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

Blog | Mais populares