Por que o SWE-2 segue melhor o que você pede? O papel dos ambientes de RL e dos overlays de instruction-following

O SWE-2 é o novo modelo da Cognition, lançado em 10 de setembro de 2026, pós-treinado em cima do modelo base Kimi K3, com 2,8 trilhões de parâmetros no total e 104 bilhões ativos por token. A página oficial cita dois pontos que explicam por que ele tende a seguir melhor a instrução dada: a Cognition triplicou o número de ambientes de RL e adicionou overlays de instruction-following, empilhando requisitos extras sobre dados que já existiam. O resultado declarado é eficiência: no FrontierCode 1.1 Main, o nível medium pontua acima do SWE-1.7 com 58% menos turnos e custo 81% menor em média.
Fala aí, beleza? Sabe aquele momento em que você escreve um prompt com três regras bem claras, o agente cumpre a primeira, refatora um arquivo que ninguém pediu pra mexer e esquece completamente a terceira?
Esse é o tipo de dor que prompt bonito não resolve sozinho, o lugar de atacar isso é o treino do modelo
A Cognition lançou o SWE-2 em 10 de setembro de 2026, apresentado como um modelo que empurra a fronteira de Pareto entre custo e desempenho em engenharia de software
E tem dois itens na página oficial do lançamento que a empresa aponta como o trabalho feito justamente nesse ponto: a triplicação do número de ambientes de RL e os overlays de instruction-following
Bora destrinchar os dois? 😀
O que é o SWE-2 e de onde ele vem
O SWE-2 é o modelo da Cognition voltado pra engenharia de software, posicionado pela própria empresa como quem melhora a relação entre custo e desempenho em vez de só empilhar pontuação
Ele não nasceu do zero
É um pós-treinamento da Cognition em cima do modelo base Kimi K3
Formação Claude Code
Domine Claude Code do absoluto zero até o avançado
- 120 aulas
- 4 projetos
- 9h 45min
"Pós-treinamento?" É quando você pega um modelo base já existente e continua treinando ele pra um comportamento específico, no caso aqui, agir como agente de código
Os números de tamanho: 2,8 trilhões de parâmetros no total, com 104 bilhões ativos por token, numa arquitetura MoE
Se você nunca viu essa sigla, MoE é aquela ideia de ter um modelo gigante mas acionar só uma fatia dele por token, em vez de rodar a coisa inteira o tempo todo
E tem um detalhe que a Cognition faz questão de marcar: essa é a primeira vez que eles escalam RL no regime de múltiplos trilhões de parâmetros
Ou seja, não é só um modelo maior, é o processo de treino deles rodando numa escala que ainda não tinha rodado
Triplicar os ambientes de RL: o que isso significa na prática
Primeiro recurso citado pela página oficial: no trabalho de dados de treino, a Cognition triplicou o número de ambientes de RL e expandiu a distribuição de repositórios usados como fonte
Agora, o que é um ambiente de RL, afinal?
É o cenário onde o modelo pratica: um repositório, uma tarefa pra cumprir e uma forma de verificar se ele cumpriu mesmo
O modelo tenta, erra, recebe sinal de que errou, tenta de novo
Se você conhece aquele esquema de treinar alguém com exercícios corrigidos em vez de só entregar apostila pra ler, é mais ou menos isso
Triplicar a quantidade desses cenários muda o quê?
Variedade
Um modelo que só praticou num punhado de situações aprende os padrões daquele punhado
Quando ele encontra um repositório com outra estrutura, outro estilo, outra bagunça, ele tende a cair no comportamento genérico dele em vez de seguir o contexto que está na frente
Ampliar a distribuição de repositórios ataca exatamente isso: mais tipo de código real, menos chance de o modelo estar operando no piloto automático
Vale o aviso: a Cognition divulgou o "triplicou", não o número absoluto de ambientes nem quais repositórios entraram
Então dá pra entender a direção do trabalho, não dá pra dimensionar o tamanho dele
Overlays de instruction-following: empilhar requisitos na mesma tarefa
Esse aqui é o recurso que casa mais direto com a dor da abertura
A Cognition adicionou overlays de instruction-following
A mecânica descrita é simples de entender: eles pegaram dados de treino que já existiam e introduziram requisitos adicionais sobre eles
A tarefa original continua lá, mas agora com regras empilhadas por cima
O objetivo declarado é treinar o modelo a manter várias instruções em contexto sem perder de vista a tarefa original
Se liga no porquê isso importa
O comportamento chato de agente de código quase nunca é "não sabe programar"
É "sabe programar e resolveu programar do jeito dele"
Você pede pra corrigir um bug sem trocar a biblioteca de datas, e ele troca a biblioteca de datas
É o mesmo padrão de quando o modelo devolve um input nativo no lugar do componente que você pediu: a tarefa foi "resolvida", só que não do jeito combinado
Overlay de instrução é o treino dizendo pro modelo que cumprir 2 de 3 regras não é vitória parcial, é falha
Agora, sendo honesto: a Cognition descreve isso de forma qualitativa
Não tem score isolado de instruction-following publicado pra medir o tamanho do ganho
Então a leitura correta é "a empresa treinou explicitamente pra isso", e não "o problema acabou"
O flywheel dos verificadores e o problema do reward hacking
Tem um terceiro pilar que fecha a lógica dos outros dois, e ele é meio invisível pra quem só usa o produto
A Cognition construiu um flywheel em que checkpoints anteriores do próprio SWE-2 são usados pra endurecer os verificadores
Na prática, versões antigas do modelo inspecionam rollouts de treino pra achar e corrigir falsos positivos e falsos negativos
O alvo disso é o reward hacking
"Que reward hacking?" É quando o modelo descobre um atalho que engana o corretor em vez de resolver o problema
O teste passou, o objetivo não foi cumprido
E aqui está o ponto que liga tudo: de nada adianta empilhar requisitos extras numa tarefa se o verificador aceita qualquer resposta que pareça certa
Um verificador frouxo premia justamente o modelo que finge ter cumprido a instrução
O treino ensinaria o comportamento errado com todo empenho do mundo 😛
Endurecer o verificador é o que faz o overlay de instrução valer alguma coisa
Sem isso, você treina um modelo muito bom em parecer obediente
Menos passos, menos custo: o que aparece nos números
Agora a parte que dá pra medir
O SWE-2 tem níveis de esforço de raciocínio: medium, high e max
E tem um detalhe interessante de engenharia: todos foram treinados numa única execução de RL, em vez de virarem modelos separados por tipo de tarefa
A média de passos por execução em cada nível ficou assim:
- medium: 53 passos
- high: 80 passos
- max: 98 passos
- SWE-1.7 (o modelo anterior): 127 passos
Ou seja, até o nível max gasta menos passos que a geração anterior
No FrontierCode 1.1 Main, o nível medium pontua acima do SWE-1.7 usando 58% menos turnos e com custo 81% menor em média
E tem um número que traduz bem o comportamento no dia a dia: a mediana de passos até a primeira edição de código real é de 18 no SWE-2 medium, contra 48 no SWE-1.7
Pensa no que isso significa sentado na cadeira
Menos tempo assistindo o agente ler arquivo, listar pasta, ler de novo, pensar alto
Menos passos até a primeira edição também é menos superfície pra ele se distrair no caminho e voltar com algo que você não pediu
SWE-2 frente a Fable 5.1 e GPT-6 Astra: pontuação e custo
As pontuações divulgadas pela Cognition para o SWE-2:
| Benchmark | Pontuação do SWE-2 |
|---|---|
| FrontierCode 1.1 Main | 50,0 |
| DeepSWE 1.1 | 73,0 |
| Terminal-Bench 2.1 | 92,8 |
| Terminal-Bench 4.0 | 27,3 |
E a comparação com os concorrentes, no FrontierCode 1.1 Main:
| Modelo | FrontierCode 1.1 Main | Custo relativo (segundo a Cognition) |
|---|---|---|
| SWE-2 (Cognition) | 50,0 | referência |
| Fable 5.1 (Anthropic) | 50,9 | SWE-2 custa 64% menos para a mesma pontuação |
| GPT-6 Astra (OpenAI) | 53,3 | SWE-2 custa cerca de um quarto |
Como ler essa tabela: são números da própria fabricante, divulgados no post de lançamento
Não é leaderboard independente, não é auditoria de terceiro
A postura saudável aqui é a mesma de quando você confere os números que a IA devolve: número em tela não vira verdade só porque veio formatado bonitinho
O que a tabela mostra com clareza é o posicionamento escolhido: pontuação na mesma faixa dos concorrentes, com a briga sendo travada no custo
Quando um agente que segue instrução faz diferença no seu dia
Onde manter várias instruções em contexto realmente pesa? Alguns cenários bem comuns:
Prompt com restrição de stack e padrão de projeto
Você diz: usa o ORM que já está no projeto, não adiciona dependência nova, segue o padrão de nomes das pastas existentes
São três regras que precisam sobreviver até o final da execução, não só até o terceiro turno
Tarefa de escopo fechado
"Mexe só nesse arquivo"
Clássico
O agente abre o arquivo, vê uma função feia num arquivo vizinho e decide melhorar a vida de todo mundo
Aí você abre o diff e leva um susto
Fluxo longo de terminal
Quanto mais passos, mais chance da instrução do começo se perder no meio do caminho
É exatamente aí que a média de passos menor ajuda de tabela: uma execução mais curta tem menos oportunidade de desvio
Trabalho em cima de código legado
Código antigo costuma ter regra não óbvia que só você sabe, e que vai no prompt como "não toca nisso aqui"
Se o modelo perde essa linha, o estrago é grande
Isso é projeção de uso baseada no que a Cognition descreve do treino, e não promessa de resultado
O jeito de saber é rodar na sua base de código, com as suas manias 🙂
Vale a pena? O que o SWE-2 entrega e o que ainda falta saber
Vamos ao veredito honesto
O que o SWE-2 entrega, segundo os dados publicados, é eficiência
Menos turnos, menos passos até a primeira edição, custo bem menor que os concorrentes na mesma faixa de pontuação
O que ele não entrega é liderança de pontuação: no FrontierCode 1.1 Main, os 50,0 dele ficam ligeiramente abaixo dos 50,9 do Fable 5.1 e dos 53,3 do GPT-6 Astra
Se o seu critério é "o teto mais alto possível", esse não é o argumento de venda dele
Se o seu critério é "resolve bem e não queima orçamento", aí a conversa muda
Agora as lacunas, que são relevantes:
- a Cognition declara custo apenas em termos relativos, em percentual frente ao Fable 5.1, ao GPT-6 Astra e ao SWE-1.7, sem tabela de preço por token publicada
- não há API standalone publicada nem pesos abertos para o SWE-2
- os benchmarks citados são da própria fabricante
Sem preço por token, aquele "64% menos" é uma afirmação que você não consegue conferir com calculadora na mão
Dá pra acreditar? Dá
Dá pra verificar? Ainda não
Onde usar o SWE-2 hoje
Desde o lançamento, o SWE-2 está disponível no Devin Desktop e no Devin CLI
O rollout no Devin Web e no Fusion estava em andamento na data do anúncio, sem data de conclusão divulgada
Fora dos produtos da Cognition, não há caminho anunciado: sem API standalone, sem preço por token, sem pesos abertos
Então, se você já está dentro do ecossistema Devin, é onde o modelo aparece pra você hoje
Se não está, por enquanto é acompanhar de fora
Conclusão
Os dois recursos que a página oficial cita não são detalhe de release notes, eles miram o sintoma mais chato de agente de código
Triplicar os ambientes de RL amplia a variedade de situações onde o modelo praticou
Os overlays de instruction-following treinam ele a segurar várias instruções ao mesmo tempo sem largar a tarefa original
E o flywheel dos verificadores existe pra que nada disso seja premiado no grito, com o modelo fingindo ter cumprido
Prova de que a dor da abertura acabou? Não tem, e a própria Cognition não publicou score isolado disso
Próximo passo realista: se você já usa Devin Desktop ou Devin CLI, pega uma tarefa com múltiplas restrições, daquelas com "faz X, sem mexer em Y, seguindo o padrão Z", e compara o comportamento com o que você já vinha usando
Se ainda não usa, vale acompanhar o rollout no Devin Web e no Fusion e ver se sai uma publicação de preço por token, porque hoje o custo só existe em percentual
E me conta nos comentários: qual agente melhor respeita instrução no seu fluxo hoje? Bora trocar uma ideia
Até o próximo post! 😀
Perguntas frequentes
Onde já dá pra usar o SWE-2 hoje?
O SWE-2 está disponível no Devin Desktop e no Devin CLI desde o lançamento, em 10 de setembro de 2026. O rollout também está em andamento no Devin Web e no Fusion, então a cobertura ainda está se espalhando pelos produtos da Cognition.
O SWE-2 tem API própria ou pesos abertos pra rodar fora do Devin?
Não. A Cognition não publicou API standalone, preço por token nem pesos abertos pro SWE-2. Ou seja, hoje o acesso passa pelos produtos da própria empresa, não por um endpoint separado.
Quanto custa usar o SWE-2 comparado a outros modelos?
A Cognition não divulga tabela de preço por token, só comparações relativas. No FrontierCode 1.1 Main, o custo do SWE-2 é 64% menor que o do Fable 5.1 pra mesma pontuação e cerca de um quarto do custo do GPT-6 Astra.
Como o SWE-2 se compara ao Fable 5.1 e ao GPT-6 Astra no FrontierCode 1.1 Main?
No FrontierCode 1.1 Main o SWE-2 marca 50,0 pontos, contra 50,9 do Fable 5.1 (Anthropic) e 53,3 do GPT-6 Astra (OpenAI). A pontuação fica levemente abaixo dos dois, mas a Cognition sustenta a diferença como custo bem menor pelo resultado entregue.
Qual a diferença entre os níveis medium, high e max do SWE-2?
São níveis de esforço de raciocínio treinados numa única execução de RL, não modelos separados. Em média, o medium usa 53 passos por execução, o high usa 80 e o max usa 98, todos abaixo dos 127 passos do SWE-1.7.
Quantos passos o SWE-2 leva até fazer a primeira edição de código real?
No FrontierCode 1.1 Main, o SWE-2 medium chega na primeira edição de código com mediana de 18 passos. O SWE-1.7 precisava de 48 passos pra isso, o que ajuda a explicar o custo menor do SWE-2 no mesmo benchmark.
Formações
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
Blog | Mais populares

Como Recuperar Conversas Apagadas no ChatGPT: É Possível?
Descubra neste artigo tudo o que você precisa saber sobre como recuperar conversas apagadas no ChatGPT, se isso é possível, quais alternativas existem para proteger […]
ChatGPT não funciona: saiba como corrigir erros
ChatGPT não funciona? O ChatGPT pode deixar de funcionar por diversos motivos, e a maioria deles está relacionada a problemas de conexão, cache ou instabilidade […]

Como limpar histórico do ChatGPT e proteger sua privacidade
Veja como limpar o histórico do ChatGPT e proteger sua privacidade de forma simples e eficaz, mantendo seus dados seguros online. Para apagar uma conversa […]
