Como a Cognition treinou o SWE-2: penalidade de custo e reward baseline explicados

O SWE-2 é o modelo de codificação mais capaz da Cognition, anunciado em 10 de setembro de 2026 e posicionado como um avanço da fronteira de Pareto entre capacidade e custo. Ele é pós-treinado a partir do Kimi K3, de 2,8 trilhões de parâmetros, e o RL da Cognition por cima adiciona de 5 a 6 pontos em vários benchmarks. Duas decisões de treino explicam o resultado: uma penalidade de custo linear por nível de esforço, calibrada pela inclinação local da fronteira de Pareto do modelo base, e um reward baseline ponderado por comprimento, que segura a variância do gradiente e estabiliza o treino
Fala aí, beleza?
O salto do SWE-2 não veio de empilhar parâmetro, veio de escolha de treino
A Cognition lançou o SWE-2 em 10 de setembro de 2026 como seu modelo de codificação mais capaz, e apresentou ele não como "o mais forte da tabela" e sim como um avanço da fronteira de Pareto entre capacidade e custo
E a parte interessante é que a própria empresa abriu duas decisões técnicas por trás disso no post de lançamento: uma penalidade de custo linear por nível de esforço e um reward baseline ponderado por comprimento
São dois termos que soam como papo de laboratório de RL
Bora traduzir os dois pra quem programa, usa agente todo dia e não vive de pesquisa? 🙂
De onde o SWE-2 parte: Kimi K3 e o que o RL da Cognition acrescenta
Primeiro o básico, porque muita gente lê "modelo novo" e imagina treino do zero
O SWE-2 é pós-treinado a partir do Kimi K3, um modelo de 2,8 trilhões de parâmetros que já tinha passado por RL extenso para codificação agêntica
Formação Claude Code
Domine Claude Code do absoluto zero até o avançado
- 120 aulas
- 4 projetos
- 9h 45min
Ou seja: a base já era boa em agir dentro de um repositório, rodar comando, ler arquivo, editar código
O que a Cognition faz é uma camada de RL por cima dessa base
E o resultado declarado pela Cognition é bem direto: de 5 a 6 pontos a mais em vários benchmarks, com a curva inteira de custo e performance do modelo base deslocada
Só leia isso como a faixa que eles anunciam, e não como régua fixa: o tamanho do ganho varia de benchmark pra benchmark, como dá pra ver na lista logo abaixo
Repara nessa palavra, "curva inteira"
Não é ganhar num ponto específico e piorar no resto, é mover a relação toda entre o quanto você gasta e o quanto o modelo resolve
Os números publicados pela Cognition comparando SWE-2 e Kimi K3 base:
- DeepSWE 1.1: 73,0% contra 68,5%
- Terminal-Bench 2.1: 92,8% contra 88,3%
- Terminal-Bench 4: 27,3% contra 21,5%
Em todos os benchmarks publicados por eles, o SWE-2 fica acima da base
O que é pós-treino, afinal?
Pergunta justa, já que o termo aparece o tempo todo e quase ninguém para pra explicar
Pós-treino é o trabalho feito DEPOIS que o modelo base já existe: você não reescreve o conhecimento dele, você molda o comportamento
A analogia de aproximação: se você já contratou um dev sênior muito bom que nunca trabalhou na sua empresa, o pós-treino é o onboarding
Ele já sabe programar
O que ele ainda não sabe é o que vale a pena investigar, quando parar de investigar e quanto de tempo (leia: custo) cada tipo de tarefa merece
E é exatamente aí que entram as duas decisões abaixo
Penalidade de custo linear: como a Cognition ensinou o modelo a se importar com a conta
Esse é o coração do assunto
O SWE-2 tem três níveis de esforço: medium, high e max
A escolha ULTRA importante aqui é que os três são treinados em um único run de RL, e não em rodadas separadas ou em três modelos diferentes
Dentro desse mesmo run, cada nível de esforço carrega a sua própria penalidade de custo, e ela é linear
E o que significa "penalidade de custo" no reward?
Em RL, o modelo recebe um reward por aquilo que fez
Se o reward olha só pra "resolveu ou não resolveu", o comportamento ótimo é explorar até o fim do mundo, porque explorar mais nunca dói
Quando você coloca uma penalidade de custo, o reward passa a ser "resolveu, menos o quanto isso custou"
Aí o modelo aprende que enrolar tem preço
A Cognition diz explicitamente que o objetivo do desenho é refletir no treino o custo real pago pelo usuário, da forma mais direta possível
O agente não está otimizando uma métrica abstrata de "seja eficiente", ele está otimizando algo modelado em cima da conta que você paga
E a tal "inclinação local da fronteira de Pareto"?
Calma que essa é mais simples do que parece
Fronteira de Pareto, aqui, é a curva do que o modelo base conseguia entregar: pra cada nível de custo, qual a melhor performance possível
A inclinação LOCAL dessa curva é o câmbio daquele ponto específico: quanto de custo extra o modelo base cobrava por cada ponto a mais de performance ali
Na parte barata da curva, um ponto a mais sai relativamente barato
Na parte cara, o mesmo ponto a mais custa muito mais
A Cognition calibra a penalidade de cada nível de esforço por essa inclinação local
O efeito disso é que cada nível é empurrado pra frente respeitando o câmbio da região onde ele vive, e a fronteira avança preservando a forma dela, em vez de virar tudo um nível só achatado no meio
Por que linear, e não qualquer outra forma?
Essa é a parte que a Cognition trata como decisão de primeiros princípios
Segundo eles, a forma linear é a única que preserva a propriedade de depender apenas do custo médio e da taxa média de resolução
Traduzindo pro dia a dia: com penalidade linear, o que importa é a média
Uma tarefa específica que saiu cara não distorce o sinal de aprendizado de um jeito estranho, porque o que o treino enxerga é o custo médio contra o solve rate médio
É um detalhe que parece pequeno e não é
É ele que permite dizer "empurrei a fronteira" em vez de "achatei uma ponta pra ganhar na outra"
Reward baseline ponderado por comprimento: por que o treino não desanda
Segundo termo, segunda tradução
Baseline é a referência contra a qual o reward de cada rollout é comparado
Rollout, no caso, é uma execução completa do agente na tarefa: ele lê, explora, edita, roda teste, termina
Sem baseline, o gradiente fica ruidoso demais, porque tudo que deu reward positivo empurra o modelo, mesmo quando aquilo era só o comportamento médio esperado
Com baseline, o sinal vira "foi melhor ou pior que a referência"
A observação que a Cognition usa
A sacada declarada é essa: a norma do gradiente ao quadrado correlaciona fortemente com o comprimento do rollout
Rollout longo mexe mais no gradiente, e mexe desproporcionalmente
Então, em vez de uma média simples dos rewards, eles aproximam o baseline ótimo como uma média dos rewards PONDERADA por comprimento
Os rollouts que pesam mais no gradiente pesam mais na referência também
Faz sentido quando você para pra pensar, né? 😀
O que eles dizem que isso entrega
Os efeitos declarados pela Cognition:
- menor variância do gradiente
- custo adicional zero para aplicar a técnica
- treino significativamente mais estável
- divergência KL entre inferência e treino mantida baixa durante o RL
Esse último merece um parágrafo
Divergência KL entre inferência e treino é, na prática, o quanto o modelo que roda em produção descola do modelo que está sendo treinado
Quanto maior o modelo, mais isso pesa, e a Cognition marca justamente esse ponto: é um problema que cresce junto com a escala
E não é técnica nova da casa: eles usam o baseline ponderado por comprimento desde o SWE-1.6
O que essas escolhas produziram nos benchmarks
Teoria é legal, mas o que interessa é o que saiu do outro lado
Os números publicados pela Cognition, SWE-2 contra o Kimi K3 base:
| Benchmark | SWE-2 | Kimi K3 (base) |
|---|---|---|
| FrontierCode 1.1 Main | 50,0% | 44,2% |
| DeepSWE 1.1 | 73,0% | 68,5% |
| Terminal-Bench 2.1 | 92,8% | 88,3% |
| Terminal-Bench 4 | 27,3% | 21,5% |
Repara que a distância muda conforme o benchmark, e é por isso que vale ler a faixa anunciada pela Cognition como faixa mesmo, não como um número igual em toda linha
E as comparações que mostram o lado do custo, que é o ponto todo do ângulo:
| Comparação | Resultado |
|---|---|
| SWE-2 vs Claude Fable 5.1 (FrontierCode 1.1 Main) | 50,0% contra 50,9%, com o SWE-2 custando 64% menos |
| SWE-2 medium vs SWE-1.7 (FrontierCode 1.1 Main) | medium pontua acima do SWE-1.7, com 58% menos turnos e 81% menos custo em média |
| Primeira edição real de código (mediana) | 18 passos no SWE-2 medium contra 48 passos do SWE-1.7 |
Essa última linha é a que mais me chama atenção
48 passos de mediana até a primeira edição real de código é MUITO
O SWE-1.7 recebia reclamação de usuário por explorar demais em tarefa simples, e dá pra entender o porquê: você pede algo pequeno e fica olhando o agente passear pelo repositório
O SWE-2 medium chega em 18
E a leitura da própria Cognition sobre de onde vem esse ganho é importante: eles atribuem os maiores ganhos de eficiência à exploração focada, não a cortar trabalho
Mais inteligência permite julgar quais partes do codebase realmente importam pra tarefa
Não é o agente fazendo menos
É o agente errando menos o alvo do que precisa ler
Medium, high ou max: qual nível de esforço usar em cada tarefa
Agora aterrissa tudo isso no uso diário
Primeiro, a coisa mais importante de entender: medium, high e max não são três modelos diferentes
É o MESMO modelo, treinado num único run, com penalidades de custo calibradas por nível
A diferença de comportamento que você sente é consequência direta disso
Os perfis descritos pela Cognition:
- medium: parte pra ação rápido, serve tarefas simples a intermediárias onde o custo importa
- high: planeja e explora mais o codebase, lida melhor com requisitos ambíguos
- max: libera o teto de turnos e tokens pras tarefas mais difíceis, com cadeias de verificação complexas
Traduzindo pro tipo de coisa que cai na sua fila:
Ajuste pontual, correção pequena, mudança que você já sabe onde fica? Esse é o território do medium, e é justamente aí que os 18 passos de mediana até a primeira edição fazem diferença no seu dia
Tarefa onde o pedido veio meio vago, você não sabe direito quais arquivos estão envolvidos e precisa de alguém lendo o contexto antes de sair editando? É o cenário do high
Aquela tarefa cabeluda, com várias camadas, que precisa verificar o próprio trabalho em cadeia até fechar? É pra isso que o max existe, com o teto de turnos e tokens liberado
O que muda para quem programa com agentes
Fecha o ciclo: penalizar custo no treino é o que faz o agente parar de explorar demais em tarefa simples
É literalmente isso
O comportamento chato de "pedi pra trocar uma string e ele leu meio projeto" não se resolve com prompt pedindo pra ser eficiente
Se resolve no reward, ensinando o modelo que gastar tem preço, e calibrando esse preço pelo câmbio real da curva
Onde dá pra usar o SWE-2 hoje: ele está disponível no Devin Desktop e no Devin CLI, com rollout em andamento para Devin Web e Fusion
E tem uma janela boa aqui: a Cognition liberou o SWE-2 sem cobrança para assinantes Pro, Max e Teams pelo mês seguinte ao lançamento
Vale citar também que a Cognition publicou resultados de avaliações internas de confiabilidade do SWE-2, rodadas sobre ele e mais cinco modelos, incluindo o Claude Fable 5.1
As avaliações cobrem comportamento de propaganda e censura e vulnerabilidade dependente de contexto em código gerado
É material de casa, então leia como o que é, mas é bom que exista e esteja publicado junto do lançamento
Vídeo: customizações e configuração de agentes na prática
Se o assunto de controlar esforço e custo do agente te interessou, esse vídeo do canal é um bom ponto de partida pra entender como customizar o comportamento de um agente de código
Conclusão
Recapitulando o que realmente explica o SWE-2
A penalidade de custo linear por nível de esforço, calibrada pela inclinação local da fronteira de Pareto do modelo base, é o que ensina o modelo a se importar com a conta e o que faz medium, high e max existirem dentro de um único run de RL
O reward baseline ponderado por comprimento é o que segura a variância do gradiente, sem custo extra, e mantém o treino estável e a divergência KL entre inferência e treino baixa
Duas alavancas de treino
Um modelo mais barato sem perder capacidade
Próximo passo se você tem acesso: pega uma tarefa real do seu projeto e roda a MESMA tarefa em medium e depois em high no Devin Desktop ou no Devin CLI
Compara turnos gastos e resultado final
É o jeito mais honesto de sentir na prática o que essas decisões de treino fizeram, e o período sem cobrança pra Pro, Max e Teams é a hora boa pra esse teste
Até o próximo post! 😀
Perguntas frequentes
O SWE-2 é gratuito para quem já assina o Devin?
Sim. A Cognition liberou o SWE-2 sem cobrança para assinantes Pro, Max e Teams durante o mês seguinte ao lançamento, que aconteceu em 10 de setembro de 2026.
Em quais produtos já dá pra usar o SWE-2?
O SWE-2 está disponível no Devin Desktop e no Devin CLI. O rollout para Devin Web e para o Fusion ainda está em andamento.
Qual a diferença entre os níveis medium, high e max do SWE-2?
Medium parte para a ação rápido e serve tarefas simples a intermediárias onde o custo importa. High planeja e explora mais o codebase, lidando melhor com requisitos ambíguos. Max libera o teto de turnos e tokens para as tarefas mais difíceis, com cadeias de verificação complexas.
O SWE-2 resolve tarefas simples mais rápido que o SWE-1.7?
Sim. No nível medium, o SWE-2 faz a primeira edição real de código numa mediana de 18 passos, contra 48 passos do SWE-1.7. No FrontierCode 1.1 Main, isso se traduz em 58% menos turnos e 81% menos custo em média.
Como o SWE-2 se compara ao Claude Fable 5.1 em custo e performance?
No FrontierCode 1.1 Main, o SWE-2 marca 50,0% contra 50,9% do Fable 5.1, uma diferença de apenas um ponto. A diferença é que o SWE-2 chega perto desse resultado custando 64% menos.
Quanto o RL da Cognition acrescenta sobre o Kimi K3 base?
A Cognition declara que seu RL adiciona de 5 a 6 pontos em vários benchmarks e desloca toda a curva de custo e performance do modelo base. Na prática, a distância varia por benchmark: no FrontierCode 1.1 Main são 50,0% contra 44,2%, no DeepSWE 1.1 são 73,0% contra 68,5%, no Terminal-Bench 2.1 são 92,8% contra 88,3% e no Terminal-Bench 4 são 27,3% contra 21,5%.
A Cognition avaliou a confiabilidade do SWE-2 além dos benchmarks de código?
Sim, a Cognition publicou avaliações internas de trustworthiness cobrindo comportamento de propaganda e censura e vulnerabilidade dependente de contexto em código gerado. As rodadas incluíram o SWE-2 e mais cinco modelos, entre eles o Fable 5.1.
Formações
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
Blog | Mais populares

Como Recuperar Conversas Apagadas no ChatGPT: É Possível?
Descubra neste artigo tudo o que você precisa saber sobre como recuperar conversas apagadas no ChatGPT, se isso é possível, quais alternativas existem para proteger […]
ChatGPT não funciona: saiba como corrigir erros
ChatGPT não funciona? O ChatGPT pode deixar de funcionar por diversos motivos, e a maioria deles está relacionada a problemas de conexão, cache ou instabilidade […]

Como limpar histórico do ChatGPT e proteger sua privacidade
Veja como limpar o histórico do ChatGPT e proteger sua privacidade de forma simples e eficaz, mantendo seus dados seguros online. Para apagar uma conversa […]
