Como a Cognition treinou o SWE-2: penalidade de custo e reward baseline explicados

Diagrama explicando a penalidade de custo e o reward baseline no treino do SWE-2
Resposta rápida

O SWE-2 é o modelo de codificação mais capaz da Cognition, anunciado em 10 de setembro de 2026 e posicionado como um avanço da fronteira de Pareto entre capacidade e custo. Ele é pós-treinado a partir do Kimi K3, de 2,8 trilhões de parâmetros, e o RL da Cognition por cima adiciona de 5 a 6 pontos em vários benchmarks. Duas decisões de treino explicam o resultado: uma penalidade de custo linear por nível de esforço, calibrada pela inclinação local da fronteira de Pareto do modelo base, e um reward baseline ponderado por comprimento, que segura a variância do gradiente e estabiliza o treino

Fala aí, beleza?

O salto do SWE-2 não veio de empilhar parâmetro, veio de escolha de treino

A Cognition lançou o SWE-2 em 10 de setembro de 2026 como seu modelo de codificação mais capaz, e apresentou ele não como "o mais forte da tabela" e sim como um avanço da fronteira de Pareto entre capacidade e custo

E a parte interessante é que a própria empresa abriu duas decisões técnicas por trás disso no post de lançamento: uma penalidade de custo linear por nível de esforço e um reward baseline ponderado por comprimento

São dois termos que soam como papo de laboratório de RL

Bora traduzir os dois pra quem programa, usa agente todo dia e não vive de pesquisa? 🙂

De onde o SWE-2 parte: Kimi K3 e o que o RL da Cognition acrescenta

Primeiro o básico, porque muita gente lê "modelo novo" e imagina treino do zero

O SWE-2 é pós-treinado a partir do Kimi K3, um modelo de 2,8 trilhões de parâmetros que já tinha passado por RL extenso para codificação agêntica

Formação Claude Code
Formação Recomendada

Formação Claude Code

Domine Claude Code do absoluto zero até o avançado

  • 120 aulas
  • 4 projetos
  • 9h 45min

Ou seja: a base já era boa em agir dentro de um repositório, rodar comando, ler arquivo, editar código

O que a Cognition faz é uma camada de RL por cima dessa base

E o resultado declarado pela Cognition é bem direto: de 5 a 6 pontos a mais em vários benchmarks, com a curva inteira de custo e performance do modelo base deslocada

Só leia isso como a faixa que eles anunciam, e não como régua fixa: o tamanho do ganho varia de benchmark pra benchmark, como dá pra ver na lista logo abaixo

Repara nessa palavra, "curva inteira"

Não é ganhar num ponto específico e piorar no resto, é mover a relação toda entre o quanto você gasta e o quanto o modelo resolve

Os números publicados pela Cognition comparando SWE-2 e Kimi K3 base:

  • DeepSWE 1.1: 73,0% contra 68,5%
  • Terminal-Bench 2.1: 92,8% contra 88,3%
  • Terminal-Bench 4: 27,3% contra 21,5%

Em todos os benchmarks publicados por eles, o SWE-2 fica acima da base

O que é pós-treino, afinal?

Pergunta justa, já que o termo aparece o tempo todo e quase ninguém para pra explicar

Pós-treino é o trabalho feito DEPOIS que o modelo base já existe: você não reescreve o conhecimento dele, você molda o comportamento

A analogia de aproximação: se você já contratou um dev sênior muito bom que nunca trabalhou na sua empresa, o pós-treino é o onboarding

Ele já sabe programar

O que ele ainda não sabe é o que vale a pena investigar, quando parar de investigar e quanto de tempo (leia: custo) cada tipo de tarefa merece

E é exatamente aí que entram as duas decisões abaixo

Penalidade de custo linear: como a Cognition ensinou o modelo a se importar com a conta

Esse é o coração do assunto

O SWE-2 tem três níveis de esforço: medium, high e max

A escolha ULTRA importante aqui é que os três são treinados em um único run de RL, e não em rodadas separadas ou em três modelos diferentes

Dentro desse mesmo run, cada nível de esforço carrega a sua própria penalidade de custo, e ela é linear

E o que significa "penalidade de custo" no reward?

Em RL, o modelo recebe um reward por aquilo que fez

Se o reward olha só pra "resolveu ou não resolveu", o comportamento ótimo é explorar até o fim do mundo, porque explorar mais nunca dói

Quando você coloca uma penalidade de custo, o reward passa a ser "resolveu, menos o quanto isso custou"

Aí o modelo aprende que enrolar tem preço

A Cognition diz explicitamente que o objetivo do desenho é refletir no treino o custo real pago pelo usuário, da forma mais direta possível

O agente não está otimizando uma métrica abstrata de "seja eficiente", ele está otimizando algo modelado em cima da conta que você paga

E a tal "inclinação local da fronteira de Pareto"?

Calma que essa é mais simples do que parece

Fronteira de Pareto, aqui, é a curva do que o modelo base conseguia entregar: pra cada nível de custo, qual a melhor performance possível

A inclinação LOCAL dessa curva é o câmbio daquele ponto específico: quanto de custo extra o modelo base cobrava por cada ponto a mais de performance ali

Na parte barata da curva, um ponto a mais sai relativamente barato

Na parte cara, o mesmo ponto a mais custa muito mais

A Cognition calibra a penalidade de cada nível de esforço por essa inclinação local

O efeito disso é que cada nível é empurrado pra frente respeitando o câmbio da região onde ele vive, e a fronteira avança preservando a forma dela, em vez de virar tudo um nível só achatado no meio

Por que linear, e não qualquer outra forma?

Essa é a parte que a Cognition trata como decisão de primeiros princípios

Segundo eles, a forma linear é a única que preserva a propriedade de depender apenas do custo médio e da taxa média de resolução

Traduzindo pro dia a dia: com penalidade linear, o que importa é a média

Uma tarefa específica que saiu cara não distorce o sinal de aprendizado de um jeito estranho, porque o que o treino enxerga é o custo médio contra o solve rate médio

É um detalhe que parece pequeno e não é

É ele que permite dizer "empurrei a fronteira" em vez de "achatei uma ponta pra ganhar na outra"

Reward baseline ponderado por comprimento: por que o treino não desanda

Segundo termo, segunda tradução

Baseline é a referência contra a qual o reward de cada rollout é comparado

Rollout, no caso, é uma execução completa do agente na tarefa: ele lê, explora, edita, roda teste, termina

Sem baseline, o gradiente fica ruidoso demais, porque tudo que deu reward positivo empurra o modelo, mesmo quando aquilo era só o comportamento médio esperado

Com baseline, o sinal vira "foi melhor ou pior que a referência"

A observação que a Cognition usa

A sacada declarada é essa: a norma do gradiente ao quadrado correlaciona fortemente com o comprimento do rollout

Rollout longo mexe mais no gradiente, e mexe desproporcionalmente

Então, em vez de uma média simples dos rewards, eles aproximam o baseline ótimo como uma média dos rewards PONDERADA por comprimento

Os rollouts que pesam mais no gradiente pesam mais na referência também

Faz sentido quando você para pra pensar, né? 😀

O que eles dizem que isso entrega

Os efeitos declarados pela Cognition:

  • menor variância do gradiente
  • custo adicional zero para aplicar a técnica
  • treino significativamente mais estável
  • divergência KL entre inferência e treino mantida baixa durante o RL

Esse último merece um parágrafo

Divergência KL entre inferência e treino é, na prática, o quanto o modelo que roda em produção descola do modelo que está sendo treinado

Quanto maior o modelo, mais isso pesa, e a Cognition marca justamente esse ponto: é um problema que cresce junto com a escala

E não é técnica nova da casa: eles usam o baseline ponderado por comprimento desde o SWE-1.6

O que essas escolhas produziram nos benchmarks

Teoria é legal, mas o que interessa é o que saiu do outro lado

Os números publicados pela Cognition, SWE-2 contra o Kimi K3 base:

Benchmark SWE-2 Kimi K3 (base)
FrontierCode 1.1 Main 50,0% 44,2%
DeepSWE 1.1 73,0% 68,5%
Terminal-Bench 2.1 92,8% 88,3%
Terminal-Bench 4 27,3% 21,5%

Repara que a distância muda conforme o benchmark, e é por isso que vale ler a faixa anunciada pela Cognition como faixa mesmo, não como um número igual em toda linha

E as comparações que mostram o lado do custo, que é o ponto todo do ângulo:

Comparação Resultado
SWE-2 vs Claude Fable 5.1 (FrontierCode 1.1 Main) 50,0% contra 50,9%, com o SWE-2 custando 64% menos
SWE-2 medium vs SWE-1.7 (FrontierCode 1.1 Main) medium pontua acima do SWE-1.7, com 58% menos turnos e 81% menos custo em média
Primeira edição real de código (mediana) 18 passos no SWE-2 medium contra 48 passos do SWE-1.7

Essa última linha é a que mais me chama atenção

48 passos de mediana até a primeira edição real de código é MUITO

O SWE-1.7 recebia reclamação de usuário por explorar demais em tarefa simples, e dá pra entender o porquê: você pede algo pequeno e fica olhando o agente passear pelo repositório

O SWE-2 medium chega em 18

E a leitura da própria Cognition sobre de onde vem esse ganho é importante: eles atribuem os maiores ganhos de eficiência à exploração focada, não a cortar trabalho

Mais inteligência permite julgar quais partes do codebase realmente importam pra tarefa

Não é o agente fazendo menos

É o agente errando menos o alvo do que precisa ler

Medium, high ou max: qual nível de esforço usar em cada tarefa

Agora aterrissa tudo isso no uso diário

Primeiro, a coisa mais importante de entender: medium, high e max não são três modelos diferentes

É o MESMO modelo, treinado num único run, com penalidades de custo calibradas por nível

A diferença de comportamento que você sente é consequência direta disso

Os perfis descritos pela Cognition:

  • medium: parte pra ação rápido, serve tarefas simples a intermediárias onde o custo importa
  • high: planeja e explora mais o codebase, lida melhor com requisitos ambíguos
  • max: libera o teto de turnos e tokens pras tarefas mais difíceis, com cadeias de verificação complexas

Traduzindo pro tipo de coisa que cai na sua fila:

Ajuste pontual, correção pequena, mudança que você já sabe onde fica? Esse é o território do medium, e é justamente aí que os 18 passos de mediana até a primeira edição fazem diferença no seu dia

Tarefa onde o pedido veio meio vago, você não sabe direito quais arquivos estão envolvidos e precisa de alguém lendo o contexto antes de sair editando? É o cenário do high

Aquela tarefa cabeluda, com várias camadas, que precisa verificar o próprio trabalho em cadeia até fechar? É pra isso que o max existe, com o teto de turnos e tokens liberado

O que muda para quem programa com agentes

Fecha o ciclo: penalizar custo no treino é o que faz o agente parar de explorar demais em tarefa simples

É literalmente isso

O comportamento chato de "pedi pra trocar uma string e ele leu meio projeto" não se resolve com prompt pedindo pra ser eficiente

Se resolve no reward, ensinando o modelo que gastar tem preço, e calibrando esse preço pelo câmbio real da curva

Onde dá pra usar o SWE-2 hoje: ele está disponível no Devin Desktop e no Devin CLI, com rollout em andamento para Devin Web e Fusion

E tem uma janela boa aqui: a Cognition liberou o SWE-2 sem cobrança para assinantes Pro, Max e Teams pelo mês seguinte ao lançamento

Vale citar também que a Cognition publicou resultados de avaliações internas de confiabilidade do SWE-2, rodadas sobre ele e mais cinco modelos, incluindo o Claude Fable 5.1

As avaliações cobrem comportamento de propaganda e censura e vulnerabilidade dependente de contexto em código gerado

É material de casa, então leia como o que é, mas é bom que exista e esteja publicado junto do lançamento

Vídeo: customizações e configuração de agentes na prática

Se o assunto de controlar esforço e custo do agente te interessou, esse vídeo do canal é um bom ponto de partida pra entender como customizar o comportamento de um agente de código

Conclusão

Recapitulando o que realmente explica o SWE-2

A penalidade de custo linear por nível de esforço, calibrada pela inclinação local da fronteira de Pareto do modelo base, é o que ensina o modelo a se importar com a conta e o que faz medium, high e max existirem dentro de um único run de RL

O reward baseline ponderado por comprimento é o que segura a variância do gradiente, sem custo extra, e mantém o treino estável e a divergência KL entre inferência e treino baixa

Duas alavancas de treino

Um modelo mais barato sem perder capacidade

Próximo passo se você tem acesso: pega uma tarefa real do seu projeto e roda a MESMA tarefa em medium e depois em high no Devin Desktop ou no Devin CLI

Compara turnos gastos e resultado final

É o jeito mais honesto de sentir na prática o que essas decisões de treino fizeram, e o período sem cobrança pra Pro, Max e Teams é a hora boa pra esse teste

Até o próximo post! 😀

Perguntas frequentes

O SWE-2 é gratuito para quem já assina o Devin?

Sim. A Cognition liberou o SWE-2 sem cobrança para assinantes Pro, Max e Teams durante o mês seguinte ao lançamento, que aconteceu em 10 de setembro de 2026.

Em quais produtos já dá pra usar o SWE-2?

O SWE-2 está disponível no Devin Desktop e no Devin CLI. O rollout para Devin Web e para o Fusion ainda está em andamento.

Qual a diferença entre os níveis medium, high e max do SWE-2?

Medium parte para a ação rápido e serve tarefas simples a intermediárias onde o custo importa. High planeja e explora mais o codebase, lidando melhor com requisitos ambíguos. Max libera o teto de turnos e tokens para as tarefas mais difíceis, com cadeias de verificação complexas.

O SWE-2 resolve tarefas simples mais rápido que o SWE-1.7?

Sim. No nível medium, o SWE-2 faz a primeira edição real de código numa mediana de 18 passos, contra 48 passos do SWE-1.7. No FrontierCode 1.1 Main, isso se traduz em 58% menos turnos e 81% menos custo em média.

Como o SWE-2 se compara ao Claude Fable 5.1 em custo e performance?

No FrontierCode 1.1 Main, o SWE-2 marca 50,0% contra 50,9% do Fable 5.1, uma diferença de apenas um ponto. A diferença é que o SWE-2 chega perto desse resultado custando 64% menos.

Quanto o RL da Cognition acrescenta sobre o Kimi K3 base?

A Cognition declara que seu RL adiciona de 5 a 6 pontos em vários benchmarks e desloca toda a curva de custo e performance do modelo base. Na prática, a distância varia por benchmark: no FrontierCode 1.1 Main são 50,0% contra 44,2%, no DeepSWE 1.1 são 73,0% contra 68,5%, no Terminal-Bench 2.1 são 92,8% contra 88,3% e no Terminal-Bench 4 são 27,3% contra 21,5%.

A Cognition avaliou a confiabilidade do SWE-2 além dos benchmarks de código?

Sim, a Cognition publicou avaliações internas de trustworthiness cobrindo comportamento de propaganda e censura e vulnerabilidade dependente de contexto em código gerado. As rodadas incluíram o SWE-2 e mais cinco modelos, entre eles o Fable 5.1.




Escrito por | Matheus Battisti

Matheus Battisti
Fundador da Hora de Codar

Programador apaixonado pelo mundo das tecnologias, sempre buscando em aprender e se aprofundar em linguagens, frameworks e o que mais for necessário para executar um bom trabalho. Agora tem uma nova missão que é de passar seu conhecimento adiante para formar novos programadores e especializar mais os que já são.

Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted

Formações

Formação Vibe Coding

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

Blog | Mais populares