SWE-2 sem integração MCP: como o agente reconstrói os dados pelo histórico do Slack

Modelo SWE-2 da Cognition reconstruindo dados via histórico do Slack sem integração MCP
Resposta rápida

O SWE-2 é o novo modelo de agente de código da Cognition, lançado em 10 de setembro de 2026 e pós-treinado a partir do Kimi K3 da Moonshot AI. No anúncio oficial, a empresa usa como exemplo de desenvoltura um caso em que a integração MCP necessária estava indisponível e o modelo reconstruiu os dados pelo histórico do canal do Slack a que já tinha acesso. Ele roda em três níveis de esforço (medium, high e max), está no Devin Desktop e no Devin CLI, marca 50,0% no FrontierCode 1.1 Main e cai para 27,3% no Terminal-Bench 4.

Agente que só funciona com tudo conectado é fácil de achar

o difícil é o que não trava quando falta uma peça

Fala aí, beleza? A Cognition lançou o SWE-2 em 10 de setembro de 2026, no post oficial Introducing SWE-2: Pushing the Pareto Frontier, e pra ilustrar o comportamento do modelo escolheu um exemplo nada glamouroso: a integração MCP necessária estava indisponível

em vez de devolver aquele clássico "não consigo acessar essa ferramenta", o modelo foi buscar a mesma informação em outro lugar

a fonte alternativa foi o histórico do canal do Slack ao qual ele já tinha acesso

parece detalhe pequeno, mas quem trabalha com agente o dia inteiro sabe que é exatamente aí que a coisa costuma morrer 🙂

O que é o SWE-2 e por que a Cognition destacou a desenvoltura do modelo:

O SWE-2 é o novo modelo de agente de código da Cognition, a mesma casa do Devin

ele foi pós-treinado a partir do Kimi K3 da Moonshot AI, um modelo base de 2,8 trilhões de parâmetros

e vem com três níveis de esforço, treinados por RL em uma única execução, em vez de virarem modelos separados

Formação Claude Code
Formação Recomendada

Formação Claude Code

Domine Claude Code do absoluto zero até o avançado

  • 120 aulas
  • 4 projetos
  • 9h 45min

desde o lançamento ele está disponível no Devin Desktop e no Devin CLI, com rollout anunciado para o Devin Web e o Devin Fusion

Agora, o que a empresa colocou no centro do anúncio não foi só pontuação de benchmark

foi comportamento

"Resourcefulness"? É desenvoltura, basicamente: quando o caminho óbvio está bloqueado, o SWE-2 tende a procurar outra rota pra chegar na mesma resposta

Junto disso vem um padrão de verificação que a Cognition descreve assim:

  • quando questionado, ele re-deriva a conclusão em vez de simplesmente reafirmar o que já disse
  • ele verifica a hipótese do usuário em vez de concordar de cara
  • ele executa o artefato pra coletar evidência em vez de confiar no próprio texto

esse último ponto é o que mais muda o dia a dia, na real

agente que roda a coisa pra ver o que acontece erra bem menos que agente que descreve com confiança o que ACHA que aconteceu

Quando reconstruir o dado por outra fonte resolve: o caso do histórico do Slack

O caso citado é simples de entender: a ferramenta esperada não respondeu, e o dado que faltava já existia escrito em algum lugar

no Slack, no meio da conversa do time

E dentro do ecossistema Devin isso faz sentido, porque o Devin já vive dentro do Slack por caminho próprio

A documentação do Devin descreve o code channel: um canal do Slack dedicado a uma única sessão, com nome que acompanha o título da sessão, chip de status e worklog ao vivo de pensamentos e chamadas de ferramenta

toda mensagem enviada nesse canal vai pra sessão, sem precisar mencionar @Devin

e os escopos de history permitem que ele leia mensagens anteriores da thread quando a sessão começa no meio de uma conversa

ou seja: conversa de time, nesse contexto, é dado acessível

Situações em que esse padrão salva o dia:

  • decisão técnica que ficou registrada só na conversa, nunca virou documento
  • configuração que alguém explicou no canal e ninguém levou pro README
  • contexto de um bug antigo que só existe no relato de quem apanhou pra resolver
  • nome de serviço, ambiente ou convenção que o time combinou por mensagem

Mas se liga no limite, porque ele é importante: reconstrução por conversa é INDÍCIO, não fonte de verdade

mensagem velha envelhece, gente muda de ideia no meio da thread, e o que era verdade em maio pode não ser mais

por isso o comportamento de re-derivar e rodar o artefato pesa tanto aqui: a conversa dá a pista, a execução confirma

Integração MCP indisponível no Devin: sintomas, causas comuns e como prevenir

O sintoma que todo mundo conhece: o servidor MCP não aparece na lista, ou aparece e não responde quando o agente tenta usar

Antes de seguir, um aviso de navegação: o roteiro abaixo é o do Devin, do jeito que a documentação do Devin descreve. O Devin Desktop, que aparece mais pra frente neste post, é outra superfície (o antigo Windsurf)

Antes de culpar o modelo, vale conferir o básico, na ordem:

  1. Abra a aba Customize > MCPs, que é onde os servidores MCP ficam hoje, ao lado de plugins, skills, hooks e rules. O erro comum deste passo é procurar no lugar antigo: a página Settings > Connections > MCP servers agora redireciona pra lá, então quem tinha o link salvo acha que sumiu tudo
  2. Confirme em qual escopo o servidor foi configurado: pessoal, organização ou enterprise. O erro comum aqui é instalar no escopo pessoal e esperar que o time inteiro enxergue
  3. Para adicionar um servidor, use o Browse marketplace e siga os prompts de instalação, ou o Add Your Own pra configurar um servidor próprio. O erro comum deste passo é achar que acabou depois de instalar: instalação e autorização são passos SEPARADOS, e um servidor instalado sem autorizar simplesmente não vai responder
  4. Cheque as variáveis de ambiente da configuração. Esse é o problema mais comum de todos: variável ausente ou com o nome escrito errado, aquele caractere a mais que ninguém enxerga lendo rápido
  5. Verifique o transporte usado. O MCP no Devin suporta três: stdio, SSE e HTTP, e escolher o errado pro tipo de servidor que você subiu dá aquele silêncio esquisito

A parte de prevenção é chata e é a que evita o incêndio

defina o escopo de acesso ANTES: com acesso de Organização, o caminho é usar uma service account; com acesso Personal, cada membro conecta a própria conta

só de resolver isso na largada você mata metade dos casos de "funciona na minha máquina e não na do resto do time"

E lembra que MCP não é o único caminho: o Devin se conecta a ferramentas externas por integrações nativas, pelo Secrets Manager e por MCP

às vezes a integração nativa já resolve o que você está tentando plugar na marra

quem já apanhou pra conectar n8n com banco de dados em VPS reconhece o roteiro na hora: credencial, escopo, teste de conexão, e só então a automação

Medium, high ou max: qual nível de esforço do SWE-2 usar

Os três níveis não são modelos diferentes, e isso muda o jeito de pensar a escolha

é o mesmo modelo gastando mais ou menos esforço na tarefa

Nível de esforço Média de passos por execução Orientação da Cognition
medium 53 Entra em ação mais rápido e é mais eficiente em custo para tarefas simples e intermediárias
high 80 Leva vantagem em tarefas complexas: planeja mais, explora mais o codebase e verifica mais
max 98 Mesmo perfil do high, com o teto de planejamento, exploração e verificação
SWE-1.7 (referência) 127 Modelo anterior, só pra você ter o parâmetro de comparação

Repara no número do SWE-1.7: 127 passos em média contra 53 do medium

mais passos não é sinônimo de melhor resultado, e esse é meio que o recado do lançamento inteiro

Relacionando com o tema deste post: procurar rota alternativa quando a fonte esperada está bloqueada é tarefa de exploração, não de execução direta

se a integração caiu e você quer que o agente vasculhe outros caminhos antes de desistir, o nível mais alto tende a fazer mais sentido que o medium

E aqui mudamos de superfície, presta atenção: não é mais a aba Customize do Devin lá de cima

no Devin Desktop, a troca de modelo fica no menu suspenso logo abaixo da caixa de texto do Cascade

é ali que você escolhe qual modelo roda a sessão

SWE-2 nos benchmarks: onde ganha e onde perde feio

Aqui a conversa fica honesta, porque os números contam duas histórias bem diferentes

Benchmark SWE-2 Fable 5.1 (Anthropic) GPT-6 Astra
FrontierCode 1.1 Main 50,0% 50,9% sem dado verificado
Terminal-Bench 4 27,3% 55,8% 57,9%

No FrontierCode 1.1 Main, o SWE-2 fica praticamente empatado com o Fable 5.1

e a Cognition alega 64% menos custo pra rodar no mesmo patamar de pontuação

esse é o argumento central do lançamento: mesmo resultado, conta bem menor

Tem também o ganho interno, contra o modelo anterior da própria casa: no FrontierCode 1.1 Main, o SWE-2 medium pontua mais que o SWE-1.7 usando 58% menos turnos e 81% menos custo em média

ou seja, o mesmo recado da tabela de passos, agora em dinheiro

Agora o outro lado

no Terminal-Bench 4, que é o benchmark agêntico mais difícil da comparação, o SWE-2 marca 27,3% contra 55,8% do Fable 5.1 e 57,9% do GPT-6 Astra

não é diferença de margem de erro, é distância mesmo

Dá para confiar no SWE-2 quando a ferramenta certa não está conectada?

Veredito curto: a desenvoltura descrita é útil de verdade, e o custo por resultado é o argumento mais forte que a Cognition tem em mãos

agente que busca outra rota em vez de devolver erro economiza aquele ping no Slack perguntando "e agora?"

Só que a queda no Terminal-Bench 4 sugere que essa vantagem não se sustenta nas tarefas mais duras

e reconstruir um dado a partir de conversa É uma tarefa dura: exige julgar o que ainda vale, o que foi revogado e o que era só opinião de alguém numa quinta-feira à noite

Então o jeito prático de usar isso é tratar a reconstrução por fonte alternativa como atalho SUPERVISIONADO

deixa ele procurar a rota, mas confere a evidência antes de aceitar a conclusão

ou melhor: aproveita o próprio comportamento anunciado e pede pra ele rodar o artefato e mostrar o resultado, em vez de aceitar o resumo bonitinho da thread

vale lembrar também que não existe, na documentação, instrução oficial ensinando a forçar o agente a usar o Slack como fonte quando o MCP cai

o que a Cognition descreve é um comportamento observado, não um botão que você liga

O que muda para quem já usa Devin no dia a dia

Pra quem já tem o Devin rodando, a mudança chega rápido

o SWE-2 está liberado por um mês sem contar na cota para assinantes Pro (US$ 20/mês), Max e Teams

hoje ele roda no Devin Desktop e no Devin CLI, com rollout anunciado para o Devin Web e o Devin Fusion

E já que citei Devin Desktop: se você conhecia essa ferramenta como Windsurf, é a mesma coisa

a renomeação foi anunciada em 2 de junho de 2026, entregue como atualização over-the-air, sem migração manual

next, next e finish sem você nem perceber 😀

Fechando com uma coisa que quase ninguém configura e depois reclama: controle de contexto no Slack

  • mute impede o Devin de ver as mensagens seguintes da thread
  • unmute reverte
  • (aside) ou !aside faz ele ignorar aquela mensagem específica
  • !new inicia a sessão em nova thread ou canal

se o agente pode reconstruir contexto pelo histórico, decidir O QUE ele lê deixa de ser detalhe e vira parte do trabalho

Conclusão:

A notícia real do SWE-2 não é a linha do benchmark, na minha leitura

é o agente que procura outra rota quando a esperada está bloqueada, e depois verifica em vez de só afirmar

isso resolve um tipo de travamento que custa tempo todo santo dia

Mas o Terminal-Bench 4 está ali pra lembrar que improviso tem teto, e que nas tarefas mais duras o modelo ainda fica bem atrás dos concorrentes

Próximo passo, se você usa Devin: dá uma revisada nos servidores em Customize > MCPs e nos escopos de acesso do time antes de contar com a improvisação do modelo

e aproveita o mês de promoção pra testar qual nível de esforço encaixa no seu tipo de tarefa, porque essa escolha muda mais o resultado do que parece

até o próximo post!

Perguntas frequentes

Quanto custa usar o SWE-2 no Devin?

No lançamento, a Cognition liberou o SWE-2 por um mês sem contar na cota para assinantes dos planos Pro (US$ 20/mês), Max e Teams. Fora dessa promoção, o uso segue a cota normal de cada plano.

O SWE-2 é melhor que o Fable 5.1 da Anthropic em qualquer tarefa?

Não. No FrontierCode 1.1 Main os dois ficam próximos (SWE-2 com 50,0% contra 50,9% do Fable 5.1), mas no Terminal-Bench 4, o benchmark agêntico mais difícil, a diferença é grande: 27,3% do SWE-2 contra 55,8% do Fable 5.1 e 57,9% do GPT-6 Astra. Ou seja, a vantagem de custo do SWE-2 não se sustenta nas tarefas mais duras.

Qual a diferença prática entre o SWE-2 e o SWE-1.7?

No nível medium, o SWE-2 já pontua mais que o SWE-1.7 no FrontierCode 1.1 Main, usando 58% menos turnos e 81% menos custo em média. Em passos por execução, a média cai para 53 (medium), 80 (high) e 98 (max), contra 127 do SWE-1.7.

Em quais produtos da Cognition o SWE-2 já pode ser usado?

Desde o lançamento ele está disponível no Devin Desktop e no Devin CLI. A Cognition já anunciou rollout do modelo também para o Devin Web e o Devin Fusion.

Como troco de modelo para usar o SWE-2 no Devin Desktop?

No Devin Desktop (o antigo Windsurf, renomeado em 2 de junho de 2026), a troca de modelo fica num menu suspenso logo abaixo da caixa de texto do Cascade. É ali que dá pra selecionar o modelo que vai rodar a sessão.

O que é o Kimi K3, modelo base usado no SWE-2?

É o modelo base da Moonshot AI, com 2,8 trilhões de parâmetros, que a Cognition usou como ponto de partida para pós-treinar o SWE-2. Os três níveis de esforço (medium, high e max) foram treinados por RL numa única execução em cima dessa base, em vez de virarem modelos separados.



Escrito por | Matheus Battisti

Matheus Battisti
Fundador da Hora de Codar

Programador apaixonado pelo mundo das tecnologias, sempre buscando em aprender e se aprofundar em linguagens, frameworks e o que mais for necessário para executar um bom trabalho. Agora tem uma nova missão que é de passar seu conhecimento adiante para formar novos programadores e especializar mais os que já são.

Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted

Formações

Formação Vibe Coding

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

Blog | Mais populares