SWE-2 sem integração MCP: como o agente reconstrói os dados pelo histórico do Slack

O SWE-2 é o novo modelo de agente de código da Cognition, lançado em 10 de setembro de 2026 e pós-treinado a partir do Kimi K3 da Moonshot AI. No anúncio oficial, a empresa usa como exemplo de desenvoltura um caso em que a integração MCP necessária estava indisponível e o modelo reconstruiu os dados pelo histórico do canal do Slack a que já tinha acesso. Ele roda em três níveis de esforço (medium, high e max), está no Devin Desktop e no Devin CLI, marca 50,0% no FrontierCode 1.1 Main e cai para 27,3% no Terminal-Bench 4.
Agente que só funciona com tudo conectado é fácil de achar
o difícil é o que não trava quando falta uma peça
Fala aí, beleza? A Cognition lançou o SWE-2 em 10 de setembro de 2026, no post oficial Introducing SWE-2: Pushing the Pareto Frontier, e pra ilustrar o comportamento do modelo escolheu um exemplo nada glamouroso: a integração MCP necessária estava indisponível
em vez de devolver aquele clássico "não consigo acessar essa ferramenta", o modelo foi buscar a mesma informação em outro lugar
a fonte alternativa foi o histórico do canal do Slack ao qual ele já tinha acesso
parece detalhe pequeno, mas quem trabalha com agente o dia inteiro sabe que é exatamente aí que a coisa costuma morrer 🙂
O que é o SWE-2 e por que a Cognition destacou a desenvoltura do modelo:
O SWE-2 é o novo modelo de agente de código da Cognition, a mesma casa do Devin
ele foi pós-treinado a partir do Kimi K3 da Moonshot AI, um modelo base de 2,8 trilhões de parâmetros
e vem com três níveis de esforço, treinados por RL em uma única execução, em vez de virarem modelos separados
Formação Claude Code
Domine Claude Code do absoluto zero até o avançado
- 120 aulas
- 4 projetos
- 9h 45min
desde o lançamento ele está disponível no Devin Desktop e no Devin CLI, com rollout anunciado para o Devin Web e o Devin Fusion
Agora, o que a empresa colocou no centro do anúncio não foi só pontuação de benchmark
foi comportamento
"Resourcefulness"? É desenvoltura, basicamente: quando o caminho óbvio está bloqueado, o SWE-2 tende a procurar outra rota pra chegar na mesma resposta
Junto disso vem um padrão de verificação que a Cognition descreve assim:
- quando questionado, ele re-deriva a conclusão em vez de simplesmente reafirmar o que já disse
- ele verifica a hipótese do usuário em vez de concordar de cara
- ele executa o artefato pra coletar evidência em vez de confiar no próprio texto
esse último ponto é o que mais muda o dia a dia, na real
agente que roda a coisa pra ver o que acontece erra bem menos que agente que descreve com confiança o que ACHA que aconteceu
Quando reconstruir o dado por outra fonte resolve: o caso do histórico do Slack
O caso citado é simples de entender: a ferramenta esperada não respondeu, e o dado que faltava já existia escrito em algum lugar
no Slack, no meio da conversa do time
E dentro do ecossistema Devin isso faz sentido, porque o Devin já vive dentro do Slack por caminho próprio
A documentação do Devin descreve o code channel: um canal do Slack dedicado a uma única sessão, com nome que acompanha o título da sessão, chip de status e worklog ao vivo de pensamentos e chamadas de ferramenta
toda mensagem enviada nesse canal vai pra sessão, sem precisar mencionar @Devin
e os escopos de history permitem que ele leia mensagens anteriores da thread quando a sessão começa no meio de uma conversa
ou seja: conversa de time, nesse contexto, é dado acessível
Situações em que esse padrão salva o dia:
- decisão técnica que ficou registrada só na conversa, nunca virou documento
- configuração que alguém explicou no canal e ninguém levou pro README
- contexto de um bug antigo que só existe no relato de quem apanhou pra resolver
- nome de serviço, ambiente ou convenção que o time combinou por mensagem
Mas se liga no limite, porque ele é importante: reconstrução por conversa é INDÍCIO, não fonte de verdade
mensagem velha envelhece, gente muda de ideia no meio da thread, e o que era verdade em maio pode não ser mais
por isso o comportamento de re-derivar e rodar o artefato pesa tanto aqui: a conversa dá a pista, a execução confirma
Integração MCP indisponível no Devin: sintomas, causas comuns e como prevenir
O sintoma que todo mundo conhece: o servidor MCP não aparece na lista, ou aparece e não responde quando o agente tenta usar
Antes de seguir, um aviso de navegação: o roteiro abaixo é o do Devin, do jeito que a documentação do Devin descreve. O Devin Desktop, que aparece mais pra frente neste post, é outra superfície (o antigo Windsurf)
Antes de culpar o modelo, vale conferir o básico, na ordem:
- Abra a aba
Customize > MCPs, que é onde os servidores MCP ficam hoje, ao lado de plugins, skills, hooks e rules. O erro comum deste passo é procurar no lugar antigo: a páginaSettings > Connections > MCP serversagora redireciona pra lá, então quem tinha o link salvo acha que sumiu tudo - Confirme em qual escopo o servidor foi configurado: pessoal, organização ou enterprise. O erro comum aqui é instalar no escopo pessoal e esperar que o time inteiro enxergue
- Para adicionar um servidor, use o
Browse marketplacee siga os prompts de instalação, ou oAdd Your Ownpra configurar um servidor próprio. O erro comum deste passo é achar que acabou depois de instalar: instalação e autorização são passos SEPARADOS, e um servidor instalado sem autorizar simplesmente não vai responder - Cheque as variáveis de ambiente da configuração. Esse é o problema mais comum de todos: variável ausente ou com o nome escrito errado, aquele caractere a mais que ninguém enxerga lendo rápido
- Verifique o transporte usado. O MCP no Devin suporta três:
stdio,SSEeHTTP, e escolher o errado pro tipo de servidor que você subiu dá aquele silêncio esquisito
A parte de prevenção é chata e é a que evita o incêndio
defina o escopo de acesso ANTES: com acesso de Organização, o caminho é usar uma service account; com acesso Personal, cada membro conecta a própria conta
só de resolver isso na largada você mata metade dos casos de "funciona na minha máquina e não na do resto do time"
E lembra que MCP não é o único caminho: o Devin se conecta a ferramentas externas por integrações nativas, pelo Secrets Manager e por MCP
às vezes a integração nativa já resolve o que você está tentando plugar na marra
quem já apanhou pra conectar n8n com banco de dados em VPS reconhece o roteiro na hora: credencial, escopo, teste de conexão, e só então a automação
Medium, high ou max: qual nível de esforço do SWE-2 usar
Os três níveis não são modelos diferentes, e isso muda o jeito de pensar a escolha
é o mesmo modelo gastando mais ou menos esforço na tarefa
| Nível de esforço | Média de passos por execução | Orientação da Cognition |
|---|---|---|
| medium | 53 | Entra em ação mais rápido e é mais eficiente em custo para tarefas simples e intermediárias |
| high | 80 | Leva vantagem em tarefas complexas: planeja mais, explora mais o codebase e verifica mais |
| max | 98 | Mesmo perfil do high, com o teto de planejamento, exploração e verificação |
| SWE-1.7 (referência) | 127 | Modelo anterior, só pra você ter o parâmetro de comparação |
Repara no número do SWE-1.7: 127 passos em média contra 53 do medium
mais passos não é sinônimo de melhor resultado, e esse é meio que o recado do lançamento inteiro
Relacionando com o tema deste post: procurar rota alternativa quando a fonte esperada está bloqueada é tarefa de exploração, não de execução direta
se a integração caiu e você quer que o agente vasculhe outros caminhos antes de desistir, o nível mais alto tende a fazer mais sentido que o medium
E aqui mudamos de superfície, presta atenção: não é mais a aba Customize do Devin lá de cima
no Devin Desktop, a troca de modelo fica no menu suspenso logo abaixo da caixa de texto do Cascade
é ali que você escolhe qual modelo roda a sessão
SWE-2 nos benchmarks: onde ganha e onde perde feio
Aqui a conversa fica honesta, porque os números contam duas histórias bem diferentes
| Benchmark | SWE-2 | Fable 5.1 (Anthropic) | GPT-6 Astra |
|---|---|---|---|
| FrontierCode 1.1 Main | 50,0% | 50,9% | sem dado verificado |
| Terminal-Bench 4 | 27,3% | 55,8% | 57,9% |
No FrontierCode 1.1 Main, o SWE-2 fica praticamente empatado com o Fable 5.1
e a Cognition alega 64% menos custo pra rodar no mesmo patamar de pontuação
esse é o argumento central do lançamento: mesmo resultado, conta bem menor
Tem também o ganho interno, contra o modelo anterior da própria casa: no FrontierCode 1.1 Main, o SWE-2 medium pontua mais que o SWE-1.7 usando 58% menos turnos e 81% menos custo em média
ou seja, o mesmo recado da tabela de passos, agora em dinheiro
Agora o outro lado
no Terminal-Bench 4, que é o benchmark agêntico mais difícil da comparação, o SWE-2 marca 27,3% contra 55,8% do Fable 5.1 e 57,9% do GPT-6 Astra
não é diferença de margem de erro, é distância mesmo
Dá para confiar no SWE-2 quando a ferramenta certa não está conectada?
Veredito curto: a desenvoltura descrita é útil de verdade, e o custo por resultado é o argumento mais forte que a Cognition tem em mãos
agente que busca outra rota em vez de devolver erro economiza aquele ping no Slack perguntando "e agora?"
Só que a queda no Terminal-Bench 4 sugere que essa vantagem não se sustenta nas tarefas mais duras
e reconstruir um dado a partir de conversa É uma tarefa dura: exige julgar o que ainda vale, o que foi revogado e o que era só opinião de alguém numa quinta-feira à noite
Então o jeito prático de usar isso é tratar a reconstrução por fonte alternativa como atalho SUPERVISIONADO
deixa ele procurar a rota, mas confere a evidência antes de aceitar a conclusão
ou melhor: aproveita o próprio comportamento anunciado e pede pra ele rodar o artefato e mostrar o resultado, em vez de aceitar o resumo bonitinho da thread
vale lembrar também que não existe, na documentação, instrução oficial ensinando a forçar o agente a usar o Slack como fonte quando o MCP cai
o que a Cognition descreve é um comportamento observado, não um botão que você liga
O que muda para quem já usa Devin no dia a dia
Pra quem já tem o Devin rodando, a mudança chega rápido
o SWE-2 está liberado por um mês sem contar na cota para assinantes Pro (US$ 20/mês), Max e Teams
hoje ele roda no Devin Desktop e no Devin CLI, com rollout anunciado para o Devin Web e o Devin Fusion
E já que citei Devin Desktop: se você conhecia essa ferramenta como Windsurf, é a mesma coisa
a renomeação foi anunciada em 2 de junho de 2026, entregue como atualização over-the-air, sem migração manual
next, next e finish sem você nem perceber 😀
Fechando com uma coisa que quase ninguém configura e depois reclama: controle de contexto no Slack
muteimpede o Devin de ver as mensagens seguintes da threadunmutereverte(aside)ou!asidefaz ele ignorar aquela mensagem específica!newinicia a sessão em nova thread ou canal
se o agente pode reconstruir contexto pelo histórico, decidir O QUE ele lê deixa de ser detalhe e vira parte do trabalho
Conclusão:
A notícia real do SWE-2 não é a linha do benchmark, na minha leitura
é o agente que procura outra rota quando a esperada está bloqueada, e depois verifica em vez de só afirmar
isso resolve um tipo de travamento que custa tempo todo santo dia
Mas o Terminal-Bench 4 está ali pra lembrar que improviso tem teto, e que nas tarefas mais duras o modelo ainda fica bem atrás dos concorrentes
Próximo passo, se você usa Devin: dá uma revisada nos servidores em Customize > MCPs e nos escopos de acesso do time antes de contar com a improvisação do modelo
e aproveita o mês de promoção pra testar qual nível de esforço encaixa no seu tipo de tarefa, porque essa escolha muda mais o resultado do que parece
até o próximo post!
Perguntas frequentes
Quanto custa usar o SWE-2 no Devin?
No lançamento, a Cognition liberou o SWE-2 por um mês sem contar na cota para assinantes dos planos Pro (US$ 20/mês), Max e Teams. Fora dessa promoção, o uso segue a cota normal de cada plano.
O SWE-2 é melhor que o Fable 5.1 da Anthropic em qualquer tarefa?
Não. No FrontierCode 1.1 Main os dois ficam próximos (SWE-2 com 50,0% contra 50,9% do Fable 5.1), mas no Terminal-Bench 4, o benchmark agêntico mais difícil, a diferença é grande: 27,3% do SWE-2 contra 55,8% do Fable 5.1 e 57,9% do GPT-6 Astra. Ou seja, a vantagem de custo do SWE-2 não se sustenta nas tarefas mais duras.
Qual a diferença prática entre o SWE-2 e o SWE-1.7?
No nível medium, o SWE-2 já pontua mais que o SWE-1.7 no FrontierCode 1.1 Main, usando 58% menos turnos e 81% menos custo em média. Em passos por execução, a média cai para 53 (medium), 80 (high) e 98 (max), contra 127 do SWE-1.7.
Em quais produtos da Cognition o SWE-2 já pode ser usado?
Desde o lançamento ele está disponível no Devin Desktop e no Devin CLI. A Cognition já anunciou rollout do modelo também para o Devin Web e o Devin Fusion.
Como troco de modelo para usar o SWE-2 no Devin Desktop?
No Devin Desktop (o antigo Windsurf, renomeado em 2 de junho de 2026), a troca de modelo fica num menu suspenso logo abaixo da caixa de texto do Cascade. É ali que dá pra selecionar o modelo que vai rodar a sessão.
O que é o Kimi K3, modelo base usado no SWE-2?
É o modelo base da Moonshot AI, com 2,8 trilhões de parâmetros, que a Cognition usou como ponto de partida para pós-treinar o SWE-2. Os três níveis de esforço (medium, high e max) foram treinados por RL numa única execução em cima dessa base, em vez de virarem modelos separados.
Formações
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
Blog | Mais populares
Supabase MCP no Claude Code: como conectar o agente ao schema do seu banco
Supabase MCP no Claude Code conecta o agente ao schema real do seu banco: veja como instalar, autenticar via OAuth e por que usar só em desenvolvimento.
Context7 MCP no Claude Code: como parar de receber código de uma versão antiga da biblioteca
Context7 MCP no Claude Code busca a documentação atual da biblioteca e evita código desatualizado. Veja como instalar, os comandos e os planos Free e Pro.
O que são servidores MCP no Claude Code e quando eles valem a pena?
Servidores MCP no Claude Code conectam o agente a bancos, docs e ferramentas externas. Entenda como funcionam e quando realmente valem a pena usar.
