Subagentes no Claude Code economizam contexto ou multiplicam o gasto?

Subagentes no Claude Code economizam contexto, não tokens. Cada subagente roda numa janela própria, começa sem o histórico da conversa principal e devolve só a mensagem final mais metadados, então a sua sessão fica limpa mesmo que ele leia dezenas de arquivos. O gasto total, porém, sobe: implementações multi-agente costumam usar de 3 a 10 vezes mais tokens que a abordagem de agente único, por duplicação de contexto, coordenação e sumarização. Delegue busca ampla que gera material descartável, faça na conversa principal o que é pequeno, sequencial ou que você vai reler depois
Fala aí, beleza? Tem uma crença rodando solta por aí, e ela virou quase regra: delegar pro subagente é sempre mais barato
Só que isolar contexto e economizar gasto são duas coisas bem diferentes
Cada subagente do Claude Code roda em uma janela de contexto própria, separada da conversa principal, e só a mensagem final dele volta pra sessão (mais metadados)
Isso limpa o seu papo, sim
Mas o trabalho continua acontecendo, só que na sala ao lado, e ele também consome tokens
A resposta honesta depende do tipo de tarefa, e é exatamente isso que a gente destrincha aqui 🙂
O que ocupa a janela de contexto do Claude Code
Antes de comparar qualquer coisa, vale lembrar o que enche essa janela
A janela de contexto guarda tudo que o modelo enxerga de uma vez: o system prompt, a conversa até ali, cada chamada de ferramenta com a saída dela e cada arquivo lido
Domine o Claude Code do básico ao avançado
Você vai aprender a criar sistemas completos com Claude Code, sem precisar ser programador. Inscreva-se para ter acesso a um desconto de lançamento e bônus especiais!
Repara no detalhe: não é só o que VOCÊ digitou
É cada busca, cada leitura de arquivo, cada retorno gordo de ferramenta que ficou empilhado no meio da conversa
E isso vale desde o primeiro minuto da sessão, antes mesmo de você pedir alguma coisa
Quer ver o tamanho do estrago em vez de teorizar? Roda /context numa sessão nova
Ele mostra o que já está carregado na janela, tipo o CLAUDE.md e as definições de ferramentas MCP, e aí dá pra cortar o que é desnecessário
Tome cuidado com uma armadilha comum aqui: muita gente acusa a delegação de estourar o contexto quando, na real, a sessão já nasceu pesada
Como o subagente isola o contexto de verdade
A mecânica está documentada e é bem específica, se liga nos quatro pontos da documentação de subagentes:
- cada subagente roda em uma janela de contexto própria, separada da principal
- ele não herda o histórico da conversa principal: começa com contexto novo e recebe apenas o prompt que a sessão principal escreve pra ele
- o texto instrucional do corpo do subagente nunca entra na conversa principal, ou seja, o system prompt dele fica fora do seu contexto
- de volta, só a mensagem final mais metadados
Se você já delegou algo pra um colega, a analogia é essa: ele lê a papelada inteira na sala ao lado e te entrega um bilhete com a conclusão
Na prática isso significa que um subagente de pesquisa pode explorar dezenas de arquivos sem que nada desse conteúdo se acumule na sua conversa
O pai recebe um resumo conciso, não cada arquivo lido
Muito massa pra quem vive estourando janela em tarefa de investigação
Só que o bilhete não sai de graça…
Busca ampla no subagente x busca ampla na conversa principal
Colocando os dois lado a lado, nos eixos que realmente importam quando o assunto é busca ampla no código:
| Eixo | Delegar pro subagente | Fazer na conversa principal |
|---|---|---|
| Contexto ocupado na sessão principal | Baixo: entra só a mensagem final mais metadados | Alto: cada arquivo lido e cada saída de ferramenta ficam empilhados |
| Tokens totais consumidos | Maior: multi-agente costuma usar de 3 a 10 vezes mais tokens que agente único em tarefas equivalentes | Menor: um contexto só, sem duplicação |
| Tempo | Vários subagentes rodam ao mesmo tempo, então subtarefas independentes terminam no tempo do mais lento, não na soma | Sequencial: uma coisa depois da outra |
| Fidelidade do resultado | Você fica com o resumo, o material bruto ficou na janela do subagente | Material bruto disponível ali, dá pra reler e cruzar |
| Retomabilidade | Explore e Plan são de uma tacada só e não podem ser retomados; general-purpose e customizados, sim | Sempre retomável, é a sua própria conversa |
A linha da fidelidade é a que mais pega gente desprevenida
Se você vai precisar do material bruto depois, o resumo não te salva: aquele conteúdo não está mais em lugar nenhum que você alcance
De onde vem o gasto extra do multi-agente
O custo adicional não é mistério, ele tem três fontes bem mapeadas:
- duplicação de contexto entre agentes
- mensagens de coordenação
- sumarização de resultados nas passagens de bastão
Cada uma dessas coisas é token que não existiria se o trabalho fosse feito numa conversa só
E a própria Anthropic não vende ilusão aqui: subagente tem custo, cada um sobe o próprio contexto, consome tokens e adiciona uma camada de indireção entre você e o trabalho
A conta fecha quando isolamento, paralelismo ou uma perspectiva independente realmente ajudam
Quando não ajudam, você pagou o pedágio à toa
Quando delegar compensa (e quando é só overhead)
Aqui tem critério, não achismo
O isolamento de contexto é mais eficaz quando:
- a subtarefa gera alto volume de contexto (mais de 1000 tokens)
- a maior parte desse material é irrelevante pra tarefa principal
- a subtarefa é bem definida, com critério claro do que extrair
- é operação de busca ou recuperação que exige filtragem antes do uso
- você já sabe de antemão que aquela saída intermediária não vai ser consultada de novo
Olha o padrão: material MUITO, aproveitamento pouco, escopo fechado
E os casos em que delegar é só overhead:
- trabalho sequencial e dependente, quando o passo dois precisa da saída inteira do passo um
- tarefas pequenas, onde o custo da delegação supera o benefício
- dois subagentes editando o mesmo arquivo em paralelo
Esse último merece um alerta: paralelizar edição no mesmo arquivo é pedir pra se ferrar
Os subagentes embutidos e quando cada um serve
O Claude Code já vem com três, e cada um tem um papel bem definido:
- Explore: busca rápida e somente leitura no código, e ao acionar ele o Claude define um nível de profundidade da busca (quick, medium ou very thorough)
- Plan: pesquisa do código durante o plan mode, também somente leitura, com Write e Edit negados
- general-purpose: tarefas complexas de várias etapas, que exigem exploração e ação
Pra busca ampla, o Explore é o candidato natural: ele é o caso de livro do isolamento (muito material lido, pouco material aproveitado)
Mas tem a ressalva da retomabilidade
Explore e Plan são de uma tacada só, não devolvem um ID de agente e por isso não podem ser retomados
Se o trabalho precisa continuar depois, o caminho é o general-purpose ou um subagente customizado
Subagente customizado: onde o arquivo vive e o que ele define
Subagentes customizados no Claude Code são arquivos Markdown com frontmatter YAML
Eles ficam em .claude/agents/ (nível projeto) ou em ~/.claude/agents/ (nível usuário)
O frontmatter define nome, descrição, ferramentas permitidas e modelo, e o corpo em Markdown vira o system prompt do subagente
O esqueleto é mais ou menos assim:
---
name: <nome-do-subagente>
description: <quando ele deve ser acionado>
tools: <ferramentas permitidas>
model: <modelo>
---
<corpo em Markdown, e isso aqui vira o system prompt do subagente>
E olha como isso amarra direto no nosso ângulo: restringir ferramentas e apertar o escopo no corpo é o que mantém o retorno enxuto
Subagente com escopo frouxo devolve textão, e textão de volta é contexto ocupado na sua sessão de novo
Se você ainda embaralha skills, comandos e subagentes, vale separar os três antes de sair criando arquivo
O corpo do subagente segue a mesma lógica de dar contexto de negócio pra skill: quanto mais claro o critério de extração, menor e mais útil o que volta
Veredito: subagente economiza contexto, não economiza tokens
Sem meio-termo: subagente é ferramenta de gestão de contexto, não de economia de gasto
A sua sessão principal fica limpa porque o material bruto morre na janela do subagente, e isso é real
O total consumido, por outro lado, sobe: multi-agente costuma usar de 3 a 10 vezes mais tokens que agente único pra tarefas equivalentes
A régua prática de decisão:
- Delegue quando o trabalho gera muito material descartável e o escopo é bem delimitado, com critério claro do que você quer de volta
- Faça na conversa principal quando a tarefa é pequena, quando ela é sequencial e dependente, ou quando você vai precisar do material bruto mais pra frente
- Pense em paralelismo só quando as subtarefas são de fato independentes, porque aí o ganho é de tempo, não de token
Pra quem serve cada escolha? Delegação é pra quem vive estourando janela em investigação longa e quer a sessão respirando
Conversa principal é pra quem está num fluxo curto, iterativo, mexendo em arquivo e voltando nele
Conclusão
Subagentes no Claude Code isolam contexto de verdade: janela própria, contexto inicial fresco sem herdar o histórico do pai, system prompt fora do seu contexto e retorno só da mensagem final
O que eles não fazem é diminuir o gasto total, porque duplicação de contexto, coordenação e sumarização cobram o pedágio
Próximo passo bem concreto: abre uma sessão nova e roda /context antes de culpar (ou adotar) a delegação
Vê o que já está ocupando a janela, corta o que não serve, e só então aplica a régua de decisão na sua próxima tarefa de busca ampla
Faça o teste e compara: mesma tarefa, um dia delegada, outro dia na conversa principal 😀
até o próximo post!
Perguntas frequentes
Subagentes no Claude Code gastam mais tokens do que fazer tudo na conversa principal?
Sim, na maioria dos casos. Implementações multi-agente costumam usar de 3 a 10 vezes mais tokens que a abordagem de agente único pra tarefas equivalentes, porque cada subagente duplica contexto, troca mensagens de coordenação e ainda sumariza resultado na volta. O que você ganha é uma sessão principal mais limpa, não uma conta menor.
Onde ficam salvos os subagentes customizados no Claude Code?
Em arquivos Markdown com frontmatter YAML, guardados em .claude/agents/ (nível projeto) ou ~/.claude/agents/ (nível usuário). O frontmatter define nome, descrição, ferramentas permitidas e modelo, e o corpo em Markdown vira o system prompt do subagente.
Dá pra retomar um subagente Explore depois que ele termina a busca?
Não. Explore e Plan são de uma tacada só, não devolvem um ID de agente e por isso não podem ser retomados. Se o trabalho precisa continuar depois, o caminho é usar o general-purpose ou um subagente customizado.
Qual a diferença entre os subagentes Explore e Plan no Claude Code?
O Explore faz busca rápida e somente leitura no código, com nível de profundidade quick, medium ou very thorough definido pelo Claude. O Plan pesquisa o código durante o plan mode, também somente leitura, com Write e Edit negados.
Como saber se vale a pena delegar uma tarefa pra um subagente?
Vale quando a subtarefa gera bastante contexto (mais de 1000 tokens), a maior parte desse material é descartável, o escopo é bem definido e é uma busca que exige filtragem antes do uso. Não vale em trabalho sequencial dependente, tarefa pequena ou quando dois subagentes editariam o mesmo arquivo em paralelo.
Como ver o que está ocupando a janela de contexto antes de decidir usar subagentes?
Rodando /context numa sessão nova do Claude Code. O comando mostra o que já está carregado, como o CLAUDE.md e as definições de ferramentas MCP, e ajuda a cortar o que é desnecessário antes de culpar a delegação por um contexto estourado.
Formações
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
Blog | Mais populares
As diferenças de var, let e const
Como fazer redirecionamento com PHP
Neste artigo você vai aprender a como fazer redirecionamento com PHP, utilizaremos abordagens fáceis de entender e de aplicar Fala programador(a), beleza? Bora aprender mais […]
Checklist de segurança n8n VPS pública: guia essencial para proteger sua instalação
Checklist de segurança n8n VPS pública: guia essencial para proteger sua instalação A popularidade da automação de processos com o n8n está em alta, principalmente […]
