Subagentes no Claude Code economizam contexto ou multiplicam o gasto?

subagentes no Claude Code dividindo tarefas sem lotar o contexto da conversa principal
Resposta rápida

Subagentes no Claude Code economizam contexto, não tokens. Cada subagente roda numa janela própria, começa sem o histórico da conversa principal e devolve só a mensagem final mais metadados, então a sua sessão fica limpa mesmo que ele leia dezenas de arquivos. O gasto total, porém, sobe: implementações multi-agente costumam usar de 3 a 10 vezes mais tokens que a abordagem de agente único, por duplicação de contexto, coordenação e sumarização. Delegue busca ampla que gera material descartável, faça na conversa principal o que é pequeno, sequencial ou que você vai reler depois

Fala aí, beleza? Tem uma crença rodando solta por aí, e ela virou quase regra: delegar pro subagente é sempre mais barato

Só que isolar contexto e economizar gasto são duas coisas bem diferentes

Cada subagente do Claude Code roda em uma janela de contexto própria, separada da conversa principal, e só a mensagem final dele volta pra sessão (mais metadados)

Isso limpa o seu papo, sim

Mas o trabalho continua acontecendo, só que na sala ao lado, e ele também consome tokens

A resposta honesta depende do tipo de tarefa, e é exatamente isso que a gente destrincha aqui 🙂

O que ocupa a janela de contexto do Claude Code

Antes de comparar qualquer coisa, vale lembrar o que enche essa janela

A janela de contexto guarda tudo que o modelo enxerga de uma vez: o system prompt, a conversa até ali, cada chamada de ferramenta com a saída dela e cada arquivo lido

Domine o Claude Code do básico ao avançado
Pré-inscrição Formação Claude Code

Domine o Claude Code do básico ao avançado

Você vai aprender a criar sistemas completos com Claude Code, sem precisar ser programador. Inscreva-se para ter acesso a um desconto de lançamento e bônus especiais!

Repara no detalhe: não é só o que VOCÊ digitou

É cada busca, cada leitura de arquivo, cada retorno gordo de ferramenta que ficou empilhado no meio da conversa

E isso vale desde o primeiro minuto da sessão, antes mesmo de você pedir alguma coisa

Quer ver o tamanho do estrago em vez de teorizar? Roda /context numa sessão nova

Ele mostra o que já está carregado na janela, tipo o CLAUDE.md e as definições de ferramentas MCP, e aí dá pra cortar o que é desnecessário

Tome cuidado com uma armadilha comum aqui: muita gente acusa a delegação de estourar o contexto quando, na real, a sessão já nasceu pesada

Como o subagente isola o contexto de verdade

A mecânica está documentada e é bem específica, se liga nos quatro pontos da documentação de subagentes:

  • cada subagente roda em uma janela de contexto própria, separada da principal
  • ele não herda o histórico da conversa principal: começa com contexto novo e recebe apenas o prompt que a sessão principal escreve pra ele
  • o texto instrucional do corpo do subagente nunca entra na conversa principal, ou seja, o system prompt dele fica fora do seu contexto
  • de volta, só a mensagem final mais metadados

Se você já delegou algo pra um colega, a analogia é essa: ele lê a papelada inteira na sala ao lado e te entrega um bilhete com a conclusão

Na prática isso significa que um subagente de pesquisa pode explorar dezenas de arquivos sem que nada desse conteúdo se acumule na sua conversa

O pai recebe um resumo conciso, não cada arquivo lido

Muito massa pra quem vive estourando janela em tarefa de investigação

Só que o bilhete não sai de graça…

Busca ampla no subagente x busca ampla na conversa principal

Colocando os dois lado a lado, nos eixos que realmente importam quando o assunto é busca ampla no código:

Eixo Delegar pro subagente Fazer na conversa principal
Contexto ocupado na sessão principal Baixo: entra só a mensagem final mais metadados Alto: cada arquivo lido e cada saída de ferramenta ficam empilhados
Tokens totais consumidos Maior: multi-agente costuma usar de 3 a 10 vezes mais tokens que agente único em tarefas equivalentes Menor: um contexto só, sem duplicação
Tempo Vários subagentes rodam ao mesmo tempo, então subtarefas independentes terminam no tempo do mais lento, não na soma Sequencial: uma coisa depois da outra
Fidelidade do resultado Você fica com o resumo, o material bruto ficou na janela do subagente Material bruto disponível ali, dá pra reler e cruzar
Retomabilidade Explore e Plan são de uma tacada só e não podem ser retomados; general-purpose e customizados, sim Sempre retomável, é a sua própria conversa

A linha da fidelidade é a que mais pega gente desprevenida

Se você vai precisar do material bruto depois, o resumo não te salva: aquele conteúdo não está mais em lugar nenhum que você alcance

De onde vem o gasto extra do multi-agente

O custo adicional não é mistério, ele tem três fontes bem mapeadas:

  • duplicação de contexto entre agentes
  • mensagens de coordenação
  • sumarização de resultados nas passagens de bastão

Cada uma dessas coisas é token que não existiria se o trabalho fosse feito numa conversa só

E a própria Anthropic não vende ilusão aqui: subagente tem custo, cada um sobe o próprio contexto, consome tokens e adiciona uma camada de indireção entre você e o trabalho

A conta fecha quando isolamento, paralelismo ou uma perspectiva independente realmente ajudam

Quando não ajudam, você pagou o pedágio à toa

Quando delegar compensa (e quando é só overhead)

Aqui tem critério, não achismo

O isolamento de contexto é mais eficaz quando:

  • a subtarefa gera alto volume de contexto (mais de 1000 tokens)
  • a maior parte desse material é irrelevante pra tarefa principal
  • a subtarefa é bem definida, com critério claro do que extrair
  • é operação de busca ou recuperação que exige filtragem antes do uso
  • você já sabe de antemão que aquela saída intermediária não vai ser consultada de novo

Olha o padrão: material MUITO, aproveitamento pouco, escopo fechado

E os casos em que delegar é só overhead:

  • trabalho sequencial e dependente, quando o passo dois precisa da saída inteira do passo um
  • tarefas pequenas, onde o custo da delegação supera o benefício
  • dois subagentes editando o mesmo arquivo em paralelo

Esse último merece um alerta: paralelizar edição no mesmo arquivo é pedir pra se ferrar

Os subagentes embutidos e quando cada um serve

O Claude Code já vem com três, e cada um tem um papel bem definido:

  • Explore: busca rápida e somente leitura no código, e ao acionar ele o Claude define um nível de profundidade da busca (quick, medium ou very thorough)
  • Plan: pesquisa do código durante o plan mode, também somente leitura, com Write e Edit negados
  • general-purpose: tarefas complexas de várias etapas, que exigem exploração e ação

Pra busca ampla, o Explore é o candidato natural: ele é o caso de livro do isolamento (muito material lido, pouco material aproveitado)

Mas tem a ressalva da retomabilidade

Explore e Plan são de uma tacada só, não devolvem um ID de agente e por isso não podem ser retomados

Se o trabalho precisa continuar depois, o caminho é o general-purpose ou um subagente customizado

Subagente customizado: onde o arquivo vive e o que ele define

Subagentes customizados no Claude Code são arquivos Markdown com frontmatter YAML

Eles ficam em .claude/agents/ (nível projeto) ou em ~/.claude/agents/ (nível usuário)

O frontmatter define nome, descrição, ferramentas permitidas e modelo, e o corpo em Markdown vira o system prompt do subagente

O esqueleto é mais ou menos assim:

---
name: <nome-do-subagente>
description: <quando ele deve ser acionado>
tools: <ferramentas permitidas>
model: <modelo>
---

<corpo em Markdown, e isso aqui vira o system prompt do subagente>

E olha como isso amarra direto no nosso ângulo: restringir ferramentas e apertar o escopo no corpo é o que mantém o retorno enxuto

Subagente com escopo frouxo devolve textão, e textão de volta é contexto ocupado na sua sessão de novo

Se você ainda embaralha skills, comandos e subagentes, vale separar os três antes de sair criando arquivo

O corpo do subagente segue a mesma lógica de dar contexto de negócio pra skill: quanto mais claro o critério de extração, menor e mais útil o que volta

Veredito: subagente economiza contexto, não economiza tokens

Sem meio-termo: subagente é ferramenta de gestão de contexto, não de economia de gasto

A sua sessão principal fica limpa porque o material bruto morre na janela do subagente, e isso é real

O total consumido, por outro lado, sobe: multi-agente costuma usar de 3 a 10 vezes mais tokens que agente único pra tarefas equivalentes

A régua prática de decisão:

  1. Delegue quando o trabalho gera muito material descartável e o escopo é bem delimitado, com critério claro do que você quer de volta
  2. Faça na conversa principal quando a tarefa é pequena, quando ela é sequencial e dependente, ou quando você vai precisar do material bruto mais pra frente
  3. Pense em paralelismo só quando as subtarefas são de fato independentes, porque aí o ganho é de tempo, não de token

Pra quem serve cada escolha? Delegação é pra quem vive estourando janela em investigação longa e quer a sessão respirando

Conversa principal é pra quem está num fluxo curto, iterativo, mexendo em arquivo e voltando nele

Conclusão

Subagentes no Claude Code isolam contexto de verdade: janela própria, contexto inicial fresco sem herdar o histórico do pai, system prompt fora do seu contexto e retorno só da mensagem final

O que eles não fazem é diminuir o gasto total, porque duplicação de contexto, coordenação e sumarização cobram o pedágio

Próximo passo bem concreto: abre uma sessão nova e roda /context antes de culpar (ou adotar) a delegação

Vê o que já está ocupando a janela, corta o que não serve, e só então aplica a régua de decisão na sua próxima tarefa de busca ampla

Faça o teste e compara: mesma tarefa, um dia delegada, outro dia na conversa principal 😀

até o próximo post!

Perguntas frequentes

Subagentes no Claude Code gastam mais tokens do que fazer tudo na conversa principal?

Sim, na maioria dos casos. Implementações multi-agente costumam usar de 3 a 10 vezes mais tokens que a abordagem de agente único pra tarefas equivalentes, porque cada subagente duplica contexto, troca mensagens de coordenação e ainda sumariza resultado na volta. O que você ganha é uma sessão principal mais limpa, não uma conta menor.

Onde ficam salvos os subagentes customizados no Claude Code?

Em arquivos Markdown com frontmatter YAML, guardados em .claude/agents/ (nível projeto) ou ~/.claude/agents/ (nível usuário). O frontmatter define nome, descrição, ferramentas permitidas e modelo, e o corpo em Markdown vira o system prompt do subagente.

Dá pra retomar um subagente Explore depois que ele termina a busca?

Não. Explore e Plan são de uma tacada só, não devolvem um ID de agente e por isso não podem ser retomados. Se o trabalho precisa continuar depois, o caminho é usar o general-purpose ou um subagente customizado.

Qual a diferença entre os subagentes Explore e Plan no Claude Code?

O Explore faz busca rápida e somente leitura no código, com nível de profundidade quick, medium ou very thorough definido pelo Claude. O Plan pesquisa o código durante o plan mode, também somente leitura, com Write e Edit negados.

Como saber se vale a pena delegar uma tarefa pra um subagente?

Vale quando a subtarefa gera bastante contexto (mais de 1000 tokens), a maior parte desse material é descartável, o escopo é bem definido e é uma busca que exige filtragem antes do uso. Não vale em trabalho sequencial dependente, tarefa pequena ou quando dois subagentes editariam o mesmo arquivo em paralelo.

Como ver o que está ocupando a janela de contexto antes de decidir usar subagentes?

Rodando /context numa sessão nova do Claude Code. O comando mostra o que já está carregado, como o CLAUDE.md e as definições de ferramentas MCP, e ajuda a cortar o que é desnecessário antes de culpar a delegação por um contexto estourado.



Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted

Formações

Formação Vibe Coding

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

Blog | Mais populares