Como saber se a sua skill de marketing está funcionando de verdade?

comparação lado a lado de resultados antes e depois de usar uma skill de marketing
Resposta rápida

Uma skill de marketing só está funcionando quando você consegue provar, não quando a saída parece boa. O método é simples: escolha de 2 a 3 tarefas reais que você já faz, rode sem a skill e anote as falhas específicas (esse é o baseline), crie avaliações com três cenários em cima dessas lacunas, rode de novo com a skill carregada e compare as saídas lado a lado. A métrica honesta é o conserto manual que sobrou. A documentação oficial trata avaliações como a fonte de verdade da eficácia de uma skill, e o plugin skill-creator roda evals e benchmark pra você.

Achar que a skill melhorou o resultado é fácil

provar isso é outra história

A cena é sempre a mesma: você instala uma skill de marketing, joga um briefing, sai um texto bonito e todo mundo acha massa

só que ninguém consegue dizer se o ganho veio da skill ou do prompt que você escreveu naquele dia, com contexto colado, exemplo junto e três correções no meio do caminho

O jeito de sair do "achei que ficou melhor" é chato de tão simples: roda a mesma tarefa sem a skill, roda com a skill, coloca as duas saídas lado a lado e anota o que você AINDA precisou consertar na mão

esse último item é o critério observável, e é ele que decide se a skill pode ser espalhada pro time ou não 🙂

O que você precisa antes de começar o teste

Onde a skill vive:

No Claude Code as skills são baseadas em sistema de arquivos e ficam em duas pastas

~/.claude/skills é a pessoal, vale em todos os projetos da máquina

.claude/skills é a do projeto, versionada no repositório

Essa diferença importa MUITO no teste que a gente vai fazer: a skill de projeto entra no repo e o time inteiro herda ela junto com o próximo git pull

ou seja, é exatamente o cenário que você quer evitar antes de ter prova de que a coisa funciona

Domine o Claude Code do básico ao avançado
Pré-inscrição Formação Claude Code

Domine o Claude Code do básico ao avançado

Você vai aprender a criar sistemas completos com Claude Code, sem precisar ser programador. Inscreva-se para ter acesso a um desconto de lançamento e bônus especiais!

O arquivo SKILL.md:

Toda skill precisa de um SKILL.md com frontmatter YAML entre os marcadores ---, contendo os campos name e description, seguido das instruções em markdown

O esqueleto é esse:

---
name: nome-da-skill
description: quando essa skill deve ser usada, nas palavras que o usuário diria
---

# Instruções

O corpo em markdown com o que o agente deve fazer

Guarde o campo description na memória, ele volta lá no passo 7 e é o suspeito número um quando a skill não ativa

O que a skill custa de contexto:

O carregamento é progressivo

name e description são carregados na inicialização; o conteúdo completo do SKILL.md, os scripts e os recursos só carregam quando a skill é considerada relevante

O custo dos metadados na inicialização é de cerca de 100 tokens por skill

Se você conhece o índice de um livro, é bem parecido: o índice está sempre ali aberto, o capítulo inteiro só é lido quando alguém precisa dele

O material do teste:

Separe de 2 a 3 tarefas REAIS de marketing, dessas que você já faz toda semana

a documentação oficial de boas práticas é explícita nisso: tarefas reais, não cenários de teste inventados

e aqui vale a mesma lógica de escrever uma spec antes de implementar: quanto mais concreto o pedido, menos achismo sobra pra discutir depois

Passo a passo para avaliar a skill de marketing

  1. Escolha as tarefas representativas. Pegue trabalho de verdade da sua rotina, com o material de verdade junto (o briefing real, o produto real, a landing real). O erro comum deste passo: montar um cenário artificial bonitinho, que passa em qualquer condição e não revela nada
  2. Rode SEM a skill e registre o baseline. A documentação recomenda começar a medição justamente aqui: rodar as tarefas sem a skill pra identificar as lacunas e documentar as falhas específicas ou o contexto que faltou. O erro comum deste passo: anotar "ficou fraco" em vez de anotar o que exatamente faltou (esqueceu o público, inventou dado, ignorou o tom)
  3. Crie as avaliações a partir dessas lacunas, com três cenários. As avaliações são a fonte de verdade pra medir a eficácia da skill, e criá-las antes de escrever documentação extensa garante que a skill resolve problema real e não problema imaginado. O erro comum deste passo: escrever uma skill gigante primeiro e só depois pensar em como testar
  4. Rode as mesmas tarefas com a skill carregada, no padrão de duas instâncias. Uma instância (Claude A) ajuda a projetar e refinar as instruções da skill; outra (Claude B), com a skill carregada, executa as tarefas reais e revela as lacunas. O ciclo é observar, refinar e testar de novo. O erro comum deste passo: usar a mesma sessão que escreveu a skill pra testar a skill, e aí o contexto da conversa faz o trabalho que a skill deveria fazer
  5. Compare as saídas e anote onde o agente errou, acertou ou fez escolha inesperada. O exemplo que a própria documentação dá é ótimo: o agente escreve a query certinha mas esquece de filtrar as contas de teste, mesmo com a regra escrita na skill. O erro comum deste passo: ler as duas saídas de cabeça e decidir no feeling, sem registrar item por item
  6. Anote o conserto manual. Essa é a métrica honesta: o que você teve que reescrever, o dado que teve que colar na mão, o parágrafo que teve que apagar. Se o conserto manual não cai, a skill não está funcionando, por mais bonita que a saída pareça. O erro comum deste passo: consertar enquanto lê e esquecer que consertou
  7. Cheque se a skill sequer foi acionada. Quando ela não é usada como esperado, a orientação é verificar se a skill aparece ao perguntar "What skills are available?" e conferir se a description inclui as palavras que o usuário diria naturalmente. O erro comum deste passo: culpar a qualidade da skill quando ela nem entrou na jogada, e o problema estava numa descrição escrita em jargão interno
  8. Itere com instruções mínimas contra o baseline. Escreva o mínimo necessário pra resolver a lacuna que você documentou, rode de novo e compare com o baseline. O erro comum deste passo: empilhar regra em cima de regra a cada rodada, até ninguém saber mais qual instrução está fazendo efeito

Pra registrar isso sem viés, uma tabela por tarefa já resolve:

Tarefa real Falha sem a skill (baseline) Saída com a skill Conserto manual que sobrou
Briefing de campanha Ignorou o público definido Manteve o público Ajustei 1 parágrafo de tom
Copy de landing Inventou benefício não confirmado Ficou nos dados do briefing Reescrevi o CTA
Roteiro de e-mail Não seguiu a estrutura padrão Seguiu a estrutura Nenhum

Dá pra automatizar essa medição?

Dá, e a própria Anthropic mantém um plugin pra isso: o skill-creator, que vive no repositório oficial anthropics/claude-plugins-official

Ele serve pra criar uma skill do zero, editar ou otimizar uma existente, rodar evals pra testar a skill, fazer benchmark de desempenho com análise de variância e otimizar a description pra melhorar a precisão de acionamento

A instalação sai pelo marketplace oficial de plugins:

/plugin install skill-creator@claude-plugins-official

O Claude Code adiciona o marketplace oficial automaticamente na primeira execução interativa

caso ele não esteja lá, dá pra adicionar na mão:

/plugin marketplace add anthropics/claude-plugins-official

E uma coisa boa de saber antes de instalar: skills vindas de plugin usam o namespace plugin-name:skill-name, então elas não conflitam com as skills dos outros níveis e convivem numa boa com uma skill de mesmo nome em .claude/skills

O que aparece quando você roda a skill em tarefa real

No vídeo abaixo eu rodo esse mesmo método numa skill de design, em tarefa real, do começo ao fim

O primeiro teste foi implícito de propósito: escrevi o prompt sem citar a skill, só pra ver se ela ativava sozinha

ativou

quando não ativa, aí não tem jeito, tu tem que ser explícito no prompt (o que já é um sinal pra revisar a description)

E aí vem a parte que nenhum cenário artificial mostra:

  • o protótipo clicável de app saiu com 4 telas, e eu não aceitei o relatório do agente como prova: abri no navegador com servidor local e cliquei pelas telas pra confirmar que a navegação funcionava mesmo
  • no teste de slides, pedi que ele sugerisse direções visuais antes de produzir; vieram as opções, escolhi uma e só então ele começou a construir
  • no meio do deck ele parou e pediu confirmação de decisões, deixando 6 slides pendentes; atribuí a parada ao projeto estar cru em dados, sem números reais pra preencher os slides
  • a navegação por setas do teclado, que eu tinha pedido explicitamente, simplesmente não funcionou quando abri os slides; só descobri porque testei
  • a exportação da animação em MP4 levou 7 minutos, e antes de gerar o agente avisou que precisava de pacotes adicionais de renderização e instalou eles
  • abri o MP4 fora do editor pra conferir o resultado final, em vez de confiar na prévia
  • notei assinatura do fornecedor colocada dentro do resultado, no player da animação e no slide; levantei a hipótese de a própria skill induzir isso, já vi outros pacotes de skills com viés parecido de recomendar empresas

Depois de tudo, fui conferir o consumo do plano pra medir quanto a brincadeira custou: ficou em torno de 30%, e é aproximação, porque eu já tinha usado um pouco antes

Repara no que essa lista é: ela é exatamente o passo 6, o conserto manual anotado

setas do teclado que não funcionaram, 6 slides pendentes, assinatura pra remover do resultado

nada disso apareceria num cenário de teste montado pra dar certo, e é justamente isso que separa "a skill funciona" de "a saída pareceu boa"

Uma observação que também vale pro seu teste: nessa skill às vezes é preciso ser mais explícito sobre as funcionalidades desejadas do que numa ferramenta comparável

no fim gostei do pacote e achei o uso viável, principalmente porque o consumo ficou menor do que eu esperava

ainda vou explorar mais pra entender as capacidades, mas o veredito só existe porque eu abri o navegador, cliquei nas telas e abri o MP4 =)

Conclusão

O critério é observável e cabe numa frase: só espalhe a skill de marketing pro time depois que a comparação com e sem mostrar ganho E o conserto manual cair

enquanto isso não acontecer, você tem uma impressão, não um resultado

Quando passar nesse teste, o próximo passo é compartilhar com os colegas e observar o uso: a skill é acionada quando você espera? as instruções estão claras? o que está faltando?

é esse feedback que cobre as lacunas que o uso individual nunca revela, porque cada pessoa escreve o pedido de um jeito diferente do seu

E se você quiser material pra submeter ao mesmo teste, tem repositório público pra garimpar: o anthropics/skills, repositório público de Agent Skills, e o coreyhaines31/marketingskills, da comunidade, com skills de marketing pra Claude Code e agentes de IA cobrindo CRO, copywriting, SEO, analytics e growth engineering

instala, roda o baseline, roda com a skill e anota o conserto

até o próximo post! 😀

Perguntas frequentes

O que é o skill-creator e pra que ele serve?

É um plugin oficial da Anthropic, mantido no repositório anthropics/claude-plugins-official. Serve pra criar uma skill do zero, editar ou otimizar uma já existente, rodar evals pra testar e fazer benchmark de desempenho com análise de variância. Também ajuda a otimizar a description pra melhorar a precisão de acionamento.

Como instalar o skill-creator no Claude Code?

O comando é /plugin install skill-creator@claude-plugins-official. O marketplace oficial (claude-plugins-official) é adicionado automaticamente na primeira execução interativa do Claude Code, mas também dá pra adicionar na mão com /plugin marketplace add anthropics/claude-plugins-official.

Existe repositório com skill de marketing pronta pra usar?

O ponto de partida é o anthropics/skills, repositório público oficial de Agent Skills da Anthropic. Seja qual for a origem da skill, o caminho é o mesmo do post: rodar a tarefa real sem a skill pra ter o baseline, rodar com a skill e anotar o conserto manual que sobrou.

Uma skill de plugin pode ter o mesmo nome de uma skill do meu projeto?

Pode sim, sem conflito. Skills vindas de plugin usam o namespace plugin-name:skill-name, então convivem tranquilamente com uma skill de mesmo nome guardada em .claude/skills ou em ~/.claude/skills.

Quanto de contexto uma skill de marketing consome antes mesmo de ser usada?

Só os metadados, name e description, carregam na inicialização, e isso custa cerca de 100 tokens por skill. O conteúdo completo do SKILL.md, scripts e recursos só entra no contexto quando a skill é considerada relevante pra tarefa.

O que fazer quando a skill de marketing não é acionada durante o teste?

O primeiro passo é perguntar "What skills are available?" e conferir se ela aparece na lista. Se aparecer, o suspeito é a description: ela precisa ter as palavras que o usuário diria naturalmente, não jargão interno do time.




Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted

Formações

Formação Vibe Coding

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

Blog | Mais populares