Seu produto é recomendado pelos modelos? Como montar um teste de AEO com prompts repetidos

planilha de teste de AEO mostrando recomendações de produtos por modelos de IA
Resposta rápida

Um teste de AEO é o procedimento de rodar as mesmas perguntas de compra em vários modelos com busca ligada e registrar quem eles recomendam, quem citam de passagem e quais páginas eles leem pra responder. A Latent Space publicou em 07/09/2026 o Frontier AEO Tracker, que roda 6 variações de prompt em 7 configurações de modelo, em 161 categorias, com pontuação para escolha primária, alternativa, menção e objeções. Este guia mostra como replicar isso em escala pequena: uma categoria, seis variações, planilha simples, mais a checagem de se o seu site entrega conteúdo legível pro agente.

A pergunta saiu do lugar: não é mais só em que posição você aparece no Google, é se o modelo fala o seu nome quando alguém pergunta qual ferramenta usar

Em 07/09/2026 a Latent Space publicou o Frontier AEO Tracker, um rastreador que roda 6 variações de prompt em 7 configurações de modelo com busca ligada, em 161 categorias de produto

Só que levantamento de terceiro é foto do mercado, não do seu caso

Aqui a ideia é outra: montar uma versão pequena e barata desse teste pro seu produto (ou o do cliente), com prompts repetidos, planilha e registro das fontes que os modelos leem pra responder sobre a sua categoria

Bora? =)

De onde vem a metodologia: o Frontier AEO Tracker da Latent Space

A ideia por trás da sigla AEO é direta: em vez de brigar por posição no buscador, você quer estar dentro da resposta que o modelo entrega

O tracker público fica em aeo.latent.space e está identificado como snapshot de pesquisa V5 de setembro de 2026, com leaderboards por categoria

A mecânica declarada: 6 variações de prompt x 7 configurações de modelo/CLI (search on) x 161 categorias, uma execução por versão

As categorias cobertas vão de agentes de código a podcasts de IA, sandboxes de IA, bancos de dados gerenciados, modelos de ASR, e ainda entram umas bem atípicas tipo investidores anjo, corporate spend e software de folha de pagamento

A extração das respostas foi feita pelo modelo Astra, e todo par de prompt e resposta é inspecionável publicamente

E o crédito da metodologia não é da Latent Space sozinha: eles estendem e ajustam a metodologia da Amplifying, do estudo What Claude Code Actually Chooses, que levantou 2.430 recomendações em 3 modelos, 4 tipos de projeto e 20 categorias

Formação Claude Code
Formação Recomendada

Formação Claude Code

Domine Claude Code do absoluto zero até o avançado

  • 120 aulas
  • 4 projetos
  • 9h 45min

Como a resposta vira nota:

Em vez de contar menção no braço, o tracker pontua o papel que o seu produto ocupou na resposta:

O que aconteceu na resposta Peso
Escolha primária 60
Alternativa direta 25
Outras menções positivas 15
Objeção em cenário elegível -25
Objeção ampla -60

Repara numa coisa importante: esses números são o peso CRU de cada papel, não a nota que aparece no final

Depois de somar, a escala normaliza a escolha primária em 100 (ou seja, o teto do score é o produto que foi escolha primária em tudo) e faz média igual entre as configurações de modelo/frame

São dois momentos diferentes, beleza? peso bruto na contagem, score normalizado na hora de comparar

E tem o aviso que quase ninguém lê: esse score não é frequência de primeira escolha, não mede qualidade do produto e não mede participação de mercado

Ele mede recomendações registradas nas configurações testadas, ponto

Guarde isso, porque é exatamente o erro que você vai querer evitar quando olhar a sua própria planilha lá na frente

Dois achados que mudam como você monta o seu teste

1) Modelo puxa sardinha pra própria casa

O artigo é bem explícito nisso: quando a pergunta é sobre agentes de código, Fable/Opus gostam do Claude Code, Sol/Astra gostam do Codex, Grok ama Cursor, Muse ama Muse Code, SWE-1.7 ama Devin

"I wonder why", escreveram eles haha

Tem contraponto, e ele importa: o material também registra casos de modelos GPT recomendando Claude, um não viés louvável

A consequência prática pro seu teste é direta: testar um modelo só não te diz nada

Se você medir só naquele assistente que você usa no dia a dia, corre o risco de estar lendo a preferência da casa e não a sua visibilidade real

2) Parafrasear a pergunta muda a resposta (em alguns modelos)

Outro achado: a estabilidade varia bastante entre modelos

O Astra é descrito como FAR less likely to change its mind quando você só parafraseia levemente a pergunta

E o próprio artigo tira a conclusão de negócio disso: quanto menor a aleatoriedade da escolha, MAIOR o valor de investir em AEO

É o mesmo raciocínio de quando você monta um teste pareado entre modelos pra decidir qual usar: uma rodada só não é evidência, repetição é

Por isso as variações de prompt não são firula, elas são o instrumento de medida

E pra fechar o argumento de por que vale a pena: de 161 categorias, apenas 28 têm uma escolha primária universalmente dominante entre todos os modelos pesquisados

Ou seja: na esmagadora maioria das categorias a disputa está aberta

O que você precisa antes de rodar o teste

Lista curta, e tudo aqui é decisão, não instalação:

  • Uma categoria específica, no nível em que um comprador realmente pergunta, não "mercado de IA"
  • Acesso a alguns modelos com busca na web habilitada, e a mesma configuração de busca valendo pra todos eles
  • Uma planilha com as colunas já criadas antes de começar (se você criar coluna no meio, vai acabar preenchendo a rodada 1 diferente da rodada 5)
  • Compromisso de não mudar nada no meio: mesma configuração, mesmas perguntas, mesma forma de classificar

E o que NÃO entra:

Nenhum prompt cita nome de ferramenta

No estudo da Amplifying os prompts são abertos, sem marcas, justamente pra não entregar a resposta de bandeja

Outro cuidado herdado de lá: contaminação entre respostas

No estudo original eles davam git reset no repositório entre um prompt e outro, pra que o resultado de uma pergunta não influenciasse a seguinte

A tradução disso pro seu teste em chat é simples: sessão nova a cada execução, sem histórico, sem "e a outra opção que você falou antes?"

Passo a passo: como montar o teste de AEO com prompts repetidos

  1. Defina a categoria no nível em que o comprador pergunta

Não é "ferramentas de IA", é "CRM pra agência pequena" ou "banco de dados gerenciado com free tier"

O erro comum deste passo: escolher a categoria que você gostaria de dominar em vez da que as pessoas digitam, aí a resposta do modelo nem chega perto do seu produto

  1. Escreva as 6 variações de pergunta

Mesma intenção, formulações diferentes, zero nome de marca (troque o que está entre chaves pelo seu caso):

1. qual a melhor ferramenta de {categoria} hoje?
2. estou escolhendo uma {categoria}, o que você recomenda?
3. quais as principais opções de {categoria} e os prós e contras de cada uma?
4. preciso de uma {categoria} para {contexto do comprador}, o que uso?
5. o que a maioria dos times usa para {tarefa que a categoria resolve}?
6. me ajuda a decidir entre as opções de {categoria} para {restrição: orçamento, time pequeno, self-hosted}

O erro comum deste passo: escrever seis perguntas que são a mesma frase com sinônimo trocado

Variação boa muda o enquadramento (comparativo, contexto de uso, restrição), não só o vocabulário

  1. Fixe a lista de modelos e a mesma configuração de busca

Três ou quatro já servem pra começar, desde que seja sempre a mesma lista em todas as rodadas

Se você já tem o hábito de comparar Astra com outro modelo no seu próprio projeto, é o mesmo controle de variáveis: muda um fator por vez

O erro comum deste passo: rodar metade dos modelos com busca ligada e metade sem perceber que a busca estava desligada

Aí a comparação morre

  1. Rode em sessão limpa, uma execução por variação e por modelo

Seis variações vezes quatro modelos dá 24 respostas, o que é perfeitamente tocável numa tarde

O erro comum deste passo: emendar as seis perguntas na mesma conversa

O modelo lembra do que já falou e você mede memória, não recomendação

  1. Classifique cada resposta por papel, não por menção solta

Escolha principal, alternativa direta ou só menção

E registre objeção quando aparecer (o modelo citando seu produto pra dizer que não serve pra aquele caso)

O erro comum deste passo: comemorar aparição

Ser citado como alternativa de terceira linha não é a mesma coisa que ser a escolha, e o tracker da Latent Space separa isso justamente porque o peso é diferente

  1. Copie as URLs citadas em cada resposta

Essa coluna é, na minha leitura, a parte mais acionável do teste todo: é a lista de páginas que os modelos leem pra responder sobre a sua categoria

O erro comum deste passo: anotar só o domínio

Página é o que interessa, porque o que você vai fazer depois é disputar aquele conteúdo específico

  1. Calcule a taxa de citação por modelo e ranqueie as fontes

Taxa de citação por modelo é simplesmente em quantas das 6 variações o seu produto apareceu, dividido por 6

Depois conte quantas vezes cada URL se repetiu no conjunto todo

O erro comum deste passo: juntar tudo num número só

A média esconde exatamente o que você quer ver: o modelo onde você está zerado

Estrutura da planilha:

modelo variação escolha principal alternativas menções objeção URLs citadas
modelo A 1 concorrente X seu produto outros 2 não url1, url2
modelo A 2 seu produto concorrente X outros 3 não url1, url3
modelo B 1 concorrente Y nenhuma nenhuma não url4

Checagem técnica: o modelo consegue ler a sua página?

Tem uma parte do teste que não depende de prompt nenhum

O artigo da Latent Space valida que práticas de AEO medidas por Ora e Vercel, como content negotiation de markdown, são reais, e que falhas nessa entrega desestimulam os modelos a ler o seu conteúdo

Que content negotiation? é o cliente dizer no cabeçalho qual formato ele prefere receber, e o servidor responder naquele formato

O estudo conjunto de Vercel e do laboratório ora.ai olhou 1.033 execuções de agente em 25 sites e 190 sondagens controladas de fetch em 19 configurações de site

Numa delas, um site de documentação foi sondado em 5 tópicos por dois clientes diferentes: um fetch que NÃO executa JavaScript e outro que executa

E tem o número que coloca tudo em perspectiva: segundo amostragem inicial do próprio sistema de AEO da Vercel, agentes de código fazem busca na web em cerca de 20% dos prompts

Os passos:

  1. Puxe a sua página com um fetch que não executa JavaScript
curl -s https://seusite.com.br/sua-pagina

Se o conteúdo que você quer que o modelo leia não estiver ali no texto retornado, ele simplesmente não existe pra quem chega sem navegador

O erro comum deste passo: testar no navegador e achar que está tudo certo

O navegador roda o JavaScript pra você, o agente pode não rodar

  1. Confira o que sai numa requisição pedindo markdown
curl -sI --header "Accept: text/markdown" https://seusite.com.br/sua-pagina

A recomendação da Vercel é que uma requisição com Accept: text/markdown receba markdown com Content-Type: text/markdown; charset=utf-8 e o cabeçalho Vary: Accept

E se markdown não estiver disponível, devolver HTML com o content type correto, sem inventar

O erro comum deste passo: servir markdown com content type de HTML

O conteúdo até vai, mas o cliente do outro lado não sabe o que recebeu

  1. Use a implementação da Vercel como referência do padrão

Na documentação deles dá pra pedir a versão markdown de duas formas, por content negotiation ou pelo sufixo .md na URL:

curl --header "Accept: text/markdown" https://vercel.com/docs/functions

As páginas HTML ainda anunciam a versão markdown num link rel="alternate" com tipo text/markdown, e existe um sitemap.md pra descoberta programática

O erro comum deste passo: copiar isso como receita universal

Esses detalhes são da implementação da Vercel, descritos na documentação de acesso markdown deles

Serve como referência de padrão, não como regra que todo modelo obedece

Ferramentas prontas quando você não quiser montar do zero

Planilha é ótima pra entender o mecanismo, mas se você prefere painel, já tem coisa nascendo

A Cloudflare lançou em 06/08/2026 o AEO Visibility Dashboard, que mostra se assistentes de IA estão recomendando a marca

Está em early access, com solicitação de acesso pela aba Overview no painel da Cloudflare, e as métricas anunciadas são Citation Rate, Prominence e Mention Rate

Ele integra a AEO Suite junto do Agent Readiness score, que é a outra metade do problema: verificar se agentes de IA conseguem encontrar e ler o seu site

Repara que é exatamente a mesma divisão que você acabou de montar na mão (visibilidade de um lado, legibilidade do outro)

E se o seu interesse for arquitetura, a Vercel descreveu o pipeline dela: pra rastrear modelos de chat, envia prompts via AI Gateway pra dezenas de modelos populares e analisa respostas, comportamento de busca e fontes citadas, com uma camada de normalização de transcrições de CLIs de agentes

É um bom mapa mental de como isso escala quando sai da planilha

Como ler o resultado sem tirar conclusão errada

O que a sua planilha entrega de útil, na real, são duas coisas:

A lista de URLs citadas te diz onde investir conteúdo, porque são as páginas que os modelos efetivamente buscam pra responder sobre a sua categoria

A taxa de citação por modelo te diz em quais assistentes você está simplesmente fora do radar

Agora a parte chata, e ela é obrigatória:

  • A metodologia é de terceiro, você está adaptando, não replicando
  • A amostra é pequena, seis variações não são estatística
  • O viés de autopromoção existe e vai aparecer nos seus dados também
  • A busca é ao vivo, então o resultado muda a cada rodada

Tem ainda um detalhe que muda bastante o seu cálculo: a mediana de fontes consultadas varia MUITO entre modelos

O Sol ficou em mediana de 9 fontes, o Astra em 5, o Opus em 11 e o Fable em 15

Traduzindo: num modelo que lê 5 fontes a disputa é brutal, num que lê 15 você tem chance real de entrar mesmo sem ser a primeira opção

Outro limite declarado pelos próprios autores: a análise de fontes tem amostra pequena e só reflete o que foi possível raspar das chamadas de ferramenta tentadas, não o dataset de pré-treino

E a primeira rodada do tracker nem cobriu todo mundo: Gemini/Antigravity, GLM/Zcode e DeepSeek/DeepCode ficaram de fora por erros e limites de taxa, apesar da tentativa de inclusão

Se nem eles conseguiram rodar tudo, relaxa que a sua rodada vai ter buraco também

E o mais importante: nenhum teste, nem o seu nem o deles, garante posição em resposta de IA

O que você ganha é diagnóstico, não passe livre

Próximo passo

Começa pequeno mesmo: uma categoria só, 6 variações, 3 ou 4 modelos

Roda, preenche a planilha, e repete em intervalo fixo pra ter com o que comparar, porque uma foto isolada não diz se você subiu ou desceu

Antes de montar o seu, dá uma olhada no tracker público em aeo.latent.space pra ver se a sua categoria já está lá e como ela aparece

E aquela coluna de URLs citadas? Ela é a sua pauta de conteúdo do mês que vem, de graça

até o próximo post! 😀

Perguntas frequentes

Quantos modelos preciso testar pra um teste de AEO fazer sentido?

Mais de um, sempre. O próprio Frontier AEO Tracker roda 7 configurações de modelo justamente porque cada casa puxa sardinha pro produto próprio (Fable e Opus preferem Claude Code, Sol e Astra preferem Codex, por exemplo). Testar num assistente só te mostra a preferência daquela casa, não a sua visibilidade real.

Por que os prompts não podem citar o nome do meu produto ou concorrente?

Porque isso entrega a resposta de bandeja e contamina o teste. No estudo da Amplifying, que embasa a metodologia da Latent Space, os prompts são abertos e nenhum cita nome de ferramenta, justamente pra medir se o modelo lembra da marca sozinho.

Preciso limpar o histórico entre uma pergunta e outra?

Sim. No estudo original da Amplifying o repositório recebia git reset após cada prompt pra evitar contaminação entre respostas. Na prática do seu teste em chat isso vira sessão nova a cada execução, sem histórico e sem referência a respostas anteriores.

Um score alto no meu teste significa que meu produto é o melhor da categoria?

Não. O próprio artigo da Latent Space avisa que o score não equivale a frequência de primeira escolha e não mede qualidade do produto nem participação de mercado. Ele mede apenas recomendações registradas nas configurações testadas, então trate o resultado como visibilidade, não como veredito de qualidade.

Vale a pena investir em AEO se a resposta do modelo muda a cada pergunta parafraseada?

Depende do modelo, e é aí que mora o dado interessante: o Astra é descrito como bem menos propenso a mudar de escolha com paráfrase leve, enquanto outros oscilam mais. O artigo conclui que quanto menor a aleatoriedade da escolha, maior o valor de investir em AEO para aquele modelo específico.

Por que o peso da escolha primária é 60 se o score normaliza em 100?

São dois momentos diferentes da mesma conta. O 60 é o peso bruto atribuído quando o produto aparece como escolha primária numa resposta, assim como 25 vale pra alternativa direta e 15 pras outras menções positivas. Depois de somar os pesos, a escala normaliza a escolha primária em 100 e faz média igual entre as configurações de modelo/frame, então o número que você vê no leaderboard já é o score normalizado, não a soma crua.



Escrito por | Matheus Battisti

Matheus Battisti
Fundador da Hora de Codar

Programador apaixonado pelo mundo das tecnologias, sempre buscando em aprender e se aprofundar em linguagens, frameworks e o que mais for necessário para executar um bom trabalho. Agora tem uma nova missão que é de passar seu conhecimento adiante para formar novos programadores e especializar mais os que já são.

Subscribe
Notify of
guest

0 Comentários
Oldest
Newest Most Voted

Formações

Formação Vibe Coding

Formação Vibe Coding

Do Prompt ao Produto: Crie Software Real com IA

  • 474 aulas
  • 20 projetos
  • 39h 27min

Blog | Mais populares