Seu produto é recomendado pelos modelos? Como montar um teste de AEO com prompts repetidos

Um teste de AEO é o procedimento de rodar as mesmas perguntas de compra em vários modelos com busca ligada e registrar quem eles recomendam, quem citam de passagem e quais páginas eles leem pra responder. A Latent Space publicou em 07/09/2026 o Frontier AEO Tracker, que roda 6 variações de prompt em 7 configurações de modelo, em 161 categorias, com pontuação para escolha primária, alternativa, menção e objeções. Este guia mostra como replicar isso em escala pequena: uma categoria, seis variações, planilha simples, mais a checagem de se o seu site entrega conteúdo legível pro agente.
A pergunta saiu do lugar: não é mais só em que posição você aparece no Google, é se o modelo fala o seu nome quando alguém pergunta qual ferramenta usar
Em 07/09/2026 a Latent Space publicou o Frontier AEO Tracker, um rastreador que roda 6 variações de prompt em 7 configurações de modelo com busca ligada, em 161 categorias de produto
Só que levantamento de terceiro é foto do mercado, não do seu caso
Aqui a ideia é outra: montar uma versão pequena e barata desse teste pro seu produto (ou o do cliente), com prompts repetidos, planilha e registro das fontes que os modelos leem pra responder sobre a sua categoria
Bora? =)
De onde vem a metodologia: o Frontier AEO Tracker da Latent Space
A ideia por trás da sigla AEO é direta: em vez de brigar por posição no buscador, você quer estar dentro da resposta que o modelo entrega
O tracker público fica em aeo.latent.space e está identificado como snapshot de pesquisa V5 de setembro de 2026, com leaderboards por categoria
A mecânica declarada: 6 variações de prompt x 7 configurações de modelo/CLI (search on) x 161 categorias, uma execução por versão
As categorias cobertas vão de agentes de código a podcasts de IA, sandboxes de IA, bancos de dados gerenciados, modelos de ASR, e ainda entram umas bem atípicas tipo investidores anjo, corporate spend e software de folha de pagamento
A extração das respostas foi feita pelo modelo Astra, e todo par de prompt e resposta é inspecionável publicamente
E o crédito da metodologia não é da Latent Space sozinha: eles estendem e ajustam a metodologia da Amplifying, do estudo What Claude Code Actually Chooses, que levantou 2.430 recomendações em 3 modelos, 4 tipos de projeto e 20 categorias
Formação Claude Code
Domine Claude Code do absoluto zero até o avançado
- 120 aulas
- 4 projetos
- 9h 45min
Como a resposta vira nota:
Em vez de contar menção no braço, o tracker pontua o papel que o seu produto ocupou na resposta:
| O que aconteceu na resposta | Peso |
|---|---|
| Escolha primária | 60 |
| Alternativa direta | 25 |
| Outras menções positivas | 15 |
| Objeção em cenário elegível | -25 |
| Objeção ampla | -60 |
Repara numa coisa importante: esses números são o peso CRU de cada papel, não a nota que aparece no final
Depois de somar, a escala normaliza a escolha primária em 100 (ou seja, o teto do score é o produto que foi escolha primária em tudo) e faz média igual entre as configurações de modelo/frame
São dois momentos diferentes, beleza? peso bruto na contagem, score normalizado na hora de comparar
E tem o aviso que quase ninguém lê: esse score não é frequência de primeira escolha, não mede qualidade do produto e não mede participação de mercado
Ele mede recomendações registradas nas configurações testadas, ponto
Guarde isso, porque é exatamente o erro que você vai querer evitar quando olhar a sua própria planilha lá na frente
Dois achados que mudam como você monta o seu teste
1) Modelo puxa sardinha pra própria casa
O artigo é bem explícito nisso: quando a pergunta é sobre agentes de código, Fable/Opus gostam do Claude Code, Sol/Astra gostam do Codex, Grok ama Cursor, Muse ama Muse Code, SWE-1.7 ama Devin
"I wonder why", escreveram eles haha
Tem contraponto, e ele importa: o material também registra casos de modelos GPT recomendando Claude, um não viés louvável
A consequência prática pro seu teste é direta: testar um modelo só não te diz nada
Se você medir só naquele assistente que você usa no dia a dia, corre o risco de estar lendo a preferência da casa e não a sua visibilidade real
2) Parafrasear a pergunta muda a resposta (em alguns modelos)
Outro achado: a estabilidade varia bastante entre modelos
O Astra é descrito como FAR less likely to change its mind quando você só parafraseia levemente a pergunta
E o próprio artigo tira a conclusão de negócio disso: quanto menor a aleatoriedade da escolha, MAIOR o valor de investir em AEO
É o mesmo raciocínio de quando você monta um teste pareado entre modelos pra decidir qual usar: uma rodada só não é evidência, repetição é
Por isso as variações de prompt não são firula, elas são o instrumento de medida
E pra fechar o argumento de por que vale a pena: de 161 categorias, apenas 28 têm uma escolha primária universalmente dominante entre todos os modelos pesquisados
Ou seja: na esmagadora maioria das categorias a disputa está aberta
O que você precisa antes de rodar o teste
Lista curta, e tudo aqui é decisão, não instalação:
- Uma categoria específica, no nível em que um comprador realmente pergunta, não "mercado de IA"
- Acesso a alguns modelos com busca na web habilitada, e a mesma configuração de busca valendo pra todos eles
- Uma planilha com as colunas já criadas antes de começar (se você criar coluna no meio, vai acabar preenchendo a rodada 1 diferente da rodada 5)
- Compromisso de não mudar nada no meio: mesma configuração, mesmas perguntas, mesma forma de classificar
E o que NÃO entra:
Nenhum prompt cita nome de ferramenta
No estudo da Amplifying os prompts são abertos, sem marcas, justamente pra não entregar a resposta de bandeja
Outro cuidado herdado de lá: contaminação entre respostas
No estudo original eles davam git reset no repositório entre um prompt e outro, pra que o resultado de uma pergunta não influenciasse a seguinte
A tradução disso pro seu teste em chat é simples: sessão nova a cada execução, sem histórico, sem "e a outra opção que você falou antes?"
Passo a passo: como montar o teste de AEO com prompts repetidos
- Defina a categoria no nível em que o comprador pergunta
Não é "ferramentas de IA", é "CRM pra agência pequena" ou "banco de dados gerenciado com free tier"
O erro comum deste passo: escolher a categoria que você gostaria de dominar em vez da que as pessoas digitam, aí a resposta do modelo nem chega perto do seu produto
- Escreva as 6 variações de pergunta
Mesma intenção, formulações diferentes, zero nome de marca (troque o que está entre chaves pelo seu caso):
1. qual a melhor ferramenta de {categoria} hoje?
2. estou escolhendo uma {categoria}, o que você recomenda?
3. quais as principais opções de {categoria} e os prós e contras de cada uma?
4. preciso de uma {categoria} para {contexto do comprador}, o que uso?
5. o que a maioria dos times usa para {tarefa que a categoria resolve}?
6. me ajuda a decidir entre as opções de {categoria} para {restrição: orçamento, time pequeno, self-hosted}
O erro comum deste passo: escrever seis perguntas que são a mesma frase com sinônimo trocado
Variação boa muda o enquadramento (comparativo, contexto de uso, restrição), não só o vocabulário
- Fixe a lista de modelos e a mesma configuração de busca
Três ou quatro já servem pra começar, desde que seja sempre a mesma lista em todas as rodadas
Se você já tem o hábito de comparar Astra com outro modelo no seu próprio projeto, é o mesmo controle de variáveis: muda um fator por vez
O erro comum deste passo: rodar metade dos modelos com busca ligada e metade sem perceber que a busca estava desligada
Aí a comparação morre
- Rode em sessão limpa, uma execução por variação e por modelo
Seis variações vezes quatro modelos dá 24 respostas, o que é perfeitamente tocável numa tarde
O erro comum deste passo: emendar as seis perguntas na mesma conversa
O modelo lembra do que já falou e você mede memória, não recomendação
- Classifique cada resposta por papel, não por menção solta
Escolha principal, alternativa direta ou só menção
E registre objeção quando aparecer (o modelo citando seu produto pra dizer que não serve pra aquele caso)
O erro comum deste passo: comemorar aparição
Ser citado como alternativa de terceira linha não é a mesma coisa que ser a escolha, e o tracker da Latent Space separa isso justamente porque o peso é diferente
- Copie as URLs citadas em cada resposta
Essa coluna é, na minha leitura, a parte mais acionável do teste todo: é a lista de páginas que os modelos leem pra responder sobre a sua categoria
O erro comum deste passo: anotar só o domínio
Página é o que interessa, porque o que você vai fazer depois é disputar aquele conteúdo específico
- Calcule a taxa de citação por modelo e ranqueie as fontes
Taxa de citação por modelo é simplesmente em quantas das 6 variações o seu produto apareceu, dividido por 6
Depois conte quantas vezes cada URL se repetiu no conjunto todo
O erro comum deste passo: juntar tudo num número só
A média esconde exatamente o que você quer ver: o modelo onde você está zerado
Estrutura da planilha:
| modelo | variação | escolha principal | alternativas | menções | objeção | URLs citadas |
|---|---|---|---|---|---|---|
| modelo A | 1 | concorrente X | seu produto | outros 2 | não | url1, url2 |
| modelo A | 2 | seu produto | concorrente X | outros 3 | não | url1, url3 |
| modelo B | 1 | concorrente Y | nenhuma | nenhuma | não | url4 |
Checagem técnica: o modelo consegue ler a sua página?
Tem uma parte do teste que não depende de prompt nenhum
O artigo da Latent Space valida que práticas de AEO medidas por Ora e Vercel, como content negotiation de markdown, são reais, e que falhas nessa entrega desestimulam os modelos a ler o seu conteúdo
Que content negotiation? é o cliente dizer no cabeçalho qual formato ele prefere receber, e o servidor responder naquele formato
O estudo conjunto de Vercel e do laboratório ora.ai olhou 1.033 execuções de agente em 25 sites e 190 sondagens controladas de fetch em 19 configurações de site
Numa delas, um site de documentação foi sondado em 5 tópicos por dois clientes diferentes: um fetch que NÃO executa JavaScript e outro que executa
E tem o número que coloca tudo em perspectiva: segundo amostragem inicial do próprio sistema de AEO da Vercel, agentes de código fazem busca na web em cerca de 20% dos prompts
Os passos:
- Puxe a sua página com um fetch que não executa JavaScript
curl -s https://seusite.com.br/sua-pagina
Se o conteúdo que você quer que o modelo leia não estiver ali no texto retornado, ele simplesmente não existe pra quem chega sem navegador
O erro comum deste passo: testar no navegador e achar que está tudo certo
O navegador roda o JavaScript pra você, o agente pode não rodar
- Confira o que sai numa requisição pedindo markdown
curl -sI --header "Accept: text/markdown" https://seusite.com.br/sua-pagina
A recomendação da Vercel é que uma requisição com Accept: text/markdown receba markdown com Content-Type: text/markdown; charset=utf-8 e o cabeçalho Vary: Accept
E se markdown não estiver disponível, devolver HTML com o content type correto, sem inventar
O erro comum deste passo: servir markdown com content type de HTML
O conteúdo até vai, mas o cliente do outro lado não sabe o que recebeu
- Use a implementação da Vercel como referência do padrão
Na documentação deles dá pra pedir a versão markdown de duas formas, por content negotiation ou pelo sufixo .md na URL:
curl --header "Accept: text/markdown" https://vercel.com/docs/functions
As páginas HTML ainda anunciam a versão markdown num link rel="alternate" com tipo text/markdown, e existe um sitemap.md pra descoberta programática
O erro comum deste passo: copiar isso como receita universal
Esses detalhes são da implementação da Vercel, descritos na documentação de acesso markdown deles
Serve como referência de padrão, não como regra que todo modelo obedece
Ferramentas prontas quando você não quiser montar do zero
Planilha é ótima pra entender o mecanismo, mas se você prefere painel, já tem coisa nascendo
A Cloudflare lançou em 06/08/2026 o AEO Visibility Dashboard, que mostra se assistentes de IA estão recomendando a marca
Está em early access, com solicitação de acesso pela aba Overview no painel da Cloudflare, e as métricas anunciadas são Citation Rate, Prominence e Mention Rate
Ele integra a AEO Suite junto do Agent Readiness score, que é a outra metade do problema: verificar se agentes de IA conseguem encontrar e ler o seu site
Repara que é exatamente a mesma divisão que você acabou de montar na mão (visibilidade de um lado, legibilidade do outro)
E se o seu interesse for arquitetura, a Vercel descreveu o pipeline dela: pra rastrear modelos de chat, envia prompts via AI Gateway pra dezenas de modelos populares e analisa respostas, comportamento de busca e fontes citadas, com uma camada de normalização de transcrições de CLIs de agentes
É um bom mapa mental de como isso escala quando sai da planilha
Como ler o resultado sem tirar conclusão errada
O que a sua planilha entrega de útil, na real, são duas coisas:
A lista de URLs citadas te diz onde investir conteúdo, porque são as páginas que os modelos efetivamente buscam pra responder sobre a sua categoria
A taxa de citação por modelo te diz em quais assistentes você está simplesmente fora do radar
Agora a parte chata, e ela é obrigatória:
- A metodologia é de terceiro, você está adaptando, não replicando
- A amostra é pequena, seis variações não são estatística
- O viés de autopromoção existe e vai aparecer nos seus dados também
- A busca é ao vivo, então o resultado muda a cada rodada
Tem ainda um detalhe que muda bastante o seu cálculo: a mediana de fontes consultadas varia MUITO entre modelos
O Sol ficou em mediana de 9 fontes, o Astra em 5, o Opus em 11 e o Fable em 15
Traduzindo: num modelo que lê 5 fontes a disputa é brutal, num que lê 15 você tem chance real de entrar mesmo sem ser a primeira opção
Outro limite declarado pelos próprios autores: a análise de fontes tem amostra pequena e só reflete o que foi possível raspar das chamadas de ferramenta tentadas, não o dataset de pré-treino
E a primeira rodada do tracker nem cobriu todo mundo: Gemini/Antigravity, GLM/Zcode e DeepSeek/DeepCode ficaram de fora por erros e limites de taxa, apesar da tentativa de inclusão
Se nem eles conseguiram rodar tudo, relaxa que a sua rodada vai ter buraco também
E o mais importante: nenhum teste, nem o seu nem o deles, garante posição em resposta de IA
O que você ganha é diagnóstico, não passe livre
Próximo passo
Começa pequeno mesmo: uma categoria só, 6 variações, 3 ou 4 modelos
Roda, preenche a planilha, e repete em intervalo fixo pra ter com o que comparar, porque uma foto isolada não diz se você subiu ou desceu
Antes de montar o seu, dá uma olhada no tracker público em aeo.latent.space pra ver se a sua categoria já está lá e como ela aparece
E aquela coluna de URLs citadas? Ela é a sua pauta de conteúdo do mês que vem, de graça
até o próximo post! 😀
Perguntas frequentes
Quantos modelos preciso testar pra um teste de AEO fazer sentido?
Mais de um, sempre. O próprio Frontier AEO Tracker roda 7 configurações de modelo justamente porque cada casa puxa sardinha pro produto próprio (Fable e Opus preferem Claude Code, Sol e Astra preferem Codex, por exemplo). Testar num assistente só te mostra a preferência daquela casa, não a sua visibilidade real.
Por que os prompts não podem citar o nome do meu produto ou concorrente?
Porque isso entrega a resposta de bandeja e contamina o teste. No estudo da Amplifying, que embasa a metodologia da Latent Space, os prompts são abertos e nenhum cita nome de ferramenta, justamente pra medir se o modelo lembra da marca sozinho.
Preciso limpar o histórico entre uma pergunta e outra?
Sim. No estudo original da Amplifying o repositório recebia git reset após cada prompt pra evitar contaminação entre respostas. Na prática do seu teste em chat isso vira sessão nova a cada execução, sem histórico e sem referência a respostas anteriores.
Um score alto no meu teste significa que meu produto é o melhor da categoria?
Não. O próprio artigo da Latent Space avisa que o score não equivale a frequência de primeira escolha e não mede qualidade do produto nem participação de mercado. Ele mede apenas recomendações registradas nas configurações testadas, então trate o resultado como visibilidade, não como veredito de qualidade.
Vale a pena investir em AEO se a resposta do modelo muda a cada pergunta parafraseada?
Depende do modelo, e é aí que mora o dado interessante: o Astra é descrito como bem menos propenso a mudar de escolha com paráfrase leve, enquanto outros oscilam mais. O artigo conclui que quanto menor a aleatoriedade da escolha, maior o valor de investir em AEO para aquele modelo específico.
Por que o peso da escolha primária é 60 se o score normaliza em 100?
São dois momentos diferentes da mesma conta. O 60 é o peso bruto atribuído quando o produto aparece como escolha primária numa resposta, assim como 25 vale pra alternativa direta e 15 pras outras menções positivas. Depois de somar os pesos, a escala normaliza a escolha primária em 100 e faz média igual entre as configurações de modelo/frame, então o número que você vê no leaderboard já é o score normalizado, não a soma crua.
Formações
Formação Vibe Coding
Do Prompt ao Produto: Crie Software Real com IA
- 474 aulas
- 20 projetos
- 39h 27min
Blog | Mais populares

Como Recuperar Conversas Apagadas no ChatGPT: É Possível?
Descubra neste artigo tudo o que você precisa saber sobre como recuperar conversas apagadas no ChatGPT, se isso é possível, quais alternativas existem para proteger […]
ChatGPT não funciona: saiba como corrigir erros
ChatGPT não funciona? O ChatGPT pode deixar de funcionar por diversos motivos, e a maioria deles está relacionada a problemas de conexão, cache ou instabilidade […]

Como limpar histórico do ChatGPT e proteger sua privacidade
Veja como limpar o histórico do ChatGPT e proteger sua privacidade de forma simples e eficaz, mantendo seus dados seguros online. Para apagar uma conversa […]
