1,28%: o quanto da lista ranqueada sobrevive dentro da resposta da IA

TV
Thiago Victorino
6 min de leitura
1,28%: o quanto da lista ranqueada sobrevive dentro da resposta da IA

Apenas 1,28% dos produtos que ranqueiam na busca tradicional do Google também aparecem no AI Mode para a mesma consulta no mesmo dia. O número vem da Productrise, que acompanhou mais de 2 milhões de anúncios de produtos em mais de 100 mil SERPs e respostas do AI Mode ao longo de 23 dias (9 a 31 de agosto de 2026), nos Estados Unidos e no Reino Unido, casando produtos pelo identificador estável do Google e rodando as duas superfícies simultaneamente no mesmo dia do calendário.

A Productrise vende analytics para e-commerce, e esse é o blog de analytics da própria empresa. A metodologia é deles, a amostra é deles, e não vimos nenhuma replicação independente. Leia os números como uma medição grande de um fornecedor, e não como fato assentado.

Mesmo com esse desconto, 1,28% descreve outra coisa. Posição 1 contra posição 8 é uma pergunta sobre ordem. Isso aqui é uma pergunta sobre existência.

O formato do filtro

A busca tradicional mostra 27,8 produtos por consulta. O AI Mode mostra 3,9. A interseção entre os dois conjuntos é de 0,94 produto. Menos de um produto, em média, aparece nas duas superfícies para a mesma consulta no mesmo dia.

Essa é uma operação diferente de ranquear. Uma lista ranqueada é o inventário completo com uma opinião anexada, e a opinião é inspecionável: você rola além do primeiro resultado, vê o que ficou em segundo e em décimo primeiro, e forma sua própria leitura sobre se aquela ordem faz sentido. O AI Mode devolve cerca de quatro produtos e nenhuma lista. Os cerca de 27 que ficaram de fora somem sem rastro na resposta.

A análise anterior da mesma equipe, de julho de 2026, já encontrava o AI Mode devolvendo cerca de 95% menos produtos que a busca tradicional. A rodada de agosto dá um número mais afiado ao mesmo comportamento e acrescenta a parte que pesa no comercial.

Os sobreviventes são mais caros

Para os produtos casados (os que ranqueiam nas duas superfícies), o AI Mode é 21,6% mais caro.

O mecanismo está na camada do vendedor. Os preços divergem entre as duas superfícies em 38,1% dos casos. Quando divergem, o AI Mode é o mais caro dos dois em 68,4% das vezes, com diferença mediana de 22,2%. O vendedor principal muda em 49,6% dos produtos casados, ou seja: em cerca de metade dos produtos presentes nos dois lugares, o comprador está sendo direcionado para um comerciante diferente.

Mesmo produto físico, mesma consulta, mesmo dia, outro vendedor e, na maioria das vezes, preço mais alto. Os resultados ranqueados do Google e a resposta gerada pelo Google discordam sobre quem deve vender a coisa para você.

Katelyn Geary, Senior SEO Strategist da Break The Web, resumiu o lado do consumidor no texto da Productrise: “A busca com IA deveria eliminar o atrito de comparar preços em cinco abas diferentes, mas se ela só serve inventário mais caro por padrão, não economizou trabalho nenhum.” O atrito continua lá. Saiu de vista, que é um lugar pior para ele morar do que cinco abas abertas.

Callum Lockwood, Director of Organic Search da Re:signal, apontou o lado do lojista no mesmo artigo: “A troca de vendedor em quase metade dos produtos casados é a parte que deveria preocupar os varejistas mais do que a diferença de preço em si.” Diferença de preço é um problema de margem que dá para modelar. Ser substituído dentro da resposta em metade do catálogo casado é um problema de distribuição, e ele é invisível de dentro do seu próprio analytics, porque a impressão que você nunca recebeu não gera dado nenhum.

Por que isso é uma questão de governança

Times de marketing vão ler esses números como um briefing de otimização. Essa leitura está disponível e passa longe do essencial.

Viés de ranqueamento em busca é um problema que reguladores já reconhecem e para o qual já têm vocabulário, porque uma lista ranqueada é auditável. Dá para puxar a SERP, contar posições, comparar o tratamento dado a inventário próprio e a inventário de terceiros, e discutir com evidência na mão. Esse reconhecimento depende de a lista estar lá para ser inspecionada.

Uma resposta generativa remove a lista. Não existe posição 8 para apontar, não existe conjunto de comparação, não existe sinal visível de que um anúncio mais barato do mesmo produto estava entre os cerca de 27 descartados. A saída são cerca de quatro produtos e um parágrafo de prosa confiante. A lógica de seleção que produziu aquilo fica oculta, e o contrafactual não é recuperável a partir da própria resposta. Foi preciso alguém rodar uma medição paralela de 23 dias para enxergar o efeito.

Essa é a mudança estrutural. A superfície de auditoria da integridade da recomendação sumiu exatamente no momento em que a recomendação passou a pesar mais na decisão do comprador. Já escrevemos sobre a camada de padrões que falta embaixo disso em governança de comércio agêntico, e sobre como a concentração de citações remodela a visibilidade em os quatro jogos separados do AEO. Aqui é o mesmo problema medido no eixo que termina na fatura de alguém.

O mesmo ponto cego dentro dos seus sistemas

Qualquer time que entregou uma recomendação apoiada em LLM, seja para produtos, fornecedores, candidatos ou documentos internos, construiu a estrutura idêntica. Uma etapa de recuperação produz o conjunto de candidatos. Uma etapa de geração escolhe alguns e escreve prosa sobre eles. O usuário vê a prosa.

Pergunte o que você consegue provar hoje sobre o seu próprio pipeline:

  • Que fração do conjunto de candidatos recuperados chega à resposta do usuário? Se ninguém mediu, você não sabe se o seu sistema estreita com critério ou arbitrariamente.
  • Os itens selecionados diferem sistematicamente dos descartados em algum atributo que carrega dinheiro? Preço, margem, fornecedor, situação contratual, recência. A Productrise achou um desvio de preço de 21,6% nos produtos casados, numa superfície onde nada expõe isso.
  • Se um usuário perguntar por que uma opção apareceu e outra não, você responde? Não com uma explicação que o modelo gera depois do fato. Com o conjunto de candidatos logado e a seleção registrada.

Já escrevemos sobre placares quebrados dos dois lados. Este é um caso específico: o conjunto de entrada não é logado e a saída não é falseável, então a métrica que todo mundo observa é engajamento com uma resposta que ninguém consegue conferir.

Faça isso agora

Escolha a sua superfície de recomendação com LLM de maior tráfego e logue o conjunto de candidatos junto com a resposta final por um ciclo inteiro de faturamento. Só os dois conjuntos, com timestamp e unidos pelo ID da requisição. Sem infraestrutura nova, sem mexer no modelo.

Depois calcule três números: que fração dos candidatos sobrevive até a resposta, se os itens sobreviventes têm desvio de preço (ou de margem, ou de qualquer atributo que carregue peso comercial no seu contexto), e com que frequência o candidato mais bem ranqueado não é o apresentado.

Se a taxa de sobrevivência for baixa e o desvio for real, você tem um problema de integridade de recomendação e agora tem a evidência para corrigir antes que um cliente ou um regulador encontre primeiro. Se os números voltarem limpos, você ganhou uma linha de base e um monitor. Qualquer um dos dois desfechos é melhor que entregar um filtro que ninguém nunca olhou por dentro.


Fontes

A Victorino ajuda times a instrumentar sistemas de recomendação apoiados em LLM para que a seleção por trás de uma resposta possa ser inspecionada e defendida: contato@victorino.com.br | www.victorino.com.br

Todos os artigos do The Thinking Wire são escritos com o auxílio do modelo LLM Opus da Anthropic. Cada publicação passa por pesquisa multi-agente para verificar fatos e identificar contradições, seguida de revisão e aprovação humana antes da publicação. Se você encontrar alguma informação imprecisa ou deseja entrar em contato com o editorial, escreva para editorial@victorino.com.br . Sobre o The Thinking Wire →

Se isso faz sentido, vamos conversar

Ajudamos empresas a implementar IA sem perder o controle.

Agendar uma Conversa