Duas Decisões, Um Crawler: Consentimento de Treino Separado da Busca

TV
Thiago Victorino
6 min de leitura
Duas Decisões, Um Crawler: Consentimento de Treino Separado da Busca

Menos de 1% dos sites na rede da Cloudflare escolhem bloquear bots de Search. 17% ativam algum mecanismo para bloquear treino de IA. Os dois números vêm de dados da própria rede da Cloudflare, publicados junto com uma mudança de setembro de 2026 na forma de expressar essas preferências.

Os dois números descrevem uma única população de donos de site com dois apetites bem distintos. Quase ninguém quer desaparecer da busca. Uma minoria relevante quer manter as próprias páginas fora do treinamento de modelos. Sustentar as duas posições ao mesmo tempo era impossível, porque os maiores operadores rodavam um único crawler que fazia os dois trabalhos. Bloquear o uso de treino significava bloquear o índice.

Isso é uma falha de granularidade no mecanismo de imposição, e vale nomear com precisão, porque a mesma falha aparece longe dos crawlers.

A preferência e o controle são objetos diferentes

O texto da Cloudflare é direto sobre o que é um arquivo robots.txt. Na formulação deles: “Qualquer um pode publicar [um robots.txt], mas ele não consegue identificar quem está rastreando, determinar por que está rastreando, ou parar um crawler que o ignore.”

Um arquivo publicado declara um pedido. Respeitá-lo é voluntário, e o arquivo não tem como distinguir um solicitante de outro. Identidade e intenção vivem os dois fora do documento. O dono de site que queria uma decisão dividida ficava sem lugar para expressá-la diante dos maiores operadores, e um crawler de uso misto disposto a respeitá-la ficava sem nada para ler.

A resposta habitual era bloquear. A Cloudflare também se posiciona contra isso: “bloquear remove um crawler. Isso não muda o comportamento dos crawlers.” Bloqueio é instrumento grosso de perímetro. Remove o tráfego e deixa a questão de política intacta, o que pesa quando o tráfego removido é também o tráfego que coloca você em um índice.

Uma ressalva antes de seguir. A Cloudflare opera a rede que impõe essas configurações, então detém autoridade de primeira mão sobre o comportamento do produto e interesse comercial no enquadramento da política. Tudo abaixo vem do anúncio. Nenhuma assinatura individual aparece nele.

Três comportamentos, quatro valores

A substituição da categoria única “bot de IA” é uma taxonomia de três comportamentos, conforme o texto da Cloudflare:

  • Search: construir um índice.
  • Training: treinar ou fazer fine-tuning de um modelo.
  • Agent: agentes dirigidos pelo usuário, agindo em nome de um humano.

Um mesmo bot pode exibir mais de um desses comportamentos. Esse é o problema inteiro reescrito como modelo de dados, e é a primeira versão do problema sobre a qual a superfície de controle da Cloudflare consegue agir.

Cada comportamento então recebe um de quatro valores no nível do domínio: Allow, Disallow AI Training, Block on pages with ads ou Block. A assimetria é a parte interessante. Disallow AI Training existe apenas para Training. A Cloudflare não oferece equivalente para Search ou Agent.

Um dono de site agora pode dizer: me indexe, não treine com o meu conteúdo, e deixe passar agentes dirigidos por usuários. Três decisões, três respostas, um domínio.

O que a designação Accountable de fato certifica

A Cloudflare também introduziu uma designação Accountable para operadores que param de forçar o trade-off. É uma rubrica de quatro requisitos:

  1. Um mecanismo de opt-out de treino, via robots.txt ou similar.
  2. Um opt-out de resumos de IA.
  3. Visibilidade em nível de URL sobre quais páginas foram disponibilizadas para treino, mais métricas de como o conteúdo apareceu na busca.
  4. Garantia de que o opt-out de treino não afeta os resultados de busca tradicional.

Leia o requisito 3 com atenção. É o que transforma promessa em algo verificável. Um registro por URL do que foi disponibilizado para treino é uma superfície de divulgação, e divulgação é a imposição que sobra quando o dono de site não pode auditar o operador diretamente.

Agora a ressalva que define quanto vale a designação. A rubrica admite explicitamente compromissos com prazo, sem exigir capacidade já entregue. Apple, Google e Microsoft são designadas Accountable em parte nessa base. Amazon, Anthropic, Meta e OpenAI se qualificam porque rodam crawlers separados de Search e de Training, então o crawler de treino pode ser bloqueado sem tocar na busca. São dois tipos distintos de evidência debaixo de um mesmo rótulo, e quem compra deve ler o rótulo como “obrigado a entregar” em vez de “já construído”.

O caso concreto: o suporte da Bing a no-training em nível de domínio no robots.txt está previsto para o início de 2027. Até isso entrar em produção, selecionar Disallow AI Training não comunica à Bing nenhuma preferência de no-training. A configuração fica selecionada e sem efeito naquele destino específico.

A restrição que revela a regra

Não existe o valor “Disallow AI Training on pages with ads”. A Cloudflare dá a razão de engenharia: a preferência é expressa em robots.txt, e o conjunto de páginas que servem anúncios em um site é grande e volátil demais para ser enumerado ali.

Essa frase é a coisa mais transferível do anúncio. A política que um dono de site consegue ter é limitada pelo arquivo em que a preferência precisa caber. O limite vem do mecanismo de expressão, acima da vontade do dono do site e da disposição do operador. Um formato de lista de caminhos comporta “estes caminhos, nunca” e para de funcionar em “esta categoria de página, recalculada a cada hora”. Essa política então deixa de existir, por razões alheias à intenção de qualquer parte.

É o mesmo desenho do problema original. Um crawler era incapaz de distinguir dois propósitos, e os donos de site recebiam uma decisão só. Um arquivo é incapaz de distinguir uma classe volátil de páginas, e os donos de site ficam sem regra de treino com escopo de anúncio. Nas duas vezes, o mecanismo definiu o teto.

A mudança que quebra compatibilidade em 15 de setembro

Datada de 15 de setembro de 2026, Block e “Block on pages with ads” agora se aplicam a crawlers de uso misto. Qualquer uma das duas configurações passa a atingir busca além de treino. Block AI Bots está deprecado em favor dos controles granulares, e Managed Robots.txt está deprecado em favor do Bot Preference Sync.

Se você configurou um bloqueio antes dessa data esperando que ele alcançasse apenas o uso de IA, o comportamento mudou debaixo da configuração. Vá verificar.

Para prestação de contas durável, a Cloudflare aponta duas superfícies: a página de transparência de bots de IA do Radar, que acompanha o que cada operador Accountable realmente oferece, e o grupo de trabalho ai-prefs do IETF como padrão de destino.

Faça isso agora

Abra as configurações de bot do seu domínio principal e leia o valor atual de cada um dos três comportamentos. O valor que está lá hoje, depois de 15 de setembro, em vez do valor que você lembra de ter escolhido.

Depois escreva, em uma linha cada, o que você quer para tráfego de Search, de Training e de Agent. Se as três respostas divergirem, você antes não tinha como expressá-las diante de um crawler de uso misto e provavelmente tem uma configuração genérica e vencida ocupando o lugar da política que você queria. Corrija isso primeiro. Em seguida, verifique se o seu opt-out de treino alcança de fato os operadores que importam para você, ou se, como no caso da Bing, ele é uma preferência sem leitor do outro lado ainda.

A disciplina mais ampla é uma a que chegamos por caminhos diferentes: conteúdo como ativo licenciável, com duração como alavanca, negociação de conteúdo por tipo de agente na camada da requisição, tráfego de agentes precisando do próprio perímetro e engenharia com Cloudflare enquanto outras áreas ficam sem nada. O fio comum é que uma preferência declarada só se torna controle em um ponto capaz de ver quem está pedindo e por quê. Onde esse ponto falta, a sua política é aquilo que o seu mecanismo por acaso permite.


Fontes

A Victorino ajuda organizações a transformar política declarada de IA em pontos de imposição que distinguem identidade de comportamento: contato@victorino.com.br | www.victorino.com.br

Todos os artigos do The Thinking Wire são escritos com o auxílio do modelo LLM Opus da Anthropic. Cada publicação passa por pesquisa multi-agente para verificar fatos e identificar contradições, seguida de revisão e aprovação humana antes da publicação. Se você encontrar alguma informação imprecisa ou deseja entrar em contato com o editorial, escreva para editorial@victorino.com.br . Sobre o The Thinking Wire →

Se isso faz sentido, vamos conversar

Ajudamos empresas a implementar IA sem perder o controle.

Agendar uma Conversa