- Início
- The Thinking Wire
- Aprovação sobre o Objetivo Errado Só Aprova Mudanças Ruins Mais Rápido
Aprovação sobre o Objetivo Errado Só Aprova Mudanças Ruins Mais Rápido
A LangChain publicou as notas de construção de um agente de mídia paga com acesso de escrita às plataformas de anúncios. O modelo de controle em volta desse acesso é o mais completo que já vimos publicado: apenas pessoas designadas podem aprovar, com verificação por user ID, e todo o resto do time fica em modo somente leitura. Cada recomendação chega no Slack como um card que mostra o valor atual contra o valor proposto. Depois que a mudança é aplicada, o código verifica que ela de fato chegou à plataforma. Os perfis de capacidade variam por ponto de entrada, então um relatório agendado não faz o que uma conversa no Slack faz. Cada requisição roda em um sandbox isolado com checkpoint próprio, e os subagentes ficam limitados a ler contexto, computar e renderizar, escrevendo em locais de relatório separados.
Isso é engenharia séria. E está mirada uma camada abaixo da decisão que importa.
O que o aprovador está aprovando de fato
Os sete passos são explícitos: analisar dados da plataforma e do warehouse, gerar recomendações com evidência, postar o card de aprovação, esperar um revisor autorizado aprovar ou editar, aplicar a mudança por código, verificar que ela chegou e reportar de volta. A atribuição de fonte da verdade também é explícita. As plataformas de anúncio são donas das métricas de mídia, como gasto, impressões e cliques. O warehouse é dono dos resultados a jusante, como leads, oportunidades e pipeline. Limites específicos de cada plataforma e modelos de atribuição são divulgados na saída, em vez de escondidos.
Essa fronteira está desenhada no lugar certo. Gasto, impressões e cliques são contagens que a plataforma observa diretamente. Leads, oportunidades e pipeline são contagens que o seu warehouse observa diretamente. O tecido que liga os dois, a parte que afirma que este gasto produziu aquele pipeline, é outra coisa: um modelo de atribuição. As recomendações do agente são moldadas por ele.
A medição que está embaixo
Gordon, Zettelmeyer, Bhargava e Chapsky publicaram na Marketing Science, em 2019, a comparação que define o estatuto epistêmico desse tecido. Quinze experimentos publicitários de larga escala nos Estados Unidos. Quinhentos milhões de observações usuário-experimento. Cerca de 1,6 bilhão de impressões de anúncio. Eles rodaram experimentos randomizados em paralelo com os métodos observacionais que o mercado usa para estimar o mesmo efeito: pareamento exato, propensity score matching e ajuste por regressão.
Os métodos observacionais, na formulação dos autores, superestimavam com frequência as conversões incrementais por um fator de três ou mais. E também subestimavam às vezes. Isso não descreve um erro médio nem um teto. Descreve uma distribuição cuja direção você não tem como conhecer de antemão na sua própria campanha. Gordon, Moakler e Zettelmeyer replicaram o trabalho ao longo de centenas de experimentos na Marketing Science em 2023 e chegaram à mesma conclusão em escala maior. Um artigo de 2017 no Journal of Marketing Research propôs a abordagem de ghost ads como um caminho mais barato para obter um contrafactual válido.
O mecanismo é pouco glamouroso. Sistemas de entrega de anúncio miram pessoas que já tinham mais probabilidade de converter, e nenhum ajuste sobre observáveis remove por completo a seleção sobre não observáveis. O problema de medição é estrutural. Covariáveis melhores não o resolvem.
Duas consequências. A evidência é de 2019 e de 2023, então ninguém pode alegar descoberta recente que a governança ainda não teve tempo de absorver. E as plataformas entregam duas classes distintas de número pelo mesmo dashboard: experimentos genuinamente randomizados, e atribuição observacional ou modelada. O dashboard não rotula qual é qual. Como escreve Karan, que diz cuidar de medição para um portfólio de US$ 1 bilhão, a ambiguidade serve ao fornecedor.
A junção que vale fazer
Já escrevemos sobre o loop de atribuição que você não consegue auditar e sobre agentes autônomos de marketing transformando voz de marca em problema de governança de dados. Aqui os dois encontram um terceiro elemento: o agente agora tem autoridade de gasto, e o portão de aprovação em volta dessa autoridade é bom.
Um portão bom sobre um objetivo inválido produz uma falha específica. O aprovador vê o gasto atual, o gasto proposto e a evidência que o agente montou. A evidência é internamente consistente. O diff está correto. A verificação confirma que a plataforma aceitou a mudança. Todos os controles disparam como deveriam. E a alocação ainda assim se move em direção ao canal que o modelo de atribuição por acaso superestima, porque nada no fluxo pergunta se aquele número de lift veio de randomização ou de ajuste sobre observáveis.
Nada aqui afirma que o agente da LangChain causou um resultado ruim. Não existe evidência disso, e os números que eles mesmos reportam apontam no sentido oposto. A afirmação é mais estreita e mais incômoda: essa classe de erro é invisível para o modelo de controle tal como descrito. Uma pessoa aprovando um diff bem formatado contra um número modelado aprova mais rápido do que uma pessoa montando uma planilha, que é exatamente a promessa de valor.
Quatro controles que o modelo descrito não inclui
Lendo o post da LangChain contra o que um modelo de controle de autoridade de gasto exige, quatro itens estão ausentes da descrição:
- Nenhum teto de gasto ou limite de raio de dano por mudança aprovada. Uma aprovação é uma aprovação, mova ela US$ 200 ou US$ 20 mil.
- Nenhum procedimento de rollback. A verificação confirma que a mudança chegou. Nada do que foi descrito a reverte.
- Nenhuma segregação de funções. O mesmo agente propõe a mudança, aplica e verifica. O humano fica no meio dessa cadeia, não em uma das pontas.
- Nenhuma trilha de auditoria fora do stack do fornecedor. O registro do que foi proposto, aprovado e aplicado vive dentro do sistema que o produziu.
Esses quatro são o que um time financeiro exigiria antes de dar a mesma autoridade a um analista júnior. A mesma assimetria aparece sempre que um agente ganha acesso de escrita a um sistema de registro, e publicidade ainda carrega uma superfície de governança própria por cima. A distância entre as permissões de um agente e os controles que uma pessoa com permissões idênticas enfrentaria é onde a dívida de governança se acumula.
Sobre os números do fornecedor
A LangChain reporta atribuição de pipeline saindo de 0 a 20% em seis meses, custo por lead qualificado cerca de 30% menor entre junho e agosto, gasto mensal cerca de 60% maior, CPL no LinkedIn 40% abaixo do patamar de janeiro, cerca de US$ 5 mil por mês economizados em relação a uma agência, um fluxo de relatório cerca de 40x mais barato e 13x mais rápido, tempo de execução caindo de 1.112 segundos para 85 segundos, e consumo inicial de cerca de 3,9 milhões de tokens de entrada por relatório reduzido a um contexto otimizado de primeiro turno de cerca de 12 mil tokens.
Todos esses números são autorreportados por um fornecedor sobre o próprio marketing, produzidos pelo próprio agente rodando no próprio stack comercial, sem auditoria externa, sem metodologia publicada e sem denominadores divulgados. Trate as alegações de engenharia (contagem de tokens, tempo de execução, arquitetura de contexto) como mais críveis do que os resultados de marketing, porque as primeiras são medidas dentro de um sistema que eles controlam e as segundas dependem justamente da camada de atribuição de que este texto trata.
As alegações arquiteturais valem de qualquer forma. Cinco camadas de contexto ordenadas por frequência de mudança: system prompt, skills, wiki, ferramentas ao vivo e código determinístico. O teste para decidir o que vai onde é limpo o bastante para copiar: uma skill deveria funcionar em outra empresa, enquanto a wiki não deveria. Python busca os dados, alinha as janelas de data, calcula totais e comparações, aplica regras fixas e escreve resultados compactos no sandbox, deixando para o modelo só o que exige julgamento. E a frase que a maioria dos times precisa ouvir: o gargalo costuma ser a janela de contexto, mais do que o modelo.
Faça isso agora
Pegue as três perguntas de entrada que Karan propõe e aplique a cada número que o seu agente tem permissão de otimizar, antes de conceder acesso de escrita a qualquer coisa.
A alocação foi randomizada, e por qual mecanismo? Um sim ou não, com o mecanismo documentado. Quem detém o grupo de controle, e ele pode ser auditado? Medição de terceiro, resultados exportáveis, um desenho que você coespecificou. A métrica de resultado se reconcilia com alguma coisa reconhecida? Ela precisa caminhar até quantidades financeiras e entrar no seu próprio stack de medição.
Depois adote a postura que decorre dessas respostas. Rotule cada número de plataforma como experimental ou observacional no momento em que ele chega. Resultados experimentais com randomização, poder estatístico adequado e desfechos reconciliáveis são evidência, e podem calibrar seus modelos. Todo o resto é telemetria operacional, e não pode dirigir alocação.
Karan localiza a falha com precisão: organizações que alocam com base em lift modelado não estão desinformadas, estão indispostas. Um agente com autoridade de gasto tira a última desculpa, porque o que tornava isso tolerável era um humano mover orçamento devagar o suficiente para o erro se diluir. Aprove na velocidade da máquina, contra um número que você nunca classificou, e ele não se dilui.
Fontes
- Karan (karandhir.substack.com). “Facebook proved its own ad measurement wrong.” Setembro de 2026.
- LangChain (A. Irgashev, D. Lambert, J. Gomez). “How we built LangChain’s paid media agent.” Setembro de 2026.
A Victorino ajuda times a classificar as métricas que seus agentes otimizam antes de conceder a esses agentes autoridade para agir sobre elas: contato@victorino.com.br | www.victorino.com.br
Todos os artigos do The Thinking Wire são escritos com o auxílio do modelo LLM Opus da Anthropic. Cada publicação passa por pesquisa multi-agente para verificar fatos e identificar contradições, seguida de revisão e aprovação humana antes da publicação. Se você encontrar alguma informação imprecisa ou deseja entrar em contato com o editorial, escreva para editorial@victorino.com.br . Sobre o The Thinking Wire →
Se isso faz sentido, vamos conversar
Ajudamos empresas a implementar IA sem perder o controle.
Agendar uma Conversa