- Início
- The Thinking Wire
- Conquistada Devagar, Revogada na Hora: A Assimetria do Score de Autonomia
Conquistada Devagar, Revogada na Hora: A Assimetria do Score de Autonomia
Um agente precisa ultrapassar o piso do nível por cinco pontos para ser promovido. Precisa de uma única chamada de ferramenta não autorizada para ser rebaixado. Esse é o modelo de autonomia graduada da AWS, publicado em agosto de 2026, e os cinco pontos são a parte que vale estudar.
AWS, Thoughtworks e Datadog publicaram, cada uma, uma arquitetura de autonomia de agentes naquele mês. Os três documentos vêm de times resolvendo problemas diferentes: pontuação de confiança, prontidão de dados e contratos de despacho. Todos chegam à mesma primitiva. Permissão não é entregue uma vez e esquecida. Ela é pontuada continuamente contra o comportamento recente, e se move.
O que a AWS publicou
A AWS pontua um agente de 0 a 100 sobre uma janela deslizante das suas últimas 50 ações. Cinco dimensões carregam o peso: Acurácia com 25%, Segurança com 20%, Consistência com 20%, Conformidade com 20% e Eficiência com 15%. Segurança também funciona como piso independente, então uma acurácia alta não dilui uma falha de segurança na média. Esse detalhe é o que a maioria dos scores ponderados erra, e está escrito na rubrica.
O score mapeia para quatro níveis:
| Nível | Score | O que o agente pode fazer |
|---|---|---|
| T1 Probation | 0 a 40 | ”Read and list only. Two tools visible.” |
| T2 Supervised | 41 a 70 | ”Add write operations. Human approves high-risk.” |
| T3 Trusted | 71 a 90 | ”Execute and modify. Anomalies flagged for review.” |
| T4 Autonomous | 91 a 100 | ”Full access. Post-hoc audit only.” |
A AWS enquadra o problema que resolve como a distância entre o que um agente poderia fazer e o que um operador confia que ele faça: “The distance between what an agent could do and what an operator trusts it to do is the agent’s trust gap.”
Os cinco pontos são o projeto inteiro
Promoção exige ultrapassar o piso do nível por cinco pontos. Rebaixamento é imediato. Uma única chamada de ferramenta não autorizada reprova no portão adversarial e o agente cai.
Essa histerese existe por uma razão mecânica. Um score calculado sobre janela deslizante oscila perto de qualquer limiar. Um agente parado logo abaixo de 71 cruzaria a linha e voltaria só por ruído, e sem folga cada cruzamento concederia ou revogaria acesso de escrita. A folga de cinco pontos transforma uma fronteira trêmula em uma fronteira estável, ao custo de tornar a promoção mais lenta do que o score bruto sugere.
O rebaixamento não tem folga alguma, e não deveria ter. Os dois erros têm consequências de tamanhos diferentes. Promover devagar demais custa latência e algum tempo de revisão humana. Promover fácil demais entrega acesso de escrita a um processo que acabou de demonstrar que o usaria mal. A assimetria do mecanismo codifica diretamente a assimetria do custo.
É aí que o modelo se separa da maioria dos desenhos de permissão, inclusive o que descrevemos em A Stack de Contenção. Aquele texto trata de onde fica a parede: runtime, microVM, egress de rede, gateway. Este trata do que move a parede. As camadas de contenção são estáticas por projeto, e devem continuar sendo. O nível de autonomia é a variável que decide dentro de qual dessas camadas o agente pode operar agora.
O problema de entrada que a Thoughtworks levanta
Um score comportamental vale o que vale o registro que ele pontua. A Thoughtworks chega à mesma arquitetura pelo lado dos dados, estagiando agentes por Shadow Mode, depois Supervisionado, depois Autônomo com guardrails, depois autonomia plena, com promoção concedida por evidência e não por calendário.
Os níveis medallion para dados consumidos por agentes vão de Bronze (ingestão bruta), Silver (validado e deduplicado), Gold (certificado) até Adaptive Gold (curado por agente), com uma regra que importa mais que os nomes dos níveis: “agents should only access Gold tier or above.”
Sadalage e Chandrasekaran dão a razão sem rodeios: “when the data feels wrong, a human double-checks; an agent confidently acts on it.” Um operador humano absorve defeitos de dado em silêncio, então um pipeline pode carregar problemas de qualidade que ninguém quantificou. Coloque um agente na mesma fonte e o defeito vira ação. Sob autonomia graduada, ele também vira rebaixamento, e o agente perde posição por uma falha que não causou.
O registro que a Datadog diz vir antes
Nada disso pontua sem um rastro legível por máquina do que o agente fez. A Datadog especifica a cadeia de despacho como “Signal, curated context, task identity, allowed capabilities, execution target, recorded output.” Cada elo é algo que um pontuador consegue ler.
A definição deles de contrato consumível por máquina define a barra para uma ferramenta que um agente pode chamar: descrição clara, entradas e saídas tipadas, schemas estáveis e versionados, limites e categorias de erro legíveis por máquina, e efeitos colaterais, pré-condições e requisitos de aprovação declarados. Efeitos colaterais declarados são o que permite classificar uma chamada como de alto risco antes de ela rodar, e não depois.
A Datadog também insiste que os estados terminais de workflow sejam definidos explicitamente: succeeded, failed, cancelled, expired, approval denied, escalated. Orçamentos de retry são limitados por número de tentativas, tempo decorrido ou custo em tokens. Um agente cujas execuções terminam em estado indefinido produz ações impontuáveis, e uma ação impontuável é um buraco na janela deslizante.
Um número medido daquele post vale carregar: seleção de campos e agregação nas ferramentas do MCP Server deles reduziram o custo de execução em cerca de 40%. Superfícies de ferramenta mais estreitas saem mais baratas de rodar além de serem mais fáceis de governar.
Três documentos, uma forma
| AWS | Thoughtworks | Datadog | |
|---|---|---|---|
| Unidade de confiança | Score numérico, 0 a 100 | Estágio, promovido por evidência | Capacidade declarada por despacho |
| Janela de evidência | 50 ações deslizantes | Comportamento observado por estágio | Saída registrada por tarefa |
| Rubrica numérica no post citado | Sim, pesos e faixas | Não informado | Não informado |
| Portão na entrada | Não especificado | Dados Gold ou acima | Contexto curado na cadeia |
| Tratamento de falha | Rebaixamento imediato | Guardrails antes da autonomia plena | Estados terminais explícitos, retries limitados |
Entre essas três, a AWS é a única que publicou uma rubrica numérica. Thoughtworks e Datadog descrevem a lógica de promoção sem se comprometer com limiares. Uma rubrica que dá para imprimir é uma rubrica com a qual o cliente consegue discutir, e essa é uma propriedade que vale ter quando a pergunta é por que um agente teve permissão de escrever em produção.
O que nenhuma delas estabelece
As três são publicações de fornecedor descrevendo arquiteturas que elas próprias recomendam. Nenhuma reporta dado de resultado em produção rodando esses modelos em escala. Os pesos da AWS são um projeto publicado, sem resultado medido por trás: nada no post mostra que 25% de Acurácia e 20% de Segurança produzem resultado melhor que qualquer outra divisão, e a janela de 50 ações é afirmada, nunca ajustada em público.
A convergência vale pela forma que tem, e não pelo tamanho. Três times descrevendo a mesma primitiva no mesmo mês diz que o desenho virou a resposta óbvia entre quem constrói isso. Não diz que a indústria adotou.
Faça isso agora
Instrumente o registro antes de construir a escada. Escolha o workflow de agente com maior volume e faça toda execução emitir um estado terminal de uma lista fechada, com a ferramenta chamada, os efeitos colaterais declarados e o desfecho. Rode por tempo suficiente para cobrir a variação normal da sua carga, sem nenhuma pontuação acoplada e sem níveis. Depois calcule qual teria sido o score.
O achado comum nesse ponto é que uma chamada de ferramenta não autorizada é indistinguível de uma autorizada, porque os contratos das ferramentas nunca declararam qual era qual. Esse achado sai mais barato antes de você ter prometido uma escada de níveis a alguém.
Para os controles ao redor: permissões por tarefa estreitam o que um nível concede dentro de uma única tarefa, A Stack de Contenção define as paredes dentro das quais o nível opera, e o raio de impacto por modo de falha diz quais rebaixamentos precisam ser instantâneos. A convergência em restringir o ambiente é a metade mais antiga dessa história, e o teatro da aprovação é o controle que esses modelos tentam substituir.
Fontes
- AWS. “Closing the AI agent trust gap with graduated autonomy.” Agosto de 2026.
- Thoughtworks. “Making your data ready for agentic AI.” Agosto de 2026.
- Datadog. “Golden paths for AI agents.” Agosto de 2026.
A Victorino constrói o registro comportamental e a rubrica de pontuação que permitem a agentes corporativos conquistarem autonomia sob auditoria: contato@victorino.com.br | www.victorino.com.br
Todos os artigos do The Thinking Wire são escritos com o auxílio do modelo LLM Opus da Anthropic. Cada publicação passa por pesquisa multi-agente para verificar fatos e identificar contradições, seguida de revisão e aprovação humana antes da publicação. Se você encontrar alguma informação imprecisa ou deseja entrar em contato com o editorial, escreva para editorial@victorino.com.br . Sobre o The Thinking Wire →
Se isso faz sentido, vamos conversar
Ajudamos empresas a implementar IA sem perder o controle.
Agendar uma Conversa