Um Modelo, Dois Harnesses, 37 Pontos de Diferença, e a Nota Melhor Custou Menos

TV
Thiago Victorino
8 min de leitura
Um Modelo, Dois Harnesses, 37 Pontos de Diferença, e a Nota Melhor Custou Menos

A ARC Prize rodou o GPT-6 Astra no ARC-AGI-3 duas vezes. O Standard Harness marcou 62,7% e custou US$ 26.098. O Provider Adapter Harness marcou 99,9% e custou US$ 18.817. Mesmo modelo, mesmo benchmark, mesmas tarefas. A única coisa que mudou foi qual estado o scaffold carrega entre as requisições, e o número andou 37 pontos.

Depois o custo andou no sentido oposto ao esperado. A rodada melhor saiu cerca de 28% mais barata.

O Que De Fato Mudou

O texto de Greg Kamradt define cada harness em um parágrafo, e a diferença cabe em uma frase. O Standard Harness “permite que o modelo leve adiante anotações que ele mesmo escolhe manter durante o ambiente”. O Provider Adapter Harness “preserva estado opaco de raciocínio entre requisições e usa compactação para conversas mais longas, permitindo que o modelo reaproveite trabalho anterior”.

Um pede que o modelo escreva um bilhete para si mesmo. O outro mantém vivo o próprio estado de trabalho do modelo através da fronteira da requisição. Esse é o delta inteiro. Sem fine-tune, sem concurso de engenharia de prompt, sem versão diferente do modelo.

Os números de eficiência do Provider Adapter apontam a razão. As rodadas usaram 49% menos tokens no total e foram aproximadamente 3,66x mais rápidas em tempo agregado registrado. A nossa leitura do porquê: um harness em que o modelo precisa reconstituir o raciocínio a partir das anotações que ele escolheu guardar pode estar pagando por essa reconstrução duas vezes, uma em tokens e outra em acurácia. A ARC Prize apresenta as diferenças de token, de tempo e de nota lado a lado sem afirmar mecanismo algum, então a direção causal aqui é inferência nossa. Preserve o estado e as duas contas encolhem juntas.

Essa inversão pesa mais que os 37 pontos. Times de compras e de avaliação costumam assumir uma fronteira entre acurácia e custo, em que nota melhor se compra com mais computação. Aqui a troca de harness moveu as duas variáveis na mesma direção. O trade-off que todo mundo está acostumado a usar como raciocínio foi, neste par de rodadas, um artefato de uma escolha de scaffold.

Para dar escala ao outro lado da comparação, a mesma página relata o Astra usando menos ações que a linha de base humana em 96,0% dos níveis, com 51,7% menos ações por nível em média. A linha de base humana custou US$ 12,78 por jogo tentado, com cerca de 500 participantes. Esses são os números que a maioria dos leitores vai guardar. São também os números que não significam nada sem um rótulo de harness colado neles.

O Mesmo Efeito Aparece em Nota de Segurança

Um benchmark de capacidade que balança com a escolha de scaffold já é desconfortável. Um benchmark de segurança fazendo o mesmo é pior, porque números de segurança são os que terminam em documento de divulgação e em questionário de fornecedor.

Um pesquisador que assina como richbc, em trabalho feito no MATS, construiu um template de jailbreak e o avaliou nos 179 prompts CBRNE e cibernéticos do ClearHarm, em 23 modelos de 7 provedores. O template alcança de 84% a 100% de taxa de sucesso de ataque (ASR) nos 9 modelos mais vulneráveis. (O post traz um aviso explícito de que as opiniões são do autor e não da MATS Research, e nenhum nome real aparece na página. Trate como resultado publicado de um pesquisador, e nunca como posição de um laboratório de fronteira.)

O achado relevante para quem escreve política de avaliação está no que aconteceu ao ligar e desligar o modo de raciocínio. O Kimi K2.5 caiu de 99,4% de ASR para 23,5%. O Kimi K3 caiu de 20% para 0%. O Gemini 2.5 Flash foi para o outro lado, subindo de 91,6% para 98,9%.

Três modelos, uma flag de configuração, e a direção do efeito varia. Uma nota de segurança publicada sem o ajuste de modo de raciocínio deixa de ser estimativa conservadora ou aproximada. Vira um número cujo sinal ninguém consegue inferir.

Os resultados de cobertura do post trazem um segundo aviso. Todos os modelos retornaram ao menos uma resposta plenamente jailbroken, com exceção do Meta Muse Spark 1.1 e dos modelos mais recentes da Anthropic (Haiku 4.5, Opus 4.6, Sonnet 5). O Claude 3.7 Sonnet, anterior aos classificadores constitucionais, mostrou 100% de ASR. Modelos de fronteira, nas palavras do autor, “continuam vulneráveis a técnicas antigas de jailbreak quando usadas em combinação”. Um relatório da FAR.AI citado na primeira nota de rodapé do post traz a versão metodológica do argumento: “Jailbreaks frequentemente se tornam mais eficazes quando múltiplas técnicas são combinadas. A avaliação de robustez precisa, portanto, cobrir composições de ataque em vez de apenas prompts de jailbreak individuais.”

Composição de ataque é uma propriedade do harness. Modo de raciocínio também. Retenção de estado entre requisições também. O que está sendo medido nos três casos é um par, e só metade do par vai impressa no placar.

Por Que Isso Quebra a Linguagem de Compras

Já argumentamos que trocar o scaffold de avaliação move o resultado, e que o harness é a superfície de controle. O primeiro deles trabalhava com oscilações na casa de 15%. Uma diferença de 37 pontos no mesmo benchmark, vinda de uma decisão sobre tratamento de estado, é um problema de outra ordem.

Com 15%, citar um benchmark é impreciso. Com 37 pontos, citar um benchmark sem especificar o harness produz uma frase sem valor de verdade, porque ela é verdadeira e falsa ao mesmo tempo dependendo de um detalhe de configuração que o leitor nunca recebeu.

Olhe como capacidade de modelo é de fato referenciada nos artefatos que amarram empresas: questionários de segurança de fornecedor, model cards resumidos em slides, políticas de IA que nomeiam uma nota de corte, regras de compra que exigem resultado de benchmark acima de alguma barra. Nos questionários de fornecedor e nas políticas de IA que já lemos, especificação de harness simplesmente não é um campo. Carregam nome do modelo, nome do benchmark e um percentual.

Sob essas regras, um fornecedor consegue satisfazer um limiar de segurança e um limiar de capacidade com rodadas legítimas e divulgadas, enquanto o cliente que roda o mesmo modelo no scaffold dele vê números que não se parecem com nenhum dos dois. Ninguém mentiu. A especificação estava subdeterminada.

Faça Isso Agora

Abra o último documento que a sua organização produziu citando nota de benchmark de modelo. Resposta de questionário de fornecedor, política interna de IA, relatório de avaliação de modelo, slide de conselho. Para cada nota, responda duas perguntas por escrito.

Primeira: qual harness produziu esse número? Nomeie o comportamento de estado entre requisições, o ajuste de modo de raciocínio e se a avaliação testou prompts isolados ou composições. Se a fonte não disse, o número está sem especificação, e o seu documento deveria registrar isso em vez de repetir a cifra sozinha.

Segunda: o seu scaffold de produção é o mesmo? Se os seus agentes carregam estado de raciocínio compactado e o benchmark citado rodou em um harness que só guarda anotações, o seu deployment está fora da configuração que foi medida. Isso não vira problema automaticamente. Vira incógnita automaticamente, e incógnita pertence ao registro de riscos, longe da coluna de resumo.

Depois mude o template. Todo documento interno que cita um benchmark deveria ter um campo obrigatório de harness ao lado da nota, vazio por padrão e visivelmente vazio quando ninguém preencheu. Campo em branco é sinal de governança. Percentual confiante sem procedência não sinaliza coisa alguma.

A versão barata desse trabalho é renomear uma coluna. A versão cara é descobrir, depois do deployment, que os 99,9% que você comprou eram do outro harness.


Fontes

A Victorino ajuda organizações de engenharia a especificar e governar os harnesses de avaliação por trás das notas em que elas apostam: contato@victorino.com.br | www.victorino.com.br

Todos os artigos do The Thinking Wire são escritos com o auxílio do modelo LLM Opus da Anthropic. Cada publicação passa por pesquisa multi-agente para verificar fatos e identificar contradições, seguida de revisão e aprovação humana antes da publicação. Se você encontrar alguma informação imprecisa ou deseja entrar em contato com o editorial, escreva para editorial@victorino.com.br . Sobre o The Thinking Wire →

Se isso faz sentido, vamos conversar

Ajudamos empresas a implementar IA sem perder o controle.

Agendar uma Conversa