- Início
- The Thinking Wire
- O Mesmo Modelo Custa Até 5× Mais em um Harness do que em Outro, com Taxa de Sucesso Parecida
O Mesmo Modelo Custa Até 5× Mais em um Harness do que em Outro, com Taxa de Sucesso Parecida
Vinte e um pares modelo-harness, dois benchmarks e um achado que um time de plataforma consegue usar ainda neste trimestre: o mesmo modelo chega a uma taxa de sucesso parecida custando até 5× mais, dependendo do harness que o executa. Esse é o resultado central do HarnessTax, estudo de setembro de 2026 da UC Berkeley e da Arena (Melissa Z. Pan, Shuo Yang, Negar Arabzadeh, Wei-Lin Chiang, Ion Stoica, Matei Zaharia). É a primeira medição controlada que vimos tratar o harness como variável de custo própria, separada do modelo que roda dentro dele.
Já escrevemos sobre a conta oculta de tokens, sobre governar o harness em vez do modelo e sobre harness e engenharia de loop em agentes. Nenhum desses textos tinha uma comparação controlada de custo entre harnesses. Este estudo tem, e os números mudam a forma de comprar um harness.
O desenho do experimento
Sete modelos: Claude Fable 5, Opus 4.8, Sonnet 4.6, Haiku 4.5, GPT-5.6 Sol, GPT-5.6 Luna e Kimi K3. Três harnesses: Claude Code, Codex CLI e Pi. Dois benchmarks: SWE-bench Lite e Terminal-Bench 2.0. Cada par rodou 30 tarefas amostradas por benchmark, três repetições cada, com teto de 100 turnos, rede bloqueada e ferramentas de web padrão desativadas.
O escopo pesa tanto quanto o resultado. Trinta tarefas amostradas por benchmark é uma estimativa por amostra, e os próprios autores declaram um limite: os dois benchmarks são open-source e podem ter entrado nos dados de treino. Trate o estudo como uma amostra bem instrumentada e leia cada número abaixo dentro desse enquadramento.
O sucesso quase não se move. O custo, sim.
Nas palavras dos autores: “The same model can achieve similar success rates at up to 5x costs.” O sucesso fica dentro de ±2% no SWE-bench Lite e dentro de cerca de ±5% no Terminal-Bench 2.0. Pouco, mas acima de zero. O custo é onde a diferença mora.
O exemplo mais limpo é o Claude Fable 5 no SWE-bench Lite. No Claude Code, resolveu 97,8% das tarefas a US$ 1,33 por tarefa resolvida. No Codex, 96,7% a US$ 0,89. No Pi, 96,7% a US$ 0,67. Os turnos por tentativa ficaram quase idênticos, 15,3 contra 15,4, então a contagem de turnos não explica a diferença. Cerca do dobro do custo comprou aproximadamente um ponto de sucesso.
GPT-5.6 Sol no mesmo benchmark: 77,8% a US$ 1,54 no Claude Code, 74,4% a US$ 0,44 no Pi. Cerca de 3,5× o custo por aproximadamente três pontos. Tom Tunguz, lendo o mesmo estudo em The Harness Margin Opportunity, descreve esse único par como uma redução de 71% no custo: “$1.540 to $0.441 per resolved task, the same model in both cases.” Esses 71% valem para um único par, sem representar o agregado. E o 5× da página do HarnessTax é a maior distância entre os 21 pares, sem estar atribuído a um modelo específico no texto.
No agregado, o padrão se mantém. As razões de custo por média geométrica colocam o Claude Code em cerca de 2,0× o Pi e cerca de 1,6× o Codex no SWE-bench Lite, e cerca de 1,5× o Pi no Terminal-Bench 2.0. O gráfico de Tunguz, cobrindo os sete modelos, vai “from 1.1x to 5.1x”. O imposto nunca é zero.
O harness do fornecedor do modelo é o padrão seguro? Os dados dizem que não
A regra intuitiva de compra diz que o harness do próprio fornecedor do modelo deve ser o mais ajustado. Os dados não sustentam a regra. Do estudo: “an alternative harness achieves the highest observed success rate in nine of twelve comparisons.” Essas doze comparações são os seis modelos da Anthropic e da OpenAI nos dois benchmarks. Em três quartos delas, um harness que o fornecedor do modelo não construiu obteve o melhor resultado observado.
O Pi é o harness que aparece repetidamente na borda eficiente. “Pi reaches the Pareto frontier on both benchmarks by providing just four tools: read, write, edit, and bash.” Quatro ferramentas, e ele fica na fronteira nos dois benchmarks.
De onde vem o custo extra? Parte dele chega antes de o modelo fazer qualquer coisa. O contexto inicial médio do Claude Code tem mais de 10× o do Pi em tokens. Os autores são diretos: “A harness tax can begin with the first model call.” Tudo que um harness carrega antes de o texto da tarefa chegar é cobrado no primeiro turno, e o estudo encontrou uma ordem de grandeza de diferença entre os dois harnesses nesse ponto.
A estatística transforma isso em decisão de governança
Tunguz acrescentou uma análise própria por cima do estudo, e é a parte que eu colocaria na frente de um CFO. “Across all 42 within-model harness comparisons, a two-sided Fisher exact test finds one result at p < 0.05, where chance alone would produce about two, & none survives a Holm-Bonferroni correction.”
Lido como regra de compra: nenhuma diferença de taxa de sucesso entre harnesses sobrevive à correção para comparações múltiplas. Toda diferença de custo é uma linha medida na fatura, e o estudo não testa nenhuma delas. Quem escolhe um harness porque ele pontua mais alto em benchmark fica sem respaldo do estudo nesse tamanho de amostra. Quem escolhe porque ele custa menos por tarefa resolvida tem o respaldo.
Tunguz estende o raciocínio para um argumento de margem para fornecedores, com um par ilustrativo de empresas (38% contra 75% de margem bruta). Pela nota de rodapé do próprio autor o exemplo é ilustrativo, então deixo como ilustração. A parte medida já basta.
O que os números deixam em aberto
Três limites do que o estudo estabelece, para que a lição saia certa.
O Pi ficou na fronteira de Pareto em dois benchmarks open-source, sob teto de 100 turnos e sem rede. Se ele é o harness certo para o seu trabalho depende de as suas tarefas precisarem de ferramentas além de read, write, edit e bash.
O Claude Code, na configuração usada no estudo, gastou mais por tarefa resolvida nesses benchmarks, e parte desse gasto começa no contexto inicial. Um harness que carrega mais estrutura pode pagar esse custo em tarefas que o estudo não amostrou.
Sucesso dentro de ±2% no SWE-bench Lite e de cerca de ±5% no Terminal-Bench 2.0 é pouco, mas acima de zero. Em um conjunto de tarefas em que cada ponto importa, alguns pontos podem valer o gasto. Saber o preço desses pontos é o exercício inteiro.
Faça isso agora
Rode a auditoria de Pareto nas suas próprias tarefas antes de aceitar qualquer harness padrão, incluindo o que o fornecedor do modelo entrega.
Escolha um modelo pelo qual o time já paga. Escolha dois ou três harnesses em que você conseguiria rodá-lo de verdade. Amostre 30 tarefas do seu próprio backlog, do tipo que os seus agentes fecham no dia a dia, e rode cada par três vezes com o mesmo teto de turnos e a mesma política de rede. Registre dois números por par: taxa de sucesso e custo por tarefa resolvida. Coloque em um gráfico. Qualquer ponto à direita de outro com taxa de sucesso igual ou menor está pagando imposto de harness por nada que se consiga medir.
Depois olhe o primeiro turno. Extraia o contexto inicial que cada harness envia antes de o texto da tarefa chegar. Se um harness começa uma ordem de grandeza mais pesado que o outro, o imposto está sendo cobrado antes de o modelo ler o ticket, e nenhuma engenharia de prompt mais adiante recupera isso.
Compre o harness como decisão de custo. O modelo decide o que é possível. O harness decide quanto custa, e este é o primeiro estudo que vimos colocar um número controlado nisso.
Fontes
- UC Berkeley / Arena. “HarnessTax: How Much Does the Harness Matter for Coding Agents?.” Setembro de 2026.
- Theory Ventures (Tomasz Tunguz). “The Harness Margin Opportunity.” Setembro de 2026.
A Victorino roda auditorias de custo de harness no seu próprio conjunto de tarefas, para que o harness padronizado seja o que a sua conta justifica: contato@victorino.com.br | www.victorino.com.br
Todos os artigos do The Thinking Wire são escritos com o auxílio do modelo LLM Opus da Anthropic. Cada publicação passa por pesquisa multi-agente para verificar fatos e identificar contradições, seguida de revisão e aprovação humana antes da publicação. Se você encontrar alguma informação imprecisa ou deseja entrar em contato com o editorial, escreva para editorial@victorino.com.br . Sobre o The Thinking Wire →
Se isso faz sentido, vamos conversar
Ajudamos empresas a implementar IA sem perder o controle.
Agendar uma Conversa