Alguém Está Gastando o Seu Orçamento de IA, e Não É o Seu Time

TV
Thiago Victorino
8 min de leitura
Alguém Está Gastando o Seu Orçamento de IA, e Não É o Seu Time

Matt Lenhard, da Vectoral, mapeou 49 relays de tokens e publicou os preços praticados. No topo da tabela, uma loja chamada Now Coding revende acesso a modelos de fronteira com 97,8% de desconto sobre a tabela oficial. A I Code Easy fica em 97,1%. Claude ZZ em 96,6%, Doro em 96,4%, UoCode em 96,3%. ZeroCode e AiYa empatam em 94,9%, HongMaCC em 94,2%, Right Code e BUZZ em 94,1%.

Dez dessas lojas, as de maior tráfego, somam 3,6 milhões de visitas por mês.

Isso é um canal de varejo com tabela de preços publicada, base de clientes e um problema de suprimento. O suprimento é a parte interessante. Ninguém fabrica inferência com 96% de desconto. O estoque vem de algum lugar, e esse lugar são contas e chaves de API que pertencem a outras pessoas.

O Que o Preço Realmente Implica

Um dos pacotes anunciados: 3.333 dólares de crédito da Anthropic por 425 RMB, cerca de 59 dólares. Um participante da thread do V2EX acompanhada por Lenhard calculou algo próximo de 13 centavos de uso oficial por dólar gasto, e o número circula desde então como se fosse uma medição. A origem é um comentarista de fórum, e o levantamento em si nunca produziu esse valor. O par bruto já basta. Quem consegue cotar 3.333 dólares de crédito por 59 não está arbitrando desconto por volume.

Trate o resto daquela thread com a mesma desconfiança. Ela foi aberta por um operador de relay, e as frases mais citáveis são vanglórias anônimas sobre cadeias industriais de bilhões de RMB e ganhos diários na casa das centenas de milhares. Lenhard reporta sem corroborar, e você também não deveria corroborar. Os números defensáveis são os que ele mediu: a tabela de descontos, o tráfego, a distribuição dos gateways, a mecânica das rifas.

A Pilha Tem Quatro Andares e Só Um É Ilegal

O mercado é mais industrializado do que sugere a frase “alguém está vendendo chaves roubadas”.

Na base ficam os pools de contas. O estoque é colhido não só de APIs de laboratórios, mas de produtos de aplicação de IA voltados ao consumidor. Ou seja, qualquer empresa que entregue uma funcionalidade apoiada em um modelo é fornecedora desse mercado, sabendo disso ou não. O chatbot que você expõe ao cliente é o canal atacadista de outra pessoa.

Acima vem a camada de gateway, e é aqui que o quadro fica desconfortável para quem defende. Os relays rodam gateways open source auto-hospedáveis. Lenhard encontra o one-api aparecendo cerca de quatro vezes mais que o new-api entre os relays rastreados. Os dois são software comum e legítimo. Milhares de times os operam por razões perfeitamente normais. Lenhard é preciso sobre onde fica a linha: “Um relay cruza a linha quando seus canais são abastecidos com chaves roubadas, vazadas ou agrupadas em vez das próprias do operador.” O software não é o crime. A procedência é.

Acima do gateway está o varejo, com o acabamento que se espera de um mercado maduro. Um operador, o hvoy.ai, roda uma rifa diária que sorteia 50 chaves de API de 100 dólares cada, com semente derivada de um hash de bloco do Bitcoin para provar a lisura do sorteio, e um snapshot de inscrições publicado para auditoria dos participantes. Alguém construiu prova criptográfica de justiça na mecânica de brindes de um negócio de credenciais roubadas.

Depois vem a demanda: desenvolvedores comprando assistentes de código baratos, a maioria provavelmente sem pensar muito em por que o preço é 3% da tabela.

Já escrevemos sobre IA sombra como problema de adoção interna e sobre a cadeia de suprimentos que se forma embaixo dela. Este é o mesmo fenômeno visto do lado criminoso da transação, e com tabela de preços.

O Atacante Que Não Quer Dinheiro

Todo controle antifraude que seus times de finanças e plataforma construíram parte de uma premissa: o atacante quer extrair valor. Detecte a extração, siga o valor, corte o caminho.

Negação de carteira quebra isso. O objetivo é queimar o orçamento do provedor pelo próprio ato de queimar. Não há revenda, não há caminho de monetização, não há comprador a jusante para rastrear. A condição de vitória do atacante é a sua fatura. Quem quer apenas prejudicar um concorrente, retaliar uma plataforma ou ver um endpoint limitado por taxa falir o próprio dono não deixa assinatura financeira alguma, e por isso a classe inteira fica invisível para um modelo calibrado para farejar lucro.

A consequência para o desenho de controles é direta. Tetos de gasto deixam de ser instrumento de orçamento e viram fronteira de contenção, da mesma família de um segmento de rede ou de um sandbox de sistema de arquivos. Um orçamento definido para prever é um número. Um orçamento que interrompe a execução quando ultrapassado é uma parede.

Lenhard também é claro sobre o varejo ser alvo móvel: “À medida que Anthropic e outros lançam controles de KYC e verificação de identidade, o abuso não vai desaparecer, apenas vai se mudar para outro lugar.” Verificação de identidade encarece abastecer um relay. Nada disso alcança quem tinha como único objetivo fazer o seu medidor girar.

Reserve o Orçamento Antes da Chamada

Os controles de raio de explosão que sobrevivem a esse modelo de ameaça são pouco glamourosos: teto de gasto por conta, travas rígidas de gasto, limites de concorrência e throttling silencioso. Sobre este último, a nota operacional de Lenhard merece citação exata: “faça o throttle em silêncio. Um erro limpo apenas diz ao atacante qual sinal corrigir antes de voltar.” Um 429 com mensagem prestativa é ferramenta de depuração para quem está te atacando.

O controle que falta na maioria dos times é mais sutil. É preciso reservar orçamento para cada requisição em voo. Cobrar somente pelas concluídas deixa o teto descoberto durante todo o intervalo em que o dinheiro já está comprometido.

Considere a implementação comum. Teto de 500 dólares por conta, verificado contra o gasto registrado quando a chamada retorna. O atacante dispara duas mil requisições concorrentes. Todas verificam o teto, veem 480 dólares de gasto registrado e passam. As duas mil executam. O teto foi respeitado em cada verificação individual e estourado no agregado, porque a contabilidade aconteceu depois que o dinheiro já estava comprometido. É a mesma forma do orçamento que o agente aprova para si mesmo: um limite que só existe no instante da checagem, sem reserva por trás, é sugestão.

Reservar no despacho resolve. Debite o orçamento disponível da conta quando a requisição é emitida, acerte a diferença quando ela retorna, libere a reserva em caso de falha. Disciplina de partidas dobradas aplicada a tokens. Quase nenhum time que expõe um endpoint de LLM hoje tem isso, e os que têm normalmente construíram depois de um incidente.

Uma ressalva sobre a fonte. A Vectoral é uma fornecedora de pesquisa de ameaças que vende detecção exatamente nesse espaço, então o checklist defensivo ao final do material funciona também como folheto de produto. Isso não torna os controles errados. A tabela de descontos e os números de tráfego são medições verificáveis. Leia as recomendações sabendo quem ganha quando você age sobre elas.

Faça Isto Agora

Pegue um endpoint de produção que alcance um modelo com as suas credenciais. Responda a três perguntas com evidência, não de memória.

Primeira: qual é o máximo que uma única conta consegue gastar em uma hora se disparar requisições concorrentes sem limite? Se você não consegue calcular esse número a partir do seu código, você não tem teto. Tem relatório.

Segunda: se uma requisição é despachada e nunca retorna, o que acontece com o orçamento que ela estava consumindo? Se a resposta é “nada até o timeout”, um atacante consegue sequestrar o seu teto inteiro com chamadas longas.

Terceira: quando você aplica throttle, o que o chamador aprende? Compare a sua resposta de limite de taxa com a resposta normal. Se elas diferem em código de status, latência ou corpo, você está entregando feedback gratuito a quem está te sondando.

Seja qual for o custo desse endpoint hoje, assuma que alguém em algum momento vai decidir que esse número deveria ser muito maior, e que não vai ganhar nada com isso. Construa para esse atacante. O que persegue lucro é o mais fácil. Se você precisa de uma estrutura inicial para o lado financeiro disso, o nosso template de governança de crédito cobre a disciplina de razão que sustenta os tetos.


Fontes

A Victorino ajuda organizações de engenharia a transformar limites de gasto com IA em fronteiras de contenção aplicáveis: contato@victorino.com.br | www.victorino.com.br

Todos os artigos do The Thinking Wire são escritos com o auxílio do modelo LLM Opus da Anthropic. Cada publicação passa por pesquisa multi-agente para verificar fatos e identificar contradições, seguida de revisão e aprovação humana antes da publicação. Se você encontrar alguma informação imprecisa ou deseja entrar em contato com o editorial, escreva para editorial@victorino.com.br . Sobre o The Thinking Wire →

Se isso faz sentido, vamos conversar

Ajudamos empresas a implementar IA sem perder o controle.

Agendar uma Conversa