- Início
- The Thinking Wire
- Qual Modelo Você Roda e Quem Serve São Duas Decisões Separadas
Qual Modelo Você Roda e Quem Serve São Duas Decisões Separadas
Modelos chineses de código aberto já carregam mais de 60% do tráfego do OpenRouter, num mercado em que os modelos americanos tinham cerca de 70% um ano antes. A Fortune reportou a virada em 21 de agosto de 2026. O ranking de volume de tokens de julho da Fortune coloca modelos desenvolvidos na China nas cinco primeiras posições: o MiMo V2.5 da Xiaomi em primeiro, depois DeepSeek, MiniMax, a família Qwen da Alibaba e o Kimi da Moonshot.
A atração está precificada em dólar. Justin Summerville, do OpenRouter, disse à CNBC que modelos chineses de código aberto saem de 60% a 90% mais baratos que as principais ofertas da Anthropic e da OpenAI. O DeepSeek V4 Flash custa US$ 0,14 por milhão de tokens de entrada. O GPT-5.5 da OpenAI custa US$ 5,00 pelo mesmo milhão de tokens de entrada.
A discussão em torno desses números costuma ser conduzida como uma pergunta única sobre confiar ou não em um modelo chinês. Essa pergunta empacota duas variáveis que se movem de forma independente: de quem são os pesos que rodam, e sob qual jurisdição a inferência acontece. Nomear as duas separadamente muda o que um time de governança está de fato decidindo.
As duas variáveis
Procedência do modelo é quem treinou os pesos, com quais dados, sob qual política de conteúdo e com qual cadeia de suprimentos por trás do artefato. Procedência viaja junto com os pesos. Baixar o Qwen e rodar na sua própria infraestrutura não muda quem treinou, o que havia no corpus de treinamento, nem qual comportamento foi otimizado dentro dele.
Jurisdição de execução é qual pessoa jurídica recebe o seu prompt, onde a requisição é processada e qual governo pode compelir acesso a ela. Jurisdição de execução viaja com o endpoint, não com o modelo. Ela muda no instante em que você troca de host.
A evidência de que as duas se separam vem da prática. A análise de junho do OpenRouter, citada na reportagem do Startup Fortune em que esta peça se apoia, registra que hosts ocidentais como Fireworks, Together e DeepInfra permitem rodar esses modelos sem mandar tráfego por uma API chinesa de primeira parte. Mesmos pesos, endpoint diferente, contraparte jurídica diferente.
O lado de residência da exposição está documentado em linguagem direta pelo próprio fornecedor. A política de privacidade da DeepSeek afirma que os serviços são prestados pela Hangzhou DeepSeek Artificial Intelligence Co., Ltd., e que dados pessoais são coletados, processados e armazenados diretamente na República Popular da China. Afirma também que a DeepSeek pode compartilhar dados pessoais com autoridades policiais ou públicas quando entender que isso é necessário para cumprir a lei ou um processo legal. Isso é uma declaração sobre o endpoint de primeira parte. Não diz nada sobre os pesos, e deixa de valer quando os pesos rodam em outro lugar.
As quatro células
Duas variáveis binárias produzem quatro posições, cada uma com um perfil de risco distinto.
| Execução em host ocidental | API chinesa de primeira parte | |
|---|---|---|
| Pesos ocidentais | O padrão consolidado. Custo mais alto, procedência e residência familiares. | Configuração que esta fonte não cobre. Nomeada para a matriz ficar completa. |
| Pesos abertos chineses | Boa parte da vantagem de custo, sem a exposição de residência da primeira parte. | O mais barato, e a única célula em que os prompts caem sob os termos de processamento na China declarados pelo fornecedor. |
A célula de baixo à esquerda é onde está o trabalho interessante. Ela preserva boa parte da vantagem de custo que tornou a migração atraente e remove a exposição específica que a própria política da DeepSeek descreve. Não remove as perguntas de procedência. Política de conteúdo assada dentro dos pesos, composição dos dados de treinamento e integridade do artefato que você baixou sobrevivem todas a uma troca de host. Essas pertencem à questão de cadeia de suprimentos que tratamos em Seu Provedor de Modelo é uma Cadeia de Suprimentos.
Times que colapsam as duas variáveis em uma pergunta só erram nas duas direções. Quem trata tudo que é chinês como desclassificado abre mão de uma redução de custo de 60% a 90% por um risco de residência que poderia ter sido resolvido por engenharia. Quem trata custo como a história inteira assume uma posição de residência de dados que ninguém na organização aprovou, porque ninguém foi consultado.
Quem carrega o peso de residência é a decisão de hospedagem, acima da linguagem da política do fornecedor. Fizemos esse argumento em O Opt-Out de Treinamento Não é Controle de Saída: uma promessa contratual sobre como o dado será tratado depois de chegar é uma classe de controle diferente de uma rota que nunca o envia. Política de fornecedor é compromisso. Escolha de endpoint é arquitetura. Só uma das duas a sua rede consegue impor.
O que Washington de fato fez
A movimentação no Congresso americano é um fato sobre o ambiente de operação, e importa para compras independentemente do que qualquer um ache da política por trás.
Em abril de 2026, o Comitê de Segurança Interna da Câmara e o Comitê Seleto sobre a China abriram investigação sobre modelos de IA desenvolvidos na China, nomeando DeepSeek, Alibaba, Moonshot AI e MiniMax, e levantando preocupações sobre procedência do modelo, censura, cibersegurança e risco de cadeia de suprimentos. Em carta de 29 de abril ao Airbnb, os comitês registraram que a empresa havia descrito publicamente o Qwen como “rápido e barato”. Em 29 de julho, o senador Tom Cotton escreveu ao secretário de Comércio Howard Lutnick defendendo a proibição, em todo o governo, do uso de modelos de IA chineses por contratados.
Lida contra a matriz, essa movimentação mira principalmente a procedência, que é a variável que uma troca de host não resolve. Uma empresa com exposição ao governo federal americano deve assumir que uma restrição futura pode ser escrita contra a família de modelos, não contra o endpoint. Essa é uma pergunta de planejamento diferente de residência de dados, e pertence a outra linha do registro de riscos. Jurisdição como coluna de compras é um movimento que já argumentamos estar em curso na Europa, em o ano da Mistral.
O número que está sendo citado errado
Martin Casado, da Andreessen Horowitz, é amplamente citado dizendo que 80% das startups de IA usam modelos chineses. O Startup Fortune faz a correção de forma explícita: entre 20% e 30% das startups de IA que apresentam pitch para a firma constroem sobre modelos de código aberto, e cerca de 80% desse grupo usa modelos chineses. Isso dá algo entre 16% e 24% de todos os pitches.
A distância entre 80% e 16% a 24% é a distância entre um padrão de indústria inteira e uma minoria relevante. Se um deck de board ou um pitch de fornecedor na sua caixa de entrada cita o número de 80%, está citando um número composto como se fosse a taxa base.
A direção da corrida
Independentemente do que o ambiente regulatório fizer, o lado da oferta segue construindo. A Alibaba informou no relatório do ano fiscal de 2026 que lançou três atualizações do Qwen em três meses, e que o aplicativo de consumo Qwen havia passado de 295 milhões de usuários ativos mensais em março de 2026. A NVIDIA publicou um blog técnico em 26 de agosto mostrando o Qwen3.8-Flash-Next rodando no sistema GB300 NVL72 para codificação agêntica, e o Portable Computer local-first da Perplexity suporta o Qwen 27B em máquinas com GPUs Nvidia.
Pesos abertos rodando em silício ocidental, documentados por fornecedores ocidentais, é o mesmo desacoplamento visto pelo lado do hardware. Somado aos hosts ocidentais citados acima, a célula de baixo à esquerda não é hipotética.
Faça isso agora
Abra seu inventário de modelos e quebre a coluna única de “aprovado / não aprovado” em duas: procedência do modelo e jurisdição de execução. Para cada carga em produção, registre quais pesos rodam e qual pessoa jurídica recebe o prompt. Toda linha em que esses dois campos colapsam em uma única resposta é uma linha onde alguém decidiu sem nomear a decisão, que é a mesma falha descrita em A Postura Padrão é uma Decisão de Compra.
Depois verifique se uma carga hoje apontada para uma API chinesa de primeira parte pode ser reapontada para um host ocidental. Se puder, você tem uma pergunta de residência com resposta técnica, e o argumento de custo sobrevive à mudança. Se não puder, a pergunta de procedência é a que você está segurando de verdade, e ela precisa de um dono, não de uma comparação de preço.
Fontes
- Startup Fortune (Walter Schulze). “US Startups Are Quietly Replacing OpenAI and Anthropic With Chinese AI.” Agosto de 2026.
Os números acima têm origem em reportagens da Fortune, da CNBC, do The Decoder e do OpenRouter, reunidas pelo Startup Fortune. São citados aqui como reportagem secundária e não foram verificados de forma independente.
A Victorino ajuda times de engenharia e governança a separar a escolha do modelo da topologia de execução antes que qualquer uma das duas chegue à produção: contato@victorino.com.br | www.victorino.com.br
Todos os artigos do The Thinking Wire são escritos com o auxílio do modelo LLM Opus da Anthropic. Cada publicação passa por pesquisa multi-agente para verificar fatos e identificar contradições, seguida de revisão e aprovação humana antes da publicação. Se você encontrar alguma informação imprecisa ou deseja entrar em contato com o editorial, escreva para editorial@victorino.com.br . Sobre o The Thinking Wire →
Se isso faz sentido, vamos conversar
Ajudamos empresas a implementar IA sem perder o controle.
Agendar uma Conversa