The Brief
Como funciona a IA 6 min de leitura

O Raciocínio Oculto da IA Está Vazando. Veja Como.

NAVION

Partilhar

Os modelos de IA de ponta mantêm seus raciocínios em segredo. Ou era o que acreditavam as empresas que os criam. Uma equipe de cientistas da computação demonstrou agora que esse sigilo é mais frágil do que se supunha, com implicações que vão desde a segurança de dados pessoais até a geopolítica do desenvolvimento de IA.

A Vulnerabilidade Oculta à Vista de Todos

Quando modelos avançados de IA abordam problemas complexos, eles não produzem apenas uma resposta. Eles trabalham por meio de uma cadeia de pensamento, dividindo o problema em etapas e analisando cada uma delas em sequência. As empresas tratam esses rastros de raciocínio como proprietários. Revelá-los permitiria que concorrentes os usassem para treinar novos modelos, um processo conhecido como distillation. Para evitar isso, as empresas criptografam o raciocínio e o enviam para a máquina do usuário em uma forma que não deveria ser legível.

A palavra-chave é “deveria”. Pesquisadores da Universidade de Tübingen, do Instituto Max Planck, do instituto de segurança de IA MATS Research e da empresa de segurança Snyk identificaram uma fraqueza estrutural em como essa criptografia funciona na prática. A maioria dos principais provedores de IA oferece seus modelos em vários tamanhos. Modelos maiores são mais capazes e mais caros de executar; versões menores existem para usuários que desejam custos mais baixos. Crucialmente, os modelos menores compartilham a mesma infraestrutura de descriptografia que suas contrapartes maiores, mas receberam menos treinamento de alinhamento. Isso significa que eles são menos propensos a se recusar a revelar o que estão processando.

Ao alimentar rastros de raciocínio criptografados em uma versão menor da mesma família de modelos, os pesquisadores descobriram que conseguiam recuperar o raciocínio oculto que o modelo maior havia produzido. O ataque não requer a quebra de nenhuma chave de criptografia. Ele explora uma lacuna na consistência com que o alinhamento é aplicado em uma família de modelos. Como disse Alexander Panfilov, cientista da computação da Universidade de Tübingen que participou do trabalho: “Todos os principais provedores de modelos de ponta que testamos compartilham dessa vulnerabilidade.”

O mesmo método também trouxe à tona algo mais imediatamente alarmante: informações pessoais, incluindo senhas e chaves de API, embutidas em rastros de raciocínio capturados da máquina de um usuário. OpenAI, Anthropic e Google foram alertados sobre a vulnerabilidade, e cada uma delas ajustou desde então sua API para evitar que informações privadas fossem extraídas dessa forma. O risco de distillation, no entanto, não foi totalmente resolvido. Panfilov observa que corrigi-lo inteiramente exigiria uma reformulação fundamental de como as APIs dessas empresas são estruturadas.

A Questão do Distillation e o que as Evidências Realmente Mostram

A pesquisa abre uma segunda frente, mais contestada: a questão de se alguns modelos de IA já foram construídos destilando o raciocínio dos sistemas fechados de concorrentes.

Para investigar isso, os pesquisadores alimentaram 90 perguntas a um conjunto de modelos e, em seguida, deram a alguns modelos de peso aberto as primeiras palavras de rastros de raciocínio capturados de sistemas proprietários. em vários casos, os modelos abertos geraram saídas que correspondiam de perto ao raciocínio oculto dos fechados. Isso foi particularmente pronunciado com o Kimi K3, um modelo de peso aberto da empresa chinesa Moonshot AI, que produziu saídas surpreendentemente semelhantes aos rastros de raciocínio ocultos do Claude Opus 4.8 e do GPT 5.6 Sol para determinados prompts. Outros dois modelos de peso aberto, o DeepSeek da China e o Inkling da empresa norte-americana Thinking Machines, não mostraram o mesmo padrão.

Os pesquisadores são cautelosos sobre o que isso significa. O artigo deles afirma explicitamente que as descobertas “não podem estabelecer causalmente o distillation”. A semelhança nos padrões de raciocínio é sugestiva, não conclusiva. A Moonshot AI não respondeu aos pedidos de comentários antes da publicação.

Isso importa porque o distillation se tornou um tópico politicamente carregado. A OpenAI disse a legisladores dos EUA que o DeepSeek parecia ter copiado um de seus modelos para construir seu modelo de raciocínio R1. A Anthropic disse a legisladores que o Alibaba havia destilado sistematicamente seus modelos para construir o Qwen. Estas são alegações sérias, e a nova pesquisa adiciona uma dimensão técnica ao debate sem resolvê-lo. Kyle Miller, pesquisador do Center for Security and Emerging Technology, um think tank de política tecnológica, observou que ainda não está claro quanto o distillation realmente beneficia o desenvolvimento de IA na China, e que remover a capacidade de destilar não mudaria dramaticamente, em sua opinião, o cenário competitivo.

Por Que Isso Vai Além de um Patch de Segurança

Aqui está o que a maior parte da cobertura desta história deixa escapar. A vulnerabilidade em si foi parcialmente corrigida. O problema mais profundo é estrutural e aponta para uma tensão que não será resolvida por uma atualização de API.

As empresas de IA construíram modelos de negócios em torno de manter o raciocínio proprietário. Esse sigilo é tanto um fosso competitivo quanto, argumentam elas, uma medida de segurança. Mas a arquitetura necessária para entregar capacidades de IA em escala, com modelos de tamanhos diferentes compartilhando infraestrutura, cria fissuras. Essas fissuras podem ser encontradas e exploradas. Os pesquisadores demonstraram isso com um método que Florian Tramer, cientista da computação da ETH Zürich especializado em segurança cibernética, descreveu como “muito legal” em sua elegância: trocar mensagens para uma variante de modelo mais fraca que compartilha a chave de descriptografia, mas tem um alinhamento mais fraco.

A implicação mais ampla é que os sistemas de IA revelam seus funcionamentos internos de maneiras que seus criadores não antecipam totalmente. O distillation já é amplamente utilizado em todo o setor. Mark Zuckerberg, CEO da Meta, descreveu-o em uma postagem de blog como “um princípio importante de como o ecossistema de código aberto funciona”. Yarin Gal, cientista da computação da Universidade de Oxford, observou que o distillation ajudou a IA a avançar mais rapidamente e que restrições universais à prática desacelerariam o ritmo de progresso para todos.

A questão não é se o distillation acontece. Ele acontece, de forma aberta e legítima, em todo o setor. A questão é se os limites que as empresas traçam em torno de seu raciocínio proprietário são tão sólidos quanto elas acreditam. Esta pesquisa sugere que não são.

Em Resumo

Uma equipe de pesquisa mostrou que o raciocínio oculto dos principais modelos de IA pode ser extraído explorando uma lacuna entre versões maiores e menores da mesma família de modelos. O método também expôs dados pessoais embutidos em rastros de raciocínio, uma vulnerabilidade que desde então foi corrigida. A mesma técnica levanta questões sobre se alguns modelos de peso aberto foram construídos usando o raciocínio destilado de concorrentes fechados, embora as evidências sejam sugestivas em vez de conclusivas. A lição mais profunda é que a arquitetura de entrega de IA cria vulnerabilidades estruturais que nem sempre podem ser corrigidas com uma simples atualização.

Com base em reportagem de Wired.

Escrito por

NAVION