Los modelos de IA de frontera mantienen su secreto su secreto. O al menos eso creían las empresas que los desarrollan. Un equipo de informáticos ha demostrado ahora que este secretismo es más frágil de lo que se suponía, con implicaciones que van desde la seguridad de los datos personales hasta la geopolítica del desarrollo de la IA.
La vulnerabilidad oculta a plena vista
Cuando los modelos de IA avanzados abordan problemas complejos, no se limitan a dar una respuesta. Trabajan a través de una cadena de pensamiento, dividiendo el problema en pasos y analizando cada uno en secuencia. Las empresas tratan estos rastros de razonamiento como propiedad exclusiva. Revelarlos permitiría a la competencia utilizarlos para entrenar nuevos modelos, un proceso conocido como destilación. Para evitarlo, las empresas cifran el razonamiento y lo envían a la máquina del usuario en una forma que supuestamente no debe ser legible.
La palabra clave es “supuestamente”. Investigadores de la Universidad de Tubinga, el Instituto Max Planck, el instituto de seguridad de la IA MATS Research y la empresa de seguridad Snyk identificaron una debilidad estructural en la forma en que este cifrado funciona en la práctica. La mayoría de los principales proveedores de IA ofrecen sus modelos en varios tamaños. Los modelos más grandes son más capaces y más caros de ejecutar; las versiones más pequeñas existen para los usuarios que buscan menores costos. Curiosamente, los modelos más pequeños comparten la misma infraestructura de descifrado que sus homólogos más grandes, pero han recibido menos entrenamiento de alineación. Esto significa que es menos probable que se nieguen a revelar lo que están procesando.
Al alimentar con rastros de razonamiento cifrados a una versión más pequeña de la misma familia de modelos, los investigadores descubrieron que podían recuperar el razonamiento oculto que el modelo más grande había producido. El ataque no requiere romper ninguna clave de cifrado. Exota una brecha en la consistencia con la que se aplica la alineación en una familia de modelos. Tal como lo expresó Alexander Panfilov, un informático de la Universidad de Tubinga que participó en el trabajo: “Todos los principales proveedores de modelos de frontera que probamos comparten esta vulnerabilidad”.
El mismo método también sacó a la luz algo más alarmante de forma inmediata: información personal, incluidas contraseñas y claves API, incrustada en los rastros de razonamiento capturados desde la máquina de un usuario. OpenAI, Anthropic y Google fueron alertados sobre la vulnerabilidad y cada una ha ajustado desde entonces su API para evitar que se extraiga información privada de esta manera. Sin embargo, el riesgo de destilación no se ha resuelto por completo. Panfilov señala que solucionarlo por completo requeriría una revisión fundamental de cómo están estructuradas las API de estas empresas.
La cuestión de la destilación y lo que los datos realmente muestran
La investigación abre un segundo frente, más disputado: la cuestión de si algunos modelos de IA ya se han construido destilando el razonamiento de los sistemas cerrados de la competencia.
Para investigar esto, los investigadores plantearon 90 preguntas a un conjunto de modelos, y luego proporcionaron a algunos modelos de pesos abiertos las primeras palabras de los rastros de razonamiento capturados de sistemas propietarios. En varios casos, los modelos abiertos generaron resultados que coincidían estrechamente con el razonamiento oculto de los cerrados. Esto fue especialmente pronunciado con Kimi K3, un modelo de pesos abiertos de la empresa china Moonshot AI, que produjo resultados sorprendentemente similares a los rastros de razonamiento ocultos de Claude Opus 4.8 y GPT 5.6 Sol para ciertos prompts. Otros dos modelos de pesos abiertos, DeepSeek de China e Inkling de la empresa estadounidense Thinking Machines, no mostraron el mismo patrón.
Los investigadores son cautelosos sobre lo que esto significa. Su documento establece explícitamente que los hallazgos “no pueden establecer causalmente la destilación”. La similitud en los patrones de razonamiento es sugestiva, no concluyente. Moonshot AI no respondió a las solicitudes de comentarios antes de su publicación.
Esto importa porque la destilación se ha convertido en un tema políticamente cargado. OpenAI dijo a los legisladores estadounidenses que DeepSeek parecía haber copiado uno de sus modelos para construir su modelo de razonamiento R1. Anthropic dijo a los legisladores que Alibaba había destilado sistemáticamente sus modelos para construir Qwen. Estas son afirmaciones graves, y la nueva investigación añade una dimensión técnica al debate sin zanjarlo. Kyle Miller, investigador del Center for Security and Emerging Technology, un centro de estudios de política tecnológica, ha señalado que sigue sin estar claro cuánto beneficia realmente la destilación al desarrollo de la IA en China, y que eliminar la capacidad de destilar no cambiaría drásticamente, en su opinión, el panorama competitivo.
Por qué esto va más allá de un parche de seguridad
Esto es lo que la mayor parte de la cobertura de esta historia pasa por alto. La vulnerabilidad en sí ha sido parcialmente solucionada. El problema más profundo es estructural y apunta a una tensión que no se resolverá con una actualización de la API.
Las empresas de IA han construido modelos de negocio basados en mantener el razonamiento como propiedad exclusiva. Ese secretismo es tanto una barrera competitiva como, según argumentan, una medida de seguridad. Pero la arquitectura necesaria para ofrecer capacidades de IA a escala, con modelos de diferentes tamaños que comparten infraestructura, crea costuras. Esas costuras se pueden encontrar y explotar. Los investigadores demostraron esto con un método que Florian Tramer, un informático de la ETH Zürich especializado en seguridad informática, describió como “muy genial” en su elegancia: intercambiar mensajes con una variante de modelo más débil que comparte la clave de descifrado pero tiene una alineación más débil.
La implicación más amplia es que los sistemas de IA revelan su funcionamiento interno de formas que sus creadores no anticipan del todo. La destilación ya se utiliza ampliamente en toda la industria. Mark Zuckerberg, director ejecutivo de Meta, la describió en una publicación de blog como “un principio importante de cómo funciona el ecosistema de código abierto”. Yarin Gal, un informático de la Universidad de Oxford, ha señalado que la destilación ha ayudado a que la IA avance más rápidamente, y que las restricciones universales a esta práctica ralentizarían el ritmo de progreso para todos.
La cuestión no es si la destilación ocurre. Lo hace, de forma abierta y legítima, en toda la industria. La cuestión es si los límites que las empresas trazan en torno a su razonamiento propietario son tan sólidos como creen. Esta investigación sugiere que no lo son.
En resumen
Un equipo de investigación ha demostrado que el razonamiento oculto de los principales modelos de IA se puede extraer explotando una brecha entre las versiones más grandes y más pequeñas de la misma familia de modelos. El método también expuso datos personales incrustados en los rastros de razonamiento, una vulnerabilidad que desde entonces ha sido parchada. La misma técnica plantea dudas sobre si algunos modelos de pesos abiertos se construyeron utilizando el razonamiento destilado de competidores cerrados, aunque la evidencia es más sugestiva que concluyente. La lección más profunda es que la arquitectura de entrega de IA crea vulnerabilidades estructurales que no siempre se pueden solucionar con una simple actualización.
Basado en información de Wired.