La IA de plegamiento de proteínas ha sido uno de los avances científicos más celebrados de los últimos años. Sin embargo, una limitación silenciosa ha ido gestándose bajo la superficie. Los modelos que predicen cómo interactúan las proteínas con posibles medicamentos solo son tan buenos como los datos con los que fueron entrenados, y resulta que esos datos son mucho más escasos de lo que la mayoría imagina. Un consorcio de empresas farmacéuticas acaba de demostrar que desbloquear datos moleculares patentados, mantenidos en privado por razones competitivas, puede cerrar esa brecha sustancialmente.
El problema de la cámara acorazada de datos en el centro del descubrimiento de fármacos
El Protein Data Bank, conocido como PDB, es el repositorio abierto que hizo posible AlphaFold 2. Contiene más de 200,000 estructuras de proteínas determinadas experimentalmente, y su escala fue fundamental para la precisión revolucionaria de AlphaFold 2, una contribución reconocida con el Premio Nobel de Química 2024.
Pero la siguiente generación de herramientas de IA de proteínas se enfrenta a un desafío diferente. Modelos como AlphaFold 3 están diseñados no solo para predecir las formas de las proteínas, sino para predecir cómo interactúan las proteínas con otras moléculas, incluidos los medicamentos candidatos. Aquí es donde el PDB se queda corto. Según Paul Mortenson, vicepresidente de química computacional e informática en Astex Pharmaceuticals, el PDB contiene solo alrededor de 10,000 estructuras determinadas experimentalmente que muestran proteínas interactuando con moléculas similares a fármacos. Esa es una cifra pequeña en relación con la diversidad de interacciones moleculares que requiere el descubrimiento de fármacos.
El resto de esos datos se encuentra dentro de las empresas farmacéuticas. Generadas mediante técnicas como la cristalografía de rayos X y la crio-microscopía electrónica, estas estructuras nunca se depositaron en bases de datos públicas porque están relacionadas con programas de desarrollo de fármacos patentados. El volumen total de estos datos privados es desconocido, pero algunas estimaciones sugieren que podría superar lo que contiene el PDB. Como señaló John Karanicolas, director de descubrimiento de fármacos computacional en AbbVie, los datos que faltan en el PDB son precisamente los datos presentes en los sistemas internos de las empresas farmacéuticas.
Qué pasa cuando pones en común los datos privados
Para comprobar si esos datos privados podían mejorar el rendimiento de la IA, AbbVie, Astex y varias otras empresas farmacéuticas formaron una colaboración llamada AI Structural Biology Network, o AISB. El grupo tomó OpenFold3, una réplica de código abierto de AlphaFold 3 que solo se había entrenado con datos públicos del PDB, y lo perfeccionó con otras 20,167 estructuras de proteínas patentadas. Estas estructuras procedían de cinco empresas y se compartieron de manera que los datos de cada firma se mantuvieron privados frente a las demás.
Los resultados fueron notables. Cuando el modelo de AISB se probó con 1,056 estructuras de proteínas y ligandos retenidas del entrenamiento, predijo más de la mitad de ellas con un alto nivel de precisión. La versión de código abierto disponible públicamente de OpenFold3, entrenada solo con datos públicos, logró el mismo rendimiento en apenas un tercio de esas estructuras. Un modelo de código abierto rival llamado Boltz-2 alcanzó alrededor del 40%.
Mohammed AlQuraishi, un biólogo computacional de la Universidad de Columbia que participó en el esfuerzo, describió la mejora como “un aumento bastante grande en el rendimiento”. Karanicolas señaló que el modelo de AISB también superó a los modelos entrenados únicamente con los datos de cada empresa individual, lo que subraya un punto clave: poner la información en común entre organizaciones produce resultados que ninguna organización individual podría lograr por sí sola.
El estudio se ha descrito en una entrada de blog y todavía no ha sido revisado por pares. El modelo en sí no está disponible públicamente. El equipo planea enviar el trabajo a una revista revisada por pares.
Por qué esto importa más allá del laboratorio
Esto es lo que la mayor parte de la cobertura sobre la IA de proteínas pasa por alto: el cuello de botella en el descubrimiento de fármacos no es la potencia informática, ni tampoco la sofisticación algorítmica. Son los datos. En concreto, es el tipo correcto de datos, ejemplos estructurados de proteínas que se unen a moléculas similares a fármacos, que reflejan la diversidad química real con la que se encuentran los investigadores al desarrollar nuevos medicamentos.
El experimento de AISB es una prueba de concepto para una idea más amplia: que el progreso científico en el descubrimiento de fármacos asistido por IA puede depender menos de construir modelos más inteligentes y más de construir mejores estructuras para compartir datos. El instinto competitivo de mantener los datos moleculares en privado es comprensible, pero los resultados de AISB sugieren que compartir datos de forma colectiva, incluso entre rivales, produce herramientas que benefician a todos.
Esta dinámica no es exclusiva de la industria farmacéutica. Hace eco de un patrón visible en todo el desarrollo de IA: las organizaciones que pueden agregar datos de entrenamiento diversos y de alta calidad obtienen capacidades que las que trabajan de forma aislada no pueden igualar. En el descubrimiento de fármacos, lo que está en juego es especialmente importante. Una predicción mejorada de proteínas y ligandos podría acelerar la identificación de candidatos a fármacos viables, reducir el coste de la investigación en fase inicial y, en última instancia, acortar el camino desde la hipótesis de laboratorio hasta el tratamiento clínico.
Los esfuerzos financiados con fondos públicos también se están moviendo en esta dirección. Un proyecto llamado OpenBind, respaldado por hasta 8 millones de libras esterlinas de financiación del gobierno del Reino Unido, ya ha publicado cientos de nuevas estructuras de proteínas, con miles más planificadas.
En resumen
Los modelos de IA de plegamiento de proteínas tienen un problema de datos: las bases de datos públicas contienen muy pocos ejemplos de proteínas que interactúen con moléculas similares a fármacos. Un consorcio de empresas farmacéuticas demostró que entrenar con más de 20,000 estructuras patentadas, compartidas entre cinco empresas, elevó la precisión de las predicciones de aproximadamente un tercio a más de la mitad de los casos de prueba. El hallazgo replantea el desafío en el descubrimiento de fármacos asistido por IA: el factor limitante no es el algoritmo, es el acceso a los datos correctos, y compartir esos datos, incluso entre competidores, produce resultados que ninguna organización individual puede lograr por sí sola.
Basado en información de Nature: Machine Learning.