Durante décadas, comprender cómo funcionan los virus a nivel molecular ha exigido un trabajo de laboratorio meticuloso, equipos costosos y años de esfuerzo. Una parte importante de este desafío se reduce a una pregunta engañosamente simple: ¿cómo son realmente las proteínas virales en tres dimensiones y cómo interactúan entre sí? Una gran ampliación de la base de datos de estructuras de proteínas AlphaFold está respondiendo ahora a esa pregunta a una escala que antes era inimaginable.
Los investigadores han añadido más de 8.000 dímeros de proteínas virales, que son pares de moléculas de proteína que interactúan, a la base de datos de AlphaFold. Estas estructuras provienen de 23 familias de virus, todas las cuales incluyen miembros capaces de infectar a los humanos. La incorporación forma parte de un portal de preparación para pandemias lanzado recientemente dentro de la base de datos, el cual es mantenido por el Instituto Europeo de Bioinformática del Laboratorio Europeo de Biología Molecular (EMBL-EBI) en Hinxton, Reino Unido, y está disponible de forma gratuita para sus más de tres millones de usuarios en todo el mundo.
Por qué los virus fueron un punto ciego desde el principio
La base de datos de AlphaFold ya contiene estructuras predichas para la gran mayoría de las proteínas conocidas en la Tierra. Los virus, sin embargo, han sido un vacío persistente. Joe Grove, un virólogo molecular de la Universidad de Glasgow, los describe claramente como un punto ciego. El motivo es en parte biológico y en parte técnico.
Muchos virus, incluidos los flavivirus como el Zika y el dengue, se replican produciendo primero una única molécula grande llamada poliproteína. Esa poliproteína se corta después en proteínas funcionales individuales. El problema es que la secuencia genética de un virus no siempre deja claro dónde termina una proteína y dónde empieza la siguiente. Esta ambigüedad conduce a predicciones de estructuras incompletas o inexactas, por lo que hasta ahora han faltado entradas de gran calidad para muchas proteínas virales.
Para solucionar esto, los investigadores del Instituto Suizo de Bioinformática en Ginebra identificaron secuencias precisas para miles de proteínas virales derivadas de poliproteínas. El equipo en su conjunto analizó entonces secuencias de 41.774 proteínas procedentes de unos 2.800 virus, incluidos los responsables de la viruela del mono (mpox), el sarampión y la hepatitis B.
Qué se añadió y qué se quedó fuera
Utilizando AlphaFold2, el equipo de investigación generó predicciones para 40.746 homodímeros (pares de cadenas de proteínas idénticas) y casi 1,7 millones de heterodímeros (pares de moléculas diferentes). No todas estas llegaron a la base de datos pública. Solo 2.749 de los homodímeros y 5.279 de los heterodímeros se consideraron lo suficientemente precisos para su inclusión, aunque todas las predicciones se hicieron públicas de todos modos.
La distinción importa. Estar incluido en la base de datos seleccionada indica un nivel de confianza que hace que los datos sean más útiles de inmediato para los investigadores que diseñan experimentos o desarrollan tratamientos. El conjunto más amplio de predicciones, aunque accesible, requiere una mayor cautela en su interpretación.
También existen limitaciones conocidas sobre lo que capturan estas predicciones. Las estructuras actuales no incluyen las moléculas de azúcar que recubren muchas proteínas virales y les ayudan a evadir el sistema inmunitario. Los complejos proteicos más grandes, conocidos como trímeros o ensamblajes de mayor orden, tampoco aparecen en la base de datos en muchos casos. La proteína de la espícula que permite al SARS-CoV-2 y a otros coronavirus infectar las células huésped, por ejemplo, está compuesta por tres proteínas idénticas. Lo mismo ocurre con la proteína de entrada de la envuelta del VIH. Las predicciones a nivel de dímero para estas estructuras no fueron lo suficientemente precisas como para incluirlas. Sameer Velankar, un bioinformático de EMBL-EBI, reconoce que añadir predicciones de trímeros es el siguiente paso lógico, aunque los complejos más grandes presentan un desafío adicional: no siempre está claro cuántas copias de cada componente contienen.
Qué significa esto más allá del laboratorio
Esto es lo que la mayor parte de la cobertura sobre este desarrollo pasa por alto: la importancia no radica solo en tener más datos. Consiste en cambiar la velocidad y la accesibilidad de un paso fundamental en virología.
Históricamente, determinar la estructura tridimensional de una proteína requería cristalografía de rayos X o crio-microscopía electrónica, ambas consumidoras de tiempo, intensivas en recursos y dependientes de muestras físicas. AlphaFold2 genera predicciones de forma computacional, a partir de datos de secuencias únicamente. Ese cambio significa que los investigadores en instituciones sin acceso a una infraestructura de imagen costosa pueden interactuar ahora con datos estructurales que antes estaban fuera de su alcance.
El enfoque de preparación para pandemias también merece ser tomado en serio. Cuando surge un nuevo virus, una de las primeras prioridades científicas es comprender sus proteínas: cómo funcionan, cómo interactúan y dónde podrían ser vulnerables a fármacos o anticuerpos. Disponer de una base de datos seleccionada y de libre acceso sobre estructuras de proteínas virales no sustituye a la validación de laboratorio, pero reduce el tiempo transcurrido entre que aparece un nuevo patógeno y el momento en que se obtienen las dianas moleculares que vale la pena investigar.
El propio Grove plantea la siguiente fase en términos prácticos: el valor de los datos se hará evidente a medida que los equipos de investigación comiencen a trabajar con ellos, contrastando las predicciones con los resultados experimentales e identificando qué estructuras se sostienen bajo escrutinio.
En resumen
La base de datos de AlphaFold ha incorporado más de 8.000 estructuras de pares de proteínas virales de 23 familias de virus que infectan a humanos, junto con un nuevo portal de preparación para pandemias. Esta ampliación aborda un vacío de larga data provocado por la complejidad de las poliproteínas virales. Siguen existiendo limitaciones, como la ausencia de revestimientos de moléculas de azúcar y la exclusión de complejos proteicos más grandes. Lo que esta adición representa, en esencia, es una reducción significativa en la barrera entre un brote viral y la comprensión a nivel molecular de aquello a lo que se enfrentan los investigadores.
Basado en información de Nature: Machine Learning.