Jahrzehntelang erforderte das Verstehen der Funktionsweise von Viren auf molekularer Ebene mühsame Laborarbeit, teure Ausrüstung und jahrelangen Aufwand. Ein erheblicher Teil dieser Herausforderung lässt sich auf eine trügerisch einfache Frage reduzieren: Wie sehen virale Proteine in drei Dimensionen tatsächlich aus, und wie interagieren sie miteinander? Eine massive Erweiterung der AlphaFold Protein Structure Database geht diese Frage nun in einem zuvor unvorstellbaren Maßstab an.
Forschende haben mehr als 8.000 Virus-Proteindimere, bei denen es sich um Paare interagierender Proteinmoleküle handelt, zur AlphaFold-Datenbank hinzugefügt. Diese Strukturen stammen aus 23 Virusfamilien, von denen alle Mitglieder umfassen, die Menschen infizieren können. Die Ergänzung ist Teil eines neu gestarteten Portals zur Pandemievorsorge innerhalb der Datenbank, die vom European Bioinformatics Institute des European Molecular Biology Laboratory (EMBL-EBI) im britischen Hinxton betreut wird und ihren weltweit mehr als drei Millionen Nutzern frei zur Verfügung steht.
Warum Viren von vornherein ein blinder Fleck waren
Die AlphaFold-Datenbank enthält bereits vorhergesagte Strukturen für die überwiegende Mehrheit der bekannten Proteine auf der Erde. Viren blieben jedoch eine hartnäckige Lücke. Joe Grove, ein molekularer Virologe an der University of Glasgow, beschreibt sie unverblümt als einen blinden Fleck. Der Grund dafür ist teils biologischer und teils technischer Natur.
Viele Viren, darunter Flaviviren wie Zika und Dengue, replizieren sich, indem sie zunächst ein einziges großes Molekül namens Polyprotein produzieren. Dieses Polyprotein wird dann in einzelne funktionelle Proteine zerschnitten. Das Problem ist, dass die genetische Sequenz eines Virus nicht immer offensichtlich macht, wo ein Protein endet und das nächste beginnt. Diese Mehrdeutigkeit führt zu unvollständigen oder ungenauen Strukturvorhersagen, weshalb hochwertige Einträge für viele virale Proteine bisher fehlten.
Um dem zu begegnen, identifizierten Forschende des Swiss Institute of Bioinformatics in Genf präzise Sequenzen für Tausende virale Proteine, die von Polyproteinen abstammen. Das breitere Team analysierte daraufhin Sequenzen von 41.774 Proteinen aus rund 2.800 Viren, einschließlich derer, die für Mpox, Masern und Hepatitis B verantwortlich sind.
Was hinzugefügt wurde und was weggelassen wurde
Unter Verwendung von AlphaFold2 generierte das Forschungsteam Vorhersagen für 40.746 Homodimere (Paare identischer Proteinfäden) und fast 1,7 Millionen Heterodimere (Paare verschiedener Moleküle). Nicht alle davon schafften es in die öffentliche Datenbank. Lediglich 2.749 der Homodimere und 5.279 der Heterodimere wurden als genau genug für eine Aufnahme eingestuft, obwohl alle Vorhersagen unabhängig davon öffentlich zugänglich gemacht wurden.
Diese Unterscheidung ist wichtig. Die Aufnahme in die kuratierte Datenbank signalisiert ein Maß an Zuverlässigkeit, das die Daten für Forschende, die Experimente entwerfen oder Behandlungen entwickeln, sofort nützlicher macht. Der breitere Satz an Vorhersagen ist zwar zugänglich, erfordert bei der Interpretation jedoch mehr Vorsicht.
Es gibt zudem bekannte Einschränkungen hinsichtlich dessen, was diese Vorhersagen erfassen. Die aktuellen Strukturen beinhalten nicht die Zuckermoleküle, die viele virale Proteine umhüllen und ihnen helfen, dem Immunsystem zu entkommen. Größere Proteinkomplexe, bekannt als Trimere oder Anordnungen höherer Ordnung, fehlen in der Datenbank in vielen Fällen ebenfalls. Das Spike-Protein, das SARS-CoV-2 und anderen Coronaviren ermöglicht, Wirtszellen zu infizieren, besteht beispielsweise aus drei identischen Proteinen. Dasselbe gilt für das Hülleneintrittsprotein von HIV. Vorhersagen auf Dimerebene für diese Strukturen waren nicht genau genug für eine Aufnahme. Sameer Velankar, Bioinformatiker am EMBL-EBI, räumt ein, dass das Hinzufügen von Trimervorhersagen ein logischer nächster Schritt ist, obwohl größere Komplexe eine zusätzliche Herausforderung darstellen: Es ist nicht immer klar, wie viele Kopien jeder Komponente sie enthalten.
Was das jenseits des Labors bedeutet
Hier ist, was die meiste Berichterstattung über diese Entwicklung übersieht: Die Bedeutung liegt nicht nur darin, mehr Daten zu haben. Es geht darum, die Geschwindigkeit und Zugänglichkeit eines grundlegenden Schritts in der Virologie zu verändern.
Historisch gesehen erforderte die Bestimmung der dreidimensionalen Struktur eines Proteins entweder Röntgendiffraktometrie oder Kryo-Elektronenmikroskopie, die beide zeitaufwendig, ressourcenintensiv und auf physische Proben angewiesen sind. AlphaFold2 generiert Vorhersagen computergestützt, allein aus Sequenzdaten. Dieser Wandel bedeutet, dass Forschende in Institutionen ohne Zugang zu teurer Bildgebungsinfrastruktur nun mit Strukturdaten arbeiten können, die zuvor unerreichbar waren.
Der Rahmen der Pandemievorsorge ist ebenfalls ernst zu nehmen. Wenn ein neuartiges Virus auftaucht, besteht eine der ersten wissenschaftlichen Prioritäten darin, seine Proteine zu verstehen: wie sie funktionieren, wie sie interagieren und wo sie für Medikamente oder Antikörper angreifbar sein könnten. Eine kuratierte, frei zugängliche Datenbank mit viralen Proteinstrukturen ersetzt zwar keine Laborvalidierung, aber sie verkürzt die Zeit zwischen der Feststellung, dass ein neuer Pathogen aufgetaucht ist, und der Bereitstellung der molekularen Ziele, die es zu untersuchen lohnt.
Grove selbst fasst die nächste Phase in praktischen Worten zusammen: Der Wert der Daten wird deutlich werden, sobald die Forschungsteams damit zu arbeiten beginnen, Vorhersagen gegen experimentelle Ergebnisse testen und herausfinden, welche Strukturen einer Überprüfung standhalten.
Kurz gesagt
Die AlphaFold-Datenbank hat mehr als 8.000 virale Proteinpaar-Strukturen aus 23 menschliche Infektionen verursachenden Virusfamilien hinzugefügt, zusammen mit einem neuen Portal zur Pandemievorsorge. Die Erweiterung adressiert eine langanhaltende Lücke, die durch die Komplexität viralcher Polyproteine verursacht wurde. Einschränkungen bleiben bestehen, darunter das Fehlen von Zuckermolekül-Hüllen und der Ausschluss größerer Proteinkomplexe. Was diese Ergänzung im Kern darstellt, ist eine bedeutsame Verringerung der Barriere zwischen einem viralen Ausbruch und einem molekularen Verständnis dessen, womit Forschende es zu tun haben.
Basierend auf Berichten von Nature: Machine Learning.