The Brief
Wissenschaft und Entdeckung 4 Min. Lesezeit

Von einem Drittel zu über der Hälfte: Wie Pharma-Daten Protein-KI neu gestalten

NAVION

Teilen

Die Protein-Folding-KI war einer der gefeierten wissenschaftlichen Fortschritte der letzten Jahre. Dennoch hat sich unter der Oberfläche eine leise Einschränkung aufgebaut. Die Modelle, die vorhersagen, wie Proteine mit potenziellen Wirkstoffen interagieren, sind nur so gut wie die Daten, mit denen sie trainiert wurden, und diese Daten sind, wie sich herausstellt, weitaus spärlicher, als die meisten Menschen denken. Ein Konsortium von Pharmaunternehmen hat nun gezeigt, dass die Freigabe geschützter molekularer Daten, die aus Wettbewerbsgründen unter Verschluss gehalten wurden, diese Lücke erheblich schließen kann.

Das Daten-Tresor-Problem im Herzen der Wirkstoffforschung

Die Protein Data Bank, bekannt als PDB, ist das offene Repository, das AlphaFold 2 möglich gemacht hat. Sie enthält mehr als 200.000 experimentell ermittelte Proteinstrukturen, und ihr Umfang war entscheidend für die bahnbrechende Genauigkeit von AlphaFold 2, ein Beitrag, der mit dem Nobelpreis für Chemie 2024 gewürdigt wurde.

Aber die nächste Generation von Protein-KI-Tools steht vor einer anderen Herausforderung. Modelle wie AlphaFold 3 sind nicht nur darauf ausgelegt, Proteinformen vorherzusagen, sondern auch vorherzusagen, wie Proteine mit anderen Molekülen, einschließlich Wirkstoffkandidaten, interagieren. Hier stößt die PDB an ihre Grenzen. Laut Paul Mortenson, Vizepräsident für Computational Chemistry und Informatik bei Astex Pharmaceuticals, enthält die PDB nur etwa 10.000 experimentell ermittelte Strukturen, die Proteine in Wechselwirkung mit wirkstoffähnlichen Molekülen zeigen. Das ist eine kleine Zahl im Vergleich zur Vielfalt molekularer Wechselwirkungen, die die Wirkstoffforschung erfordert.

Der Rest dieser Daten befindet sich in Pharmaunternehmen. Generiert durch Techniken wie Röntgenkristallographie und Kryo-Elektronenmikroskopie, wurden diese Strukturen nie in öffentlichen Datenbanken hinterlegt, weil sie sich auf proprietäre Wirkstoffentwicklungsprogramme beziehen. Das Gesamtvolumen dieser privaten Daten ist unbekannt, aber einige Schätzungen legen nahe, dass es das übertreffen könnte, was die PDB enthält. Wie John Karanicolas, Leiter der computergestützten Wirkstoffforschung bei AbbVie, es ausdrückte: Die in der PDB fehlenden Daten sind genau die Daten, die in den internen Systemen der Pharmaunternehmen vorhanden sind.

Was passiert, wenn du die privaten Daten bündelst

Um zu testen, ob diese privaten Daten die KI-Leistung verbessern können, haben AbbVie, Astex und mehrere andere Pharmaunternehmen eine Zusammenarbeit namens AI Structural Biology Network, oder AISB, gegründet. Die Gruppe nahm OpenFold3, eine Open-Source-Replikation von AlphaFold 3, die nur mit öffentlichen PDB-Daten trainiert worden war, und passte sie mit zusätzlichen 20.167 proprietären Proteinstrukturen fein an. Diese Strukturen stammten von fünf Unternehmen und wurden auf eine Weise geteilt, die die Daten jeder einzelnen Firma vor den anderen geheim hielt.

Die Ergebnisse waren bemerkenswert. Als das AISB-Modell gegen 1.056 Protein-Ligand-Strukturen getestet wurde, die beim Training zurückgehalten worden waren, sagte es mehr als die Hälfte davon mit einem hohen Maß an Genauigkeit voraus. Die öffentlich zugängliche Version von OpenFold3, die nur mit öffentlichen Daten trainiert wurde, erreichte dieselbe Leistung bei nur einem Drittel dieser Strukturen. Ein konkurrierendes Open-Source-Modell namens Boltz-2 erreichte etwa 40 Prozent.

Mohammed AlQuraishi, ein Bioinformatiker an der Columbia University, der an der Bemühung teilnahm, beschrieb die Verbesserung als einen ziemlichen Leistungssprung. Karanicolas wies darauf hin, dass das AISB-Modell auch Modelle übertraf, die nur mit den Daten der einzelnen Unternehmen trainiert wurden, was einen wichtigen Punkt unterstreicht: Die Bündelung von Informationen über Organisationen hinweg erzeugt Ergebnisse, die keine einzelne Organisation unabhängig erreichen könnte.

Die Studie wurde in einem Blogbeitrag beschrieben und wurde noch nicht von Fachleuten begutachtet. Das Modell selbst ist nicht öffentlich verfügbar. Das Team plant, die Arbeit bei einer begutachteten Zeitschrift einzureichen.

Warum das über das Labor hinaus wichtig ist

Hier ist, was die meiste Berichterstattung über Protein-KI übersieht: Der Flaschenhals in der Wirkstoffforschung ist nicht die Rechenleistung und auch nicht die algorithmische Raffinesse. Es sind Daten. Genauer gesagt ist es die richtige Art von Daten, strukturierte Beispiele von Proteinen, die an wirkstoffähnliche Moleküle binden, die die tatsächliche chemische Vielfalt widerspiegeln, auf die Forscher bei der Entwicklung neuer Medikamente stoßen.

Das AISB-Experiment ist ein Machbarkeitsnachweis für eine breitere Idee: dass der wissenschaftliche Fortschritt in der KI-gestützten Wirkstoffforschung möglicherweise weniger vom Bau smarterer Modelle und mehr vom Aufbau besserer Datenaustauschstrukturen abhängt. Der Wettbewerbsinstinkt, molekulare Daten privat zu halten, ist verständlich, aber die AISB-Ergebnisse legen nahe, dass kollektiver Datenaustausch, selbst unter Rivalen, Tools hervorbringt, von denen alle profitieren.

Diese Dynamik ist nicht auf die Pharmaindustrie beschränkt. Sie spiegelt ein Muster wider, das in der gesamten KI-Entwicklung sichtbar ist: Die Organisationen, die diverse, qualitativ hochwertige Trainingsdaten aggregieren können, erlangen Fähigkeiten, mit denen diejenigen, die isoliert arbeiten, nicht mithalten können. In der Wirkstoffforschung steht besonders viel auf dem Spiel. Eine verbesserte Protein-Ligand-Vorhersage könnte die Identifizierung lebensfähiger Wirkstoffkandidaten beschleunigen, die Kosten der Frühphasenforschung senken und letztendlich den Weg von der Laborhypothese zur klinischen Behandlung verkürzen.

Öffentlich finanzierte Bemühungen bewegen sich ebenfalls in diese Richtung. Ein Projekt namens OpenBind, das mit bis zu 8 Millionen Pfund britischer Regierungsförderung unterstützt wird, hat bereits Hunderte neuer Proteinstrukturen veröffentlicht, wobei Tausende weitere geplant sind.

Kurz gefasst

KI-Modelle zur Proteinfaltung haben ein Datenproblem: Öffentliche Datenbanken enthalten zu wenige Beispiele von Proteinen, die mit wirkstoffähnlichen Molekülen interagieren. Ein Konsortium von Pharmaunternehmen hat gezeigt, dass das Training mit mehr als 20.000 proprietären Strukturen, gebündelt über fünf Firmen hinweg, die Vorhersagegenauigkeit von etwa einem Drittel auf mehr als die Hälfte der Testfälle steigerte. Die Erkenntnis neu formuliert die Herausforderung in der KI-gestützten Wirkstoffforschung: Der limitierende Faktor ist nicht der Algorithmus, es ist der Zugang zu den richtigen Daten, und das Teilen dieser Daten, selbst unter Wettbewerbern, bringt Ergebnisse hervor, die keine einzelne Organisation allein erreichen kann.

Basierend auf Berichten von Nature: Machine Learning.

Geschrieben von

NAVION