The Brief
Science et découvertes 5 min de lecture

D'un tiers à plus de la moitié: comment les données pharmaceutiques réinventent l'IA des protéines

NAVION

Partager

L’IA dédiée au repliement des protéines a été l’une des avancées scientifiques les plus saluées de ces dernières années. Pourtant, une limite silencieuse s’est développée sous la surface. Les models qui prédisent comment les protéines interagissent avec des médicaments potentiels ne valent que par les données qui ont servi à les entraîner, et ces données, s’avèrent bien plus clairsemées que la plupart des gens ne le pensent. Un consortium d’entreprises pharmaceutiques vient de démontrer que le fait de libérer des données moléculaires propriétaires, gardées secrètes pour des raisons concurrentielles, permet de combler en grande partie cet écart.

Le problème du coffre-fort de données au cœur de la découverte de médicaments

La Protein Data Bank, connue sous le nom de PDB, est le répertoire ouvert qui a rendu possible AlphaFold 2. Elle contient plus de 200 000 structures protéiques déterminées expérimentalement, et son ampleur a été centrale pour la précision révolutionnaire d’AlphaFold 2, une contribution récompensée par le prix Nobel de chimie 2024.

Mais la prochaine génération d’outils d’IA pour les protéines fait face à un défi différent. Des models comme AlphaFold 3 sont conçus non seulement pour prédire la forme des protéines, mais aussi pour prédire comment les protéines interagissent avec d’autres molécules, y compris des candidats médicaments. C’est là que la PDB montre ses limites. Selon Paul Mortenson, vice-président de la chimie computationnelle et de l’informatique chez Astex Pharmaceuticals, la PDB ne contient qu’environ 10 000 structures déterminées expérimentalement montrant des protéines en interaction avec des molécules de type médicament. C’est un petit nombre par rapport à la diversité des interactions moléculaires qu’exige la découverte de médicaments.

Le reste de ces données réside au sein des entreprises pharmaceutiques. Générées par des techniques telles que la cristallographie aux rayons X et la cryo-microscopie électronique, ces structures n’ont jamais été déposées dans des bases de données publiques parce qu’elles concernent des programmes de développement de médicaments propriétaires. Le volume total de ces données privées est inconnu, mais certaines estimations suggèrent qu’il pourrait dépasser ce que contient la PDB. Comme l’a résumé John Karanicolas, responsable de la découverte de médicaments par IA chez AbbVie, les données manquantes dans la PDB sont précisément les données présentes dans les systèmes internes des entreprises pharmaceutiques.

Ce qui se passe lorsque vous mettez en commun les données privées

Pour tester si ces données privées pouvaient améliorer les performances de l’IA, AbbVie, Astex et plusieurs autres entreprises pharmaceutiques ont formé une collaboration appelée AISB Structural Biology Network, ou AISB. Le groupe a pris OpenFold3, une réplication open-source d’AlphaFold 3 qui n’avait été entraînée que sur les données publiques de la PDB, et l’a affiné sur 20 167 structures protéiques propriétaires supplémentaires. Ces structures provenaient de cinq entreprises et ont été partagées d’une manière qui a préservé la confidentialité des données de chaque firme vis-à-vis des autres.

Les résultats ont été notables. Lorsque le model de l’AISB a été testé sur 1 056 structures protéine-ligand tenues à l’écart de l’entraînement, il a prédit plus de la moitié d’entre elles avec un haut niveau de précision. La version publique d’OpenFold3, entraînée uniquement sur des données publiques, a atteint la même performance sur un tiers seulement de ces structures. Un model open-source concurrent appelé Boltz-2 a atteint environ 40%.

Mohammed AlQuraishi, biologiste computationnel à l’Université Columbia qui a participé à l’effort, a décrit l’amélioration comme un bond assez important en matière de performance. Karanicolas a souligné que le model de l’AISB a également surperformé les models entraînés uniquement sur les données de chaque entreprise individuelle, ce qui met en évidence un point clé: la mise en commun d’informations entre organisations produit des résultats qu’aucune organisation isolée ne pourrait atteindre de manière indépendante.

L’étude a été décrite dans un article de blog et n’a pas encore été évaluée par des pairs. Le model lui-même n’est pas publiquement disponible. L’équipe prévoit de soumettre le travail à une revue à comité de lecture.

Pourquoi cela compte au-delà du laboratoire

Voici ce que la plupart des reportages sur l’IA des protéines oublient: le goulot d’étranglement dans la découverte de médicaments n’est pas la puissance de calcul, et ce n’est pas la sophistication algorithmique. Ce sont les données. Plus précisément, il s’agit du bon type de données, à savoir des exemples structurés de protéines se liant à des molécules de type médicament, qui reflètent la diversité chimique réelle rencontrée par les chercheurs lors du développement de nouveaux médicaments.

L’expérience de l’AISB est une preuve de concept pour une idée plus large, selon laquelle le progrès scientifique dans la découverte de médicaments assistée par l’IA dépend peut-être moins de la construction de models plus intelligents et plus de la construction de meilleures structures de partage de données. L’instinct concurrentiel de garder les données moléculaires privées est compréhensible, mais les résultats de l’AISB suggèrent que le partage collectif de données, même entre rivaux, produit des outils qui profitent à tout le monde.

Cette dynamique n’est pas propre aux produits pharmaceutiques. Elle fait écho à un schéma visible dans l’ensemble du développement de l’IA: les organisations capables d’agréger des données d’entraînement diverses et de haute qualité acquièrent des capacités que celles travaillant en isolation ne peuvent égaler. Dans la découverte de médicaments, les enjeux sont particulièrement élevés. Une prédiction améliorée des interactions protéine-ligand pourrait accélérer l’identification de candidats médicaments viables, réduire le coût de la recherche au stade précoce et, en fin de compte, raccourcir le chemin menant de l’hypothèse de laboratoire au traitement clinique.

Les efforts financés par des fonds publics vont également dans cette direction. Un projet appelé OpenBind, soutenu par un financement du gouvernement britannique pouvant atteindre 8 millions de livres sterling, a déjà publié des centaines de nouvelles structures protéiques, et des milliers d’autres sont prévues.

En bref

Les models d’IA de repliement des protéines ont un problème de données: les bases de données publiques contiennent trop peu d’exemples de protéines interagissant avec des molécules de type médicament. Un consortium d’entreprises pharmaceutiques a démontré que l’entraînement sur plus de 20 000 structures propriétaires, mises en commun entre cinq firmes, a fait passer la précision des prédictions d’environ un tiers à plus de la moitié des cas de test. Cette découverte redéfinit le défi de la découverte de médicaments assistée par l’IA: le facteur limitant n’est pas l’algorithme, c’est l’accès aux bonnes données, et le partage de ces données, même entre concurrents, produit des résultats qu’aucun organisme unique ne peut obtenir seul.

D’après un reportage de Nature: Machine Learning.

Rédigé par

NAVION