L’intelligence artificielle transforme la recherche biologique depuis des années, mais le rythme de cette transformation s’est accéléré au point que même les scientifiques les plus proches du domaine se disent pris au dépourvu. Nature Methods, l’une des revues phares de la discipline, consacre aujourd’hui un deuxième numéro spécial au sujet, à peine deux ans après le premier. Cet intervalle à lui seul en dit long, car dans la plupart des disciplines scientifiques, deux ans suffisent à peine pour reproduire une seule étude. En biologie pilotée par l’IA, c’est le temps nécessaire pour exiger une mise à jour complète.
L’IA réécrit les outils de l’investigation biologique
L’éventail des domaines désormais touchés par l’IA en biologie est frappant. Les chercheurs qui travaillent en protéomique basée sur la spectrométrie de masse, l’étude des protéines à grande échelle, explorent la manière dont l’IA peut contribuer à l’analyse des séquences protéiques, aux interactions protéiques, à la protéomique spatiale et aux études de perturbation. Les ambitions vont encore plus loin, puisque l’intégration multi-omique et la construction de cellules virtuelles basées sur l’IA sont désormais considérées comme des orientations de recherche sérieuses, et non comme des futurs spéculatifs.
La microscopie est un autre domaine qui connaît des changements rapides. Les techniques d’IA issues de la vision par ordinateur sont appliquées à la microscopie à super-résolution pour améliorer les tâches de reconstruction d’images, notamment la réduction du bruit, l’amplification en faible luminosité, la suppression du flou et l’amélioration de la résolution. L’objectif est d’extraire des informations biologiques significatives à l’échelle nanométrique, une échelle où les méthodes d’imagerie traditionnelles peinent. La recherche sur les cellules souches est également transformée, avec des architectures d’IA qui améliorent l’analyse d’images, des modèles génératifs permettant l’augmentation de données et des pipelines automatisés qui réduisent la charge manuelle pesant sur les chercheurs.
L’application la plus ambitieuse sur le plan conceptuel abordée dans ce numéro est peut-être l’idée d’embryons virtuels, c’est-à-dire des reconstructions entièrement numériques du processus d’embryogenèse, conçues pour capturer la dynamique complexe et multi-échelle de la façon dont un organisme se développe à partir d’une seule cellule. Il ne s’agit pas d’une métaphore. Les chercheurs travaillent à la mise au point de systèmes informatiques qui modélisent la biologie du développement dans toute sa complexité.
Des outils pratiques, conçus par des non-ingénieurs
Parallèlement à ces ambitions scientifiques à grande échelle, le numéro met en lumière un aspect plus immédiatement pratique, à savoir que l’IA commence à modifier qui peut créer des logiciels scientifiques et à quelle vitesse.
Une contribution de Nelson Medina et Joergen Kornfeld décrit comment de grands LLM peuvent être utilisés pour générer des outils logiciels personnalisés destinés à des applications scientifiques, sans qu’il soit nécessaire de faire appel à des ingénieurs logiciels dédiés. Leur exemple est MOSS (Microscopy Oriented Segmentation with Supervision), un outil de segmentation conçu par un seul chercheur ayant une expérience limitée en développement logiciel, achevé en l’espace de quelques semaines. C’est un point sur lequel il convient de s’attarder. Historiquement, le développement de logiciels scientifiques a constitué un goulet d’étranglement, nécessitant soit une collaboration avec des ingénieurs, soit des années d’apprentissage autodidacte de la programmation. Ce qui est suggéré ici, c’est que cette barrière est en train de s’abaisser.
Une autre contribution, signée par Henry Pinkard et Nils Norlin, soulève une opportunité pratique différente. Les instruments scientifiques génèrent régulièrement des commandes, des données et des métadonnées qui sont généralement rejetées. Ces chercheurs soutiennent que ce flux de données négligé pourrait être utilisé pour entraîner des systèmes d’IA à mener des expériences de manière autonome à un niveau élevé. Le piège, et il est de taille, est que la concrétisation de ce potentiel nécessite de repenser les données qui doivent être stockées ainsi que les mécanismes de contrôle de la qualité et de surveillance humaine qui doivent être mis en place. Les données existent, mais l’infrastructure permettant de les utiliser de manière responsable n’est pas encore prête.
Ce que cela implique au-delà du laboratoire
Voici ce que la plupart des reportages sur l’IA en biologie oublient, à savoir que la communauté scientifique ne se contente pas d’adopter un nouvel outil. Elle est aux prises avec une mutation de la manière dont la science elle-même est pratiquée, validée et communiquée.
Nature Methods est explicite à ce sujet. À mesure que les IA models prolifèrent dans les domaines biologiques, l’absence de normes communautaires robustes pour évaluer leurs performances, leur reproductibilité et leur durabilité devient un véritable problème. Les foundation models, c’est-à-dire des systèmes d’apprentissage automatique à grande échelle formés sur des ensembles de données vastes et hétérogènes couvrant de multiples domaines, gagnent du terrain en biologie. Pourtant, des méthodes rigoureuses pour évaluer leurs capacités réelles font toujours défaut. Les chercheurs Julio Saez-Rodriguez, Gustavo Stolovitzky et leurs collègues ont examiné ces lacunes et proposé des lignes directrices pour des évaluations plus pertinentes. Une autre contribution aborde l’importance d’une IA ouverte et durable dans la recherche en sciences de la vie.
La position éditoriale de la revue est claire, car la transparence n’est pas optionnelle. Les nouvelles méthodes d’IA ne sont utiles que dans la mesure où elles sont dignes de confiance. Des repères communautaires sont nécessaires pour évaluer si les nouveaux outils représentent de véritables avancées ou simplement des résultats aux formulations impressionnantes.
Il y a également un point fondamental qui mérite d’être souligné. Les systèmes d’IA en biologie dépendent entièrement de données expérimentales de haute qualité pour leur entraînement. Aucune sophistication algorithmique ne peut compenser des données médiocres ou insuffisantes. Les chercheurs, les répertoires et l’infrastructure qui génèrent et hébergent les données biologiques ne sont pas secondaires dans l’histoire de l’IA, ils en sont la condition préalable. Veiller à ce que ces ressources continuent d’être soutenues ne relève pas d’un souci bureaucratique, mais d’une exigence scientifique.
En bref
L’IA est passée du statut de complément prometteur de la recherche biologique à celui de caractéristique quasi structurelle de celle-ci. Cellules virtuelles, outils de microscopie conçus par l’IA, logiciels générés sans ingénieurs et instruments capables un jour de mener leurs propres expériences, il ne s’agit pas de possibilités lointaines. Ce sont des orientations de recherche actives documentées dans une grande revue à comité de lecture. Le défi actuel n’est pas celui de l’adoption, mais celui de la gouvernance, c’est-à-dire la création de normes, de repères et de mécanismes de surveillance qui permettent à ces outils d’être approuvés, reproduits et évalués en toute impartialité.
D’après un reportage de Nature: Machine Learning.