En février, lors du India AI Summit à New Delhi, Demis Hassabis, cofondateur de Google DeepMind, a proposé une expérience de pensée qui va au cœur de ce que l’intelligence artificielle peut et ne peut pas faire. Entraînez un LLM sur tout ce qui était connu jusqu’en 1911, a-t-il suggéré, puis demandez-lui de dériver la théorie de la relativité générale d’Einstein, publiée en 1915. Si elle le pouvait, ce serait, selon ses mots, « un bon test pour une AGI ». Plusieurs équipes de recherche ont depuis tenté des versions de cette expérience. Les résultats sont instructifs, et pas de la manière que les optimistes de l’IA pourraient espérer.
Pourquoi la relativité générale est la bonne référence
La théorie d’Einstein de 1915 n’est pas seulement un morceau célèbre de physique. C’est un véritable changement de paradigme, une reconceptualisation complète de la gravitation en tant que déformation de l’espace-temps par la masse, plutôt qu’une force agissant à distance. La théorie sous-tend aujourd’hui la cosmologie, éclaire la recherche sur les trous noirs et les ondes gravitationnelles, et guide les satellites GPS dans la vie de tous les jours. Elle est, en d’autres termes, à la fois intellectuellement radicale et empiriquement consécutive.
Cette combinaison est précisément ce qui en fait une référence utile. Tom Zahavy, chercheur chez Google DeepMind, a développé ce test dans un document de position intitulé « LLMs can’t jump », publié en janvier. Son argumentation s’appuie sur une distinction que les philosophes des sciences reconnaissent depuis longtemps, à savoir la différence entre le raisonnement inductif, qui déduit des règles générales à partir de données accumulées, et le raisonnement abductif, qui invente une cause pour un phénomène singulier. Le saut d’Einstein était abductif. Les modèles d’IA actuels sont, par conception, des moteurs inductifs. Ils identifient des tendances statistiques à travers de vastes ensembles d’entraînement. Ils n’inventent pas de causes. Ils ne font pas de saut.
Ce qui s’est passé lorsque les chercheurs ont réellement essayé
Le chercheur indépendant en IA Michael Hla, basé à San Francisco, a construit un modèle qu’il nomme Machina Mirabilis, entraîné sur des données antérieures à 1900, et a testé s’il pouvait reconstruire la mécanique quantique, la relativité restreinte et la relativité générale. Il a fourni des invites délibérées, à savoir des observations sur l’effet photoélectrique et l’essence de l’expérience de pensée de « l’ascenseur » d’Einstein. Dans certains cas, le modèle a produit des résultats suggestifs. Présenté avec l’effet photoélectrique, il a décrit la lumière se brisant en « impulsions distinctes », faisant allusion au concept de quanta de lumière. Mais Hla a conclu que le modèle a échoué dans la plupart des cas, qu’il manquait d’une véritable compréhension de la physique qu’il produisait, et qu’il se contentait souvent de « répéter des mots qui semblent plausibles » sans aucune représentation interne forte du monde à partir de laquelle raisonner.
Nick Levine, un informaticien indépendant également basé à San Francisco, a rencontré un problème différent mais tout aussi révélateur. Son équipe a construit un modèle ancien entraîné uniquement sur du matériel disponible jusqu’en 1930, une date choisie parce que les œuvres publiées cette année-là sont entrées dans le domaine public aux États-Unis au début de 2026. L’objectif était de tester si un tel modèle pouvait arriver de manière autonome à des concepts développés dans les années 1930, y compris les machines de Turing, le théorème d’incomplétude de Gödel et la postulation des neutrinos. L’obstacle n’était pas le raisonnement du modèle. C’étaient les données d’entraînement elles-mêmes. Les textes historiques sont criblés d’artefacts de numérisation et d’un langage archaïque. Pire encore, les données se sont révélées « désespérément poreuses » : le modèle prétendument antérieur à 1930 répondait spontanément et correctement à des questions sur des événements des années 1950, absorbant des connaissances qu’il n’était pas censé posséder.
Sendhil Mullainathan, informaticien au MIT, a abordé le problème différemment. Son équipe a fourni à un modèle de fondation de « mécanique orbitale » des données synthétiques sur des systèmes planétaires obéissant à la mécanique newtonienne, puis lui a demandé de déduire la loi de la gravitation sous-jacente. Le modèle n’a jamais retrouvé la vraie loi. Au lieu de cela, il a déduit une loi différente et incorrecte pour chaque système planétaire. Il ajustait des courbes, il ne découvrait pas de principes.
Ce que cela révèle sur la nature de la découverte scientifique
Voici ce que la plupart des reportages sur l’IA dans la science manquent : les percées les plus difficiles de l’histoire de la connaissance ne proviennent pas du fait d’avoir plus de données. Elles proviennent du fait d’avoir la bonne idée sur des données éparses ou anormales. Les observations minutieuses du mouvement planétaire par Kepler étaient limitées en nombre, mais elles ont donné à Newton la matière première pour construire ses lois de la gravitation et du mouvement. La relativité générale d’Einstein a émergé d’une expérience de pensée sur un ascenseur, et non d’une base de données.
Ido Kaminer, spécialiste de l’optique quantique au Technion à Haïfa et coauteur d’une prépublication intitulée « Can AI follow in Einstein’s footsteps? », soutient qu’une percée à l’échelle de la relativité n’est pas intrinsèquement hors de portée de l’IA. Mais cela nécessitera de repenser les principes fondamentaux de la façon dont les modèles actuels sont construits. L’architecture qui rend les LLM d’aujourd’hui puissants en matière de prédiction et de mise en correspondance de motifs est la même architecture qui les rend structurellement inadaptés au type de raisonnement créatif et constructeur de modèles du monde qui produit des changements de paradigme.
Il y a ici une nuance. Un chatbot OpenAI en mai a réfuté une conjecture vieille de 80 ans du mathématicien hongrois Paul Erdős, et Mullainathan qualifie cela d’« avance conceptuelle authentique », qui a nécessité de petites abstractions nouvelles plutôt qu’une recherche par force brute. Mais même cette réalisation s’est appuyée sur des idées déjà présentes dans la littérature mathématique. C’était de la synthèse, pas de la révélation.
En bref
L’IA devient un outil puissant pour la science : elle trouve des motifs, accélère le calcul et peut désormais contribuer de manière significative aux mathématiques. Ce qu’elle ne peut pas encore faire, c’est raisonner à partir de presque rien pour arriver à quelque chose de véritablement nouveau. Le test d’Einstein n’est pas seulement une référence intelligente. C’est une description précise du fossé entre ce que l’IA actuelle fait bien et ce que la découverte scientifique, dans ce qu’elle a de plus transformateur, exige réellement.
D’après un reportage de Nature: Machine Learning.