Pendant au moins 100 000 ans, un seul type d’entité sur Terre pouvait apprendre une langue humaine avec une parfaite aisance, à savoir un enfant humain. Cela a changé il y a environ quatre ans. Les LLM peuvent désormais tenir des conversations qui, en surface, sont impossibles à distinguer d’un échange humain. Pourtant, sous cette aisance, quelque chose de profondément étrange se produit. Ces systèmes nécessitent une quantité stupéfiante de données pour atteindre un niveau de compétence qu’un tout-petit acquiert presque sans effort. Comprendre pourquoi cet écart existe est désormais l’une des questions ouvertes les plus importantes à la fois en science cognitive et dans la recherche en IA.
L’échelle du problème est difficile à saisir
Les chiffres en jeu sont difficiles à se représenter. Un préadolescent élevé dans un environnement riche sur le plan linguistique peut avoir entendu environ 100 millions de mots au moment d’arriver à l’adolescence. Si l’on ajoute la lecture, ce chiffre peut grimper à environ 300 millions de mots à l’âge de 20 ans. Le modèle à poids ouverts de Meta, Llama 3.1, a quant à lui été entraîné sur 15 billions de tokens, les tokens étant des unités de langage semblables à des mots. Les modèles de pointe s’entraînent peut-être sur dix fois cette quantité, selon Ethan Gotlieb Wilcox, spécialiste des sciences cognitives et linguiste à l’Université de Georgetown.
Pour rendre le contraste concret, si vous imprimiez tous les mots utilisés pour entraîner un LLM moderne, la pile de papier dépasserait la Station spatiale internationale. Les 100 millions de mots qu’un préadolescent a entendus s’empileraient sur environ 20 mètres. Wilcox formule les choses autrement: Claude a vu la quantité de langage qu’une ville entière expérimentera en une seule génération.
C’est ce que les chercheurs appellent l’écart d’efficacité des données. Les enfants apprennent le langage à partir d’une fraction infime des données d’entrée que les machines exigent, et ils le font plus rapidement, de manière plus fiable et avec bien moins d’instructions explicites. Les tout-petits commencent généralement à produire des phrases grammaticalement correctes après avoir entendu entre 10 et 30 millions de mots. Entraîner GPT-2 sur 30 millions de mots, comme le souligne Michael C. Frank, spécialiste des sciences cognitives à l’Université de Stanford, produit un générateur de non-sens. Cela ne produit rien qui ressemble à un enfant.
Un débat qui a façonné à la fois la linguistique et l’IA
La question de savoir comment les enfants acquièrent le langage n’est pas nouvelle, et les réponses qui s’y opposeront ont eu de réelles conséquences sur la manière dont l’IA s’est développée. Dans les années 1950, le linguiste du MIT Noam Chomsky a soutenu que les enfants naissent avec des connaissances grammaticales innées. Son raisonnement était que le langage, en particulier sa syntaxe, est trop complexe et que l’exposition des enfants à celui-ci est trop limitée pour que l’apprentissage se fasse purement par l’expérience. Il a appelé cela la pauvreté du stimulus. Face à lui se trouvait le psychologue B.F. Skinner, qui soutenait que le langage était entièrement acquis par le conditionnement environnemental, de la même manière que les animaux apprennent à réagir aux récompenses.
Le point de vue de Chomsky a dominé la linguistique américaine pendant des décennies, et il a directement façonné les débuts de la recherche en IA. Les chercheurs ont essayé d’enseigner le langage aux ordinateurs en codant explicitement des règles grammaticales dans des programmes, une approche basée sur des règles qui est devenue une composante de ce qu’on a appelé la symbolic AI. Cette approche a largement échoué à produire des systèmes capables de traiter le langage humain réel à grande échelle. L’intérêt pour ce domaine a fortement chuté pendant la période connue sous le nom de l’hiver de l’IA, qui a débuté dans les années 1970.
Le retour en force s’est fait par une voie totalement différente. Les réseaux de neurones, qui apprennent en reconnaissant des schémas statistiques plutôt qu’en suivant des règles explicites, ont commencé à surpasser les systèmes basés sur des règles à mesure que le matériel devenait moins cher et que Internet fournissait de vastes quantités de texte. Vers 2018 et 2019, des modèles comme BERT et GPT-2, construits sur une nouvelle architecture appelée le transformer, ont démontré que l’apprentissage à partir de masses de données pouvait fonctionner pour le langage. Le succès de ChatGPT en 2022 a rendu cela visible au grand public.
L’ironie est frappante. Les LLM sont, par essence, exactement le genre de machines d’apprentissage statistique que Chomsky affirmait ne jamais pouvoir acquérir le langage. Ils n’ont pas de grammaire innée, pas de règles câblées, pas d’architecture biologique. Et pourtant, ils fonctionnent, du moins à grande échelle. Les enfants, quant à eux, réussissent le même exploit avec une fraction des données et sans aucune infrastructure informatique. Aucune des deux parties du vieux débat n’explique pleinement chaque cas.
Pourquoi cette question dépasse le cadre du laboratoire
Il y a ici une urgence pratique qui va au-delà du débat académique. Internet n’est pas infini. Les chercheurs suggèrent que l’approvisionnement en données textuelles facilement disponibles pour l’entraînement pourrait s’épuiser dès les années 2030. Si les systèmes d’IA ne peuvent s’améliorer qu’en consommant davantage de données, cette trajectoire a une limite. Les enfants démontrent que cette limite n’est pas fondamentale. C’est une contrainte des méthodes actuelles, et non de la tâche elle-même.
Combler l’écart d’efficacité des données pourrait ouvrir des possibilités que les modèles actuels ne peuvent pas atteindre: des systèmes d’IA formés efficacement sur de la vidéo plutôt que sur du texte, des outils linguistiques conçus pour les communautés de langues minoritaires où les grands corpus de texte n’existent tout simplement pas, et des modèles qui généralisent à partir d’exemples limités de la même manière que le font les humains. Étudier la manière dont les enfants apprennent offre également un moyen de tester des hypothèses de longue date sur l’esprit humain, notamment celle de savoir si l’acquisition du langage exige des structures biologiques innées ou si le bon type d’environnement d’apprentissage suffit.
Ce que ce domaine pose réellement comme question est une variante d’une interrogation beaucoup plus ancienne: que signifie comprendre le langage, et quelle part de cette compréhension est proprement humaine? L’IA n’a pas répondu à cette question. Elle l’a rendue plus urgente.
En bref
Les enfants apprennent le langage à partir d’une fraction des données requises par les systèmes d’IA, un écart si vaste qu’il ne peut être décrit que par analogie. Les chercheurs étudient la manière dont les enfants parviennent à ce résultat, car la réponse pourrait transformer la façon dont les modèles d’IA sont construits, et parce que l’approvisionnement en données d’entraînement a des limites. Le débat entre la connaissance innée et l’apprentissage statistique, qui a façonné à la fois la linguistique et les débuts de l’IA, reste irrésolu. Les LLM constituent la preuve éclatante que les statistiques peuvent aller très loin. Les enfants sont la preuve tout aussi éclatante que les statistiques seules ne racontent pas toute l’histoire.
D’après un reportage de MIT Technology Review.