Le président d’OpenAI Greg Brockman a récemment déclaré que “l’ère de l’AGI” a commencé, à la suite du lancement de GPT-6 Astra. Le PDG de Nvidia Jensen Huang a publiquement fait écho à cette annonce. Cette affirmation a eu un poids considérable, car l’intelligence artificielle générale, longtemps traitée comme l’horizon lointain de la recherche en IA, était présentée comme une réalité du moment présent. Le problème est qu’presque personne en dehors de ces entreprises ne s’accorde sur ce que cette réalité signifie réellement.
Un score de benchmark qui change avec le logiciel
La preuve la plus souvent citée de la capacité de niveau AGI d’Astra est sa performance sur ARC-AGI-3, un benchmark conçu par le chercheur en IA François Chollet spécifiquement pour résister au type d’entraînement ciblé qui a rendu de nombreux tests d’IA peu fiables. Le benchmark place les modèles dans des environnements de jeux vidéo non familiers et mesure s’ils peuvent comprendre les règles, s’adapter et gagner. Il est, par conception, plus difficile à manipuler que la plupart des autres.
Astra a obtenu des résultats remarquables. En utilisant le propre outil de test d’OpenAI, la couche logicielle qui fait l’intermédiaire entre le modèle et le benchmark, il a obtenu 99,9 %. En utilisant la configuration de test standard d’ARC-AGI-3, conçue pour donner à tous les modèles une interface plus uniforme, le score est tombé à 62,7 %. Cet écart n’est pas une note de bas de page technique mineure. Il soulève une question directe, à savoir si le modèle est véritablement capable ou s’il est partiellement optimisé pour les conditions dans lesquelles il est évalué.
Chollet lui-même a abordé ce point directement. Le benchmark, a-t-il expliqué, teste un ensemble non exhaustif d’attributs à petite échelle. L’intelligence du monde réel implique des horizons temporels d’apprentissage beaucoup plus longs, une bien plus grande complexité dans la modélisation du monde et des objectifs beaucoup plus ambigus. Résoudre ARC-AGI-3, à son avis, est un signe significatif de progrès. Ce n’est pas une preuve d’AGI, et cela n’a jamais eu vocation à l’être.
Le problème de la définition est la véritable histoire
Voici ce que la plupart des couvertures médiatiques de cette annonce oublient, c’est que le débat sur le fait de savoir si l’AGI est arrivée est indissociable du débat sur ce que l’AGI signifie réellement. Il n’existe pas de définition universellement acceptée, et cette absence laisse une marge considérable à l’interprétation.
La définition actuelle d’OpenAI décrit l’AGI comme des “systèmes hautement autonomes qui surpassent les humains dans la plupart des travaux à valeur économique.” Le Center for AI Safety utilise un cadre plus exigeant qui nécessite des performances élevées dans dix domaines cognitifs distincts, couvrant le raisonnement, la mémoire et la perception. Les chercheurs indépendants travaillent souvent à partir de définitions encore plus strictes.
Gary Marcus, professeur à l’Université de New York et critique notoire de l’IA, a qualifié la revendication de l’AGI de simple opération marketing, arguant qu’elle soit incomprend les définitions originales du terme, soit abaisse délibérément la barre. Son point de vue sur les performances d’Astra dans l’Epoch Capabilities Index est instructif, car Astra a bel et bien établi un nouveau record en marquant 169 contre un précédent record de 163, mais la propre analyse d’Epoch AI a révélé que cette amélioration restait cohérente avec la trajectoire existante des progrès de l’IA. Un nouveau record, oui. Un saut discontinu, non.
Ben Goertzel, le chercheur qui a inventé le terme “intelligence artificielle générale” en 2005, a proposé le cadrage peut-être le plus précis. Après avoir utilisé Astra, son évaluation a été que le modèle est surhumain dans certains domaines, en particulier les mathématiques et la programmation, tout en restant plus faible dans d’autres. En le comparant à un être humain, a-t-il déclaré, “cela finit par être compliqué plutôt que de se résumer à un simple oui ou non.” Il a également identifié des lacunes spécifiques que l’échafaudage logiciel ne peut pas combler, comme la façon dont le modèle se comprend lui-même, la façon dont il retient et applique la mémoire tout au long de son expérience, et la façon dont il coordonne des objectifs concurrents.
Andy Konwinski, qui a cofondé Databricks, Perplexity et Laude, l’a formulé plus clairement. Ces systèmes ne peuvent pas encore penser de manière autonome sur de longues périodes. Ils peuvent écrire des logiciels complexes et identifier des bugs, mais la majeure partie de la valeur mondiale ne provient pas de l’ingénierie logicielle. Ils ne cultivent pas de nourriture, ne construisent pas d’infrastructures et ne gouvernent pas de sociétés.
Pourquoi l’étiquette compte au-delà du laboratoire
Le débat sur l’AGI peut sembler être un différend technique entre chercheurs, mais ses implications s’étendent bien au-delà des scores de benchmarks. Lorsque des personnalités influentes de l’industrie déclarent qu’un seuil a été franchi, cela façonne les attentes du public, les conversations politiques, les décisions d’investissement et la façon dont les gens comprennent la technologie avec laquelle ils vivent de plus en plus.
Brockman n’est pas le premier à faire ce genre de déclaration. Huang a fait une annonce similaire un peu plus tôt dans l’année. Le PDG d’OpenAI Sam Altman a décrit le moment présent comme le début de la Singularité, une phase dans laquelle les systèmes d’IA ont pris le relais et accéléré le développement de nouveaux modèles, les humains étant largement exclus de cette boucle. Chacune de ces déclarations a du poids précisément en raison de la personne qui les prononce, et chacune d’elles arrive sans un étalon partagé pour mesurer cette affirmation.
L’analogie du réseau cellulaire est pertinente : les opérateurs ont historiquement étiqueté leurs réseaux avec le marqueur de la génération suivante avant que la technologie sous-jacente ne réponde pleinement à la norme technique. L’étiquette stimule l’adoption et la perception. L’écart entre l’étiquette et la réalité se comble plus tard, en silence.
Les capacités de l’IA progressent. Cela ne fait aucun doute. Ce qui reste véritablement non résolu, c’est de savoir si le concept d’AGI, tel qu’il a été défini et redéfini par les personnes les plus motivées pour l’atteindre, décrit encore quelque chose d’assez précis pour avoir du sens.
En bref
GPT-6 Astra est un modèle performant, et ses résultats aux benchmarks représentent de réels progrès. Mais l’affirmation selon laquelle l’AGI est arrivée repose sur une définition que les entreprises à l’origine de cette affirmation ont façonnée pour l’adapter à leurs propres systèmes. Les chercheurs qui ont inventé le terme, conçu les benchmarks et étudient l’IA de manière indépendante ne sont pas convaincus. La chose la plus importante à comprendre n’est pas de savoir si l’AGI est là. C’est que la réponse dépend entièrement de la personne qui se charge de définir la question.
D’après un reportage de Fast Company - Tech.