Pendant des années, une seule expression a façonné la façon dont beaucoup de gens perçoivent les LLM : le “perroquet stochastique”. Cette idée, qui a gagné du terrain entre 2017 et 2022, décrivait les premiers systèmes d’IA générative comme des moteurs de correspondance de motifs sophistiqués qui sélectionnaient des mots statistiquement probables sans aucune véritable compréhension. C’était un correctif utile contre le battage médiatique. Le problème est qu’elle a survécu à sa propre exactitude, et l’utiliser aujourd’hui pour rejeter les inquiétudes concernant les models d’IA de pointe mène à un tableau dangereusement incomplet.
Comment fonctionnaient réellement les premiers modèles, et pourquoi cette étiquette leur collait à la peau
La formulation du perroquet stochastique n’était pas fausse pour son époque. Les premiers modèles de langage fonctionnaient par prédiction autorégressive du token suivant : étant donnée une séquence de mots, le modèle calculait quel mot avait le plus de chances de venir ensuite, en se basant entièrement sur les motifs absorbés lors de l’entraînement. Il n’y avait pas de récupération de connaissances externes, pas de raisonnement structuré, pas d’autocorrection. Le modèle était, dans un sens significatif, une très grande table de consultation statistique habillée en outil de conversation. L’appeler un perroquet capturait quelque chose de réel à propos de ses limites.
L’étiquette est restée. Et en 2026, elle est encore utilisée, souvent pour affirmer que des modèles comme Astra d’OpenAI ou Mythos d’Anthropic ne présentent aucun risque sérieux parce qu’ils ne sont, au fond, que de la saisie semi-automatique. C’est là que la métaphore cesse d’être utile et commence à devenir trompeuse.
Quatre axes de recherche qui ont tout changé
À partir d’environ 2017 et en s’accélérant au début des années 2020, plusieurs pistes de recherche distinctes ont commencé à pousser les modèles de langage bien au-delà de la correspondance de motifs statique. Elles n’ont pas tant remplacé l’architecture sous-jacente qu’elles ont bâti des couches de capacités par-dessus.
La première était la génération augmentée par récupération, connue sous le nom de RAG. Plutôt que de forcer un modèle à compter uniquement sur ce qu’il avait absorbé pendant l’entraînement, le RAG a donné aux modèles la capacité d’interroger des sources externes, de récupérer des documents pertinents et d’incorporer ce matériel dans leurs réponses. L’effet pratique a été une amélioration significative de l’exactitude factuelle, car le modèle pouvait s’appuyer sur des informations actuelles et faisant autorité plutôt que sur des données d’entraînement figées.
Le deuxième axe était l’IA neurosymbolique, qui répondait à une limitation différente : la capacité à gérer la logique structurée. Un modèle de langage récupérant une police d’assurance peut vous dire ce que dit le document. Un système neurosymbolique peut traduire cette police en règles et conditions explicites, puis appliquer un solveur logique pour déterminer une réponse déterministe. La sortie en langage naturel provient du modèle neural, et le raisonnement rigoureux provient d’une couche symbolique opérant à ses côtés, ou intégrée en son sein lors de l’entraînement.
Le troisième développement est issu d’une collaboration en 2022 entre des chercheurs de Google et de l’Université de Tokyo. Ils ont démontré qu’il suffisait de souffler à un modèle la consigne “Réfléchissons étape par étape” pour libérer une capacité latente de résolution de problèmes structurée, sans modifier les poids du modèle ni fournir d’exemples résolus. Le modèle prédisait toujours des tokens, mais générer des étapes de raisonnement intermédiaires lui donnait l’équivalent fonctionnel d’un bloc-notes. Cette recherche sur la chaîne de pensée a jeté les bases de ce qui allait suivre.
Le quatrième changement, et le plus important, a été l’émergence de modèles de raisonnement. Les chercheurs ont commencé à entraîner des modèles spécifiquement pour raisonner sur des problèmes lors de l’inférence en direct, après une instruction de l’utilisateur, plutôt que de produire une réponse en une seule passe avant. Le modèle o1 d’OpenAI, sorti en 2024, a été le premier modèle de raisonnement issu d’un grand laboratoire. Il a été entraîné en combinant un pré-entraînement sur des exemples écrits par des humains et par apprentissage par renforcement. Ensuite, au début de 2025, le laboratoire chinois DeepSeek a démontré que le seul apprentissage par renforcement, sans exemples de raisonnement explicites, pouvait enseigner à un modèle à produire des chaînes de pensée plus longues, à vérifier son propre travail et à réexaminer ses approches. Le modèle a appris à raisonner en étant récompensé lorsqu’il donnait les bonnes réponses.
Ces quatre axes se sont développés en grande partie en parallèle, se chevauchant considérablement entre 2019 et 2023, les modèles de raisonnement arrivant peu de temps après. Le résultat est une classe de systèmes qui fait bien plus que soumettre un prompt à un ensemble fixe de paramètres.
Pourquoi cette formulation compte au-delà de l’exactitude technique
C’est ce que la plupart des reportages manquent : le débat sur le perroquet stochastique n’est pas seulement un désaccord sémantique entre chercheurs. Il a des conséquences pratiques sur la façon dont la société évalue le risque.
Si les models d’IA de pointe sont perçus comme une correction automatique sophistiquée, l’instinct pousse à traiter les inquiétudes concernant leurs capacités comme exagérées. Mais un système capable de récupérer des informations externes, d’appliquer une logique structurée, de raisonner à travers des problèmes en plusieurs étapes et de s’auto-corrigé pendant l’inférence est un outil d’une nature qualitativement différente. Il augmente le jugement humain d’une manière que les modèles précédents ne pouvaient pas le faire, et il peut opérer à une échelle et à une vitesse que des équipes humaines ne peuvent égaler sans aide. Cette capacité accrue est précisément la raison pour laquelle la question de savoir comment ces systèmes sont déployés, et par qui, mérite une attention sérieuse.
La métaphore du perroquet a toujours été une simplification. Les simplifications sont utiles jusqu’à ce qu’elles obscurcissent plus qu’elles ne révèlent. En 2026, le perroquet stochastique obscurcit énormément de choses.
En bref
Les grands modèles de langage en 2026 ne sont pas les systèmes de correspondance de motifs que l’étiquette de “perroquet stochastique” a été inventée pour décrire. La génération augmentée par récupération, le raisonnement neurosymbolique, le prompt en chaîne de pensée et les modèles de raisonnement dédiés ont transformé collectivement ce que ces systèmes peuvent faire. Utiliser une métaphore obsolète pour rejeter les inquiétudes concernant leurs capacités n’est pas du scepticisme. C’est un échec à suivre le rythme de la technologie dont il est question.
D’après un reportage de Fast Company - Tech.