L’évaluation par les pairs scientifique constitue le fondement de la validation des connaissances. Un article soumis à une grande conférence passe entre les mains d’évaluateurs experts qui examinent ses méthodes, ses résultats et sa portée. Ce processus est censé relever d’un jugement humain. Que se passe-t-il lorsqu’une part importante de ces humains délègue discrètement une partie du travail à un modèle de langage, même lorsqu’on leur a explicitement ordonné de ne pas le faire ?
Une expérience à grande échelle menée lors de la Conférence internationale sur l’apprentissage automatique (ICML) de 2026 à Séoul, en Corée du Sud, a apporté une réponse rare et exceptionnellement directe à cette question.
L’expérience qui a pris les évaluateurs la main dans le sac
L’étude, menée par une équipe de chercheurs en informatique de Microsoft Research, a été intégrée à l’une des plus grandes conférences sur l’IA au monde. Avec 24 661 articles soumis et 17 886 évaluateurs impliqués, l’échelle était suffisante pour produire des résultats statistiquement significatifs.
Le protocole était simple. Lors de la soumission de leurs travaux, les auteurs pouvaient choisir la politique d’évaluation qui s’appliquerait à leur article. La première option était une politique conservatrice interdisant totalement l’utilisation de grands modèles de langage. La seconde était une politique permissive permettant aux LLM d’aider les évaluateurs à comprendre les articles, à vérifier les travaux connexes et à peaufiner leur propre rédaction, mais pas à juger des mérites d’un article ni à rédiger l’évaluation proprement dite.
L’attente, vraisemblablement, était que ces deux groupes se comporteraient différemment. Ce ne fut pas le cas, du moins pas d’une manière qui importait pour le résultat.
Les chiffres qui concrétisent le problème des politiques
Les taux d’acceptation sous les deux politiques étaient presque identiques : 27 pour cent sous l’interdiction la plus stricte, 26,5 pour cent sous l’approche permissive. Les notes moyennes des évaluations étaient de 3,31 et 3,32 sur 6, respectivement. La confiance des évaluateurs est restée pratiquement inchangée dans les deux groupes.
Il y a eu quelques différences de surface. Les évaluations rédigées sous le régime de la politique permissive étaient environ 5,5 à 7 pour cent plus longues et ont reçu une évaluation de qualité légèrement supérieure de la part d’experts externes. Une comparaison évaluateur par évaluateur n’a toutefois révélé aucune différence significative en termes de qualité.
L’explication de cette convergence presque totale provient d’une enquête anonyme menée après la conférence auprès de 1 486 évaluateurs. Parmi ceux assignés au groupe conservateur interdisant l’IA, 22,5 pour cent ont admis avoir tout de même utilisé un modèle de langage. Miro Dudík, de Microsoft Research, qui a participé à l’étude et a été l’un des organisateurs de la conférence, a qualifié ce chiffre de plus élevé que prévu.
Ceux qui ont enfreint les règles ont utilisé l’IA pour trouver des idées de commentaires, rédiger le texte de l’évaluation, lire des articles et résumer leurs forces et leurs faiblesses. L’enquête a également mis en évidence les raisons de ces actes : une charge de travail d’évaluation lourde et des règles que les évaluateurs jugeaient insuffisamment claires.
Un autre niveau d’analyse a eu recours à un détecteur de texte IA nommé Pangram pour évaluer directement les comptes rendus. Seuls 52,2 pour cent des avis soumis dans le cadre de la politique conservatrice ont été classés comme entièrement rédigés par des humains. Sous la politique permissive, ce chiffre est tombé à 37,0 pour cent. Les chercheurs ont noté que les détecteurs de texte IA sont des outils imparfaits, de sorte que ces chiffres comportent une part d’incertitude. Néanmoins, la tendance observée concorde avec les données de l’enquête : l’interdiction n’a pas produit le comportement pour lequel elle avait été conçue.
Kayvan Kousha, de l’Université de Wolverhampton, l’a formulé sans ambages : il est très difficile d’imposer une interdiction de l’IA dans l’évaluation par les pairs. La charge de travail des universitaires crée une tentation persistante de recourir à des outils qui réduisent les frictions.
Ce que cela implique au-delà d’une seule conférence
Voici ce que la plupart des articles sur cette étude oublient. Le constat ne concerne pas vraiment l’IA ou l’ICML. Il concerne le décalage entre la politique formelle et le comportement réel lorsque l’application des règles est impossible et que la pression sous-jacente est bien réelle.
L’évaluation par des pairs est déjà un système mis à rude épreuve. Les évaluateurs sont généralement des bénévoles non rémunérés, qui gèrent souvent leurs propres recherches en plus de l’enseignement et de responsabilités administratives. Le volume d’articles soumis aux grandes conférences a considérablement augmenté au fil du temps. L’ICML 2026 à elle seule a nécessité près de 18 000 évaluateurs pour traiter près de 25 000 soumissions. Il s’agit d’un problème de coordination énorme, et il existe indépendamment de toute question relative à l’IA.
Lorsqu’un outil devient largement accessible, réduit l’effort et produit des résultats difficiles à distinguer du travail humain, les interdictions se heurtent à un problème structurel : elles reposent sur le respect volontaire de personnes qui ont de fortes incitations à y déroger. Le taux de non-conformité de 23 pour cent observé dans cette étude ne raconte pas l’histoire de scientifiques malhonnêtes. Il raconte l’histoire d’une politique qui n’a pas été calibrée en fonction des conditions réelles dans lesquelles les évaluateurs exercent.
Sunnie S. Y. Kim, de Microsoft Research, a souligné que ces conclusions ont une pertinence qui dépasse le cadre des conférences en informatique, pouvant potentiellement s’étendre aux instances d’évaluation par les pairs dans d’autres domaines. C’est une déduction logique. Les pressions qui poussent à l’adoption de l’IA dans l’évaluation académique ne sont propres à aucune discipline en particulier.
La question plus profonde que soulève l’étude est de savoir à quoi sert réellement l’évaluation par les pairs et si le modèle actuel, conçu pour une autre époque en matière de volume de publications, peut être préservé sous sa forme actuelle. Interdire un outil que les évaluateurs utilisent déjà, à grande échelle, sans détection et sans effet apparent sur les résultats, n’est pas une stratégie viable. C’est une solution temporaire en attendant que le domaine découvre la suite.
En bref
Une expérience contrôlée menée lors de l’ICML 2026 a révélé que l’interdiction de l’IA dans l’évaluation par les pairs n’a entraîné presque aucune différence dans les résultats par rapport à son autorisation, principalement parce que 22,5 pour cent des évaluateurs du groupe restreint ont tout de même utilisé l’IA. Les taux d’acceptation, les notes et la confiance des évaluateurs étaient presque identiques pour les deux politiques. Cette découverte met en évidence un décalage structurel : les politiques qui dépendent du respect volontaire d’évaluateurs surchargés, sans mécanisme d’application, ne tiendront pas. La question pour les institutions scientifiques n’est pas de savoir s’il faut reconnaître la présence de l’IA dans l’évaluation, mais bien de savoir comment la régir honnêtement.
D’après un reportage de New Scientist.
Lire l’étude originale.