Das wissenschaftliche Peer-Review bildet das Fundament dafür, wie Wissen validiert wird. Ein bei einer großen Konferenz eingereichter Artikel wandert durch die Hände von Experten, die seine Methoden, Ergebnisse und Bedeutung bewerten. Dieser Prozess soll eigentlich ein menschliches Urteil sein. Was passiert, wenn ein signifikanter Teil dieser Menschen einen Teil der Arbeit klammheimlich an ein Sprachmodell übergibt, selbst wenn ihnen ausdrücklich gesagt wurde, dass sie das nicht tun sollen?
Ein groß angelegtes Experiment während der International Conference on Machine Learning (ICML) 2026 in Seoul, Südkorea, lieferte eine seltene und ungewöhnlich direkte Antwort auf diese Frage.
Das Experiment, das Reviewer auf frischer Tat ertappte
Die Studie, die von einem Team von Informatikern bei Microsoft Research geleitet wurde, war in eine der weltweit größten AI-Konferenzen eingebettet. Mit 24.661 eingereichten Artikeln und 17.886 beteiligten Reviewern war der Umfang groß genug, um statistisch aussagekräftige Ergebnisse zu liefern.
Das Design war unkompliziert. Bei der Einreichung ihrer Arbeit konnten die Autoren wählen, welche Review-Richtlinie für ihren Artikel gelten soll. Eine Option war eine konservative Richtlinie, die die Nutzung von großen Sprachmodellen komplett verbot. Die andere war eine liberale Richtlinie, die LLMs erlaubte, Reviewern dabei zu helfen, Artikel zu verstehen, verwandte Arbeiten zu überprüfen und ihre eigenen Texte zu polieren, aber nicht die Vorzüge eines Artikels zu beurteilen oder das eigentliche Review zu verfassen.
Die Erwartung war vermutlich, dass sich diese beiden Gruppen unterschiedlich verhalten würden. Das taten sie nicht, zumindest nicht auf eine Weise, die für das Ergebnis von Bedeutung war.
Die Zahlen, die das Problem der Richtlinie greifbar machen
Die Annahmequoten unter den beiden Richtlinien waren nahezu identisch: 27 Prozent unter dem strengeren Verbot, 26,5 Prozent unter dem liberalen Ansatz. Die durchschnittlichen Review-Ergebnisse lagen bei 3,31 beziehungsweise 3,32 von 6 Punkten. Das Vertrauen der Reviewer war in beiden Gruppen praktisch unverändert.
Es gab einige oberflächliche Unterschiede. Reviews, die unter der liberalen Richtlinie verfasst wurden, fielen etwa 5,5 bis 7 Prozent länger aus und wurden von externen Experten in ihrer Qualität etwas höher bewertet. Ein Vergleich Reviewer für Reviewer ergab jedoch keinen nennenswerten Qualitätsunterschied.
Die Erklärung für diese nahezu vollständige Annäherung stammte aus einer anonymen Umfrage nach der Konferenz unter 1.486 Reviewern. Unter denjenigen, die der konservativen Gruppe mit AI-Verbot zugeteilt waren, gaben 22,5 Prozent zu, trotzdem ein Sprachmodell verwendet zu haben. Miro Dudík von Microsoft Research, der sowohl an der Studie beteiligt war als auch als einer der Konferenzorganisatoren fungierte, bezeichnete diesen Wert als höher als erwartet.
Diejenigen, die gegen die Regeln verstießen, nutzten AI, um Feedback zu braindampfen, Review-Texte zu entwerfen, Artikel zu lesen sowie deren Stärken und Schwächen zusammenzufassen. Die Umfrage brachte auch die Gründe ans Licht: hohe Arbeitsbelastungen beim Reviewen und Regeln, die die Reviewer als nicht klar genug empfanden.
Eine separate Analyseebene nutzte einen AI-Textdetektor namens Pangram, um die Reviews direkt zu bewerten. Nur 52,2 Prozent der unter der konservativen Richtlinie eingereichten Reviews wurden als vollständig von Menschen verfasst eingestuft. Unter der liberalen Richtlinie sank dieser Wert auf 37,0 Prozent. Die Forscher wiesen darauf hin, dass AI-Textdetektoren unvollkommene Werkzeuge sind, weshalb diese Zahlen mit Unsicherheiten behaftet sind. Dennoch deckt sich die Richtung des Befundes mit den Umfragedaten: Das Verbot erzeugte nicht das Verhalten, zu dessen Zweck es entwickelt worden war.
Kayvan Kousha von der University of Wolverhampton drückte es unverblümt aus: Ein AI-Verbot im Peer-Review ist nur sehr schwer durchzusetzen. Die Arbeitsbelastung von Akademikern erzeugt eine anhaltende Versuchung, nach Werkzeugen zu greifen, die Reibungsverluste reduzieren.
Was das über eine einzelne Konferenz hinaus bedeutet
Das ist es, was die meiste Berichterstattung über diese Studie übersieht. Der Befund dreht sich nicht wirklich um AI oder um die ICML. Es geht um die Kluft zwischen formaler Richtlinie und tatsächlichem Verhalten, wenn eine Durchsetzung unmöglich ist und der zugrundeliegende Druck real ist.
Peer Review ist bereits ein stark belastetes System. Reviewer sind typischerweise unbezahlte Freiwillige, die oft ihre eigene Forschung neben Lehr- und Verwaltungsaufgaben managen. Das Volumen der bei großen Konferenzen eingereichten Artikel ist im Laufe der Zeit erheblich gewachsen. Allein die ICML 2026 erforderte fast 18.000 Reviewer, um knapp 25.000 Einreichungen zu bewältigen. Das ist ein enormes Koordinationsproblem, und es existiert unabhängig von jeder Frage bezüglich AI.
Wenn ein Werkzeug breit verfügbar wird, den Aufwand reduziert und Ergebnisse liefert, die sich nur schwer von menschlicher Arbeit unterscheiden lassen, stehen Verbote vor einem strukturellen Problem: Sie sind auf freiwillige Compliance von Personen angewiesen, die starke Anreize haben, auszuscheren. Die Nichteinhaltungsrate von 23 Prozent in dieser Studie ist keine Geschichte über unehrenhafte Wissenschaftler. Es ist eine Geschichte über eine Richtlinie, die nicht auf die tatsächlichen Bedingungen kalibriert war, unter denen Reviewer arbeiten.
Sunnie S. Y. Kim von Microsoft Research merkte an, dass die Ergebnisse auch über Informatikkonferenzen hinaus relevant sind und sich möglicherweise auf Peer-Review-Plattformen in anderen Bereichen ausdehnen. Das ist eine vernünftige Schlussfolgerung. Der Druck, der die AI-Adoption im akademischen Review vorantreibt, ist in keiner Disziplin einzigartig.
Die tiefere Frage, die die Studie aufwirft, lautet, wozu Peer Review eigentlich da ist und ob das aktuelle Modell, das für eine andere Ära des Publikationsvolumens entworfen wurde, in seiner bestehenden Form erhalten werden kann. Ein Werkzeug zu verbieten, das Reviewer bereits im großen Stil, ohne Entdeckung und ohne erkennbaren Effekt auf die Ergebnisse nutzen, ist keine nachhaltige Strategie. Es ist ein Platzhalter, während das Fachgebiet herausfindet, was als Nächstes kommt.
Kurz gefasst
Ein kontrolliertes Experiment auf der ICML 2026 ergab, dass ein AI-Verbot beim Peer-Review im Vergleich zu seiner Erlaubnis fast keinen Unterschied bei den Ergebnissen bewirkte, was vor allem daran lag, dass 22,5 Prozent der Reviewer in der eingeschränkten Gruppe ohnehin AI nutzten. Annahmequoten, Punktzahlen und das Vertrauen der Reviewer waren bei beiden Richtlinien nahezu identisch. Der Befund weist auf eine strukturelle Diskrepanz hin: Richtlinien, die von der freiwilligen Compliance überlasteter Reviewer abhängen und keinen Durchsetzungsmechanismus besitzen, werden keinen Bestand haben. Die Frage für wissenschaftliche Institutionen lautet nicht, ob sie die Präsenz von AI im Review anerkennen sollen, sondern wie sie diese ehrlich regulieren können.
Basierend auf Berichten von New Scientist.
Zur Originalstudie.