The Brief
Scienza e scoperte 5 min di lettura

Il 23% ha ignorato il divieto: cosa rivela l'uso dell'IA nella peer review

NAVION

Condividi

La peer review scientifica è alla base del modo in cui la conoscenza viene validata. Un articolo inviato a una grande conferenza passa tra le mani di revisori esperti che ne valutano i metodi, i risultati e la rilevanza. Quel processo dovrebbe essere un giudizio umano. Cosa succede quando una quota significativa di quegli umani affida silenziosamente parte del lavoro a un modello linguistico, anche quando viene detto esplicitamente di non farlo?

Un esperimento su larga scala condotto durante la International Conference on Machine Learning (ICML) del 2026 a Seul, in Corea del Sud, ha prodotto una risposta rara e insolitamente diretta a questa domanda.

L’esperimento che ha colto i revisori sul fatto

Lo studio, guidato da un team di informatici di Microsoft Research, è stato integrato all’interno di una delle più grandi conferenze sull’IA del mondo. Con 24.661 articoli presentati e 17.886 revisori coinvolti, la scala era sufficientemente ampia da generare risultati statisticamente significativi.

La struttura era semplice. Al momento di presentare il proprio lavoro, gli autori potevano scegliere quale politica di revisione applicare al proprio articolo. Un’opzione era una politica conservativa che vietava del tutto l’uso di large language models. L’altra era una politica permissiva che consentiva agli LLM di aiutare i revisori a comprendere gli articoli, controllare il lavoro correlato e perfezionare la propria scrittura, ma non di giudicare i meriti di un articolo o di redigere la recensione effettiva.

L’aspettativa, presumibilmente, era che questi due gruppi si sarebbero comportati in modo diverso. Non lo hanno fatto, almeno non in alcun modo che contasse per il risultato.

I numeri che rendono concreto il problema delle politiche

I tassi di accettazione secondo le due politiche erano quasi identici: il 27% con il divieto più rigido, il 26,5% con l’approccio permissivo. I punteggi medi delle recensioni erano rispettivamente 3,31 e 3,32 su 6. La fiducia dei revisori era praticamente immutata in entrambi i gruppi.

C’erano alcune differenze superficiali. Le recensioni scritte secondo la politica permissiva erano circa dal 5,5 al 7% più lunghe e valutate leggermente superiori in termini di qualità da esperti esterni. Un confronto revisore per revisore, tuttavia, non ha riscontrato alcuna differenza significativa nella qualità.

La spiegazione di questa convergenza quasi totale è arrivata da un sondaggio anonimo post-conferenza condotto su 1.486 revisori. Tra quelli assegnati al gruppo conservativo, con divieto di usare l’IA, il 22,5% ha ammesso di aver comunque utilizzato un modello linguistico. Miro Dudík di Microsoft Research, che ha partecipato allo studio ed è stato anche uno degli organizzatori della conferenza, ha descritto quella cifra come più alta del previsto.

Coloro che hanno infranto le regole hanno usato l’IA per fare brainstorming sui feedback, redigere il testo della recensione, leggere gli articoli e riassumerne i punti di forza e di debolezza. Il sondaggio ha anche fatto emergere le ragioni: carichi di lavoro di revisione pesanti e regole che i revisori hanno trovato non sufficientemente chiare.

Un ulteriore livello di analisi ha utilizzato un rilevatore di testo basato sull’IA chiamato Pangram per valutare direttamente le recensioni. Solo il 52,2% delle recensioni presentate secondo la politica conservativa è stato classificato come interamente scritto da umani. Sotto la politica permissiva, tale cifra è scesa al 37,0%. I ricercatori hanno notato che i rilevatori di testo basati sull’IA sono strumenti imperfetti, quindi questi numeri comportano incertezza. Ciononostante, la direzione del risultato si allinea con i dati del sondaggio: il divieto non stava producendo il comportamento per cui era stato progettato.

Kayvan Kousha dell’Università di Wolverhampton lo ha detto chiaramente: vietare l’IA nella peer review è molto difficile da far rispettare. Il carico di lavoro dei accademici crea una tentazione persistente a ricorrere a strumenti che riducono l’attrito.

Cosa significa questo oltre una singola conferenza

Ecco cosa la maggior parte della copertura di questo studio tralascia. La scoperta non riguarda realmente l’IA o l’ICML. Riguarda il divario tra la politica formale e il comportamento effettivo quando l’applicazione delle regole è impossibile e la pressione di fondo è reale.

La peer review è già un sistema sotto pressione. I revisori sono in genere volontari non retribuiti, spesso impegnati a gestire la propria ricerca insieme all’insegnamento e alle responsabilità amministrative. Il volume di articoli presentati alle grandi conferenze è cresciuto notevolmente nel tempo. La sola ICML 2026 ha richiesto quasi 18.000 revisori per gestire quasi 25.000 candidature. Si tratta di un enorme problema di coordinamento, ed esso esiste indipendentemente da qualsiasi questione riguardante l’IA.

Quando uno strumento diventa ampiamente disponibile, riduce lo sforzo e produce risultati difficilmente distinguibili dal lavoro umano, i divieti affrontano un problema strutturale: si affidano alla conformità volontaria di persone che hanno forti incentivi a trasgredire. Il tasso di non conformità del 23% in questo studio non è una storia di scienziati disonesti. È la storia di una politica che non è stata calibrata sulle condizioni reali in cui operano i revisori.

Sunnie S. Y. Kim di Microsoft Research ha osservato che i risultati hanno rilevanza al di là delle conferenze di informatica, estendendosi potenzialmente alle sedi di peer review in altri campi. Questa è una deduzione ragionevole. Le pressioni che guidano l’adozione dell’IA nella revisione accademica non sono esclusive di alcuna disciplina.

La questione più profonda sollevata dallo studio riguarda lo scopo effettivo della peer review e se il modello attuale, progettato per un’altra era di volumi di pubblicazione, possa essere preservato nella sua forma esistente. Vietare uno strumento che i revisori stanno già usando, su scala, senza rilevamento e senza un effetto evidente sui risultati, non è una strategia sostenibile. È un segnaposto mentre il settore capisce cosa verrà dopo.

In breve

Un esperimento controllato all’ICML 2026 ha riscontrato che vietare l’IA dalla peer review ha prodotto quasi nessuna differenza nei risultati rispetto al consentirla, in gran parte perché il 22,5% dei revisori nel gruppo soggetto a restrizioni ha comunque usato l’IA. I tassi di accettazione, i punteggi e la fiducia dei revisori erano quasi identici con entrambe le politiche. Il risultato indica un disallineamento strutturale: le politiche che dipendono dalla conformità volontaria di revisori sovraccarichi, senza alcun meccanismo di applicazione, non reggeranno. La domanda per le istituzioni scientifiche non è se riconoscere la presenza dell’IA nella revisione, ma come governarla onestamente.

Basato su un articolo di New Scientist.

Leggi lo studio originale.

Scritto da

NAVION