La revisión por pares científica se encuentra en la base de cómo se valida el conocimiento. Un artículo enviado a una conferencia importante pasa por las manos de revisores expertos que evalúan sus métodos, resultados y relevancia. Se supone que ese proceso es un juicio humano. ¿Qué pasa cuando una parte significativa de esos humanos le entrega silenciosamente una parte del trabajo a un modelo de lenguaje, incluso cuando se les dice explícitamente que no lo hagan?
Un experimento a gran escala realizado durante la Conferencia Internacional de Aprendizaje Automático (ICML) de 2026 en Seúl, Corea del Sur, produjo una respuesta poco común e inusualmente directa a esa pregunta.
El experimento que pilló a los revisores con las manos en la masa
El estudio, liderado por un equipo de científicos informáticos en Microsoft Research, se integró dentro de una de las conferencias de IA más grandes del mundo. Con 24.661 artículos enviados y 17.886 revisores involucrados, la escala fue lo suficientemente sustancial como para generar resultados estadísticamente significativos.
El diseño fue directo. Al enviar su trabajo, los autores podían elegir qué política de revisión se aplicaría a su artículo. Una opción era una política conservadora que prohibía por completo el uso de modelos de lenguaje grandes. La otra era una política permisiva que permitía a los LLMs ayudar a los revisores a entender los artículos, verificar trabajos relacionados y pulir su propia redacción, pero no juzgar los méritos de un artículo ni redactar la revisión real.
La expectativa, presumiblemente, era que estos dos grupos se comportarían de manera diferente. No lo hicieron, al menos no de ninguna manera que importara para el resultado.
Los números que hacen que el problema de la política sea concreto
Las tasas de aceptación bajo las dos políticas fueron casi idénticas: 27 por ciento bajo la prohibición más estricta, 26,5 por ciento bajo el enfoque permisivo. Las puntuaciones promedio de las revisiones fueron 3,31 y 3,32 de 6, respectivamente. La confianza de los revisores se mantuvo prácticamente inalterada en ambos grupos.
Hubo algunas diferencias superficiales. Las revisiones escritas bajo la política permisiva duraron aproximadamente entre un 5,5 y un 7 por ciento más y fueron calificadas ligeramente más alto en calidad por expertos externos. Una comparación revisor por revisor, sin embargo, no encontró ninguna diferencia significativa en calidad.
La explicación de esta convergencia casi total provino de una encuesta anónima posterior a la conferencia a 1.486 revisores. Entre los asignados al grupo conservador donde se prohibía la IA, el 22,5 por ciento admitió haber usado un modelo de lenguaje de todos modos. Miro Dudík en Microsoft Research, quien participó en el estudio y sirvió como uno de los organizadores de la conferencia, describió esa cifra como más alta de lo anticipado.
Quienes rompieron las reglas usaron IA para idear comentarios, redactar texto de revisión, leer artículos y resumir sus fortalezas y debilidades. La encuesta también sacó a la luz las razones: cargas de trabajo de revisión pesadas y reglas que los revisores consideraron insuficientemente claras.
Una capa separada de análisis utilizó un detector de texto de IA llamado Pangram para evaluar las revisiones directamente. Solo el 52,2 por ciento de las revisiones enviadas bajo la política conservadora fueron clasificadas como escritas completamente por humanos. Bajo la política permisiva, esa cifra cayó al 37,0 por ciento. Los investigadores señalaron que los detectores de texto de IA son herramientas imperfectas, por lo que estos números conllevan incertidumbre. Aún así, la dirección del hallazgo se alinea con los datos de la encuesta: la prohibición no estaba produciendo el comportamiento para el que fue diseñada.
Kayvan Kousha en la Universidad de Wolverhampton lo expresó claramente: prohibir la IA en la revisión por pares es muy difícil de hacer cumplir. La carga de trabajo de los académicos crea una tentación persistente de recurrir a herramientas que reducen la fricción.
Lo que esto significa más allá de una conferencia
Esto es lo que la mayor parte de la cobertura de este estudio pasa por alto. El hallazgo no trata realmente sobre la IA ni sobre ICML. Trata sobre la brecha entre la política formal y el comportamiento real cuando la aplicación de la ley es imposible y la presión subyacente es real.
La revisión por pares ya es un sistema tenso. Los revisores suelen ser voluntarios no remunerados, que a menudo gestionan su propia investigación junto con la enseñanza y las responsabilidades administrativas. El volumen de artículos enviados a conferencias importantes ha crecido sustancialmente con el tiempo. ICML 2026 por sí solo requirió casi 18.000 revisores para manejar casi 25.000 envíos. Ese es un problema de coordinación enorme, y existe independientemente de cualquier pregunta sobre la IA.
Cuando una herramienta se vuelve ampliamente disponible, reduce el esfuerzo y produce resultados que son difíciles de distinguir del trabajo humano, las prohibiciones se enfrentan a un problema estructural: dependen del cumplimiento voluntario de personas que tienen fuertes incentivos para desertar. La tasa de incumplimiento del 23 por ciento en este estudio no es una historia sobre científicos deshonestos. Es una historia sobre una política que no estaba calibrada para las condiciones reales bajo las cuales operan los revisores.
Sunnie S. Y. Kim en Microsoft Research señaló que los hallazgos tienen relevancia más allá de las conferencias de informática, extendiéndose potencialmente a lugares de revisión por pares en otros campos. Esa es una deducción razonable. Las presiones que impulsan la adopción de la IA en la revisión académica no son exclusivas de ninguna disciplina.
La pregunta más profunda que plantea el estudio es para qué sirve realmente la revisión por pares, y si el modelo actual, diseñado para una era diferente de volumen de publicaciones, se puede preservar en su forma existente. Prohibir una herramienta que los revisores ya están usando, a escala, sin detección y sin efecto aparente en los resultados, no es una estrategia sostenible. Es un marcador de posición mientras el campo descubre qué viene después.
En resumen
Un experimento controlado en ICML 2026 encontró que prohibir la IA en la revisión por pares produjo casi ninguna diferencia en los resultados en comparación con permitirla, en gran medida porque el 22,5 por ciento de los revisores en el grupo restringido usó IA de todos modos. Las tasas de aceptación, las puntuaciones y la confianza de los revisores fueron casi idénticas en ambas políticas. El hallazgo apunta a un desajuste estructural: las políticas que dependen del cumplimiento voluntario de revisores sobrecargados, sin ningún mecanismo de aplicación, no se mantendrán. La pregunta para las instituciones científicas no es si deben reconocer la presencia de la IA en la revisión, sino cómo gobernarla honestamente.
Basado en información de New Scientist.
Lee el estudio original.