A revisão por pares científica está na base de como o conhecimento é validado. Um artigo submetido a uma grande conferência passa pelas mãos de revisores especialistas que avaliam seus métodos, resultados e relevância. Esse processo deveria ser um julgamento humano. O que acontece quando uma parcela significativa desses humanos entrega discretamente parte do trabalho para um modelo de linguagem, mesmo quando recebem ordens explícitas para não fazê-lo?
Um experimento em larga escala realizado durante a Conferência Internacional sobre Aprendizagem de Máquina (ICML) de 2026 em Seul, na Coreia do Sul, produziu uma resposta rara e incomumente direta para essa pergunta.
O Experimento Que Flagrou os Revisores no Ato
O estudo, liderado por uma equipe de cientistas da computação no Microsoft Research, foi embutido dentro de uma das maiores conferências de IA do mundo. Com 24.661 artigos submetidos e 17.886 revisores envolvidos, a escala foi substancial o suficiente para gerar resultados estatisticamente significativos.
O desenho foi direto. Ao submeterem seus trabalhos, os autores podiam escolher qual política de revisão se aplicaria ao seu artigo. Uma opção era uma política conservadora que proibia totalmente o uso de grandes modelos de linguagem. A outra era uma política permissiva que permitia que os LLMs ajudassem os revisores a entender os artigos, checar trabalhos relacionados e polir sua própria escrita, mas não a julgar os méritos de um artigo ou redigir a revisão real.
A expectativa, presumivelmente, era que esses dois grupos se comportassem de forma diferente. Eles não o fizeram, pelo menos não de qualquer maneira que importasse para o resultado.
Os Números Que Tornam o Problema da Política Concreto
As taxas de aceitação sob as duas políticas foram quase idênticas: 27 por cento sob a proibição mais rigorosa, 26,5 por cento sob a abordagem permissiva. As pontuações médias de revisão foram de 3,31 e 3,32 de um total de 6, respectivamente. A confiança do revisor permaneceu virtualmente inalterada em ambos os grupos.
Houve algumas diferenças superficiais. As revisões escritas sob a política permissiva duraram de 5,5 a 7 por cento mais e foram avaliadas com uma qualidade ligeiramente superior por especialistas externos. Uma comparação revisor por revisor, no entanto, não encontrou nenhuma diferença significativa na qualidade.
A explicação para essa convergência quase total veio de uma pesquisa anônima pós-conferência com 1.486 revisores. Entre aqueles designados para o grupo conservador, com proibição de IA, 22,5 por cento admitiram usar um modelo de linguagem mesmo assim. Miro Dudík, do Microsoft Research, que esteu envolvido no estudo e atuou como um dos organizadores da conferência, descreveu esse número como maior do que o antecipado.
Aqueles que quebraram as regras usaram IA para debater ideias de feedback, redigir o texto da revisão, ler artigos e resumir seus pontos fortes e fracos. A pesquisa também revelou os motivos: pesadas cargas de trabalho de revisão e regras que os revisores acharam insuficientemente claras.
Uma camada separada de análise usou um detector de texto de IA chamado Pangram para avaliar as revisões diretamente. Apenas 52,2 por cento das revisões submetidas sob a política conservadora foram classificadas como totalmente escritas por humanos. Sob a política permissiva, esse número caiu para 37,0 por cento. Os pesquisadores observaram que os detectores de texto de IA são ferramentas imperfeitas, portanto esses números carregam incerteza. Ainda assim, a direção da descoberta se alinha com os dados da pesquisa: a proibição não estava produzindo o comportamento para o qual foi projetada.
Kayvan Kousha, da Universidade de Wolverhampton, colocou a questão de forma clara: banir a IA na revisão por pares é muito difícil de aplicar. A carga de trabalho dos acadêmicos cria uma tentação persistente de buscar ferramentas que reduzem o atrito.
O Que Isso Significa Além de uma Única Conferência
Aqui está o que a maior parte da cobertura deste estudo deixa passar. A descoberta não é realmente sobre IA ou sobre a ICML. É sobre a lacuna entre a política formal e o comportamento real quando a aplicação é impossível e a pressão subjacente é real.
A revisão por pares já é um sistema sobrecarregado. Os revisores são tipicamente voluntários não remunerados, muitas vezes gerenciando sua própria pesquisa junto com o ensino e responsabilidades administrativas. O volume de artigos submetidos a grandes conferências cresceu substancialmente ao longo do tempo. Apenas a ICML 2026 exigiu quase 18.000 revisores para lidar com quase 25.000 submissões. Esse é um enorme problema de coordenação, e ele existe independentemente de qualquer questão sobre IA.
Quando uma ferramenta se torna amplamente disponível, reduz o esforço e produz resultados difíceis de distinguir do trabalho humano, as proibições enfrentam um problema estrutural: elas dependem da conformidade voluntária de pessoas que têm fortes incentivos para transgredir. A taxa de não conformidade de 23 por cento neste estudo não é uma história sobre cientistas desonestos. É uma história sobre uma política que não foi calibrada para as condições reais sob as quais os revisores operam.
Sunnie S. Y. Kim, do Microsoft Research, observou que as descobertas têm relevância além das conferências de ciência da computação, estendendo-se potencialmente a locais de revisão por pares em outros campos. Essa é uma inferência razoável. As pressões que impulsionam a adoção de IA na revisão acadêmica não são exclusivas de nenhuma disciplina.
A pergunta mais profunda que o estudo levanta é para que serve realmente a revisão por pares, e se o modelo atual, projetado para uma era diferente de volume de publicações, pode ser preservado em sua forma existente. Banir uma ferramenta que os revisores já estão usando, em escala, sem detecção e sem efeito aparente nos resultados, não é uma estratégia sustentável. É um espaço reservado enquanto o campo descobre o que vem a seguir.
Em Resumo
Um experimento controlado na ICML 2026 descobriu que banir a IA da revisão por pares produziu quase nenhuma diferença nos resultados em comparação a permiti-la, em grande parte porque 22,5 por cento dos revisores no grupo restrito usaram IA de qualquer maneira. As taxas de aceitação, pontuações e confiança do revisor foram quase idênticas em ambas as políticas. A descoberta aponta para uma incompatibilidade estrutural: políticas que dependem da conformidade voluntária de revisores sobrecarregados, sem mecanismo de aplicação, não vão se sustentar. A questão para as instituições científicas não é se devem reconhecer a presença da IA na revisão, mas como governá-la honestamente.
Com base em reportagem de New Scientist.
Leia o estudo original.