Em fevereiro, na India AI Summit em Nova Delhi, Demis Hassabis, cofundador da Google DeepMind, propôs um experimento mental que vai direto ao cerne do que a inteligência artificial pode e não pode fazer. Treine um LLM com tudo o que era conhecido até 1911, sugeriu ele, e peça para derivar a teoria da relatividade geral de Einstein, publicada em 1915. Se conseguisse, isso seria, segundo suas palavras, “um bom teste para a AGI”. Várias equipes de pesquisa tentaram versões deste experimento desde então. Os resultados são instrutivos, e não da maneira que os otimistas da IA poderiam esperar.
Por Que a Relatividade Geral É a Referência Certa
A teoria de Einstein de 1915 não é apenas uma peça famosa da física. É uma verdadeira mudança de paradigma: uma reconceituação completa da gravidade como uma deformação do espaço-tempo pela massa, em vez de uma força que age à distância. A teoria hoje sustenta a cosmologia, informa pesquisas sobre buracos negros e ondas gravitacionais, e guia satélites GPS no uso prático todos os dias. É, em outras palavras, intelectualmente radical e empiricamente consequente.
Essa combinação é exatamente o que a torna uma referência útil. Tom Zahavy, pesquisador da Google DeepMind, detalhou o teste em um artigo de opinião intitulado “LLMs can’t jump”, publicado em janeiro. Seu argumento se baseia em uma distinção que os filósofos da ciência reconhecem há muito tempo: a diferença entre o raciocínio indutivo, que deriva regras gerais de dados acumulados, e o raciocínio abdutivo, que inventa uma causa para um fenômeno singular. O salto de Einstein foi abdutivo. Os modelos atuais de IA são, por design, motores indutivos. Eles identificam padrões estatísticos em vastos conjuntos de treinamento. Eles não inventam causas. Eles não dão saltos.
O Que Aconteceu Quando os Pesquisadores Realmente Tentaram
O pesquisador independente de IA Michael Hla, baseado em São Francisco, construiu um modelo que chama de Machina Mirabilis, treinado com dados anteriores a 1900, e testou se ele conseguia reconstruir a mecânica quântica, a relatividade restrita e a relatividade geral. Ele forneceu comandos deliberados: observações sobre o efeito fotoelétrico, a essência do experimento mental do “elevador” de Einstein. Em alguns casos, o modelo produziu saídas sugestivas. Apresentado ao efeito fotoelétrico, ele descreveu a luz se dividindo em “impulsos distintos”, sugerindo o conceito de quanta de luz. Mas Hla concluiu que o modelo falhou na maioria dos casos, carecia de compreensão genuína da física que produzia e muitas vezes estava “papagueando palavras que parecem plausíveis” sem nenhuma representação interna forte do mundo a partir da qual raciocinar.
Nick Levine, um cientista da computação independente também baseado em São Francisco, encontrou um problema diferente, mas igualmente revelador. Sua equipe construiu um modelo antigo treinado apenas com material disponível até 1930, uma data escolhida porque as obras publicadas naquele ano entraram em domínio público nos Estados Unidos no início de 2026. O objetivo era testar se tal modelo poderia chegar independentemente a conceitos desenvolvidos na década de 1930, incluindo máquinas de Turing, o teorema da incompletude de Gödel e a postulação de neutrinos. O obstáculo não foi o raciocínio do modelo. Foram os próprios dados de treinamento. Os textos históricos estão repletos de artefatos de digitalização e linguagem arcaica. Pior ainda, os dados provaram ser “irritantemente vazios”: o modelo supostamente pré-1930 respondia espontânea e corretamente a perguntas sobre eventos da década de 1950, absorvendo conhecimento que nunca deveria ter tido.
Sendhil Mullainathan, cientista da computação no MIT, abordou o problema de forma diferente. Sua equipe forneceu a um modelo base de “mecânica orbital” dados sintéticos sobre sistemas planetários que obedecem à mecânica Newtoniana, e pediu que inferisse a lei subjacente da gravitação. O modelo nunca recuperou a verdadeira lei. Em vez disso, inferiu uma lei diferente e incorreta para cada sistema planetário. Ele estava ajustando curvas, não descobrindo princípios.
O Que Isso Revela Sobre a Natureza da Descoberta Científica
Aqui está o que a maior parte da cobertura da IA na ciência perde: as descobertas mais difíceis na história do conhecimento não vieram de ter mais dados. Vieram de ter a idéia certa sobre dados esparsos ou anômalos. As observações cuidadosas do movimento planetário por Kepler eram limitadas em número, mas deram a Newton a matéria-prima para construir suas leis da gravitação e do movimento. A relatividade geral de Einstein emergiu de um experimento mental sobre um elevador, e não de um banco de dados.
Ido Kaminer, especialista em ótica quântica no Technion em Haifa e coautor de um preprint intitulado “Can AI follow in Einstein’s footsteps?”, argumenta que uma descoberta na escala da relatividade não está inerentemente fora do alcance da IA. Mas exigirá repensar os princípios fundamentais de como os modelos atuais são construídos. A arquitetura que torna os LLMs de hoje poderosos na predição e na correspondência de padrões é a mesma arquitetura que os torna estruturalmente inadequados para o tipo de raciocínio criativo de construção de modelos de mundo que produz mudanças de paradigma.
Há uma nuance aqui. Um chatbot da OpenAI em maio desdisse uma conjectura de 80 anos do matemático húngaro Paul Erdős, e Mullainathan a descreve como um “avanço conceitual genuíno”, que exigiu pequenas novas abstrações em vez de busca por força bruta. Mas até essa conquista baseou-se em ideias já presentes na literatura matemática. Foi síntese, e não revelação.
Em Resumo
A IA está se tornandouma ferramenta poderosa para a ciência: ela encontra padrões, acelera a computação e agora pode contribuir significativamente para a matemática. O que ela ainda não consegue fazer é raciocinar a partir de quase nada para algo genuinamente novo. O teste de Einstein não é apenas uma referência inteligente. É uma descrição precisa da lacuna entre o que a IA atual faz bem e o que a descoberta científica, em seu momento mais transformador, realmente exige.
Com base em reportagem de Nature: Machine Learning.