En febrero, en la India AI Summit de Nueva Delhi, Demis Hassabis, cofundador de Google DeepMind, propuso un experimento mental que va directo al núcleo de lo que la inteligencia artificial puede y no puede hacer. Entrena un LLM con todo lo que se conocía hasta 1911, sugirió, y luego pídele que deduzca la teoría general de la relatividad de Einstein, publicada en 1915. Si pudiera hacerlo, eso sería, según sus palabras, “una buena prueba para la AGI”. Varios equipos de investigación han intentado desde entonces versiones de este experimento. Los resultados son instructivos, y no de la manera que los optimistas de la IA podrían esperar.
Por qué la relatividad general es el punto de referencia adecuado
La teoría de Einstein de 1915 no es solo una pieza famosa de física. Es un auténtico cambio de paradigma, una reconceptualización completa de la gravedad como una deformación del espacio-tiempo por la masa, en lugar de una fuerza que actúa a distancia. La teoría hoy sustenta la cosmología, informa la investigación sobre agujeros negros y ondas gravitacionales, y guía a los satélites GPS en el uso práctico todos los días. Es, en otras palabras, intelectualmente radical y empíricamente consecuente.
Esa combinación es precisamente lo que la convierte en un punto de referencia útil. Tom Zahavy, un investigador de Google DeepMind, profundizó en la prueba en un documento de postura titulado “LLMs can’t jump”, publicado en enero. Su argumento se basa en una distinción que los filósofos de la ciencia han reconocido durante mucho tiempo: la diferencia entre el razonamiento inductivo, que deriva reglas generales de datos acumulados, y el razonamiento abductivo, que inventa una causa para un fenómeno singular. El salto de Einstein fue abductivo. Los modelos de IA actuales son, por diseño, motores inductivos. Identifican patrones estadísticos en vastos conjuntos de entrenamiento. No inventan causas. No dan saltos.
Qué pasó cuando los investigadores realmente lo intentaron
El investigador independiente de IA Michael Hla, radicado en San Francisco, construyó un modelo al que llama Machina Mirabilis, entrenado con datos anteriores a 1900, y probó si podía reconstruir la mecánica cuántica, la relatividad especial y la relatividad general. Proporcionó indicaciones deliberadas: observaciones sobre el efecto fotoeléctrico, la esencia del experimento mental del “ascensor” de Einstein. En algunos casos, el modelo produjo resultados sugestivos. Al presentársele el efecto fotoeléctrico, describió la luz rompiéndose en “impulsos distintos”, insinuando el concepto de cuantos de luz. Pero Hla concluyó que el modelo falló en la mayoría de los casos, carecía de una comprensión genuina de la física que producía y a menudo “repetía como un loro palabras que parecen plausibles” sin ninguna representación interna sólida del mundo a partir de la cual razonar.
Nick Levine, un científico informático independiente también radicado en San Francisco, se encontró con un problema diferente pero igualmente revelador. Su equipo construyó un modelo antiguo entrenado solo con material disponible hasta 1930, una fecha elegida porque las obras publicadas ese año entraron en el dominio público en Estados Unidos a principios de 2026. El objetivo era probar si un modelo así podía llegar por sí mismo a conceptos desarrollados en la década de 1930, incluidas las máquinas de Turing, el teorema de incompletitud de Gödel y la postulación de los neutrinos. El obstáculo no fue el razonamiento del modelo. Fueron los propios datos de entrenamiento. Los textos históricos están llenos de artefactos de digitalización y lenguaje arcaico. Peor aún, los datos demostraron ser “molestamente permeables”: el modelo supuestamente anterior a 1930 respondía de forma espontánea y correcta a preguntas sobre eventos de la década de 1950, absorbiendo conocimientos que nunca debió tener.
Sendhil Mullainathan, un científico informático del MIT, abordó el problema de manera diferente. Su equipo dio a un modelo base de “mecánica orbital” datos sintéticos sobre sistemas planetarios que obedecen a la mecánica newtoniana, y luego le pidió que infiriera la ley de gravitación subyacente. El modelo nunca recuperó la verdadera ley. En su lugar, infirió una ley diferente e incorrecta para cada sistema planetario. Estaba ajustando curvas, no descubriendo principios.
Qué revela esto sobre la naturaleza del descubrimiento científico
Esto es lo que la mayor parte de la cobertura sobre la IA en la ciencia pasa por alto: los avances más difíciles en la historia del conocimiento no provinieron de tener más datos. Vinieron de tener la idea correcta sobre datos escasos o anómalos. Las cuidadosas observaciones de Kepler sobre el movimiento planetario fueron limitadas en número, pero le dieron a Newton la materia prima para construir sus leyes de gravedad y movimiento. La relatividad general de Einstein surgió de un experimento mental sobre un ascensor, no de una base de datos.
Ido Kaminer, especialista en óptica cuántica en el Technion de Haifa y coautor de una preimpresión titulada “Can AI follow in Einstein’s footsteps?”, argumenta que un avance a escala de relatividad no está inherentemente fuera del alcance de la IA. Pero requerirá replantear los principios fundamentales de cómo se construyen los modelos actuales. La arquitectura que hace que los LLMs de hoy sean potentes en predicción y coincidencia de patrones es la misma arquitectura que los hace estructuralmente inadecuados para el tipo de razonamiento creativo y de construcción de modelos del mundo que produce cambios de paradigma.
Hay matices aquí. Un chatbot de OpenAI este mayo desmintió una conjetura de 80 años del matemático húngaro Paul Erdős, y Mullainathan lo describe como un “avance conceptual genuino”, uno que requirió pequeñas abstracciones nuevas en lugar de una búsqueda por fuerza bruta. Pero incluso ese logro se basó en ideas ya presentes en la literatura matemática. Fue síntesis, no revelación.
En resumen
La IA se está convirtiendo en una herramienta poderosa para la ciencia: encuentra patrones, acelera la computación y ahora puede contribuir de manera significativa a las matemáticas. Lo que todavía no puede hacer es razonar desde casi la nada hasta algo genuinamente nuevo. La prueba de Einstein no es solo un punto de referencia inteligente. Es una descripción precisa de la brecha entre lo que la IA actual hace bien y lo que el descubrimiento científico, en su faceta más transformadora, realmente requiere.
Basado en información de Nature: Machine Learning.