The Brief
Cómo funciona la IA 5 min de lectura

Más allá del lenguaje: qué intentan hacer realmente los world models

NAVION

Compartir

Durante los últimos años, la comprensión pública de la inteligencia artificial ha estado moldeada casi por completo por los grandes modelos de lenguaje. Chatbots, generadores de texto, asistentes de código: estas son las caras de la IA con las que la mayoría de la gente se ha encontrado. Ahora, una categoría diferente está atraendo una atención seria, una financiación considerable y un gran esfuerzo de investigación. Se la conoce con el nombre de “world models”, y entender qué significa realmente ese término, y qué no significa, es más útil que seguir los anuncios.

Un término que significa varias cosas a la vez

Lo primero que hay que entender sobre los world models es que la etiqueta está en disputa. Como lo expresó claramente Ben Mildenhall, cofundador de World Labs y cocreador de la técnica NeRF (neural radiance field): pregúntale a diferentes empresas qué es un world model, y cada una dará una respuesta ligeramente diferente.

En su sentido más general, un world model es cualquier sistema que toma una interacción como entrada y simula lo que sucedería a continuación en algún entorno. Runway, la empresa de IA de video, lo define como un sistema que construye una representación interna de un entorno y utiliza esa representación para simular eventos futuros. Fei-Fei Li, la pionera de la visión por computadora que cofundó World Labs, ha propuesto tres criterios: el sistema genera resultados con consistencia perceptiva, geométrica y física; es multimodal por diseño; y produce estados posteriores basados en las acciones de entrada.

Vincent Sitzmann, profesor asistente en el MIT que dirige el Scene Representation Group dentro de CSAIL, ofrece una observación más sólida sobre dónde se encuentra realmente el campo hoy en día. La mayoría de las personas que utilizan el término “world model”, señala, en realidad están hablando de generar píxeles: producir video realista que responde a acciones. Esa es una capacidad significativa, pero no es lo mismo que simular la física o razonar sobre el espacio en un sentido profundo. Vale la pena tener en cuenta la brecha entre el lenguaje de marketing y la realidad técnica.

En qué se diferencian los world models de los LLMs y por qué eso importa

La distinción entre los world models y los grandes modelos de lenguaje no es solo técnica. Refleja una teoría diferente de lo que requiere la inteligencia.

Los LLM operan con el lenguaje. Son, como escribió Fei-Fei Li, “forjadores de palabras en la oscuridad”: capaces de producir texto elocuente y bien informado, pero sin arraigo en el mundo físico. Yann LeCun, exdirector científico de IA en Meta, ha argumentado que extender los LLM hacia una inteligencia de nivel humano es, en sus palabras, un “sinsentido absoluto”. Clem Delangue, CEO de Hugging Face, una importante plataforma para alojar modelos de lenguaje, ha sugerido que la burbuja de los LLM puede estar acercándose a sus límites, al tiempo que señala que la IA aplicada a la biología, la química, la imagen, el audio y el video aún se encuentra en sus primeras etapas.

Los world models están diseñados para abordar esta brecha. Mientras que una interacción con un LLM es por turnos —un prompt de texto seguido de una respuesta de texto—, Mildenhall describe un world model como algo síncrono y en tiempo real. El usuario o agente no se mueve a través de una secuencia lineal de intercambios. En su lugar, interactúa con algo que se comporta como un entorno, donde suceden múltiples cosas en paralelo y son posibles las acciones continuas. Este es un modo de interacción fundamentalmente diferente, más cercano a navegar por un espacio que a mantener una conversación.

Los objetivos prácticos de los world models reflejan esta diferencia. Los investigadores y las empresas de este sector están centrados en entrenar y probar robots, generar recursos tridimensionales para juegos y producción cinematográfica, y realizar simulaciones científicas. Estos son dominios donde el lenguaje por sí solo es insuficiente y donde la capacidad de modelar relaciones espaciales y dinámicas físicas es esencial.

Por qué el auge de la financiación señala un cambio estructural

El impulso comercial detrás de los world models es real. Según se informa, World Labs y AMI recaudaron alrededor de 1000 millones de dólares cada una en febrero y marzo, respectivamente. Runway recaudó 315 millones de dólares en febrero. Estas no son apuestas especulativas sobre un futuro lejano: reflejan la convicción de que hay aplicaciones específicas a corto plazo al alcance de la mano.

Esto es lo que la mayoría de la cobertura sobre los world models pasa por alto. A diferencia de los grandes modelos de lenguaje, que comenzaron con una interfaz de propósito general (el chatbot) y luego buscaron casos de uso, los principales esfuerzos en world models están trabajando en la dirección opuesta. Comienzan con problemas concretos: entrenamiento de robots, generación de recursos, modelado científico. Las interfaces y herramientas que eventualmente ofrecerán estas capacidades a los usuarios aún se están desarrollando.

El término “world model” en sí tiene una historia más larga de lo que sugiere la ola actual de anuncios. Ha aparecido en la investigación sobre aprendizaje por refuerzo y robótica durante años, utilizado para describir modelos que predicen cómo cambian los entornos. Lo nuevo es la ambición de escalar esa idea a sistemas generativos de propósito general entrenados con grandes volúmenes de datos visuales y multimodales.

En resumen

Los world models no son un reemplazo de los grandes modelos de lenguaje. Son un enfoque diferente para un problema diferente: cómo construir sistemas de IA que puedan razonar sobre el espacio, simular la dinámica física e interactuar con entornos en tiempo real en lugar de hacerlo a través de intercambios de texto. El término está genuinamente sobrecargado, ya que se utiliza para describir desde la generación de video hasta la evaluación de políticas de robots y la creación de recursos en 3D. La convicción subyacente, compartida por investigadores del MIT, World Labs y Runway, es que una arquitectura de modelo fundamental debería ser capaz de abordar eventualmente muchos de estos problemas. Si esa convicción resulta ser correcta sigue siendo una pregunta abierta. Lo que ya está claro es que el campo ha pasado de ser un tema de investigación a una prioridad comercial, y las aplicaciones que se están construyendo sobre él están fundamentadas en necesidades prácticas, no en especulaciones abstractas.

Basado en información de Ars Technica.

Escrito por

NAVION