Durante al menos 100.000 años, un solo tipo de entidad en la Tierra pudo aprender un idioma humano con total fluidez: un niño humano. Eso cambió hace aproximadamente cuatro años. Los modelos de lenguaje grande ahora pueden mantener conversaciones que, en la superficie, son indistinguibles del intercambio humano. Y sin embargo, debajo de esa fluidez, algo profundamente extraño está sucediendo. Estos sistemas requieren una cantidad abrumadora de datos para alcanzar un nivel de competencia que un niño pequeño logra casi sin esfuerzo. Entender por qué existe esa brecha es ahora una de las preguntas abiertas más importantes tanto en la ciencia cognitiva como en la investigación de IA.
La escala del problema es difícil de comprender
Los números involucrados son difíciles de retener en la mente. Un preadolescente criado en un entorno lingüísticamente rico puede haber escuchado aproximadamente 100 millones de palabras para cuando llega a la adolescencia. Si añades la lectura a la imagen, esa cifra podría subir a unos 300 millones de palabras a los 20 años. El modelo de peso abierto de Meta, Llama 3.1, en contraste, fue entrenado con 15 billones de tokens, donde los tokens son unidades de lenguaje similares a palabras. Los modelos de frontera pueden estar entrenándose con diez veces esa cantidad, según Ethan Gotlieb Wilcox, científico cognitivo y lingüista de la Universidad de Georgetown.
Para hacer que el contraste sea tangible: si imprimieras todas las palabras usadas para entrenar a un modelo de lenguaje grande moderno, la pila de papel llegaría más allá de la Estación Espacial Internacional. Los 100 millones de palabras que un preadolescente ha escuchado se apilarían hasta unos 20 metros. Wilcox lo plantea de otra manera: Claude ha visto la cantidad de lenguaje que experimentará toda una ciudad en una generación.
Esto es lo que los investigadores llaman la brecha de eficiencia de datos. Los niños aprenden lenguaje a partir de una pequeña fracción de la entrada que las máquinas requieren, y lo hacen más rápido, de manera más confiable y con mucha menos instrucción explícita. Los niños pequeños típicamente empiezan a producir oraciones gramaticales correctas después de escuchar entre 10 y 30 millones de palabras. Entrenar a GPT-2 con 30 millones de palabras, como señala Michael C. Frank, científico cognitivo de la Universidad de Stanford, produce un generador de tonterías. No produce nada que se parezca a un niño.
Un debate que ha dado forma tanto a la lingüística como a la IA
La pregunta de cómo los niños adquieren el lenguaje no es nueva, y las respuestas competidoras a esta han tenido consecuencias reales para cómo se desarrolló la IA. En la década de 1950, el lingüista del MIT Noam Chomsky argumentó que los niños nacen con conocimiento gramatical preconfigurado. Su razonamiento era que el lenguaje, especialmente su sintaxis, es demasiado complejo y la exposición de los niños a este es demasiado limitada para que el aprendizaje ocurra puramente a través de la experiencia. Llamó a esto la “pobreza del estímulo”. En su contra estuvo el psicólogo B.F. Skinner, quien sostuvo que el lenguaje se aprendía enteramente a través del condicionamiento ambiental, de la misma manera que los animales aprenden a responder a las recompensas.
La visión de Chomsky dominó la lingüística estadounidense durante décadas, y dio forma a la investigación temprana de IA directamente. Los investigadores intentaron enseñar a las computadoras lenguaje codificando reglas gramaticales explícitamente en programas, un enfoque basado en reglas que pasó a formar parte de lo que se llamó IA simbólica. Ese enfoque falló en gran medida al producir sistemas capaces de manejar lenguaje humano real a escala. El interés en el campo se enfrió significativamente durante el periodo conocido como el invierno de la IA, que comenzó en la década de 1970.
El regreso vino por una ruta completamente diferente. Las redes neuronales, que aprenden reconociendo patrones estadísticos en lugar de seguir reglas explícitas, empezaron a superar a los sistemas basados en reglas a medida que el hardware se abarataba y el internet proporcionaba vastas cantidades de texto. Entre 2018 y 2019, modelos como BERT y GPT-2, construidos sobre una nueva arquitectura llamada transformer, demostraron que aprender de cantidades masivas de datos podía funcionar para el lenguaje. El éxito de ChatGPT en 2022 hizo eso visible para el público general.
La ironía es clara. Los modelos de lenguaje grande son, en esencia, exactamente el tipo de máquinas de aprendizaje estadístico que Chomsky argumentó que nunca podrían adquirir el lenguaje. No tienen gramática innata, ni reglas preconfiguradas, ni arquitectura biológica. Y aun así funcionan, al menos a escala. Los niños, mientras tanto, logran la misma hazaña con una fracción de los datos y sin ninguna de la infraestructura computacional. Ningún lado del viejo debate explica completamente ninguno de los casos.
Por qué esta pregunta importa más allá del laboratorio
Hay una urgencia práctica aquí que va más allá del debate académico. El internet no es infinito. Los investigadores sugieren que el suministro de datos de texto fácilmente disponibles para el entrenamiento podría agotarse tan pronto como en la década de 2030. Si los sistemas de IA solo pueden mejorar consumiendo más datos, esa trayectoria tiene un techo. Los niños demuestran que el techo no es fundamental. Es una limitación de los métodos actuales, no de la tarea en sí misma.
Cerrar la brecha de eficiencia de datos podría abrir posibilidades que los modelos actuales no pueden alcanzar: sistemas de IA entrenados eficazmente en video en lugar de texto, herramientas de lenguaje construidas para comunidades de lenguas minoritarias donde los corpus de texto grandes simplemente no existen, y modelos que generalizan a partir de ejemplos limitados de la manera en que lo hacen los humanos. Estudiar cómo aprenden los niños también ofrece una forma de probar hipótesis de larga data sobre la mente humana, incluyendo si la adquisición del lenguaje requiere estructuras biológicas innatas o si el tipo correcto de entorno de aprendizaje es suficiente.
Lo que este campo está preguntando realmente es una versión de una pregunta mucho más antigua: qué significa entender el lenguaje, y cuánto de ese entendimiento es exclusivamente humano. La IA no ha respondido esa pregunta. La ha hecho más urgente.
En resumen
Los niños aprenden lenguaje a partir de una fracción de los datos que los sistemas de IA requieren, una brecha tan grande que solo puede describirse mediante analogía. Los investigadores están estudiando cómo los niños logran esto porque la respuesta podría redefinir cómo se construyen los modelos de IA, y porque el suministro de datos de entrenamiento tiene límites. El debate entre el conocimiento innato y el aprendizaje estadístico, que dio forma tanto a la lingüística como a la IA temprana, sigue sin resolverse. Los modelos de lenguaje grande son una prueba poderosa de que la estadística puede llegar muy lejos. Los niños son una prueba igualmente poderosa de que la estadística por sí sola no es toda la historia.
Basado en información de MIT Technology Review.