Las empresas de IA publican informes detallados sobre cómo las personas usan sus productos. Esos informes están cuidadosamente construidos, son metodológicamente coherentes y, según investigadores independientes, son sistemáticamente incompletos. Una nueva iniciativa de investigación llamada el AI Observatory intenta llenar ese vacío, y lo que descubrió desafía algunas de las suposiciones más repetidas sobre cómo se usa realmente la IA generativa.
Los datos que se quedan fuera
El Anthropic Economic Index es una de las fuentes de información más citadas sobre los patrones de uso de IA. Como su nombre lo indica, se centra en el trabajo y la productividad. Las conversaciones no relacionadas con esas categorías se filtran antes de que comience el análisis.
Cuando los investigadores del AI Observatory aplicaron la propia metodología de filtrado de Anthropic a su conjunto de datos independiente, casi la mitad de todas las conversaciones, específicamente el 48%, habrían quedado excluidas del análisis. Esas conversaciones excluidas no eran neutrales. Tenían muchas más probabilidades de involucrar temas de salud y relaciones, contenido adulto o ilícito, acoso y discursos de odio, y contenido sexual. La brecha entre lo que aparece en los informes filtrados de Anthropic y lo que muestran los datos sin filtrar no es marginal. Es estructural.
Esto no es exclusivo de Anthropic. El informe de OpenAI de 2025 sobre el uso de ChatGPT descubrió que solo el 30% de las interacciones de los consumidores estaban relacionadas con el trabajo. La mayor parte de cómo las personas realmente usan estas herramientas queda fuera del marco que los informes de las empresas tienden a construir.
Anka Reuel, candidata al doctorado en informática en el Trustworthy AI Research Lab de Stanford y codirectora del AI Observatory, plantea el problema claramente: no hay una fuente independiente para corroborar lo que informan las empresas de IA. El AI Observatory se creó para ser esa fuente.
Un panorama diferente entre modelos y a lo largo del tiempo
El AI Observatory agrupó 24 521 conversaciones a través de 85 633 turnos conversacionales, extraídos de siete conjuntos de datos del mundo real recopilados con el consentimiento de los usuarios. Esos conversaciones involucraron a 5000 usuarios interactuando con 52 modelos diferentes, incluidos ChatGPT, Gemini, Claude y Grok, entre 2023 y 2025.
Lo que revelan los datos es que el uso de la IA no es ni uniforme ni estático. Diferentes plataformas atraen diferentes comportamientos. Los usuarios recurrieron a Grok y Gemini con más frecuencia para la recuperación de información. Grok, en particular, se usó mucho para noticias y política, y también fue donde la desinformación tendía a concentrarse. El Claude de Anthropic se usó más comúnmente para la programación. Gemini atrajo más interacciones sociales y de juego de roles. ChatGPT se usó frecuentemente para la ayuda con las tareas escolares.
Las diferencias aparecieron incluso dentro del mismo modelo entre versiones. Las conversaciones con ChatGPT impulsado por GPT-3.5 tendían a ser más cortas. Las realizadas con GPT-4o fueron más largas y más iterativas, un patrón consistente con la asociación de esa versión con una mayor participación del usuario.
Con el tiempo, las conversaciones dentro de uno de los conjuntos de datos más grandes incluidos en el estudio crecieron y se volvieron más elaboradas. La charla trivial aumentó. La tendencia de los asistentes de IA a identificarse como chatbots disminuyó. Los casos de uso sensibles, definidos como intercambios que involucran contenido potencialmente dañino o restringido, cayeron, lo que puede reflejar medidas de seguridad de la plataforma más efectivas implementadas con el tiempo.
Ninguna de estas dinámicas aparece en los informes de las empresas con ninguna consistencia. Como señala Shayne Longpre, un recién graduado de doctorado del MIT Media Lab y codirector de la investigación: ningún informe de una sola empresa cuenta toda la historia.
Por qué el punto ciego importa más allá de la investigación
Esto es lo que la mayor parte de la cobertura sobre los datos de uso de IA pasa por alto: la pregunta no es solo académica. Los formuladores de políticas, los reguladores y las instituciones están tomando decisiones trascendentales sobre los riesgos y beneficios de la IA basándose en gran medida en los datos que las empresas eligen publicar, enmarcados en torno a las preguntas que las empresas eligen hacer.
David Widder, profesor asistente en la School of Information de UT-Austin que investiga la interacción humano-IA, plantea el problema directamente. Al intentar evaluar si un sistema de IA de propósito general se utiliza principalmente para fines beneficiosos o dañinos, actualmente no hay una manera independiente de responder a esa pregunta. La información relevante es propietaria.
El conjunto de datos del AI Observatory es pequeño en comparación con lo que poseen los principales laboratorios. El Anthropic Economic Index se basó en 1 millón de conversaciones de Claude. El informe de uso de OpenAI analizó 1,5 millones de conversaciones de ChatGPT. Las 24 521 conversaciones del Observatory son una fracción de eso. Los investigadores también reconocen que sus datos proporcionados voluntariamente probablemente subrepresentan el uso sensible, ya que los usuarios pueden ser menos proclives a compartir esas interacciones.
Pero la escala no es el único problema. El problema más profundo es que cuando los únicos datos disponibles provienen de partes con un interés directo en cómo esos datos se reflejan en ellas, el panorama que surge es inevitablemente parcial. Las empresas de IA, como señalan los investigadores independientes, tienden a publicar hallazgos que presentan sus plataformas favorablemente. Eso no es una conspiración. Es una estructura de incentivos.
Los datos del AI Observatory estarán disponibles para la comunidad de investigación en general, y el equipo tiene la intención de ampliar sus conjuntos de datos con el tiempo. Reuel ha declarado que lo ideal sería que las empresas de IA compartieran sus datos con investigadores independientes de manera que se preserve la privacidad. Hasta que eso suceda, cualquiera que dependa únicamente de los informes de las empresas para comprender cómo se está utilizando la IA generativa está, como dice Reuel, operando a ciegas y tomando decisiones trascendentales sin saber qué está pasando realmente más allá de esas narrativas corporativas.
En resumen
Los informes de uso de IA de las principales empresas son reales, pero selectivos. Tienden a enfatizar el trabajo y la productividad mientras filtran grandes porciones del comportamiento real del usuario, incluidas interacciones sensibles, personales y potencialmente dañinas. La investigación independiente como el AI Observatory está empezando a mostrar un panorama más completo, uno que muestra diferencias significativas entre modelos, a lo largo del tiempo y en toda la gama del comportamiento humano. Comprender el papel real de la IA en la sociedad requiere datos que ninguna empresa individual tiene el incentivo de divulgar por completo.
Basado en información de MIT Technology Review.