The Brief
Sociedad y ética 5 min de lectura

La brecha de los idiomas que crea la IA, y cómo las comunidades la están cerrando

NAVION

Compartir

Los modelos de lenguaje grandes se entrenan con enormes cantidades de texto, pero ese texto no se distribuye de manera uniforme entre los idiomas del mundo. El resultado es un desequilibrio estructural: la IA generativa funciona bien en los idiomas muy hablados y mal en los minoritarios, en particular aquellos con una presencia digital limitada. Esto no es una nota al pie técnica menor. Define qué comunidades pueden beneficiarse de las herramientas de IA y cuáles se quedan fuera de manera efectiva. Sin embargo, una historia más silenciosa se desarrolla junto a esta desigualdad, una que la mayoría de la cobertura sobre la IA y el lenguaje suele pasar por alto.

El problema estructural: no todos los idiomas son iguales en línea

Los sistemas de IA generativa aprenden de los datos. Cuanto más texto tiene un idioma en línea, mejor puede representarlo un modelo. Para los idiomas hablados por millones, esto crea un ciclo virtuoso. Para los idiomas minoritarios, crea lo contrario.

El hula, hablado en Papúa Nueva Guinea, tiene unos 10.000 hablantes. El tetun, la lingua franca de Timor Oriental, tiene poco más de 1 millón. El dinka, hablado en Sudán del Sur, tiene aproximadamente 5 millones de hablantes, pero una representación digital muy limitada. Ninguno de estos idiomas aparece en los datos de entrenamiento de la IA a una escala que permita a los modelos manejarlos con precisión. Cuando aparecen en los resultados de la IA, es probable que estén mal representados.

Esto no es simplemente una limitación técnica a la espera de ser solucionada. Refleja un patrón más profundo: las comunidades cuyos idiomas están infrarrepresentados en línea son a menudo las mismas comunidades con menos recursos para abogar por la inclusión en los procesos de desarrollo comercial de IA. El vacío se agrava a sí mismo.

Comunidades que construyen sus propias herramientas

Esto es lo que la mayoría de la cobertura pasa por alto: algunas de estas comunidades no están esperando a que las grandes empresas tecnológicas resuelvan el problema. Están construyendo sus propias soluciones, utilizando la IA como una herramienta de construcción en lugar de un producto terminado.

Vavanagi es una plataforma de documentación lingüística creada enteramente por y para la comunidad hula en Papúa Nueva Guinea. Liderados por Bri Olewale, los miembros de la comunidad utilizaron herramientas de programación de IA para diseñar y construir una plataforma que no habrían podido ensamblar de otro modo. La comunidad hula carece de la fuerza laboral de lingüistas e ingenieros de software que normalmente se requiere para este tipo de proyectos. La IA redujo esa barrera. La plataforma cuenta ahora con más de 80 usuarios que han contribuido colectivamente con más de 12.000 traducciones del inglés al hula. El objetivo a largo plazo es acumular suficientes datos para construir una aplicación de traducción del idioma hula.

Tulun adopta un enfoque diferente. Creada en colaboración con la organización no gubernamental local Maluk Timor, ayuda a los educadores de salud a traducir material de educación sanitaria al tetun. El personal puede gestionar su propia lista de términos y frases aprobados, lo que garantiza que las traducciones sean precisas y contextualmente adecuadas para los trabajadores sanitarios timorenses. El modelo de IA se adapta al contenido subido por el usuario, lo que convierte la traducción en un proceso de colaboración entre sistemas automatizados y expertos locales en lugar de un resultado unidireccional.

El diccionario dinka-inglés, desarrollado por Alier Makoi Achuoth desde Sudán del Sur, responde a una necesidad diferente: ampliar y preservar el vocabulario dinka en formato digital. Achuoth utilizó modelos de IA para ayudar a diseñar la aplicación, recopilar datos y organizarlos. Su motivación declarada fue desarrollar una solución práctica en lugar de esperar a que una organización externa actuara.

Tres herramientas, tres comunidades, tres propósitos diferentes. Lo que comparten es el uso de la IA para canalizar el conocimiento local de vuelta a la comunidad que lo posee, en los propios términos de la comunidad.

Por qué esto importa más allá del lenguaje

La importancia de estos proyectos se extiende mucho más allá de la lingüística. Desafían un marco común en los debates sobre la IA y el Sur Global: que los países de menores ingresos y las comunidades minoritarias son principalmente partes afectadas, receptoras de tecnología desarrollada en otra parte, sujetas a sus consecuencias pero no a su autoría.

La realidad es más compleja. Se informa que la adopción de IA en Kenia y Nigeria, por ejemplo, es tan alta como en Estados Unidos, lo que complica la suposición de que los países de bajos ingresos simplemente se están quedando atrás. Las pequeñas empresas del Sur Global están utilizando la traducción asistida por IA para competir en mercados donde la traducción profesional era antes inaccesible. Estos no son casos marginales. Son señales tempranas de un tipo diferente de historia de adopción de IA.

Cat Kutay, una informática de ascendencia aborigen de la Universidad Charles Darwin, ha señalado que varias comunidades de las Primeras Naciones en Australia están desarrollando ahora su propia tecnología lingüística. El marco que ofrece es instructivo: al igual que estas comunidades adoptaron el automóvil cuando se volvió relevante para su forma de vivir y desplazarse, ahora están adoptando la IA porque es relevante para la traducción y la narración de historias. La tecnología se está adoptando en sus propios términos, para sus propios propósitos.

Esto importa para la forma en que los investigadores, los financiadores y los responsables políticos piensan sobre el desarrollo de la IA. Un modelo de arriba hacia abajo, en el que las grandes instituciones construyen herramientas y las comunidades las reciben, pasa por alto la capacidad de acción que ya está presente. Los proyectos liderados por la comunidad no son una solución provisional. Pueden producir las representaciones digitales más precisas y culturalmente arraigadas de los idiomas minoritarios que existen.

En resumen

La brecha lingüística de la IA es real: los idiomas minoritarios con una presencia digital limitada están mal atendidos por los modelos de lenguaje grandes, y esa brecha no se cierra automáticamente. Pero las comunidades no son pasivas ante esto. Proyectos como Vavanagi, Tulun y el diccionario dinka-inglés demuestran que la IA puede funcionar como una herramienta facilitadora, reduciendo el costo y la barrera técnica lo suficiente como para que las comunidades construyan lo que necesitan por sí mismas. La implicación más amplia es que las aplicaciones de IA más significativas para las comunidades infrarrepresentadas puede que no provengan de las grandes empresas tecnológicas. Puede que provengan desde dentro.

Basado en información de The Conversation AI.

Escrito por

NAVION