I large language models sono addestrati su enormi quantità di testo, ma quel testo non è distribuito uniformemente tra le lingue del mondo. Il risultato è uno squilibrio strutturale: la generative AI funziona bene sulle lingue più parlate e male su quelle minoritarie, in particolare quelle con una presenza digitale limitata. Questa non è una nota tecnica marginale. Determina quali comunità possono beneficiare degli strumenti di IA e quali ne rimangono effettivamente escluse. Tuttavia, una storia più silenziosa si sta svolgendo accanto a questa diseguaglianza, una storia che la maggior parte dei reportage su IA e linguaggio tende a trascurare.
Il problema strutturale: non tutte le lingue sono uguali online
I sistemi di generative AI imparano dai dati. Più testo ha una lingua online, meglio un modello può rappresentarla. Per le lingue parlate da milioni di persone, questo crea un circolo virtuoso. Per le lingue minoritarie, crea l’opposto.
L’hula, parlato in Papua Nuova Guinea, ha circa 10.000 parlanti. Il tetum, la lingua franca di Timor Est, ha poco più di 1 milione di parlanti. Il dinka, parlato in Sudan del Sud, ha circa 5 milioni di parlanti ma una rappresentazione digitale molto limitata. Nessuna di queste lingue compare nei dati di addestramento dell’IA su una scala che consentirebbe ai modelli di gestirle con precisione. Quando compaiono negli output dell’IA, è probabile che vengano rappresentate in modo errato.
Questa non è semplicemente una limitazione tecnica in attesa di essere risolta. Riflette un modello più profondo: le comunità le cui lingue sono sottorappresentate online sono spesso le stesse comunità con minori risorse per sostenere l’inclusione nei processi di sviluppo commerciale dell’IA. Il divario si autoalimenta.
Comunità che costruiscono i propri strumenti
Ecco cosa sfugge alla maggior parte dei reportage: alcune di queste comunità non stanno aspettando che le grandi aziende tecnologiche risolvano il problema. Stanno costruendo le proprie soluzioni, usando l’IA come strumento di costruzione piuttosto che come prodotto finito.
Vavanagi è una piattaforma di documentazione linguistica creata interamente dalla e per la comunità hula in Papua Nuova Guinea. Guidati da Bri Olewale, i membri della comunità hanno utilizzato strumenti di programmazione basati su IA per progettare e costruire una piattaforma che non avrebbero potuto assemblare altrimenti. La comunità hula manca della forza lavoro di linguisti e ingegneri del software tipicamente richiesta per questo tipo di progetto. L’IA ha abbassato quella barriera. La piattaforma ha ora più di 80 utenti che hanno contribuito collettivamente a oltre 12.000 traduzioni inglese-hula. L’obiettivo a lungo termine è accumulare dati sufficienti per creare un’app di traduzione della lingua hula.
Tulun adotta un approccio diverso. Sviluppato in collaborazione con la organizzazione non governativa locale Maluk Timor, aiuta gli educatori sanitari a tradurre materiale di educazione sanitaria in tetum. Lo staff può gestire il proprio elenco di termini e frasi approvati, assicurandosi che le traduzioni siano accurate e contestualmente appropriate per gli operatori sanitari timoresi. Il modello di IA si adatta ai contenuti caricati dall’utente, rendendo la traduzione un processo collaborativo tra sistemi automatizzati ed esperti locali piuttosto che un output unidirezionale.
Il dizionario dinka-inglese, sviluppato da Alier Makoi Achuoth dal Sudan del Sud, risponde a un’esigenza diversa: espandere e preservare il vocabolario dinka in formato digitale. Achuoth ha utilizzato i modelli di IA per aiutare a progettare l’app, raccogliere dati e organizzarli. La sua motivazione dichiarata era sviluppare una soluzione pratica piuttosto che aspettare che un’organizzazione esterna agisse.
Tre strumenti, tre comunità, tre scopi differenti. Ciò che condividono è l’uso dell’IA per convogliare la conoscenza locale all’interno della comunità che la detiene, secondo i termini della comunità stessa.
Perché questo è importante al di là del linguaggio
Il significato di questi progetti si estende ben oltre la linguistica. Sfidano una struttura comune nelle discussioni sull’IA e sul Sud Globale: che i paesi a basso reddito e le comunità minoritarie siano principalmente parti interessate, destinatari di tecnologia sviluppata altrove, soggetti alle sue conseguenze ma non alla sua paternità.
La realtà è più stratificata. L’adozione dell’IA in Kenya e Nigeria, per esempio, risulta essere alta quanto negli Stati Uniti, il che complica l’ipotesi che i paesi a basso reddito siano semplicemente in ritardo. Le piccole imprese nel Sud Globale stanno usando la traduzione assistita da IA per competere in mercati in cui la traduzione professionale era precedentemente inaffordabile. Questi non sono casi limite. Sono segnali precoci di un tipo diverso di storia sull’adozione dell’IA.
Cat Kutay, un’informatica di discendenza aborigena della Charles Darwin University, ha osservato che diverse comunità di Prime Nazioni in Australia stanno ora sviluppando la propria tecnologia linguistica. Il quadro che offre è istruttivo: così come queste comunità hanno adottato l’automobile quando è diventata rilevante per il loro modo di vivere e di muoversi, ora stanno adottando l’IA perché è rilevante per la traduzione e la narrazione. La tecnologia viene adottata alle loro condizioni, per i loro scopi.
Questo è importante per il modo in cui ricercatori, finanziatori e responsabili politici pensano allo sviluppo dell’IA. Un modello dall’alto verso il basso, in cui le grandi istituzioni costruiscono strumenti e le comunità li ricevono, tralascia l’agency che è già presente. I progetti guidati dalla comunità non sono una soluzione di ripiego. Possono produrre le rappresentazioni digitali più accurate e culturalmente radicate delle lingue minoritarie attualmente esistenti.
In breve
Il divario linguistico dell’IA è reale: le lingue minoritarie con una presenza online limitata sono mal servite dai large language models, e quel divario non si chiude automaticamente. Ma le comunità non sono passive di fronte a questo. Progetti come Vavanagi, Tulun e il dizionario dinka-inglese dimostrano che l’IA può funzionare come strumento abilitante, abbassando il costo e la barriera tecnica abbastanza da permettere alle comunità di costruire ciò di cui hanno bisogno da sole. L’implicazione più ampia è che le applicazioni di IA più significative per le comunità sottorappresentate potrebbero non provenire dalle grandi aziende tecnologiche. Potrebbero arrivare dall’interno.
Basato su un articolo di The Conversation AI.