The Brief
Société et éthique 5 min de lecture

Le fossé linguistique créé par l'IA et la façon dont les communautés le comblent

NAVION

Partager

Les grands modèles de langage sont entraînés sur de vastes quantités de texte, mais ce texte n’est pas réparti de manière égale entre les langues du monde. Il en résulte un déséquilibre structurel : l’IA générative donne de bons résultats pour les langues parlées par un grand nombre de personnes et de mauvais résultats pour les langues minoritaires, en particulier celles qui ont une présence numérique limitée. Il ne s’agit pas d’une simple note de bas de page technique. Cela détermine quelles communautés peuvent bénéficier des outils d’IA et quelles sont celles qui en sont effectivement exclues. Pourtant, une histoire plus discrète se déroule en parallèle de cette inégalité, une histoire que la plupart des reportages sur l’IA et le langage ont tendance à négliger.

Le problème structurel : toutes les langues ne sont pas égales en ligne

Les systèmes d’IA générative apprennent à partir de données. Plus une langue dispose de texte en ligne, mieux un modèle peut la représenter. Pour les langues parlées par des millions de personnes, cela crée un cercle vertueux. Pour les langues minoritaires, cela crée l’effet inverse.

Le hula, parlé en Papouasie-Nouvelle-Guinée, compte environ 10 000 locuteurs. Le tétoum, la lingua franca du Timor oriental, compte un peu plus d’un million de locuteurs. Le dinka, parlé au Sud-Soudan, compte environ 5 millions de locuteurs, mais une représentation numérique très limitée. Aucune de ces langues n’apparaît dans les données d’entraînement de l’IA à une échelle qui permettrait aux modèles de les traiter avec précision. Lorsqu’elles apparaissent dans les résultats de l’IA, elles risquent d’être mal représentées.

Il ne s’agit pas simplement d’une limitation technique qui attend d’être résolue. Cela reflète un schéma plus profond : les communautés dont les langues sont sous-représentées en ligne sont souvent les mêmes qui disposent de moins de ressources pour plaider en faveur de leur inclusion dans les processus de développement de l’IA commerciale. Le fossé s’aggrave de lui-même.

Des communautés qui construisent leurs propres outils

Voici ce que la plupart des reportages oublient : certaines de ces communautés n’attendent pas que les grandes entreprises technologiques résolvent le problème. Elles construisent leurs propres solutions, en utilisant l’IA comme un outil de construction plutôt que comme un produit fini.

Vavanagi est une plateforme de documentation linguistique conçue entièrement par et pour la communauté hula en Papouasie-Nouvelle-Guinée. Sous la direction de Bri Olewale, des membres de la communauté ont utilisé des outils de codage par IA pour concevoir et bâtir une plateforme qu’ils n’auraient pas pu assembler autrement. La communauté hula ne dispose pas de la main-d’œuvre de linguistes et d’ingénieurs logiciels généralement requise pour ce type de projet. L’IA a abaissé cette barrière. La plateforme compte aujourd’hui plus de 80 utilisateurs qui ont contribué collectivement à plus de 12 000 traductions entre l’anglais et le hula. L’objectif à long terme est d’accumuler suffisamment de données pour créer une application de traduction en langue hula.

Tulun adopte une approche différente. Développé en partenariat avec l’organisation non gouvernementale locale Maluk Timor, il aide les éducateurs de santé à traduire du matériel d’éducation à la santé en tétoum. Le personnel peut gérer sa propre liste de termes et d’expressions approuvés, ce qui garantit que les traductions sont exactes et adaptées au contexte des agents de santé timorais. Le modèle d’IA s’adapte au contenu téléchargé par l’utilisateur, faisant de la traduction un processus collaboratif entre des systèmes automatisés et des experts locaux plutôt qu’un résultat à sens unique.

Le dictionnaire dinka-anglais, développé par Alier Makoi Achuoth du Sud-Soudan, répond à un besoin différent : élargir et préserver le vocabulaire dinka sous forme numérique. Achuoth a utilisé des modèles d’IA pour l’aider à concevoir l’application, à collecter des données et à les organiser. Sa motivation déclarée était de développer une solution pratique plutôt que d’attendre qu’une organisation externe agisse.

Trois outils, trois communautés, trois objectifs différents. Ce qu’ils ont en commun, c’est l’utilisation de l’IA pour canaliser les connaissances locales vers la communauté qui les détient, selon les conditions de cette dernière.

Pourquoi cela compte au-delà du langage

La portée de ces projets dépasse largement le cadre de la linguistique. Ils remettent en question un cadre courant dans les discussions sur l’IA et les pays du Sud global : l’idée selon laquelle les pays à faible revenu et les communautés minoritaires sont principalement des parties touchées, des bénéficiaires de technologies développées ailleurs, soumis à leurs conséquences mais pas à leur conception.

La réalité est plus nuancée. L’adoption de l’IA au Kenya et au Nigéria, par exemple, serait aussi élevée qu’aux États-Unis, ce qui complexifie l’hypothèse selon laquelle les pays à faible revenu sont simplement à la traîne. Les petites entreprises du Sud global utilisent la traduction assistée par l’IA pour concurrencer sur des marchés où la traduction professionnelle était auparavant inabordable. Il ne s’agit pas de cas marginaux. Ce sont les premiers signaux d’un autre type de scénario d’adoption de l’IA.

Cat Kutay, informaticienne d’origine aborigène de l’Université Charles Darwin, a fait remarquer que plusieurs communautés des Premières Nations en Australie développent actuellement leur propre technologie linguistique. Le cadre qu’elle propose est instructif : tout comme ces communautés ont adopté l’automobile lorsqu’elle est devenue pertinente pour leur mode de vie et leurs déplacements, elles adoptent aujourd’hui l’IA parce qu’elle est pertinente pour la traduction et la narration. La technologie est adoptée selon leurs conditions, pour leurs propres objectifs.

Cela importe pour la façon dont les chercheurs, les bailleurs de fonds et les décideurs politiques envisagent le développement de l’IA. Un modèle descendant, dans lequel de grandes institutions construisent des outils et les communautés les reçoivent, passe à côté de la capacité d’action qui est déjà présente. Les projets menés par les communautés ne sont pas une solution de contournement. Ils peuvent produire les représentations numériques des langues minoritaires qui soient les plus précises et les plus ancrées dans la culture.

En bref

Le fossé linguistique de l’IA est bien réel : les langues minoritaires ayant une présence en ligne limitée sont mal desservies par les grands modèles de langage, et ce fossé ne se comble pas automatiquement. Mais les communautés ne sont pas passives face à cette situation. Des projets comme Vavanagi, Tulun et le dictionnaire dinka-anglais montrent que l’IA peut fonctionner comme un outil habilitant, abaissant le coût et la barrière technique juste assez pour que les communautés construisent elles-mêmes ce dont elles ont besoin. La conclusion plus générale est que les applications de l’IA les plus significatives pour les communautés sous-représentées ne proviendront peut-être pas des grandes entreprises technologiques. Elles proviendront de l’intérieur.

D’après un reportage de The Conversation AI.

Rédigé par

NAVION