Große Sprachmodelle werden mit riesigen Mengen an Text trainiert, aber dieser Text ist nicht gleichmäßig über die Sprachen der Welt verteilt. Das Ergebnis ist ein strukturelles Ungleichgewicht: Generative KI funktioniert bei weit verbreiteten Sprachen gut und bei Minderheitensprachen schlecht, insbesondere bei solchen mit begrenzter digitaler Präsenz. Das ist keine unbedeutende technische Fußnote. Es bestimmt, welche Gemeinschaften von KI-Werkzeugen profitieren können und welche effektiv außen vor bleiben. Doch parallel zu dieser Ungleichheit entfaltet sich eine leisere Geschichte, die die meiste Berichterstattung über KI und Sprache tendenziell übersieht.
Das strukturelle Problem: Nicht alle Sprachen sind online gleich
Generative KI-Systeme lernen aus Daten. Je mehr Text eine Sprache online hat, desto besser kann ein Modell sie abbilden. Für Sprachen, die von Millionen gesprochen werden, schafft dies einen positiven Kreislauf. Für Minderheitensprachen erzeugt es das Gegenteil.
Hula, gesprochen in Papua-Neuguinea, hat etwa 10.000 Sprecher. Tetun, die Lingua Franca von Timor-Leste, hat knapp über 1 Million. Dinka, gesprochen im Südsudan, hat ungefähr 5 Millionen Sprecher, aber eine sehr begrenzte digitale Präsenz. Keine dieser Sprachen taucht in KI-Trainingsdaten in einem Umfang auf, der es Modellen erlauben würde, sie genau zu handhaben. Wenn sie überhaupt in KI-Ausgaben auftauchen, werden sie wahrscheinlich falsch dargestellt.
Das ist nicht einfach eine technische Einschränkung, die darauf wartet, behoben zu werden. Es spiegelt ein tieferes Muster wider: Die Gemeinschaften, deren Sprachen online unterrepräsentiert sind, sind oft dieselben Gemeinschaften mit weniger Ressourcen, um sich für die Inklusion in kommerziellen KI-Entwicklungspipelines stark zu machen. Die Lücke verstärkt sich selbst.
Gemeinschaften bauen ihre eigenen Werkzeuge
Hier ist, was die meiste Berichterstattung übersieht: Einige dieser Gemeinschaften warten nicht darauf, dass große Technologieunternehmen das Problem lösen. Sie bauen ihre eigenen Lösungen und nutzen KI dabei eher als Bauwerkzeug denn als fertiges Produkt.
Vavanagi ist eine Sprachdokumentationsplattform, die vollständig von und für die Hula-Gemeinschaft in Papua-Neuguinea entwickelt wurde. Unter der Leitung von Bri Olewale nutzten Gemeindemitglieder KI-Codierungswerkzeuge, um eine Plattform zu entwerfen und zu bauen, die sie sonst nicht hätten zusammenstellen können. Der Hula-Gemeinschaft fehlt die Belegschaft aus Linguisten und Softwareentwicklern, die für diese Art von Projekt normalerweise erforderlich ist. KI hat diese Hürde gesenkt. Die Plattform hat inzwischen mehr als 80 Nutzer, die gemeinsam über 12.000 Englisch-Hula-Übersetzungen beigesteuert haben. Das langfristige Ziel ist es, genügend Daten anzuhäufen, um eine App für Hula-Sprachübersetzung zu bauen.
Tulun verfolgt einen anderen Ansatz. In Partnerschaft mit der lokalen Nichtregierungsorganisation Maluk Timor gebaut, hilft es Gesundheitspädagogen dabei, Gesundheitsmaterial in Tetun zu übersetzen. Mitarbeiter können ihre eigene Liste an genehmigten Begriffen und Phrasen verwalten, um sicherzustellen, dass Übersetzungen genau und für timoresische Gesundheitspfleger kontextuell angemessen sind. Das KI-Modell passt sich an vom Nutzer hochgeladene Inhalte an, wodurch die Übersetzung zu einem kollaborativen Prozess zwischen automatisierten Systemen und lokalen Experten wird anstelle einer Einwegausgabe.
Das Dinka-Englisch-Wörterbuch, entwickelt von Alier Makoi Achuoth aus dem Südsudan, adressiert einen anderen Bedarf: die Erweiterung und Bewahrung des Dinka-Worschatzes in digitaler Form. Achuoth nutzte KI-Modelle, um das Design der App zu unterstützen, Daten zu sammeln und diese zu organisieren. Seine erklärte Motivation war es, eine praktische Lösung zu entwickeln, anstatt auf das Handeln einer externen Organisation zu warten.
Drei Werkzeuge, drei Gemeinschaften, drei verschiedene Zwecke. Was sie gemeinsam haben, ist die Nutzung von KI, um lokales Wissen in die Gemeinschaft zurückzuführen, die es besitzt, und zwar zu den Bedingungen der Gemeinschaft selbst.
Warum das über Sprache hinaus wichtig ist
Die Bedeutung dieser Projekte geht weit über die Linguistik hinaus. Sie stellen ein gängiges Raster in Diskussionen über KI und den globalen Süden infrage: dass einkommensschwache Länder und Minderheitengemeinschaften primär betroffene Parteien sind, Empfänger von Technologie, die anderswo entwickelt wurde, den Konsequenzen ausgesetzt, aber nicht ihrer Urheberschaft.
Die Realität ist vielschichtiger. Die Einführung von KI in Kenia und Nigeria beispielsweise ist Berichten zufolge ebenso hoch wie in den Vereinigten Staaten, was die Annahme kompliziert, dass einkommensschwache Länder einfach hinterherhinken. Kleine Unternehmen im globalen Süden nutzen KI-gestützte Übersetzung, um in Märkten zu konkurrieren, in denen professionelle Übersetzung zuvor unbezahlbar war. Das sind keine Randfälle. Sie sind frühe Signale für eine andere Art der KI-Einführungsgeschichte.
Cat Kutay, eine Informatikerin mit australischen Urwurzeln von der Charles Darwin University, hat angemerkt, dass mehrere indigene Gemeinschaften in Australien nun ihre eigene Sprachtechnologie entwickeln. Das Raster, das sie anbietet, ist lehrreich: So wie diese Gemeinschaften das Auto übernahmen, als es für ihre Lebens- und Fortbewegungsweise relevant wurde, übernehmen sie jetzt KI, weil sie für Übersetzung und Geschichtenerzählen relevant ist. Die Technologie wird zu ihren Bedingungen und für ihre Zwecke aufgegriffen.
Das ist wichtig dafür, wie Forscher, Geldgeber und politische Entscheidungsträger über die KI-Entwicklung denken. Ein Top-down-Modell, bei dem große Institutionen Werkzeuge bauen und Gemeinschaften sie erhalten, verfehlt die Eigenverantwortung, die bereits vorhanden ist. Von der Gemeinschaft geführte Projekte sind kein Workaround. Sie bringen möglicherweise die genauesten und kulturell fundiertesten digitalen Repräsentationen von Minderheitensprachen hervor, die es gibt.
Kurz gesagt
Die Sprachlücke der KI ist real: Minderheitensprachen mit begrenzter Online-Präsenz werden von großen Sprachmodellen schlecht bedient, und diese Lücke schließt sich nicht von selbst. Aber Gemeinschaften sind demgegenüber nicht passiv. Projekte wie Vavanagi, Tulun und das Dinka-Englisch-Wörterbuch zeigen, dass KI als befähigendes Werkzeug fungieren kann, das die Kosten und die technische Hürde so weit senkt, dass Gemeinschaften selbst bauen können, was sie brauchen. Die breitere Implikation ist, dass die aussagekräftigsten KI-Anwendungen für unterrepräsentierte Gemeinschaften vielleicht nicht von großen Technologieunternehmen kommen. Sie kommen möglicherweise von innen.
Basierend auf Berichten von The Conversation AI.