The Brief
Gesundheit und Medizin 5 Min. Lesezeit

Gleichzeitig sprechen und gestikulieren: Was eine Genauigkeit von 88 Prozent bedeutet

NAVION

Teilen

Menschliche Kommunikation besteht selten nur aus Wörtern. Ein Nicken, ein Winken, ein Kopfschütteln: Diese Gesten transportieren Bedeutung, die Sprache allein nicht vollständig vermitteln kann. Für Menschen mit einer Lähmung, die sowohl die Fähigkeit zu sprechen als auch die zu einer Bewegung verloren haben, war diese vielschichtige Qualität der Kommunikation doppelt unerreichbar. Ein Forschungsteam der University of California, San Francisco hat nun einen konkreten Schritt unternommen, um dies wiederherzustellen, indem es mithilfe eines Gehirnimplantats beabsichtigte Sprache und Gesten gleichzeitig aus neuronaler Aktivität dekodiert.

Das Problem mit zwei Dingen gleichzeitig

Frühzeitige experimentelle Gehirnimplantate haben vielversprechende Ergebnisse bei der Wiederherstellung von entweder Sprache oder Bewegung bei Menschen mit Lähmungen gezeigt, aber die Kombination von beidem hat sich als schwierig erwiesen. Der Grund dafür ist anatomisch. Um die Signale einzufangen, die für beide Funktionen erforderlich sind, muss ein Implantat einen großen Teil des Sensorimotorkortex abdecken, also der Gehirnregion, die an der Steuerung von Sprache und Bewegung beteiligt ist. Das ist eine erhebliche technische und chirurgische Herausforderung.

Das Team der UCSF ging dieses Problem an, indem es ein Implantat in der Größe eines iPhones testete, das direkt in dieser Gehirnregion platziert wurde. Zwei Teilnehmer nahmen an der Studie teil. Der erste, genannt Bravo-1r, war nach einem Schlaganfall gelähmt worden. Der zweite, Bravo-6, hatte amyotrophe Lateralsklerose, die häufigste Form von Motoneuronen-Erkrankungen. Beide hatten fast alle Gliedmaßenbewegungen verloren und waren nicht in der Lage, verständliche Sprache zu produzieren.

Der experimentelle Aufbau war methodisch. Die Teilnehmer versuchten wiederholt, zehn Phrasen zu produzieren, darunter Begrüßungen wie „hallo“ und „wie geht’s?“, sowie zehn Gesten, wie winken, klatschen und den Kopf schütteln. Manchmal versuchten sie, Sprache und Gesten getrennt auszuführen, ein anderes Mal gleichzeitig. Die während dieser Versuche aufgezeichnete Gehirnaktivität wurde verwendet, um für jeden Teilnehmer maßgeschneiderte machine learning Modelle zu trainieren, also Modelle, die darauf ausgelegt sind, vorherzusagen, was die Person sagen oder tun wollte.

Was die Zahlen tatsächlich zeigen

Die Ergebnisse wurden getestet, indem die Teilnehmer gebeten wurden, Phrasen-Gesten-Kombinationen auszuprobieren, die die Modelle zuvor noch nicht gesehen hatten. Vorhersagen der Modelle steuerten einen Avatar, der jedem Teilnehmer ähnelte: Der Avatar bewegte sich, um die beabsichtigte Geste widerzuspiegeln, während die beabsichtigte Sprache als Text auf dem Bildschirm erschien.

Die Genauigkeitswerte sind es wert, genau betrachtet zu werden. Bei Bravo-1r erreichte die Vorhersage von Gesten eine Genauigkeit von 88 Prozent und die Sprachvorhersage 84 Prozent. Bei Bravo-6 lagen die Werte bei 66 Prozent für Gesten und 70 Prozent für Sprache. Wie Samantha Brosler, die das Projekt leitende Forscherin, anmerkte, würde ein Modell, das auf reinem Zufall beruht, angesichts der verfügbaren Optionen eine Genauigkeit von etwa 9 Prozent erreichen. Die Lücke zwischen Zufall und diesen Ergebnissen ist beträchtlich.

Henri Lorach an der University of Lausanne bot eine abgewogene Einschätzung: Die Arbeit ist robust, aber das Vokabular an Phrasen und Gesten ist nach wie vor begrenzt, und die Genauigkeit müsste für den praktischen täglichen Gebrauch ohne Frustration höher sein. Das ist eine ehrliche Einschätzung davon, wo die Technologie steht. Beeindruckend in einem Forschungskontext, aber noch nicht bereit, die volle Komplexität menschlicher Unterhaltungen zu ersetzen.

Das Team verfeinert die Modelle weiter und passt die zugrundeliegenden Algorithmen an. Eine zukünftige Richtung, die Brosler ausgemacht hat, ist die vollständige Abkehr von Avataren: Wenn die Gelenke und Muskeln eines Teilnehmers in ausreichendem Zustand sind, könnte das System schließlich Bewegungen im eigenen Körper der Person steuern und eine synthetische Stimme erzeugen, anstatt alles über eine digitale Repräsentation zu leiten.

Warum das über das Labor hinaus wichtig ist

Hier ist, was die meiste Berichterstattung über die Forschung zu Gehirn-Computer-Schnittstellen tendenziell unterbetont. Die technische Leistung, zwei gleichzeitige Ströme beabsichtigter Kommunikation aus neuronalen Signalen zu dekodieren, ist bedeutsam. Aber der tiefergehende Punkt dreht sich darum, was Kommunikation tatsächlich ist.

Wie Brosler es ausdrückte, hat das Sagen von „vielleicht“ bei gleichzeitigem Nicken eine ganz andere Bedeutung als das Sagen von „vielleicht“ bei gleichzeitigem Kopfschütteln. Dieser Unterschied ist keine kleine Nuance. Es ist der Unterschied zwischen Zustimmung und Zweifel, zwischen Aufrichtigkeit und Ironie, zwischen einer Person, die verstanden wird, und einer Person, die falsch verstanden wird. Für jemanden, der die Fähigkeit zu sprechen und sich zu bewegen verloren hat, ist die Unfähigkeit, diese Signale miteinander zu verschränken, nicht nur eine körperliche Einschränkung. Es ist eine Barriere dafür, in einem Gespräch voll und ganz präsent zu sein.

Gehirn-Computer-Schnittstellen werden oft im Hinblick auf die Wiederherstellung von Funktionen diskutiert, und diese Sichtweise ist treffend. Aber diese Forschung weist auf etwas Spezifischeres hin: die Wiederherstellung der Textur von Kommunikation. Das Ziel besteht nicht einfach darin, jemandem eine Möglichkeit zu geben, Wörter zu produzieren. Es geht darum, ihnen die Fähigkeit zurückzugeben, Dinge in dem vollen, körperlichen Sinn zu meinen, auf den menschliche Interaktion angewiesen ist.

Der Einsatz von machine learning ist hierbei nicht nebensächlich. Die Modelle werden anhand der einzigartigen neuronalen Muster jedes Einzelnen trainiert, was bedeutet, dass das System auf eine Weise personalisiert ist, die generische Hilfstechnologie nicht leisten kann. Diese Personalisierung ist zugleich eine Einschränkung, denn sie erfordert viel Aufzeichnungs- und Trainingszeit, bevor das System nützlich wird. Diesen Ansatz zu skalieren und ihn zugänglich statt experimentell zu machen, bleibt ein langer Weg.

Kurz gefasst

Ein Gehirnimplantat, das bei zwei gelähmten Menschen getestet wurde, hat beabsichtigte Sprache und Gesten gleichzeitig erfolgreich dekodiert und dabei eine Genauigkeit erzielt, die weit über dem Zufall liegt. Das System nutzt personalisierte machine learning Modelle, die anhand der neuronalen Aktivität jedes Teilnehmers trainiert wurden, und arbeitet derzeit über einen Avatar. Die Genauigkeit liegt je nach Teilnehmer und Aufgabe zwischen 66 und 88 Prozent. Forscher erkennen an, dass eine höhere Genauigkeit und ein breiteres Vokabular erforderlich sein werden, bevor die Technologie als praktisches Kommunikationswerkzeug dienen kann. Die Bedeutung dieser Arbeit liegt nicht nur im technischen Ergebnis, sondern darin, worauf sie abzielt: der vielschichtigen, multimodalen Natur menschlicher Kommunikation, die Wörter allein nicht einfangen können.

Basierend auf Berichten von New Scientist.

Geschrieben von

NAVION