The Brief
Santé et médecine 5 min de lecture

Parler et faire des gestes en même temps: ce que signifie une précision de 88 pour cent

NAVION

Partager

La communication humaine se résume rarement à de simples mots. Un signe de tête, un geste de la main, un mouvement négatif: ces gestes véhiculent un sens que la parole seule ne peut pas pleinement exprimer. Pour les personnes vivant avec une paralysie qui ont perdu à la fois l’usage de la parole et de leurs mouvements, cette dimension nuancée de la communication était doublement inaccessible. Une équipe de recherche de l’University of California, San Francisco a désormais franchi une étape concrète pour y remédier, en utilisant un implant cérébral pour décoder simultanément l’intention de parler et de faire un geste à partir de l’activité neurale.

Le problème de faire deux choses en même temps

De précédents implants cérébraux expérimentaux ont montré des résultats prometteurs pour restituer soit la parole, soit le mouvement à des personnes paralysées, mais combiner les deux s’est avéré difficile. La raison est anatomique. Pour capturer les signaux nécessaires à ces deux fonctions, un implant doit couvrir une large partie du cortex sensorimoteur, la région du cerveau impliquée dans le contrôle de la parole et du mouvement. C’est un défi technique et chirurgical important.

L’équipe de l’UCSF a résolu ce problème en testant un implant de la taille d’un iPhone placé directement dans cette région du cerveau. Deux participants ont pris part à l’étude. Le premier, désigné sous le nom de Bravo-1r, était devenu paralysé à la suite d’un accident vasculaire cérébral. Le second, Bravo-6, souffrait de sclérose latérale amyotrophique, la forme la plus courante de maladie du motoneurone. Tous deux avaient perdu la quasi-totalité des mouvements de leurs membres et étaient incapables de produire un discours intelligible.

Le protocole expérimental était méthodique. Les participants ont tenté à plusieurs reprises de produire dix phrases, incluant des salutations comme “bonjour” et “comment ça va ?”, ainsi que dix gestes, tels que faire signe de la main, applaudir et secouer la tête. Parfois, ils tentaient de parler et de faire un geste séparément, et d’autres fois, simultanément. L’activité cérébrale enregistrée lors de ces tentatives a servi à entraîner des modèles de machine learning personnalisés pour chaque participant, des modèles conçus pour prédire ce que la personne avait l’intention de dire ou de faire.

Ce que les chiffres montrent réellement

Les résultats ont été testés en demandant aux participants d’essayer des combinaisons de phrases et de gestes que les modèles n’avaient jamais vues auparavant. Les prédictions des modèles pilotaient un avatar ressemblant à chaque participant: l’avatar bougeait pour refléter le geste voulu, tandis que la parole voulue apparaissait sous forme de texte à l’écran.

Il convient d’examiner attentivement les chiffres de précision. Pour Bravo-1r, la prédiction des gestes a atteint une précision de 88 pour cent et la prédiction de la parole a atteint 84 pour cent. Pour Bravo-6, les chiffres étaient de 66 pour cent pour les gestes et de 70 pour cent pour la parole. Comme l’a fait remarquer Samantha Brosler, la chercheuse qui dirige ces travaux, un modèle fonctionnant par pur hasard atteindrait environ 9 pour cent de précision compte tenu de l’éventail des options disponibles. L’écart entre le hasard et ces résultats est considérable.

Henri Lorach, de l’Université de Lausanne, a proposé une évaluation mesurée: le travail est solide, mais le vocabulaire des phrases et des gestes reste limité, et la précision devrait être plus élevée pour un usage quotidien pratique sans frustration. C’est une description honnête de la situation actuelle de la technologie. Impressionnant dans un contexte de recherche, mais pas encore prêt à remplacer toute la complexité d’une conversation humaine.

L’équipe continue d’affiner les modèles et d’ajuster les algorithmes sous-jacents. Une orientation future identifiée par Brosler consiste à se passer complètement des avatars: si les articulations et les muscles d’un participant sont en état adéquat, le système pourrait éventuellement piloter les mouvements du corps de la personne elle-même et générer une voix de synthèse, plutôt que de tout faire transiter par une représentation numérique.

Pourquoi cela compte au-delà du laboratoire

Voici ce que la plupart des reportages sur la recherche en interfaces cerveau-ordinateur ont tendance à minimiser. La réussite technique, qui consiste à décoder deux flux simultanés de communication intentionnelle à partir de signaux neuraux, est importante. Mais le point le plus profond concerne la nature réelle de la communication.

Comme l’a formulé Brosler, dire “peut-être” tout en hochant la tête revêt un sens très différent que de dire “peut-être” en secouant la tête. Cette distinction n’est pas une nuance mineure. C’est la différence entre l’accord et le doute, entre la sincérité et l’ironie, entre une personne qui est comprise et une personne qui est mal interprétée. Pour quelqu’un qui a perdu la capacité de parler et de bouger, l’incapacité d’associer ces signaux n’est pas seulement une limitation physique. C’est un obstacle à une présence pleine et entière dans une conversation.

Les interfaces cerveau-ordinateur sont souvent discutées sous l’angle de la restauration des fonctions, et cette approche est exacte. Mais cette recherche pointe vers quelque chose de plus spécifique: la restauration de la texture de la communication. L’objectif n’est pas simplement de donner à quelqu’un un moyen de produire des mots. C’est de lui restituer la capacité de signifier des choses dans le sens complet et incarné dont dépend l’interaction humaine.

L’utilisation du machine learning ici n’a rien d’accessoire. Les modèles sont entraînés sur les schémas neuraux uniques de chaque individu, ce qui signifie que le système est personnalisé d’une manière qu’une technologie d’assistance générique ne peut égaler. Cette personnalisation est également une contrainte: elle exige un temps d’enregistrement et d’entraînement substantiel avant que le système ne devienne utile. Déployer cette approche à plus grande échelle et la rendre accessible plutôt qu’expérimentale reste un long chemin.

En bref

Un implant cérébral testé chez deux personnes paralysées a décodé avec succès l’intention de parler et de faire un geste simultanément, atteignant une précision bien supérieure au hasard. Le système utilise des modèles de machine learning personnalisés, entraînés sur l’activité neurale de chaque participant, et fonctionne actuellement par l’intermédiaire d’un avatar. La précision varie de 66 à 88 pour cent selon le participant et la tâche. Les chercheurs reconnaissent qu’une précision accrue et un vocabulaire plus large seront nécessaires avant que la technologie ne puisse servir d’outil de communication pratique. L’importance de ces travaux réside non seulement dans le résultat technique, mais aussi dans leur cible: la nature multimodale et nuancée de la communication humaine que les mots seuls ne peuvent capturer.

D’après un reportage de New Scientist.

Rédigé par

NAVION