La comunicazione umana raramente si riduce alle sole parole. Un cenno, un gesto della mano, un movimento della testa: questi gesti trasmettono un significato che il solo parlato non può pienamente esprimere. Per le persone affette da paralisi che hanno perso la capacità sia di parlare sia di muoversi, questa qualità stratificata della comunicazione è stata doppiamente fuori portata. Un gruppo di ricerca dell’University of California, San Francisco ha ora compiuto un passo concreto verso il suo ripristino, utilizzando un impianto cerebrale per decodificare simultaneamente l’intenzione di parlare e di gesticolare a partire dall’attività neurale.
Il Problema di Fare Due Cose in Un Momento
Precedenti impianti cerebrali sperimentali hanno mostrato risultati promettenti nel ripristinare la parola o il movimento in persone con paralisi, ma combinare entrambe le cose si è rivelato difficile. Il motivo è anatomico. Per catturare i segnali necessari a entrambe le funzioni, un impianto deve coprire gran parte della corteccia sensoresomotoria, la regione del cervello coinvolta nel controllo del linguaggio e del movimento. Questa è una sfida ingegneristica e chirurgica significativa.
Il team di UCSF ha affrontato la questione testando un impianto delle dimensioni di un iPhone posizionato direttamente in quella regione del cervello. Due partecipanti hanno preso parte allo studio. Il primo, indicato come Bravo-1r, era rimasto paralizzato in seguito a un ictus. Il secondo, Bravo-6, soffriva di sclerosi laterale amiotrofica, la forma più comune di malattia dei motoneuroni. Entrambi avevano perso quasi ogni movimento degli arti ed erano incapaci di produrre un linguaggio intelligibile.
La configurazione sperimentale è stata metodica. I partecipanti hanno ripetutamente tentato di produrre dieci frasi, tra cui saluti come “ciao” e “come va?”, e dieci gesti, come salutare con la mano, applaudire e scuotere la testa. Talvolta hanno tentato il linguaggio e il gesto separatamente, altre volte simultaneamente. L’attività cerebrale registrata durante questi tentativi è stata utilizzata per addestrare modelli di machine learning personalizzati per ciascun partecipante, modelli costruiti per prevedere ciò che la persona intendeva dire o fare.
Cosa Mostrano Davvero i Numeri
I risultati sono stati testati chiedendo ai partecipanti di tentare combinazioni di frasi e gesti che i modelli non avevano mai visto in precedenza. Le previsioni dei modelli guidavano un avatar che somigliava a ciascun partecipante: l’avatar si muoveva per riflettere il gesto inteso, mentre il discorso inteso appariva come testo sullo schermo.
I dati sull’accuratezza meritano di essere esaminati con attenzione. Per Bravo-1r, la previsione dei gesti ha raggiunto l’88 per cento di accuratezza e quella del linguaggio l’84 per cento. Per Bravo-6, le cifre sono state del 66 per cento per i gesti e del 70 per cento per il linguaggio. Come ha osservato Samantha Brosler, la ricercatrice che guida il lavoro, un modello che operasse puramente a caso raggiungerebbe circa il 9 per cento di accuratezza data la gamma di opzioni disponibili. Il divario tra il caso e questi risultati è notevole.
Henri Lorach all’University of Lausanne ha offerto una valutazione misurata: il lavoro è solido, ma il vocabolario di frasi e gesti rimane limitato, e l’accuratezza dovrebbe essere superiore per un pratico uso quotidiano senza frustrazione. Questa è una rappresentazione onesta della posizione in cui si trova la tecnologia. Impressiva in un contesto di ricerca, non ancora pronta a sostituire la piena complessità della conversazione umana.
Il team sta continuando a perfezionare i modelli e ad adeguare gli algoritmi sottostanti. Una direzione futura identificata da Brosler è andare oltre gli avatar: se le articolazioni e i muscoli di un partecipante sono in condizioni adeguate, il sistema potrebbe un giorno guidare il movimento nel corpo stesso della persona e generare una voce sintetica, anziché convogliare tutto attraverso una rappresentazione digitale.
Perché Questo È Importante Oltre il Laboratorio
Ecco cosa la maggior parte della copertura mediatica sulla ricerca delle interfacce cervello-computer tende a sminuire. Il risultato tecnico, ovvero la decodifica di due flussi simultanei di comunicazione intenzionale dai segnali neurali, è significativo. Ma il punto più profondo riguarda ciò che la comunicazione è realmente.
Come ha dichiarato Brosler, dire “forse” annuendo porta un significato molto diverso rispetto a dire “forse” scuotendo la testa. Questa distinzione non è una sfumatura minore. È la differenza tra accordo e dubbio, tra sincerità e ironia, tra una persona che viene compresa e una persona che viene fraintesa. Per qualcuno che ha perso la capacità di parlare e muoversi, l’incapacità di stratificare insieme quei segnali non è solo una limitazione fisica. È una barriera all’essere pienamente presenti in una conversazione.
Le interfacce cervello-computer vengono spesso discusse in termini di ripristino della funzione, e questa prospettiva è accurata. Ma questa ricerca punta verso qualcosa di più specifico: il ripristino della consistenza della comunicazione. L’obiettivo non è semplicemente dare a qualcuno un modo per produrre parole. È restituire la capacità di esprimere significati nel senso pieno e incarnato da cui dipende l’interazione umana.
L’uso del machine learning qui non è incidentale. I modelli sono addestrati sui pattern neurali unici di ciascun individuo, il che significa che il sistema è personalizzato in un modo che la tecnologia assistiva generica non può replicare. Questa personalizzazione è anche un vincolo: richiede una notevole quantità di registrazione e tempo di addestramento prima che il sistema diventi utile. Scalare questo approccio e renderlo accessibile anziché sperimentale rimane una lunga strada.
In Breve
Un impianto cerebrale testato in due persone con paralisi ha decodificato con successo il linguaggio e i gesti intenzionali simultaneamente, raggiungendo un’accuratezza ben superiore al caso. Il sistema utilizza modelli di machine learning personalizzati addestrati sull’attività neurale di ciascun partecipante e attualmente opera attraverso un avatar. L’accuratezza varia dal 66 all’88 per cento a seconda del partecipante e del compito. I ricercatori riconoscono che saranno necessari una maggiore accuratezza e un vocabolario più ampio prima che la tecnologia possa servire come strumento di comunicazione pratico. Il significato del lavoro risiede non solo nel risultato tecnico, ma in ciò a cui mira: la natura stratificata e multimodale della comunicazione umana che le sole parole non possono catturare.
Basato su un articolo di New Scientist.