The Brief
Salud y medicina 5 min de lectura

Hablar y hacer gestos a la vez: qué significa una precisión del 88 por ciento

NAVION

Compartir

La comunicación humana rara vez se reduce a meras palabras. Un asentimiento, un saludo con la mano, un movimiento de cabeza: estos gestos transmiten un significado que el habla por sí sola no puede expresar por completo. Para las personas que viven con parálisis y han perdido la capacidad tanto de hablar como de moverse, esa cualidad matizada de la comunicación ha estado doblemente fuera de su alcance. Un equipo de investigación de la Universidad de California en San Francisco ha dado ahora un paso concreto hacia su recuperación, utilizando un implante cerebral para decodificar de forma simultánea la intención de hablar y gesticular a partir de la actividad neuronal.

El problema de hacer dos cosas a la vez

Los implantes cerebrales experimentales anteriores han demostrado ser prometedores para restaurar el habla o el movimiento en personas con parálisis, pero combinar ambos ha resultado difícil. El motivo es anatómico. Para capturar las señales necesarias para ambas funciones, un implante debe cubrir una gran parte de la corteza sensoriomotora, la región del cerebro implicada en el control del habla y el movimiento. Se trata de un reto de ingeniería y cirugía considerable.

El equipo de la UCSF abordó esta cuestión probando un implante del tamaño de un iPhone colocado directamente en esa región del cerebro. Dos participantes tomaron parte en el estudio. El primero, denominado Bravo-1r, se había quedado paralizado tras un derrame cerebral. El segundo, Bravo-6, padecía esclerosis lateral amiotrófica, la forma más común de enfermedad de la motoneurona. Ambos habían perdido casi todo el movimiento de las extremidades y eran incapaces de producir un discurso inteligible.

La configuración experimental fue metódica. Los participantes intentaron producir repetidamente diez frases, incluidos saludos como “hola” y “¿cómo va?”, y diez gestos, como saludar con la mano, aplaudir y sacudir la cabeza. A veces intentaban el habla y el gesto por separado, y otras veces de forma simultánea. La actividad cerebral registrada durante estos intentos se utilizó para entrenar modelos de aprendizaje automático personalizados para cada participante, modelos construidos para predecir lo que la persona tenía la intención de decir o hacer.

Lo que los números muestran en realidad

Los resultados se pusieron a prueba pidiendo a los participantes que intentaran combinaciones de frases y gestos que los modelos no habían visto antes. Las predicciones de los modelos controlaban un avatar que se parecía a cada participante: el avatar se movía para reflejar el gesto pretendido, mientras que el discurso pretendido aparecía como texto en la pantalla.

Las cifras de precisión merecen ser examinadas con atención. Para Bravo-1r, la predicción de gestos alcanzó un 88 por ciento de precisión y la predicción del habla alcanzó un 84 por ciento. Para Bravo-6, las cifras fueron del 66 por ciento para el gesto y del 70 por ciento para el habla. Como señaló Samantha Brosler, la investigadora que lidera el trabajo, un modelo que operara por puro azar lograría aproximadamente un 9 por ciento de precisión dada la gama de opciones disponibles. La brecha entre el azar y estos resultados es sustancial.

Henri Lorach, de la Universidad de Lausana, ofreció una evaluación medida: el trabajo es sólido, pero el vocabulario de frases y gestos sigue siendo limitado, y la precisión tendría que ser mayor para un uso diario práctico sin frustración. Ese es un enfoque honesto de la situación actual de la tecnología. Impresionante en un contexto de investigación, aún no está listo para reemplazar toda la complejidad de la conversación humana.

El equipo sigue refinando los modelos y ajustando los algoritmos subyacentes. Una dirección futura que identificó Brosler es ir más allá de los avatares por completo: si las articulaciones y los músculos de un participante se encuentran en condiciones adecuadas, el sistema podría eventualmente impulsar el movimiento en el propio cuerpo de la persona y generar una voz sintética, en lugar de canalizarlo todo a través de una representación digital.

Por qué esto importa más allá del laboratorio

Esto es lo que la mayor parte de la cobertura sobre la investigación de interfaces cerebro-computadora tiende a infravalorar. El logro técnico, decodificar dos flujos simultáneos de comunicación intencionada a partir de señales neuronales, es significativo. Pero el punto más profundo trata sobre lo que la comunicación es en realidad.

Como expresó Brosler, decir “tal vez” mientras se asiente con la cabeza conlleva un significado muy diferente al de decir “tal vez” mientras se niega con la cabeza. Esa distinción no es un matiz menor. Es la diferencia entre el acuerdo y la duda, entre la sinceridad y la ironía, entre una persona a la que se comprende y una persona a la que se malinterpreta. Para alguien que ha perdido la capacidad de hablar y moverse, la incapacidad de combinar esas señales no es solo una limitación física. Es una barrera para estar plenamente presente en una conversación.

Las interfaces cerebro-computadora se suelen discutir en términos de restauración de la función, y ese enfoque es preciso. Pero esta investigación apunta hacia algo más específico: la restauración de la textura de la comunicación. El objetivo no es simplemente darle a alguien una forma de producir palabras. Es devolverle la capacidad de significar cosas en el sentido pleno y encarnado del que depende la interacción humana.

El uso del aprendizaje automático aquí no es incidental. Los modelos se entrenan con los patrones neuronales únicos de cada individuo, lo que significa que el sistema está personalizado de un modo que la tecnología de asistencia genérica no puede alcanzar. Esa personalización es también una restricción: requiere un tiempo sustancial de registro y entrenamiento antes de que el sistema resulte útil. Escalar este enfoque, y hacerlo accesible en lugar de experimental, sigue siendo un camino largo.

En resumen

Un implante cerebral probado en dos personas con parálisis decodificó con éxito el habla y el gesto intencionados de manera simultánea, logrando una precisión muy superior al azar. El sistema utiliza modelos de aprendizaje automático personalizados y entrenados con la actividad neuronal de cada participante, y actualmente opera a través de un avatar. La precisión oscila entre el 66 y el 88 por ciento según el participante y la tarea. Los investigadores reconocen que se necesitará una mayor precisión y un vocabulario más amplio antes de que la tecnología pueda servir como una herramienta de comunicación práctica. La importancia del trabajo no radica solo en el resultado técnico, sino en lo que aborda: la naturaleza multimodal y compleja de la comunicación humana que las palabras por sí solas no pueden capturar.

Basado en información de New Scientist.

Escrito por

NAVION