Google DeepMind presentó SL2T, un nuevo modelo de inteligencia artificial capaz de interpretar el lenguaje de señas y transformarlo en texto en tiempo real. La tecnología busca llevar esta capacidad fuera de los laboratorios y convertirla en una herramienta de comunicación cotidiana.
El sistema permitirá que una persona se comunique mediante señas con un dispositivo de forma similar a como actualmente se utilizan los comandos de voz. No se limitará a convertir gestos en palabras: también podría permitir navegar por internet, escribir documentos y realizar consultas a sistemas de inteligencia artificial.
Por ahora, el primer despliegue está previsto en el Pixel 11, utilizando el lenguaje de señas estadounidense y el inglés. Sin embargo, Google pretende incorporar progresivamente otros idiomas y sistemas de señas, un desafío especialmente complejo debido a las diferencias existentes entre ellos.
La tecnología tuvo que superar un enorme reto: el lenguaje de señas no consiste simplemente en sustituir palabras por movimientos de las manos. La IA debe interpretar la posición y movimiento de manos, brazos, torso, cabeza y rostro, además de comprender una gramática propia.
Para entrenar el modelo, DeepMind utilizó más de 100.000 horas de datos provenientes de más de 50 lenguajes de señas. El sistema procesa secuencias de puntos clave en los movimientos y no interpreta directamente las imágenes completas captadas por la cámara.
El avance podría marcar un antes y un después en la accesibilidad tecnológica: una persona que se comunica mediante señas podría interactuar con una computadora o una IA sin necesidad de utilizar un teclado. Google apuesta así por convertir el lenguaje de señas en una nueva vía de interacción directa con la tecnología.









