Google DeepMind ha lanzado una nueva forma de traducción por IA de lengua de señas que permite a las personas sordas y con discapacidad auditiva signar directamente a su teléfono en lugar de escribir, en lo que la empresa califica como un verdadero avance para la tecnología de accesibilidad. El modelo, presentado el 12 de agosto de 2026, se llama SL2T — abreviatura de sign-language-to-text — y marca la primera vez que este tipo de tecnología sale de los laboratorios de investigación y llega a aplicaciones de consumo cotidianas como Gboard y Transcripción instantánea.
Summary
Puntos clave
- Google DeepMind lanzó SL2T, un modelo multilingüe de lengua de señas que convierte el signado directamente en texto escrito.
- Actualmente es compatible con lengua de señas americana (ASL) a inglés dentro de Gboard y Transcripción instantánea en el Pixel 11, sin costo adicional.
- El modelo se entrenó con más de 100.000 horas de datos en más de 50 lenguas de señas y obtiene 70 BLEURT en el benchmark FLEURS-ASL, muy por encima de modelos anteriores.
- SL2T rastrea puntos de referencia de la pose en lugar de video sin procesar para proteger la privacidad del usuario, descartando de inmediato las imágenes de la cámara.
- Miembros de la comunidad sorda dieron forma al proyecto desde el principio, y Google creó el Comité Asesor de IA para Lengua de Señas (AISLAC, por sus siglas en inglés) para guiar su implementación.
Google DeepMind lanza SL2T, un modelo multilingüe de IA para traducción de lengua de señas
SL2T es la respuesta de DeepMind a una brecha que ha existido en la IA durante años: mientras que las herramientas de lengua hablada como la dictado y la traducción automática se volvieron comunes en las últimas dos décadas, las más de 200 lenguas de señas del mundo — utilizadas por unos 70 millones de personas sordas y con discapacidad auditiva — quedaron en gran medida fuera. DeepMind describe SL2T como un sistema «masivamente multilingüe» creado para cerrar esa brecha con un avance significativo tanto en calidad de traducción como en cobertura de idiomas.
El resultado práctico es un nuevo tipo de dictado. Así como las personas oyentes pueden hablar en lugar de escribir, SL2T permite a las personas sordas signar a su teléfono en cualquier lugar donde normalmente escribirían: buscar en la web, redactar mensajes o documentos, o pedirle a Gemini que complete una tarea. Dentro de Transcripción instantánea, las personas usuarias pueden signar su parte de una conversación en lugar de escribir de un lado a otro con una persona oyente. Según los propios evaluadores de Google, signar en ASL se sintió más rápido y natural que escribir el equivalente en inglés.
Compatibilidad con ASL en Gboard y Transcripción instantánea en Pixel 11
Por ahora, la tecnología admite un par de idiomas: lengua de señas americana traducida al inglés. Está disponible primero dentro de Gboard y Transcripción instantánea en el Pixel 11, y Google promete que más dispositivos e idiomas de señas adicionales están en camino. Es notable que la función se ofrece sin costo adicional para las personas usuarias, posicionándola como una función de accesibilidad estándar en lugar de un complemento premium.
Cómo se construyó el modelo multilingüe de lengua de señas
SL2T se entrenó con un conjunto de datos de más de 100.000 horas que abarcan más de 50 lenguas de señas, con aproximadamente una cuarta parte de esos datos específicamente en ASL. Entrenar el modelo en muchos idiomas y niveles de competencia a la vez, en lugar de crear sistemas independientes de un solo idioma, ayudó a que aprendiera estructuras compartidas que mejoraron el rendimiento general, superando a los modelos monolingües en las propias pruebas de DeepMind.
Esa escala se refleja en las cifras. En el benchmark FLEURS-ASL, que mide la calidad de la traducción de ASL a inglés, SL2T obtuvo una puntuación zero-shot de 70 BLEURT, una cifra que, según DeepMind, es significativamente más alta que cualquier cosa reportada anteriormente para este tipo de tarea. Esa diferencia importa: indica que SL2T no es solo una mejora incremental, sino un cambio de nivel en qué tan bien la IA puede entender la lengua de señas como un idioma completo, en lugar de una serie de gestos de manos asignados a palabras.
Parte de la dificultad es que las lenguas de señas no son simplemente lenguas habladas realizadas con las manos. Tienen su propia gramática, vocabulario y estructura, y transmiten significado mediante el movimiento simultáneo de manos, brazos, torso, cabeza y rostro. Rastrear todo eso en tiempo real es un problema exigente de visión por computadora, y es una de las razones por las que intentos anteriores — como los guantes de lengua de señas — tuvieron dificultades, ya que trataban el signado como una tarea limitada de seguimiento de manos en lugar de una verdadera traducción de idioma.
Los puntos de referencia de la pose protegen la privacidad de quien signa
En lugar de enviar video sin procesar a un servidor, SL2T procesa el signado como un flujo de coordenadas de puntos de referencia de la pose. Un modelo en el dispositivo llamado MediaPipe Holistic rastrea puntos en el cuerpo de la persona que signa, y solo esas coordenadas geométricas — no las imágenes de la cámara en sí — se envían para la traducción. El video original se descarta de inmediato, lo que es la forma en que DeepMind incorpora la protección de la privacidad directamente en la arquitectura del sistema en lugar de tratarla como una idea posterior.
Omitir los glosados para lograr precisión de traducción directa
SL2T también se aparta de un enfoque común en investigaciones anteriores sobre lengua de señas: traduce secuencias de coordenadas directamente a texto, omitiendo anotaciones intermedias paso a paso conocidas como «glosados». Los glosados tienden a pasar por alto las partes más ricas y no lineales de las lenguas de señas, incluidas las expresiones faciales y las construcciones espaciales que transmiten significado real. Al omitir ese paso, SL2T evita límites artificiales de vocabulario y permite que la calidad de la traducción escale directamente con más datos.
Google afirma que también trabajó en cuestiones prácticas y del mundo real más allá de las puntuaciones de los benchmarks: reducir el retraso en la transmisión, evitar traducciones erróneas cuando alguien no está realmente signando y mejorar específicamente la precisión para aproximadamente el 10% de las personas que signan y son zurdas, así como para quienes signan con una sola mano mientras sostienen el teléfono con la otra.
La comunidad sorda dio forma al desarrollo de SL2T
DeepMind presenta esto como un proyecto creado con la comunidad sorda en lugar de simplemente para ella. La idea se originó con Sam Sepah, una persona sorda empleada en Google, y socios sordos participaron en la recopilación de datos, las pruebas de uso y la evaluación del impacto real de la tecnología.
Para mantener esa participación estructurada más allá del lanzamiento inicial, Google formó el Comité Asesor de IA para Lengua de Señas (AISLAC), que reúne a organizaciones sordas de todo el mundo y personas expertas en la materia para ayudar a orientar cómo se implementa la tecnología en el futuro. La empresa también coescribió un informe conjunto de impacto junto con socios comunitarios para esta primera versión, en el que se detalla tanto lo que SL2T puede hacer como cuáles son sus límites actuales; un enfoque que Google afirma que piensa repetir en futuras versiones relacionadas con lengua de señas.
Qué sigue para la traducción de lengua de señas con IA
DeepMind presenta la compatibilidad con ASL como un punto de partida y no como una meta final. El equipo afirma que está trabajando para ampliar SL2T a lenguas de señas adicionales, explorar la generación de lengua de señas — esencialmente el proceso inverso de convertir texto en salida signada — y añadir capacidades de IA más avanzadas sobre el modelo existente.
La ambición más amplia se vincula con el objetivo de larga data de Google de hacer que la información sea universalmente accesible. Lograr eso para las comunidades sordas significa acercar las lenguas de señas a la paridad con las lenguas habladas y escritas en los productos digitales, no solo lanzar una función en un dispositivo. Si los primeros resultados de SL2T con ASL se mantienen a medida que se expande a decenas de lenguas de señas más, cada una con su propia gramática y variación regional, probablemente determinará qué tan rápido esa visión más amplia se vuelve real para personas usuarias más allá del Pixel 11.
Preguntas frecuentes
¿Qué es SL2T y qué hace?
SL2T es el modelo multilingüe de sign-language-to-text de Google DeepMind. Traduce el signado directamente en texto escrito, lo que permite a las personas sordas signar a su teléfono para escribir mensajes, buscar o comunicarse en lugar de usar un teclado.
¿Qué lenguas de señas admite actualmente SL2T?
Por ahora, SL2T solo admite lengua de señas americana traducida al inglés, y está disponible a través de Gboard y Transcripción instantánea en el Pixel 11. Están previstas lenguas de señas adicionales para futuras versiones.
¿Cómo protege SL2T la privacidad de las personas usuarias durante la traducción de lengua de señas?
SL2T ejecuta un sistema de seguimiento en el dispositivo que lee puntos en el cuerpo de la persona que signa en lugar de enviar video sin procesar a cualquier lugar. Solo esas coordenadas se utilizan para la traducción, y las imágenes de la cámara se descartan de inmediato.
¿Cómo participa la comunidad sorda en el proyecto SL2T?
Las personas sordas participaron desde la etapa más temprana del concepto hasta la recopilación de datos, las pruebas y la gobernanza. Google también creó el Comité Asesor de IA para Lengua de Señas, compuesto por organizaciones sordas y personas expertas, para ayudar a guiar cómo la tecnología continúa desarrollándose.
{«@context»:»https://schema.org»,»@type»:»FAQPage»,»mainEntity»:[{«@type»:»Question»,»name»:»¿Qué es SL2T y qué hace?»,»acceptedAnswer»:{«@type»:»Answer»,»text»:»SL2T es el modelo multilingüe de sign-language-to-text de Google DeepMind. Traduce el signado directamente en texto escrito, lo que permite a las personas sordas signar a su teléfono para escribir mensajes, buscar o comunicarse en lugar de usar un teclado.»}},{«@type»:»Question»,»name»:»¿Qué lenguas de señas admite actualmente SL2T?»,»acceptedAnswer»:{«@type»:»Answer»,»text»:»Por ahora, SL2T solo admite lengua de señas americana traducida al inglés, y está disponible a través de Gboard y Transcripción instantánea en el Pixel 11. Están previstas lenguas de señas adicionales para futuras versiones.»}},{«@type»:»Question»,»name»:»¿Cómo protege SL2T la privacidad de las personas usuarias durante la traducción de lengua de señas?»,»acceptedAnswer»:{«@type»:»Answer»,»text»:»SL2T ejecuta un sistema de seguimiento en el dispositivo que lee puntos en el cuerpo de la persona que signa en lugar de enviar video sin procesar a cualquier lugar. Solo esas coordenadas se utilizan para la traducción, y las imágenes de la cámara se descartan de inmediato.»}},{«@type»:»Question»,»name»:»¿Cómo participa la comunidad sorda en el proyecto SL2T?»,»acceptedAnswer»:{«@type»:»Answer»,»text»:»Las personas sordas participaron desde la etapa más temprana del concepto hasta la recopilación de datos, las pruebas y la gobernanza. Google también creó el Comité Asesor de IA para Lengua de Señas, compuesto por organizaciones sordas y personas expertas, para ayudar a guiar cómo la tecnología continúa desarrollándose.»}}]}
Artículo producido con la ayuda de inteligencia artificial y revisado por el equipo editorial.

