Google DeepMind lançou SL2T (Sign Language-to-Text), um modelo multilingüe habilitando transcrição de língua de sinais em telefones do consumidor pela primeira vez. O modelo alimenta novo ditação sign-to-text no Gboard e Live Transcribe para Pixel 11, lançando com conversão de American Sign Language (ASL) para inglês. Os usuários agora podem fazer sinais em vez de digitar para pesquisar a web, rascunhar mensagens ou interagir com Gemini, com línguas adicionais em breve.
SL2T foi treinado em mais de 100.000 horas de dados em 50+ línguas de sinais (aproximadamente 25% ASL). Diferentemente de abordagens anteriores que usavam anotações intermediárias chamadas "glosses", SL2T traduz diretamente de coordenadas de corpo-pose para texto, capturando marcadores não-manuais e construções espaciais que glosses perdem. O modelo atinge uma pontuação zero-shot BLEURT de 70 no benchmark FLEURS-ASL — significativamente mais alta do que qualquer resultado previamente relatado para tradução ASL-to-English.
A engenharia abordou restrições do mundo real: redução de latência de streaming, prevenção de alucinação em entradas não-assinando, equidade para assinantes canhotos (10% da população) e desempenho em assinatura com uma mão (usado enquanto segura um telefone). A privacidade é preservada usando detecção de marca-pose em dispositivo (MediaPipe Holistic) em vez de vídeo bruto — apenas coordenadas geométricas são enviadas ao servidor para tradução, e o vídeo original é imediatamente descartado.