Google DeepMind 将手语到文本模型 SL2T 带入 Gboard 与 Live Transcribe
Putting sign language AI into users’ hands
AI 导读
Google DeepMind 推出手语到文本(SL2T)翻译模型,并首次将其落地消费级产品——Pixel 11 上的 Gboard 与 Live Transcribe,首发支持美国手语(ASL)转英语听写。该模型基于超 100,000 小时、覆盖 50 多种手语的数据训练,其中约四分之一为 ASL,联合训练使其优于单语模型,并在未见过的数据上取得 70 BLEURT 的零样本成绩。它把手语视为手势坐标序列而非摄像头画面,由端侧 MediaPipe Holistic 提取姿态地标后再送服务器翻译,跳过 gloss 中间标注,从而摆脱人工词汇表限制。