核心观点

内容精讲

手语是聋人社区的主要语言,全球有超过200种手语,约7000万聋人使用。但手语AI进展缓慢,原因有二:手语是独立自然语言,有自身语法和词汇,例如ASL的语法与英语完全不同,需要真正的机器翻译而非顺序映射;模型必须学会“看”和理解身体运动,手语通过手、臂、躯干、头和脸的同时运动传达意义,高帧率准确跟踪是困难的计算机视觉任务。早期尝试如手语手套从根本上受限,因为手语不是“手上的英语”,它们无法捕捉完整语言复杂性。

SL2T通过用户中心、文化知情的方法结合大规模数据扩展来解决这些挑战。模型在超过100,000小时、50多种手语数据上训练,其中约四分之一为ASL。数据涵盖不同方言、熟练程度和场景,联合训练使模型学习共享底层结构,在实验中优于单语言模型。为保护用户隐私,SL2T将手语视为姿态地标位置序列:设备上的MediaPipe Holistic跟踪手语者身体点位置,仅这些几何坐标发送到服务器翻译,原始视频立即丢弃。这种设计确保用户视频不被存储或传输。

SL2T直接将坐标序列翻译为文本,绕过先前广泛使用的glosses中间标注。Glosses是手语的近似文字标注,但无法捕捉非手部标记(如面部表情、头部运动)和空间结构(如指代位置)。直接从地标翻译消除了人工词汇限制,使翻译质量直接随数据扩展。在FLEURS-ASL基准上,SL2T零样本BLEURT达70,远超此前任何分数。示例显示模型能准确翻译复杂句子:事实陈述(“库克群岛没有城市,由15个岛屿组成”)、天气描述(“比赛在上午10点开始,天气很好,早晨有小雨但很快放晴”)、税收制度解释(“在一些联邦国家如美国和加拿大,所得税在联邦和地方层面征收”)等,保持语义准确和自然表达。

但团队不满足于基准成绩,着力解决实际部署问题:最小化流式延迟,使翻译几乎实时;防止非手语输入时的幻觉,确保模型在无手语时保持静默;确保对10%左撇子手语者的公平性,因为模型可能对惯用手有偏差;改进单手手语性能,因为用户常一手握手机一手打手语。这些优化使模型在真实场景中可用,测试者反馈手语输入比打字更快、更自然、更愉悦。

团队与聋人社区共同建设,从概念化(由聋人Google员工Sam Sepah提出)到数据收集、评估和影响评估,聋人视角贯穿每个阶段。还成立了AI手语咨询委员会(AISLAC),汇集全球聋人组织和专家,通过参与式治理模型,让受影响社区直接影响开发优先级。团队联合发布了SL2T 1.0在Gboard和Live Transcribe中的影响报告,透明详细说明技术能力和当前局限,这种合作模式将延续到所有主要手语发布。

SL2T建立在数十年学术和工业基础研究之上,但将ASL输入带到用户手机只是开始。团队正致力于将技术扩展到更多手语(如英国手语、法国手语等)、手语生成(从文本到手语视频)和前沿AI能力,目标是实现与口语和书面语的完全平等,使手语访问成为数字景观的标准。SL2T首先在Pixel 11上可用,更多设备即将推出,且无需额外费用。

阅读价值

本文适合AI研究者、无障碍技术开发者、聋人社区成员及关注包容性技术的人群阅读。通过本文,读者可以了解手语AI的核心技术挑战、SL2T的创新方案及其实际部署效果,以及社区参与式开发的重要性。

阅读原文 → 返回 AI 技术文档

内容与图片版权归原作者所有 · 原文: https://deepmind.google/blog/putting-sign-language-ai-into-users-hands/