核心观点
- Google发布SL2T(手语到文本翻译)模型,首次将手语AI从实验室带入消费产品,在Pixel 11的Gboard和Live Transcribe中提供ASL到英语的输入功能。
- SL2T采用MediaPipe Holistic提取姿态地标序列,仅传输几何坐标而非原始视频,从设计上保护用户隐私。
- 模型直接翻译坐标序列为文本,绕过传统glosses中间表示,避免人工词汇限制,使翻译质量随数据规模提升。
- 在超过100,000小时、50多种手语数据上联合训练,在FLEURS-ASL基准上零样本BLEURT达70,显著高于此前所有报告分数。
- 团队与聋人社区深度合作,成立AI手语咨询委员会(AISLAC),共同评估技术影响并指导负责任部署。
内容精讲
手语是聋人社区的主要语言,全球有超过200种手语,约7000万聋人使用。但手语AI进展缓慢,原因有二:手语是独立自然语言,有自身语法和词汇,例如ASL的语法与英语完全不同,需要真正的机器翻译而非顺序映射;模型必须学会“看”和理解身体运动,手语通过手、臂、躯干、头和脸的同时运动传达意义,高帧率准确跟踪是困难的计算机视觉任务。早期尝试如手语手套从根本上受限,因为手语不是“手上的英语”,它们无法捕捉完整语言复杂性。
SL2T通过用户中心、文化知情的方法结合大规模数据扩展来解决这些挑战。模型在超过100,000小时、50多种手语数据上训练,其中约四分之一为ASL。数据涵盖不同方言、熟练程度和场景,联合训练使模型学习共享底层结构,在实验中优于单语言模型。为保护用户隐私,SL2T将手语视为姿态地标位置序列:设备上的MediaPipe Holistic跟踪手语者身体点位置,仅这些几何坐标发送到服务器翻译,原始视频立即丢弃。这种设计确保用户视频不被存储或传输。
SL2T直接将坐标序列翻译为文本,绕过先前广泛使用的glosses中间标注。Glosses是手语的近似文字标注,但无法捕捉非手部标记(如面部表情、头部运动)和空间结构(如指代位置)。直接从地标翻译消除了人工词汇限制,使翻译质量直接随数据扩展。在FLEURS-ASL基准上,SL2T零样本BLEURT达70,远超此前任何分数。示例显示模型能准确翻译复杂句子:事实陈述(“库克群岛没有城市,由15个岛屿组成”)、天气描述(“比赛在上午10点开始,天气很好,早晨有小雨但很快放晴”)、税收制度解释(“在一些联邦国家如美国和加拿大,所得税在联邦和地方层面征收”)等,保持语义准确和自然表达。
但团队不满足于基准成绩,着力解决实际部署问题:最小化流式延迟,使翻译几乎实时;防止非手语输入时的幻觉,确保模型在无手语时保持静默;确保对10%左撇子手语者的公平性,因为模型可能对惯用手有偏差;改进单手手语性能,因为用户常一手握手机一手打手语。这些优化使模型在真实场景中可用,测试者反馈手语输入比打字更快、更自然、更愉悦。
团队与聋人社区共同建设,从概念化(由聋人Google员工Sam Sepah提出)到数据收集、评估和影响评估,聋人视角贯穿每个阶段。还成立了AI手语咨询委员会(AISLAC),汇集全球聋人组织和专家,通过参与式治理模型,让受影响社区直接影响开发优先级。团队联合发布了SL2T 1.0在Gboard和Live Transcribe中的影响报告,透明详细说明技术能力和当前局限,这种合作模式将延续到所有主要手语发布。
SL2T建立在数十年学术和工业基础研究之上,但将ASL输入带到用户手机只是开始。团队正致力于将技术扩展到更多手语(如英国手语、法国手语等)、手语生成(从文本到手语视频)和前沿AI能力,目标是实现与口语和书面语的完全平等,使手语访问成为数字景观的标准。SL2T首先在Pixel 11上可用,更多设备即将推出,且无需额外费用。
阅读价值
本文适合AI研究者、无障碍技术开发者、聋人社区成员及关注包容性技术的人群阅读。通过本文,读者可以了解手语AI的核心技术挑战、SL2T的创新方案及其实际部署效果,以及社区参与式开发的重要性。
内容与图片版权归原作者所有 · 原文: https://deepmind.google/blog/putting-sign-language-ai-into-users-hands/