谷歌DeepMind推出手语转文本模型,Pixel 11首发支持

手语人工智能首次进入消费级:谷歌 DeepMind 推出手语转文本模型

精选理由

谷歌DeepMind把手语转文字做进了Pixel 11,美国手语直接变成文本,比打字还快,而且数据在本地处理,隐私有保障。

AI 摘要

谷歌DeepMind发布大规模多语言手语转文本模型SL2T,Pixel 11系列手机上的Gboard和Live Transcribe应用率先支持美国手语输入。该模型在超过50种手语的10万小时数据上训练,能识别身体多部位同步运动。测试显示,美国手语输入比英语打字更快更自然。模型将手语转为姿势特征点,在设备端完成处理,无需上传原始视频,保护用户隐私。

原文 · IT之家

手语人工智能首次进入消费级:谷歌 DeepMind 推出手语转文本模型

IT之家 8 月 13 日消息,谷歌旗下人工智能实验室当地时间 12 日宣布推出一款大规模多语言手语转文本 (SL2T) 翻译模型。 得益于这一模型, 手语人工智能首次进入消费级产品 :谷歌 Pixel 11 系列智能手机上的 Gboard 和 Live Transcribe 应用程序支持手语转文本输入功能(初期仅限美国手语,后续将扩展至更多种手语和更多设备)。 全球约 7000 万听力障碍人士使用 200 余种手语, 新的功能使他们能享受到类似语音输入的灵活“打字替代”体验 。测试显示,使用美国手语比用英语打字更快、更自然、更令人愉悦。 DeepMind 表示,手语是一种独立的自然语言,拥有自身独特的语法和词汇。因此 手语翻译需要真正的机器翻译 ,而非按顺序将手语转换为文字。而能满足 SL2T 任务的模型 必须能“看懂”手语使用者的身体多部位同步运动 ,这需要强大的计算机视觉处理能力。 Google DeepMind 的 SL2T 模型在超过 50 种手语的 10 万小时数据上进行训练。其将手语转化为一系列姿势特征点的位置信息以保护用户隐私安全, 无需将原始视频流发送到服务器端 。同时其放弃了以往广泛使用的“中间注释”,直接解读空间信息。 相关阅读: 《 无障碍升级,消息称谷歌 Gboard 键盘即将支持“手语转文字”功能 》(此前爆料,现已证实)