AI资讯

谷歌手语转文字模型发布,Pixel 11手机率先支持手语输入

智能摘要

应用程序支持手语转文本输入功能(初期仅限美国手语,后续将扩展至更多种手语和更多设备)。余种手语,新的功能使他们能享受到类似语音输入的灵活“打字替代”体验。任务的模型必须能“看懂”手语使用者的身体多部位同步运动,这需要强大的计算机视觉处理能力。

听力障碍者达7000万之众, 终于不必再借助用手比划去打字了, 谷歌使得手语如同语音输入那般便利。这款名为SL2T的模型, 首次将专业翻译设备引入消费级手机, 听障人士的表达方式将会被彻底改变。

手语不是比划 是真正的语言

能作为一种独立的自然语言存在的手语, 有着自身所独有的语法以及词汇体系, 它并非单纯的手势胡乱拼凑, 更不是依照顺序把动作变成文字那样简单, 并需要凭借内心真正领会语言逻辑的专业翻译人员去完成, 而不是仅仅依靠机械那般的对应来开展。

基于该一认知所设计的是谷歌的 SL2T 模型, 它具有识别使用者身体多于一个部位同步运动之能力这件事, 而此需强大的计算机视觉处理能力才行, 只有将动作当作完整语言加以解读, 翻译结果才会精准自然。

Pixel 11成首款支持手语输入手机

谷歌于Pixel 11系列手机之上, 推出了借助Gboard键盘以及Live Transcribe应用达成的手语转文本功能, 此项功能起初只支持美国手语, 往后会朝着其他手语种类以及更多设备予以扩展。

这表明, 在全球范围内, 大约7000万存在听力障碍的人士, 能够获取类似于语音输入那般的灵活感受。这样子, 他们无需始终对着屏幕, 不紧不慢地敲下文字, 而是借助手语直接去表述自身的想法, 进而使得沟通的效率得到显著的提高。

训练50种手语 10万小时数据

此款SL2T模型于超过五十种手语的十万小时数据之上予以训练, 覆盖面颇为广泛, 数据量越大, 模型就对手语的理解越精准, 翻译质量亦更具保障。

谷歌摒弃了往昔普遍运用的中间注释计策, 径直去解读空间信息。这般行径更贴合真实的语言处理遵循逻辑, 规避掉因存在过度环节致使的误差累积。

隐私保护不传原始视频

创新的数据处理方式被SL2T模型所采纳, 该方式把手语转变为姿势特征点的位置消息, 此处理之举能够有力地保护用户隐私, 并不需要把原始视频流传送到服务器那边去的标点符号。

对听障群体而言, 隐私安全相当关键, 他们的肢体动作含有个人身份信息, 直接于本地开展识别处理, 既能确保翻译效果, 又能规避敏感数据泄露风险。

比打字更快更自然 测试结果亮眼

测试所得数据表明, 运用美国手语相较于采用英语打字而言, 速度更快, 状态更自然, 感受更令人愉悦。这般情形打破了诸多人士对手语输入持有的刻板印象, 从而证明了手语能够成为一种具备高效性的表达工具。

长期以来, 听障人士都依赖打字来进行交流, 然而, 这样的方式效率是有限的。手语输入, 使得他们可以用最为自然的方式去表达思想, 真正地消除了语言障碍, 显著地改善了沟通质量。

未来将扩展更多手语和设备

最开始具备的功能只是在美国被推出, 且只支持美国手语这一种, 谷歌清晰表明后续会朝着更多手语种类去拓展, 其中涵盖中国手语、日本手语等世界主要的手语类型。

设备这块也会渐渐涵盖更多手机型号, 并非只局限于Pixel系列。这项技术的推广会让全球数百万听力障碍用户受益, 成为AI普惠科技方面典型的应用实例。

会认为手语输入对听障人士而言会变成主流沟通途径吗, 欢迎于评论区域将你的看法予以分享, 要是知觉此篇文章具备作用, 切莫忘掉施行点赞以及予以更多群体知悉下予以分享。

相关文章