每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

谷歌发布手语转文字模型SL2T,率先应用于Pixel 11

听障用户无需打字,只需用手"说话",Gboard和Live Transcribe即可将其转换为文字

이미지: X — 프론티어랩

摘要

  • 谷歌DeepMind发布了将手语转换为文本的模型SL2T
  • 美国手语(ASL)与英语的互译功能将率先应用于Pixel 11的Gboard和Live Transcribe
  • 手部动作追踪在设备本地处理,文本转换则在服务器端完成
原文视频
모델명
SL2T (Sign Language-to-Text)
개발사
Google DeepMind
1차 지원 언어
미국식 수어(ASL) → 영어
적용 기기·기능
Pixel 11, Gboard, Live Transcribe
처리 방식
포즈 추적은 온디바이스, 텍스트 변환은 서버
개발 협력
청각장애인 구글 직원 및 AI Sign Language Advisory Committee

用手代替打字输入的方法

谷歌DeepMind发布了一款可将手部动作实时转换为文字的模型"SL2T"。该模型首先支持将美国手语(ASL)转换为英语,率先应用于Pixel 11,用户可以在Gboard和Live Transcribe中对着摄像头用手语表达句子,而不必敲击键盘。据公开的示例画面显示,用户用手语表达"电影放映时间,含开放式字幕"这样的句子时,搜索框中会自动弹出相应的自动完成候选项。

谷歌表示,SL2T的训练方式是将手部、身体和面部的同步动作作为一个整体进行学习,从而转换为文字。为了保护用户隐私,该模型采用了双轨结构:手部和身体姿态的追踪仅在设备本地处理,而将其转换为实际句子的工作则在服务器端完成。

이미지: X — 프론티어랩

手语AI为何迟迟未能取得进展

手语并非仅由手部形状构成的语言。手的位置和方向、身体的倾斜角度,以及眉毛、嘴型等表情,都同时承担着语法功能。这与以单词为单位识别英语句子的语音、文本翻译在结构上根本不同,因此现有的自然语言处理模型很难直接套用。谷歌解释称,正是这种技术难度与人们对手语的种种误解叠加在一起,才导致相关AI开发长期滞后。

据悉,SL2T在学术基准测试中展现出顶尖水平的性能,尤其针对一手持手机、仅用另一只手打手语这种实际使用场景进行了优化。据传,这一设计从开发初期就参考了听障谷歌员工及AI手语咨询委员会(AI Sign Language Advisory Committee)的建议。

此次发布与谷歌当天正式推出Pixel 11的"Made by Google 26"活动同步进行。当时,Pixel 11基础版售价为899美元,比前代上涨100美元,基础存储容量则翻倍至256GB。相比硬件发布,SL2T的公布更多聚焦于无障碍功能层面。

이미지: X — 프론티어랩

那么,具体带来了哪些变化

ASL用户现在可以不必在智能手机上打字,而是通过手语"说话"来进行搜索或生成对话字幕。谷歌表示,将以ASL为起点,逐步将SL2T扩展到其他手语及更多应用场景。这种在设备本地处理以保护隐私、同时叠加便利功能的方式,与谷歌近期推出的离线语音翻译工具"Gemma Translator"思路相通。可以说,无障碍技术正从以语音识别为主,逐渐扩展到手部动作识别领域。

이미지: X — 프론티어랩