Google DeepMind 给自己的手语翻译模型打了个分:70 BLEURT,零样本,官方说是目前已知最高。但这条新闻真正值得点开的原因不是这个分数,是它第一次装进了普通人能买到的手机——Pixel 11 的 Gboard 输入法和 Live Transcribe 字幕应用,已经能把美国手语直接翻译成英文文字。
全球有超过200种手语,约7000万聾人和听障用户在用。这是这套技术第一次真正走出实验室,变成手机里一个能点开的功能。
发生了什么,谁先用上
- 模型.SL2T(sign-language-to-text),Google DeepMind与Android团队联合开发
- 上线渠道.Pixel 11 的 Gboard 输入法 + Live Transcribe,免费,更多设备"即将推出"
- 首发能力.仅支持美国手语(ASL)翻译成英语文字,其他语言和设备没有给出时间表
- 训练规模.超过10万小时数据,覆盖50多种手语,约四分之一是ASL——但这是训练材料,不是产品已支持的语言数
- 基准成绩.FLEURS-ASL 测试拿到70 BLEURT,官方称"显著高于此前任何公开分数"
从"识别手势"到"翻译语言"
早期手语技术,包括那些戴在手上的手语手套,本质是把手语当成"手上的英语"——逐个手势对应一个单词。这条路走不通,因为手语有自己的语法,同时靠手、臂、躯干、头、脸传递意思,单纯识别手部动作丢掉了大半信息。
SL2T换了个思路:把手语当成全身动作坐标序列,用MediaPipe Holistic在设备端提取关键点位置,只把几何坐标传到服务器做翻译,跳过了传统方法依赖的"gloss"中间注释。原始视频会即时丢弃,但坐标数据仍要联网上传给服务器——这不是纯本地处理,只是把最敏感的画面拦在了手机里。
聾人和听障群体等来的从来不是模型,而是入口
即便拿了70分的基准,官方自己也承认罕见手势、快速指拼(把"prey"翻成"grey")、被动句、分类词表达(丢掉"claws")、脱离语境的时态判断("kicked off"变成"start")仍会出错——这些恰恰是真实对话里最常出现的部分。
锐评:入口打开了,边界也画出来了
这次的突破不在跑分,在入口。手语翻译从论文demo变成了输入法里的一个开关,和过去十几年语音识别、机器翻译走的是同一条路:先在实验室刷分,再某天悄悄出现在亿级用户的产品里。
绕开gloss、直接端到端翻译坐标序列,是方法论上真正的纠错,不是又一次同思路的升级版——这一点该给肯定。
但普惠的边界很清楚:只支持ASL一种手语,覆盖200多种手语里的一种;只上线Pixel 11一款设备;处理流程要联网,数据要经过Google服务器;70分的基准离"日常对话可靠替代人工翻译"还有距离。
- 结论.训练规模领先不等于产品普及,ASL用户先尝到甜头,其余6000多万手语使用者还在等一个没有时间表的承诺。
- 风险.云端处理和基准高分,不能直接等同于真实对话中的无障碍替代级可靠性。
70分和一款设备,这中间的差距,才是接下来真正该盯的地方。
