METAL

James Manyika发布Google语言AI二十年研究综述

Google于9月15日以高级副总裁James Manyika的名义发布了一篇综述,回顾覆盖300种语言、70亿人的二十年语言AI研究。它的骨架是直接处理音频而不只是翻译文本的模型,以及由语言社区自己录制的语言数据。

James Manyika发布Google语言AI二十年研究综述

图片:METAL

摘要

  • Google表示,其技术支持300多种语言、70多亿人,相当于全球人口的86%。
  • Gemini 3.5 Live Translate可在70种语言、2,000多个语言对之间实时口译,音频不经文本转换直接处理。
  • WAXAL、Project Vaani和Amplify Initiative的结构是由当地社区自己录制数据,合作方保留数据所有权。

Google于9月15日在公司博客上发布了一篇文章,把二十年的语言AI研究汇成一份综述。作者是负责研究、实验室、技术与社会的高级副总裁James Manyika,文章的第一句就从数字开始:Google的技术和产品目前在300多种语言中支撑着日常交互,使用这些语言的人超过70亿,相当于全球人口的86%。同一天,Google Research的Yossi Matias在X上用四条帖子的连发梳理了要点,Google Research官方账号随后引用这组连发再次转发。

起点是2006年的Google翻译。Manyika写道,当时的目标是打破语言之间的壁垒,随着AI的进步,翻译支持的语言从少数几种扩展到如今的250多种。但文章的重心落在下一句。他写道:"但只翻译文本是不够的。"并补充说,技术需要理解人们在现实世界中真正的交流方式。紧接着是他的判断:几十年来,技术只在少数主导语言上运转良好,数千种仍在使用的语言和方言在数字世界中要么被草率对待,要么根本缺席。

第一个例子是语音处理方式的转变。据该文介绍,过去的语音识别遵循一条僵硬的多步骤流水线:先把音频转成文本,再处理文本,然后重新合成为音频。它能运转,却在过程中削掉了交流中最丰富的部分,包括语调、节奏、情绪和语境。人们说话并不总是合乎语法的整句,会笑、会抢话、会犹豫,还会像西班牙式英语或印地式英语那样在一句话里混用多种语言。Google表示,因此它训练Gemini这样的模型直接处理音频,而不经过文本。

在此之上有两款产品。Gemini 3.5 Live Translate负责70种语言、2,000多个语言对的实时口译,能原样捕捉句内的语言切换和情绪信号。Gemini 3.5 Transcribe是Google迄今最精确的语音转文字模型,即便在嘈杂环境或夹杂专业术语的情况下也能输出经过整理的文本。同一模型还驱动Android Gboard中的Rambler功能,它会去除口头填充词、修正语法和标点,并允许用语音指令改写或切换语言。

目标语言数量也写得很清楚。Google把目标定为支持全球使用人数最多的1,000种语言,作为基础的Universal Speech Model用1,200万小时的音频训练而成。方法是跨语言迁移学习,把从数据丰富的语言中学到的模式迁移到数据稀少的语言上。Manyika写道,这项工作建立在25年的公开研究和400多篇经同行评审的语音论文之上。

从社会学者的眼光看,这篇文章最重要的部分不是模型,而是数据的收集方式。由于网络过度代表少数主导语言,Google承认,要让AI理解代表性不足的语言,必须重新思考数据收集本身。答案是本地的草根合作,其结果是三项开放数据合作。第一项是WAXAL。这个名字在沃洛夫语中意为"说话",数据集与马凯雷雷大学、Digital Umuganda等合作方共同建成,覆盖撒哈拉以南非洲的27种语言,使用者超过1亿人,分布在26个以上国家。

METAL查阅的3月6日Google Research博客上的WAXAL发布文给出了更具体的数字。这项工作始于2021年,历时多年,首批发布包含约1,846小时经转写的自然语音用于语音识别,以及565小时以上的高质量录音用于语音合成,以CC-BY-4.0许可发布。参与者不是朗读脚本,而是看着50多个主题的图片用母语描述,Google Research称这种方式捕捉到了声调变化和语言切换。数据收集完全由非洲的学术和社区机构主导,发布文中写明了合作方保留所采集数据所有权的原则。

第二项是印度的Project Vaani。它与印度科学研究所和Bhashini合作,以地区而非语言为基准绘制印度的语言多样性地图,迄今已从15.5万多名说话者那里采集了109种语言、3万多小时的语音。第三项是Amplify Initiative,包括巴西UFMG、印度IIT Kharagpur和乌干达马凯雷雷大学在内的四大洲20所大学和1,600多名当地专家参与,贡献了1.5万个承载本地细微差别的多模态数据点。三个项目的结构都是让说这种语言的社区自己记录,而不是从外部采集。

一同介绍的还有一件展示这些数据在哪里、有多少的工具。Language Explorer是一款交互式工具,用于可视化全球最大的开源语言数据库LinguaMeta,把口语、书面语和手语合计7,000多种语言绘成地图。文章称该工具因设计创新获得了外界认可。由Google.org支持的Centre for Digital Language Inclusion和AI Singapore的Project Aquarium,则负责把这些数据和洞见以多语言工具的形式送到农民、医护人员、教师等社区成员手中。

文章也写到了技术触及不到的条件。Manyika写道,仍有30多亿人没有稳定的互联网。对此给出的答案是基于Gemini打造的轻量开源翻译模型TranslateGemma,它以55种语言训练,在设备上运行,因此无需云端或互联网连接也能翻译。据METAL查阅的1月15日发布文,TranslateGemma以Gemma 3为基础,分4B、12B、27B三个尺寸,其中12B模型在WMT24++基准的MetricX指标上超过了体量两倍于它的Gemma 3 27B基线模型。METAL曾报道Google推出可在设备上离线运行的语音翻译器。

有些地方连智能手机都没有。为了数亿功能手机用户,Google支持Viamo的语音AI助手AVA,把Gemini的能力放到普通功能手机上。据该文介绍,Viamo在卢旺达面向既有的交互式语音应答用户试运行了AVA,该服务已借助Gemini回答了200多万个问题。在无障碍方面,用50多种手语训练的SL2T在Pixel 11的Gboard和Live Transcribe中承担手语转文字听写,从美国手语到英语起步。Google称这是面向全球7,000万依赖手语交流者的第一步。METAL曾在8月报道SL2T的发布。

地名发音这样的小事也在同一原则之下。文章写道,导航应用念错城镇或街道名称,不只是造成混乱,更是忽视了那个地方的文化遗产;在新西兰,Google与毛利语专家合作修正了Google地图中的地名发音。Manyika把二十年语言AI研究的一条经验写成这样一句话:"技术绝不应收窄人类表达的范围,而应拓宽它。"Matias在X连发中用另一种表述说了同样的话:"仅有翻译和文本处理是不够的;系统必须反映人们在现实世界中跨越多元文化细微差别的交流方式。"

规模放在最后。Google的语言技术在搜索、Android、Chrome、YouTube和Google Play等九个平台上连接着50多亿人。但文章自己说,规模只是故事的一部分。由谁以哪种语言采集数据、数据归谁所有,既是技术问题,同时也决定了哪些语言得以在数字世界中存在。合作方持有数据、社区亲自录音的WAXAL结构,以及以地区而非语言为基准的Vaani设计,是这篇文章中最经得起时间的部分。二十年后,Google把语言AI的课题从翻译改写为代表性。

评论