METAL

18个模型问世,五年前的手机也能跑

欧洲一家新的 AI 实验室为每项任务各配了一个模型。9MB 的模型一秒钟修好五分钟录音,2MB 的模型凭三个词分辨出84种语言。

18个模型问世,五年前的手机也能跑

图片:METAL

摘要

  • Desert Ant Labs 于9月8日成立,公开了18个在设备内运行的模型。12个稳定版和6个测试版被打包进面向 Swift、Kotlin 和 JavaScript 的同一套 SDK。
  • 语音识别模型 Voz 在 iPhone 上用两秒处理10分钟音频,以30分钟连续音频计达到实时的319倍,远超 Whisper large-v3-turbo 的50倍。
  • 12MB 的 Redact 抓出88.8%的个人信息,未及2.3GB 的 GLiNER-PII 的91.1%。公司表示,它在自家视频应用中用284MB 的 Clips 替换了 Claude Sonnet。

在欧洲新成立的 AI 实验室 Desert Ant Labs 一口气推出了18个在设备内运行的模型。在9月8日发布的成立文章中,公司表示已把12个稳定版和6个测试版打包进面向 Swift、Kotlin 和 JavaScript 的同一套 SDK。这不是由一个大模型承担多项工作,而是为每项任务各配一个模型的构成。

公司拿出的标准不是大小,而是响应时间。创始人兼首席执行官 Paul Veugen 写道:"我们正在打造面向音频、视觉和文本的小型专用模型,每个模型都以毫秒级作答。"设计条件是:在五年前的手机上也能跑,并且快到每一帧画面或每一次敲键都能调用而不吃力。公司主张,一旦单次调用的成本消失,功能就可以挂在每一条消息上,而不是只挂在负担得起的那几条上。

数字是按任务分开列出的。语音识别模型 Voz 在 iPhone 上把10分钟的音频用两秒转写完,并为每个词标上起止时间。在公司公开的测量中,以30分钟连续音频为准,实时倍数 Voz 为319倍,Apple SpeechAnalyzer 为78倍,Whisper large-v3-turbo 为50倍。在 iPhone 17 Pro 上则达到298倍。

处理音频的 Clear 只有9MB。公司解释说,它能把五分钟长的笔记本电脑录音在一秒内变成录音棚品质。测得的结果是 iPhone 16 Pro 上为实时的302倍,M5 MacBook Pro 上为345倍。同一套权重在 iPhone 上跑在神经网络引擎上,在浏览器中则通过 WebAssembly 运行。

在遮蔽个人信息的 Redact 上,公司把自己落后的一项也照实写了出来。12MB 的 Redact 能抓出文档中88.8%的个人信息,低于2.3GB 的 GLiNER-PII 的91.1%。相比之下,14.7MB 的 Rampart 为61.4%,3GB 的 OpenAI 过滤器为60.2%。分辨语言的 Tongue 以2MB 的体量仅凭三个词就能区分84种语言,得分0.933,而293MB 的判别器为0.887。

公司先在自家应用里做了替换。在做了五年的视频应用 Detail 中,音频增强由 Dolby 换成 Clear,转写换成了快五倍的 Voz。把10分钟视频切成十二个片段这件事由284MB 的 Clips 在五秒内完成,公司表示在这个位置上替换掉了 Claude Sonnet,速度快10倍,能耗少470倍,而品质相同。将与 iOS 27 一同推出的 Detail 6 会彻底去掉云端 API,只在设备内运行。

从工程师的角度看,这次发布的核心不是模型大小,而是把调用送往何处。METAL 通读的这篇成立文章,引用了英伟达研究人员拆解三类智能体系统后得出的推算:其中40%至70%对大模型的调用可以改由小型专用模型承担。一天重复十万次的活儿,比如整理录音、给照片打标签、从句子里提取日期、在文本抵达服务器之前滤掉人名,都不需要前沿模型。公司把这一层比作承担日常运转的小脑,并表示决定由哪个模型作答的大脑层将排在下一步。

公司还算了一笔算力已在人们手中的账。它一方面估计今年数据中心的支出约为4500亿美元,另一方面写道:"地球上所有 AI 数据中心加起来,也不如人们手中的算力多。"因为每年出货的手机、平板和笔记本电脑超过10亿台,芯片还在不断变强。模型在每套 SDK 下可用于最多10万台月活跃设备,对每位用户的推理次数不设上限。

公司写道,在哪里制造也是设计的一部分。在欧洲,在设备内运行是默认选项;数据不离开客户之手,功能就不会被别人的云绑住,从未上传过的资料也无从被要求交出。把小模型放到设备上的尝试,从今年夏天起明显增多。METAL 曾报道过 Liquid AI 把设备端模型评测工具 Pipette 开源一事,而这次发布与那股潮流分道之处在于,它拿出的不是评测工具或单个模型,而是按任务划分的模型组合与商用条件一并推出。

概括来说,Desert Ant Labs 以每项任务配一个模型的18件套和同一套 SDK 起步,并以在自家应用中去掉云端调用的方式先行验证了这一主张。公开的数字在速度和体量上大幅领先,在准确率上则略逊于大出许多的模型。接下来有两件事值得看。越过10万台活跃设备这一区间的应用会被附加什么条件,以及公司预告的大脑层,也就是决定把活儿交给哪个模型的那一层,能否真正落地。

评论