METAL for iPhone

AI 新闻, 现在用 App 阅读。

下载 METAL, 每天发现最新 AI 报道。

在 App Store 下载

iPhone 应用 · 免费下载

也可在 iPhone 的 App Store 中搜索 METAL AI Magazine。

METAL

谷歌DeepMind发布EmbeddingGemma 2

谷歌DeepMind发布了拥有7.4亿参数的开放模型EmbeddingGemma 2,可将文本、代码、图像、音频和视频放入同一个嵌入空间。模型采用按需加载编码器的模块化结构,让多模态搜索可以在智能手机上运行。

谷歌DeepMind发布EmbeddingGemma 2

图片:METAL

摘要

  • 谷歌DeepMind于10月6日以Apache 2.0许可证发布开放模型EmbeddingGemma 2,可将文本、代码、图像、音频和视频映射到同一个嵌入空间。
  • 模型共有7.4亿参数,由2.7亿参数的文本核心加上可选的视觉与音频编码器组成,在Pixel 11 Pro上仅文本约占用191MB内存,完整多模态约567MB。
  • 其MTEB Code得分从68.76升至78.68,上下文窗口为8192个token,是第一代的四倍,向量可截断至128维,存储最多可减少六倍。

谷歌DeepMind于10月6日发布开放模型EmbeddingGemma 2,可将文本、代码、图像、音频和视频放入同一个嵌入空间。模型参数为7.4亿,专为在智能手机、笔记本电脑等个人设备上运行而设计。谷歌称其为设备端多模态嵌入领域能力最强的模型。模型以允许商业使用的Apache 2.0许可证发布,权重可在Hugging Face和Kaggle下载。

嵌入模型会把文字、照片或声音转换成由数字组成的向量,让含义相近的内容彼此靠近。它是搜索、推荐和检索增强生成(RAG)的底层组件。去年9月推出的第一代EmbeddingGemma只能处理文本。撰写发布文章的谷歌DeepMind研究工程师Sahil Dua和Henrique Schechter Vera表示,第一代模型下载量已超过2000万次,并称“开发者社区的反响远远超出了我们的预期”。开发者用它搭建了设备端搜索工具,以及不把个人数据外传的RAG流程。

第二代的核心是把多种感官统一起来。两位工程师解释说,这个模型“可以通过一段语音备忘录找到特定的视频片段,或用一句文本查询检索数小时的录音,而这一切都由单一的原生多模态模型完成”。它基于今年4月发布的Gemma 4架构。谷歌表示,该模型与Gemini Embedding模型采用了相同的技术。

模型采用模块化设计。只处理文本和代码时仅需2.7亿参数,1.7亿参数的视觉编码器和3亿参数的音频编码器只在需要时加载。据报道,模型卡列出文本加视觉组合为4.4亿参数、文本加音频组合为5.7亿参数,无论哪种组合都共用同一个768维向量空间。只搜索照片的应用无需把音频编码器载入内存。

内存数据也很具体。谷歌表示,经量化后在Pixel 11 Pro上运行时,仅文本权重约占191MB活动内存,完整多模态模型约占567MB。上下文窗口为8192个token,是第一代的四倍。单次输入可容纳5.5分钟音频、29张图像、58个视频帧,或它们的混合。据报道,一张图像占用280个token,一个视频帧占140个token,一秒音频占25个token。

模型还加入了节省存储的机制。借助套娃表示学习(MRL),开发者可以把768维输出向量截断为512、256或128维,谷歌称这能让本地向量数据库的存储和内存占用最多减少六倍。据报道,谷歌开发者指南指出,在256维时图像、视频和语音检索可保留约95%的完整质量;在128维时文本和代码可保留约90%,但多模态检索会降至约75%。

成绩单上提升最大的是代码。大规模文本嵌入基准(MTEB)代码部分的得分从68.76升至78.68,提高9.92分,多语言文本性能则维持在第一代水平。在METAL查阅的谷歌发布文章中的MTEB代码图表里,EmbeddingGemma 2的位置高于6亿参数的Qwen3-Embedding-0.6B,与80亿参数的Qwen3-Embedding-8B相差几分。谷歌表示,它在10亿参数以下的多模态嵌入模型中取得最高分,并在图像、视频和音频任务上超过了部分规模是其两倍以上的专用模型。

从工程角度看,值得关注的是它与Gemma 4共用组件。EmbeddingGemma 2共享Gemma 4的文本分词器和音频编码器,因此两个模型在同一流程中运行时总内存占用会下降。负责检索的模型和负责回答的模型在同一台设备上使用相同的部件。谷歌在AI Edge Gallery应用中加入了Video Moments Finder演示,可通过文字或语音找到视频中的场景。Mac会议应用AI Edge Foresight用这个模型查找本地文件,再用Gemma 4进行上下文推理。

MTEB 코드 부문 평균 점수와 모델 크기를 비교한 산점도, EmbeddingGemma 2가 비슷한 크기 모델보다 높다

部署途径也很广。模型可在Transformers、Sentence Transformers、MLX、vLLM、llama.cpp、SGLang、Ollama和LM Studio上运行,微调可参照Unsloth的指南。设备端支持MediaPipe和LiteRT,浏览器端支持transformers.js和WebGPU。谷歌表示,模型很快将上线Gemini Enterprise Agent Platform的Model Garden。据报道,模型卡提示其激活值范围超出float16,可能产生NaN,建议使用bfloat16或float32推理,训练数据截止时间为2025年1月。

METAL曾报道Liquid AI开源了设备端模型评估工具Pipette。设备端竞争正从生成模型下沉到检索组件。无需把照片和录音上传服务器,就能在设备内找到视频中的某个场景,这件事如今用一个内存占用不到600MB的组件就能做到。应用开发者现在需要决定的,是加载哪些编码器,以及把向量压缩到多少维。

评论