Google 开源 EmbeddingGemma 2:740M 参数把文本、代码、图像、视频和音频放进同一个向量空间,纯文本版手机上约占 191MB 内存

Google 于 10 月 6 日发布开放嵌入模型 EmbeddingGemma 2,采用 Apache 2.0 许可证。它把文本、代码、图像、视频和音频映射到同一个嵌入空间,总参数 7.4 亿,按模块拆分为 2.7 亿文本主干、1.7 亿视觉编码器和 3 亿音频编码器,可只加载需要的部分。上下文从上一代的 2K 扩到 8K token,可容纳约 5.5 分钟音频、29 张图片或 58 帧视频;向量维度可从 768 截断到 512、256 或 128。官方称在 MTEB 代码检索上得分 78.68,比上一代高 9.92 分;量化后纯文本版在 Pixel 11 Pro 上约占 191MB 内存,完整多模态版约 567MB。模型已上架 Hugging Face、Kaggle,并支持 Ollama、llama.cpp、vLLM 等。

一个模型,五种内容

做检索增强生成(RAG)时,文本、截图、会议录音、产品视频往往要用不同的嵌入模型分别建索引,再想办法拼起来查。10 月 6 日 Google 发布的 EmbeddingGemma 2 想把这一步合并:文本、代码、图像、视频和音频映射到同一个嵌入空间,用一句话就能搜到相关的图片或录音片段。

它总参数 7.4 亿,但是模块化的:2.7 亿参数的文本主干,加 1.7 亿视觉编码器和 3 亿音频编码器,只做文本检索就只加载文本部分。上下文从上一代的 2K 扩到 8K token,单次可以放进约 5.5 分钟音频、29 张图片或 58 帧视频。向量用 Matryoshka 表示学习训练,可以从 768 维截断到 512、256 或 128 维,官方称存储最多可省到六分之一。

数字与部署

官方称它在 MTEB 代码检索上拿到 78.68 分,比上一代的 68.76 高 9.92 分;在 MIEB(Lite)和 MAEB 上,按参数量计算的质量是 10 亿以下模型的新标杆,部分超过体量两倍以上的专用模型。端侧方面,量化后纯文本版在 Pixel 11 Pro 上约占 191MB 内存,完整多模态版约 567MB。模型以 Apache 2.0 许可证发布在 Hugging Face、Kaggle 和 LiteRT 社区,并支持 Ollama、llama.cpp、vLLM 和 MediaPipe。

影响判断

对做本地知识库、相册搜索或手机端助手的开发者,这是一个可以直接商用的选择:不到 10 亿参数、能离线跑,还能把多种素材放进同一个索引,省掉多套模型和对齐的麻烦。需要注意的是,以上成绩都是 Google 自测,多模态检索的效果高度依赖具体数据。建议先在自己的语料上和现有文本嵌入方案对比召回率,再决定是否把图片、音频一起迁过去。

via: Google 官方博客