一个模型,五种内容
做检索增强生成(RAG)时,文本、截图、会议录音、产品视频往往要用不同的嵌入模型分别建索引,再想办法拼起来查。10 月 6 日 Google 发布的 EmbeddingGemma 2 想把这一步合并:文本、代码、图像、视频和音频映射到同一个嵌入空间,用一句话就能搜到相关的图片或录音片段。
它总参数 7.4 亿,但是模块化的:2.7 亿参数的文本主干,加 1.7 亿视觉编码器和 3 亿音频编码器,只做文本检索就只加载文本部分。上下文从上一代的 2K 扩到 8K token,单次可以放进约 5.5 分钟音频、29 张图片或 58 帧视频。向量用 Matryoshka 表示学习训练,可以从 768 维截断到 512、256 或 128 维,官方称存储最多可省到六分之一。
数字与部署
官方称它在 MTEB 代码检索上拿到 78.68 分,比上一代的 68.76 高 9.92 分;在 MIEB(Lite)和 MAEB 上,按参数量计算的质量是 10 亿以下模型的新标杆,部分超过体量两倍以上的专用模型。端侧方面,量化后纯文本版在 Pixel 11 Pro 上约占 191MB 内存,完整多模态版约 567MB。模型以 Apache 2.0 许可证发布在 Hugging Face、Kaggle 和 LiteRT 社区,并支持 Ollama、llama.cpp、vLLM 和 MediaPipe。
影响判断
对做本地知识库、相册搜索或手机端助手的开发者,这是一个可以直接商用的选择:不到 10 亿参数、能离线跑,还能把多种素材放进同一个索引,省掉多套模型和对齐的麻烦。需要注意的是,以上成绩都是 Google 自测,多模态检索的效果高度依赖具体数据。建议先在自己的语料上和现有文本嵌入方案对比召回率,再决定是否把图片、音频一起迁过去。
via: Google 官方博客