谷歌发布端侧多模态嵌入模型 EmbeddingGemma 2

10月8日消息,当地时间 10 月 6 日,谷歌发布新一代端侧嵌入模型 EmbeddingGemma 2。这是一款面向 "检索" 与 "理解" 任务的嵌入模型,可在手机本地设备上离线处理文字、图片、音频和视频多种模态数据,全程无需联网,数据不离开终端设备。

参数与架构:模块化按需加载

与前代产品相比,EmbeddingGemma 2 的核心变化在于将纯文本嵌入能力扩展到了多模态。据谷歌披露,纯文本工作负载约需 2.7 亿参数,视觉编码器 1.7 亿参数,音频编码器 3 亿参数,全模态版本合计 7.4 亿参数。模块化架构允许开发者按场景按需加载,无需为单一文本检索任务加载整个多模态模型。

其上一代产品 EmbeddingGemma 下载量已超过 2000 万次。

资源占用与存储效率

谷歌公布的测试数据显示,经量化处理后,在 Pixel 11 Pro 上运行纯文本权重,活跃内存占用约 191MB;全多模态模式约 567MB。

在存储效率方面,模型引入 Matryoshka 表示学习技术,输出向量可从 768 维动态截断至 512、256 乃至 128 维,最高可实现本地向量数据库约 6 倍的存储压缩比。

上下文与检索能力提升

上下文窗口较上一代扩大四倍,达到 8K token,可在本地直接处理约 5.5 分钟音频、29 张图像、58 帧视频,或上述模态交错组合的输入。

代码检索能力亦有明显提升:在 MTEB Code 基准测试中得分从 68.76 分升至 78.68 分,提升 9.92 分。多语言文本嵌入性能与上一代持平,图像、视频、文档、音频维度均有质量提升。

支持本地 RAG 流水线

EmbeddingGemma 2 与 Gemma 4 共享文本分词器与音频编码器,可在同一推理流水线内组合运行,综合内存占用更低。开发者可借此在设备本地构建完整的检索增强生成(RAG)流水线,全程不连接云端服务器,从而实现数据不出终端、降低延迟与隐私合规风险。

该模型采用 Apache 2.0 商业友好型许可证开源发布。

Copyright © DoNews 2000-2026 All Rights Reserved
京ICP备2025120072号