Google DeepMind 发布 EmbeddingGemma 2:轻量级开源多模态嵌入模型
2026/10/07 03:57阅读量 3
Google DeepMind 推出基于 Gemma 4 架构的 EmbeddingGemma 2,这是一款拥有 7.4 亿参数的开源多模态嵌入模型,支持文本、代码、图像、音频和视频的统一向量空间映射。该模型专为端侧部署优化,具备模块化设计和动态维度截断能力,在子十亿参数级别的多模态基准测试中表现领先。其 Apache 2.0 许可允许商业使用,旨在赋能本地隐私保护检索增强生成(RAG)及跨模态搜索应用。
事件概述
Google DeepMind 发布了 EmbeddingGemma 2,这是上一代 EmbeddingGemma 的升级版。作为目前最强大的开源多模态嵌入模型之一,它原生支持将文本、图像、音频和视频映射到统一的嵌入空间中。该模型基于 Gemma 4 架构构建,采用 Apache 2.0 许可证发布,允许商业用途,参数量为 7.4 亿,专为设备端推理优化。
核心技术与性能
- 多模态统一处理:能够在一个模型中同时处理多种数据类型,例如通过语音备忘录查找特定视频片段,或根据文本查询搜索数小时的音频录音。
- 模块化设计:
- 基础文本任务仅需 2.7 亿参数。
- 可选视觉编码器(1.7 亿参数)和音频编码器(3 亿参数),实现全多模态支持。
- 存储效率优化:利用 Matryoshka Representation Learning (MRL) 技术,开发者可将输出向量从 768 维动态截断至 512、256 或 128 维,从而在本地向量数据库中实现最高 6 倍的存储缩减。
- 端侧性能表现:
- 在 Google Pixel 11 Pro 上,纯文本权重仅需约 191MB 活跃 RAM,完整多模态模型需约 567MB。
- 上下文窗口扩展至 8K tokens(是前代的 4 倍),可直接处理长达 5.5 分钟的音频、29 张图片或 58 帧视频及其混合内容。
- 基准测试成绩:
- 在 MTEB(大规模文本嵌入基准)和 MAEB(大规模音频嵌入基准)等评测中,EmbeddingGemma 2 在子 1B 参数模型中处于领先地位。
- 代码性能显著提升,MTEB Code 得分从 68.76 提升至 78.68,适用于本地代码库索引和语义搜索。
- 在图像、视频和音频任务上,其质量-参数比优于许多体积大两倍的专用模型。
应用场景与开发支持
- 隐私优先的 RAG 管道:结合生成式模型(如 Gemma 4),可在本地构建理解复杂多模态数据的检索增强生成系统,确保数据隐私并降低延迟。
- 具体用例示例:
- 即时媒体搜索:通过文本或图像在媒体库中查找语义相似项。
- 视频时刻定位:利用文本或音频查询定位视频中的特定片段。
- 实时决策引擎:通过 MediaPipe Decision Task API 利用多模态上下文进行分类、路由和预测。
- 开发者工具链集成:
- 下载平台:Hugging Face、Kaggle 以及即将推出的 Gemini Enterprise Agent Platform Model Garden。
- 部署框架:支持 LiteRT(针对端侧优化)、MediaPipe、transformers.js、WebGPU。
- 推理与微调:兼容 transformers、sentence-transformers、MLX、vLLM、llama.cpp、SGLang、Ollama、LMStudio 等主流工具;提供 Unsloth 微调指南。
- 向量存储:支持 Qdrant 等向量数据库。
