模型精选

Google DeepMind 开源端侧多模态嵌入模型 EmbeddingGemma 2

精选理由

Google DeepMind 把多模态嵌入模型压缩到手机能跑的体积了,纯文本只占约 191MB 内存,还能搜代码和音视频,做端侧 RAG 的可以看看。

Google DeepMind 开源发布 740M 参数的端侧嵌入模型 EmbeddingGemma 2,将文本、代码、图像、视频、音频映射进同一个 768 维向量空间。模型基于 Gemma 4 架构,纯文本场景仅需 270M 参数,量化后在 Pixel 11 Pro 上活跃内存约 191MB,加载全部模态也仅约 567MB。上下文从一代的 2K 提升到 8K token,支持 100+ 语言。基准方面,MTEB Code 的 NDCG@10 达 78.68,比一代约 14% 相对提升,多模态是主要增量,而 MTEB 多语言 v2 得分 61.36,相对一代仅持平。

原文 · shao__meng

Google DeepMind 这次要把端侧搜索和 RAG 认真地放进手机本地了! 他们最新开源发布了原生多模态、专为端侧设计的 740M 参数嵌入模型「EmbeddingGemma 2」,把文本、代码、图像、视频、音频映射进同一个 768 维向量空间。 blog.google/innovation-and… EmbeddingGemma 2 基于 Gemma 4 架构,核心设计是按模态按需加载: · 文本主干:270M,130M transformer + 140M embedder,比一代的 300M 反而更小 · 视觉编码器(可选):170M · 音频编码器(可选):300M 纯文本场景只需 270M 参数,量化后在 Pixel 11 Pro 上活跃内存约 191MB;加载全部模态也仅约 567MB。这意味着嵌入模型首次可以认真地放进手机本地运行,支撑隐私优先的端侧搜索与 RAG。 其他关键规格:8K token 上下文(是一代的 4 倍),支持 100+ 语言(训练语料覆盖 140+ 种),文档按 "title: {标题} | text: {正文}" 格式编码。各模态的 token 开销:图像 280 token(最多约 29 张)、视频每帧 140(最多 58 帧)、音频每秒 25(最长约 5.5 分钟),视觉预算还可在 70–1120 软 token 间调节。 官方核心数据(768 维):代码检索是最大跃升,多模态“以小打大” · MTEB Code (NDCG @10 ):78.68,比第一代约 14% 相对提升 · MTEB 多语言 v2:61.36,持平略升 官方口径是“1B 以下多模态嵌入模型中同尺寸最佳”,并能匹配或超越一些两倍以上体积的专用模型。需要客观指出:多语言文本相对一代只是持平而非大幅进步,真正的增量在代码检索(得益于 Gemma 4 词表和代码语料)和全新的音视频能力。 Google DeepMind @GoogleDeepMind Meet EmbeddingGemma 2, our first natively multimodal open model for on-device embeddings. It expands beyond text to unify code, images, audio, and video in a shared space. 🧵 🔗 View Quoted Tweet 💬 1 🔄 0 ❤️ 0 👀 123 📊 1 ⚡