谷歌开源EmbeddingGemma 2多模态模型
谷歌新出的EmbeddingGemma 2能同时处理文本图像视频音频,手机端就能跑,适合做本地多模态搜索。
谷歌发布EmbeddingGemma 2,原生支持文本、代码、图像、视频和音频的多模态嵌入。该模型拥有740M参数,上下文窗口扩展至8K,支持100+语言。量化后在Pixel 11 Pro上,纯文本模式仅需191MB内存,全多模态模式约567MB。代码能力显著提升,MTEB Code评分从68.76升至78.68。
刚刚谷歌开源了其最新Embedding模型:EmbeddingGemma 2,原生多模态,手机、端侧能跑
去年的EmbeddingGemma是纯文本嵌入,这代把代码、图像、视频、音频全部打通,都映射进同一个向量空间
上下文8K,上一代的4倍,支持100+语言,跟Gemma 4搭配可跑端侧多模态RAG
740M参数,文本模块约270M、视觉约170M、音频约300M。量化后在Pixel 11 Pro上,纯文本约191MB活跃内存,全多模态约567MB
它的代码能力也提上来了,MTEB Code 68.76升到了78.68,+9.92分,本地代码索引、语义代码搜索、给编程Agent做检索都可以
EmbeddingGemma 2等于给医疗、法律、金融、政务这些高合规场景提供了一个可本地部署的检索底座;相册、网盘、会议记录、安防视频等这些,一句话找视频应该会成标配
#EmbeddingGemma2 #嵌入模型