01 发生了什么
2026年10月6日,谷歌发布EmbeddingGemma 2。该模型基于Gemma 4架构,拥有740M参数,将文本、代码、图像、音频和视频统一到共享嵌入空间,用于设备端检索。模型权重已在Hugging Face和Kaggle上线;Gemini Enterprise Agent Platform Model Garden的可用性被宣布为即将推出。
02 关键细节
- EmbeddingGemma 2拥有740M参数,支持文本、代码、图像、视频和音频;纯文本工作负载最低只需270M参数,可选图像编码器(170M)和音频编码器(300M)用于完整多模态。
- 通过Matryoshka表示学习,开发者可将输出向量从768维截断至512、256或128维,为本地向量数据库和内存节省最多6倍。
- 谷歌报告在Google Pixel 11 Pro上量化后,文本权重仅需约191MB活动内存,完整多模态模型约需567MB。
- 谷歌报告MTEB Code得分提升9.92分,从68.76升至78.68;8K token上下文窗口是EmbeddingGemma 1的4倍,可处理最多5.5分钟音频、29张图像、58帧视频或交错组合。
03 为什么重要
此次发布让多模态嵌入在本地硬件上变得可行。模块化设计使文本工作负载最低只需270M参数;通过Matryoshka表示学习,开发者可将输出向量从768维动态截断至512、256或128维,为本地向量数据库和内存节省最多6倍。谷歌还报告该模型拥有8K token上下文窗口,并在MTEB Code中提升9.92分,从68.76升至78.68;这些是公司报告的数字,尚未经独立验证。
04 适合谁
本地搜索开发人员、RAG系统开发人员及人工智能代理开发人员。
原始来源Google