01 发生了什么

2026年10月6日,谷歌发布EmbeddingGemma 2。该模型基于Gemma 4架构,拥有740M参数,将文本、代码、图像、音频和视频统一到共享嵌入空间,用于设备端检索。模型权重已在Hugging Face和Kaggle上线;Gemini Enterprise Agent Platform Model Garden的可用性被宣布为即将推出。

02 关键细节

  • EmbeddingGemma 2拥有740M参数,支持文本、代码、图像、视频和音频;纯文本工作负载最低只需270M参数,可选图像编码器(170M)和音频编码器(300M)用于完整多模态。
  • 通过Matryoshka表示学习,开发者可将输出向量从768维截断至512、256或128维,为本地向量数据库和内存节省最多6倍。
  • 谷歌报告在Google Pixel 11 Pro上量化后,文本权重仅需约191MB活动内存,完整多模态模型约需567MB。
  • 谷歌报告MTEB Code得分提升9.92分,从68.76升至78.68;8K token上下文窗口是EmbeddingGemma 1的4倍,可处理最多5.5分钟音频、29张图像、58帧视频或交错组合。

03 为什么重要

此次发布让多模态嵌入在本地硬件上变得可行。模块化设计使文本工作负载最低只需270M参数;通过Matryoshka表示学习,开发者可将输出向量从768维动态截断至512、256或128维,为本地向量数据库和内存节省最多6倍。谷歌还报告该模型拥有8K token上下文窗口,并在MTEB Code中提升9.92分,从68.76升至78.68;这些是公司报告的数字,尚未经独立验证。

04 适合谁

本地搜索开发人员、RAG系统开发人员及人工智能代理开发人员。

原始来源Google