01 Что произошло

6 октября 2026 года Google выпустила EmbeddingGemma 2 — модель на 740 млн параметров на архитектуре Gemma 4, которая объединяет текст, код, изображения, аудио и видео в едином пространстве эмбеддингов для поиска и извлечения на устройстве. Веса уже выложены на Hugging Face и Kaggle; доступность в Gemini Enterprise Agent Platform Model Garden заявлена как скорое.

02 Ключевые детали

  • EmbeddingGemma 2 насчитывает 740 млн параметров и работает с текстом, кодом, изображениями, видео и аудио. Для текстовых сценариев достаточно 270 млн параметров; опциональные кодировщики изображений (170 млн) и аудио (300 млн) дают полный мультимодальный режим.
  • Matryoshka Representation Learning позволяет урезать выходные векторы с 768 до 512, 256 или 128 измерений, что даёт до 6x экономии хранилища и памяти в локальных векторных базах.
  • С квантованием на Google Pixel 11 Pro модель требует минимально около 191 МБ активной RAM для текстовых весов и около 567 МБ для полного мультимодального варианта.
  • Google заявляет прирост в MTEB Code на 9,92 пункта, с 68,76 до 78,68, и контекст в 8K токенов — в 4 раза больше, чем у EmbeddingGemma 1; модель обрабатывает до 5,5 минут аудио, 29 изображений, 58 кадров видео или чередующиеся комбинации.

03 Почему это важно

Релиз делает мультимодальные эмбеддинги практичными для локального железа. Модульная конструкция позволяет запускать текстовые сценарии всего с 270 млн параметров, а Matryoshka Representation Learning даёт урезать векторы с 768 до 512, 256 или 128 измерений, сокращая хранилище и память до шести раз. Google также сообщает об окне контекста в 8K токенов и приросте в MTEB Code на 9,92 пункта — с 68,76 до 78,68; это заявленные компанией результаты, а не независимо проверенные.

04 Кому полезно

Разработчики локального поиска, разработчики RAG-систем и разработчики AI-агентов.

ПервоисточникGoogle