01 Ce qui s’est passé

Le 6 octobre 2026, Google a lancé EmbeddingGemma 2, un modèle de 740 millions de paramètres basé sur l'architecture Gemma 4, qui réunit texte, code, images, audio et vidéo dans un espace d'embeddings partagé pour la recherche sur appareil. Les poids sont disponibles sur Hugging Face et Kaggle ; la disponibilité via Gemini Enterprise Agent Platform Model Garden est annoncée comme prochaine.

02 Les points essentiels

  • EmbeddingGemma 2 compte 740 millions de paramètres et traite texte, code, images, vidéo et audio. Les charges textuelles n'en demandent que 270 millions, avec des encodeurs image (170M) et audio (300M) en option pour le multimodal complet.
  • Avec Matryoshka Representation Learning, les vecteurs de sortie passent de 768 à 512, 256 ou 128 dimensions, jusqu'à 6x de réduction de stockage et de mémoire dans les bases vectorielles locales.
  • Quantisé sur un Google Pixel 11 Pro, Google indique seulement environ 191 Mo de RAM active pour les poids texte et environ 567 Mo pour le modèle multimodal complet.
  • Google indique un gain de 9,92 points dans MTEB Code, de 68,76 à 78,68, et une fenêtre de contexte de 8K tokens, quatre fois plus grande que celle d'EmbeddingGemma 1 ; le modèle gère jusqu'à 5,5 minutes d'audio, 29 images, 58 frames vidéo ou des combinaisons entrelacées.

03 Pourquoi c’est important

La sortie rend les embeddings multimodaux praticables sur matériel local. Le design modulaire permet de faire tourner des charges texte avec seulement 270 millions de paramètres, et Matryoshka Representation Learning permet de réduire les vecteurs de 768 à 512, 256 ou 128 dimensions, économisant jusqu'à 6x de stockage et de mémoire. Google annonce aussi une fenêtre de contexte de 8K tokens et une progression de 9,92 points dans MTEB Code, de 68,76 à 78,68 ; ces chiffres sont fournis par l'éditeur et ne sont pas vérifiés indépendamment.

04 Pour qui c’est utile

Développeurs de recherche locale, développeurs de systèmes RAG et développeurs d'agents IA.

Source originaleGoogle