EmbeddingGemma 2 : Google mise sur la recherche IA locale

Smartphone affichant une recherche de scène vidéo avec un cycliste sur un pont, à côté d’un enregistreur audio.

Retrouver une scène dans une vidéo sans l’envoyer à un serveur : c’est l’un des usages visés par EmbeddingGemma 2, lancé par Google le 6 octobre 2026. Ce modèle ouvert rapproche textes, images, sons et vidéos pour permettre une recherche fondée sur leur contenu, directement sur un appareil. Annonce de Google

L’intérêt se comprend facilement. Nous accumulons des fichiers dont nous oublions le nom, la date ou le dossier. Une requête comme « le passage où quelqu’un traverse un pont à vélo » décrit ce que nous cherchons mieux qu’un nom de fichier. La nouveauté porte sur la possibilité de faire ce rapprochement avec un modèle compact, sans imposer une infrastructure distante pour chaque recherche.

Des mots, des images et des sons dans le même espace

EmbeddingGemma 2 produit des embeddings, des représentations numériques du contenu. Imaginez un système qui attribue des coordonnées à chaque fichier et à chaque demande. La recherche consiste ensuite à comparer ces coordonnées pour repérer les éléments les plus proches.

L’analogie a une limite : cette proximité exprime une ressemblance apprise, pas une certitude. Une image de vélo peut bien correspondre à une demande générale tout en montrant le mauvais lieu ou le mauvais moment.

Pourquoi le multimodal change la recherche

L’enjeu est de rendre comparables des formats différents. Une phrase peut servir à chercher une photographie ; une description peut pointer vers un enregistrement. Google documente ces comparaisons directes ainsi que le traitement d’entrées mêlant plusieurs médias. Exemples techniques officiels

Pour une application, cela ouvre une autre manière d’organiser les archives : partir de ce dont l’utilisateur se souvient, plutôt que du classement qu’il avait prévu. Un monteur pourrait rechercher une scène décrite par un collègue ; une personne pourrait retrouver un souvenir parmi ses vidéos. Ce sont des exemples d’usage possibles, pas des performances que nous avons mesurées.

Il faut aussi distinguer cette recherche d’une réponse rédigée. Le modèle repère des correspondances. Si une application veut ensuite expliquer un document ou résumer les résultats, elle doit ajouter cette fonction, éventuellement avec un autre modèle.

Un modèle compact que l’application peut alléger

Basé sur Gemma 4, EmbeddingGemma 2 compte 740 millions de paramètres dans sa configuration complète. Son architecture permet de ne charger que les composants nécessaires : 270 millions pour le texte et le code, 440 millions avec la vision, 570 millions avec l’audio. Les représentations restent compatibles entre ces configurations. Les poids sont disponibles sous licence Apache 2.0. Guide développeur

L’intérêt pratique est d’adapter l’outil à la collection. Un moteur consacré aux documents écrits n’a pas les mêmes besoins qu’une application indexant des rushes et des entretiens. Charger des composants inutiles consommerait des ressources sans enrichir cette recherche.

Google annonce, avec quantification sur un Pixel 11 Pro, environ 191 Mo de mémoire vive active pour les poids textuels et 567 Mo pour le modèle multimodal complet. Ces mesures situent l’ambition matérielle ; elles ne représentent pas la mémoire totale de toute application, avec ses fichiers et son index. Elles ne garantissent pas non plus la même expérience sur tous les téléphones. Annonce technique Google AI Edge

Deux démonstrations disponibles, une intégration Android encore attendue

Google ajoute deux expériences dans AI Edge Gallery. Instant Media Search retrouve des images et vidéos locales à partir d’une demande ou d’une image d’exemple. Video Moments Finder cherche des moments au sein d’enregistrements. L’éditeur décrit une indexation et une comparaison réalisées sur l’appareil.

En revanche, l’arrivée du modèle comme service Android via ML Kit, avec accélération NPU lorsque disponible, est annoncée pour les prochaines semaines. Il faut donc distinguer les démonstrations proposées aujourd’hui d’une intégration future dans les applications. Présentation des expériences et calendrier

La recherche locale suppose aussi un travail initial : représenter les fichiers avant de pouvoir les retrouver rapidement. Une démonstration réactive ne suffit pas à connaître le temps nécessaire pour préparer une grande collection. Pour juger l’expérience, il faudra examiner ce premier traitement autant que la vitesse d’une requête.

Des progrès mesurés, sans victoire sur toutes les tâches

La fiche du modèle donne un résultat instructif. Sur MTEB multilingue, EmbeddingGemma 2 atteint 61,36, contre 61,15 pour la première version. Sur MTEB code, il passe de 68,76 à 78,68, soit 9,92 points supplémentaires. L’évolution est donc beaucoup plus marquée pour le code que pour ce score textuel global.

Ces résultats sont publiés par Google et utilisent le modèle en pleine précision. Ils ne permettent pas de déduire directement la qualité d’une application mobile quantifiée, ni un taux de réussite sur des vidéos personnelles en français. Fiche officielle et évaluations

Réduire l’index demande un compromis

Les vecteurs de 768 dimensions peuvent être raccourcis. Mais la fiche signale une baisse importante de qualité multimodale à 128 dimensions. La réduction par six concerne le stockage des vecteurs, pas l’ensemble des médias ou de la base. Choisir un index plus petit nécessite donc de vérifier les résultats sur les fichiers réellement utilisés. Détail du compromis

Un bon essai devrait inclure les cas embarrassants : deux scènes proches, un bruit qui ressemble à un autre, une requête vague ou un événement absent de la collection. Retrouver un résultat plausible est utile ; permettre à l’utilisateur de reconnaître qu’il est incorrect l’est tout autant.

La confidentialité se joue dans toute l’application

Le traitement local offre un bénéfice clair : une architecture peut rechercher dans des fichiers sans les transmettre pour cette opération. Cela intéresse les usages personnels comme professionnels, notamment lorsque les archives contiennent des conversations ou des documents sensibles.

Cette possibilité ne suffit toutefois pas à qualifier toute application de confidentielle. Il reste à examiner ses sauvegardes, sa télémétrie, les permissions accordées et les autres services appelés. L’index mérite lui aussi une protection : il représente une collection et permet d’y retrouver des informations.

Pour une entreprise, la question dépasse également le lieu du calcul. Un moteur doit respecter les droits d’accès aux documents, y compris lorsque plusieurs personnes partagent un poste ou une collection. Un résultat pertinent pour la requête n’est pas nécessairement un résultat que son auteur est autorisé à consulter.

Une IA utile se juge aussi à ce qu’elle retrouve

EmbeddingGemma 2 met en lumière une fonction moins spectaculaire que la génération : retrouver le bon élément parmi ceux qui existent déjà. Son ouverture et sa conception modulaire donnent aux développeurs de quoi expérimenter cette recherche sur des appareils ordinaires.

Le test décisif sera concret : sur une collection réelle, l’application retrouve-t-elle le passage voulu, à un coût acceptable en temps, mémoire et batterie, tout en conservant les permissions attendues ? C’est à cette échelle que la recherche multimodale locale pourra devenir un outil quotidien.

Références

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *

Ce site utilise Akismet pour réduire les indésirables. Découvrez comment les données de vos commentaires sont traitées.