Pour éviter une comparaison théorique, les deux modèles doivent être testés dans des conditions identiques. Les documents sont découpés selon la même stratégie, puis indexés dans deux espaces vectoriels séparés.
Une collection Qdrant est créée pour EmbeddingGemma et une seconde pour BGE-M3. Les deux collections utilisent les mêmes contenus, les mêmes métadonnées, les mêmes filtres et la même distance de similarité.
Il est important de ne pas mélanger directement les vecteurs des deux modèles. EmbeddingGemma peut produire des vecteurs de 768, 512, 256 ou 128 dimensions, tandis que BGE-M3 utilise des vecteurs denses de 1 024 dimensions. Une collection vectorielle doit être configurée pour la dimension du modèle qui l’alimente. Qdrant permet également d’utiliser des vecteurs nommés pour préparer progressivement une migration entre plusieurs modèles.
Test 1 : retrouver une information formulée différemment
Le premier test mesure la capacité du modèle à comprendre une intention, même lorsque la question ne reprend aucun des termes principaux du document.
Document indexé :
En cas d’arrêt non planifié, exécuter le protocole de reprise du service depuis la console d’administration.
Question posée :
Comment remettre l’application en fonctionnement après une coupure ?
Les deux modèles sont conçus pour la recherche sémantique multilingue et peuvent établir un rapprochement entre ces formulations. EmbeddingGemma est particulièrement adapté aux applications de recherche, de classification, de regroupement et de similarité sémantique. Google précise également qu’il peut utiliser des instructions distinctes selon que le texte représente une requête ou un document.
Orientation observée : pour des FAQ, des procédures courtes et des questions exprimées en langage naturel, EmbeddingGemma constitue une solution légère et cohérente. BGE-M3 reste également performant dans ce scénario, mais ses fonctionnalités supplémentaires ne sont pas nécessairement exploitées.
Test 2 : rechercher une référence exacte
Document indexé :
Le module MED-8520-B doit être utilisé avec le connecteur CNX-21-USB.
Question posée :
Quel connecteur faut-il pour MED-8520-B ?
Une recherche dense peut comprendre le sens général de la question, mais les références contenant des lettres, des chiffres et des tirets sont parfois difficiles à différencier sémantiquement.
BGE-M3 peut produire simultanément une représentation dense et une représentation sparse. La représentation dense recherche le sens général, tandis que la représentation sparse renforce la correspondance lexicale avec les termes exacts. Qdrant peut fusionner ces deux résultats afin de combiner recherche sémantique et recherche par mots-clés.
Orientation observée : BGE-M3 possède un avantage architectural lorsque le corpus contient de nombreuses références produit, des numéros de dossier, des codes d’erreur, des versions logicielles ou des noms propres peu fréquents.
EmbeddingGemma peut néanmoins être associé à un moteur lexical séparé, par exemple BM25. Cette solution conserve la légèreté du modèle, mais ajoute un composant et une étape de fusion supplémentaires dans le workflow.
Test 3 : interroger un document long
Le troisième test porte sur un manuel dont certaines sections dépassent largement la longueur habituelle d’une fiche produit ou d’une procédure.
EmbeddingGemma accepte jusqu’à 2 048 tokens en entrée, contre 8 192 tokens pour BGE-M3. Ce dernier peut donc traiter des blocs plus longs sans devoir les diviser aussi rapidement.
Cela ne signifie pas qu’il faut systématiquement créer des blocs de 8 192 tokens. Un bloc trop long peut contenir plusieurs sujets et réduire la précision de la recherche. La fenêtre étendue de BGE-M3 offre surtout davantage de souplesse pour les textes juridiques, les rapports, les notices et les documents dont le découpage naturel produit de longues sections.
Le travail de recherche publié avec BGE-M3 montre que l’association de plusieurs modes de récupération améliore particulièrement les résultats sur les documents longs. Les auteurs précisent toutefois que les performances observées sur les benchmarks doivent encore être confirmées sur des corpus réels présentant d’autres caractéristiques.
Orientation observée : BGE-M3 est généralement plus adapté lorsque l’entreprise souhaite indexer de longs documents et exploiter plusieurs stratégies de recherche. EmbeddingGemma reste suffisant lorsque les documents sont correctement découpés en passages courts et cohérents.
Test 4 : évaluer les ressources du serveur local
Le choix d’un modèle d’embedding ne dépend pas uniquement de la pertinence des résultats. Il faut également mesurer :
- le temps nécessaire pour indexer les documents ;
- le temps de réponse à chaque requête ;
- l’utilisation du processeur et du GPU ;
- la mémoire vive mobilisée ;
- la taille de l’index Qdrant ;
- le nombre de requêtes simultanées supportées ;
- la durée d’une réindexation complète.
EmbeddingGemma peut réduire sa dimension de sortie de 768 jusqu’à 128. Cette souplesse permet d’adapter la taille des vecteurs au volume documentaire et aux capacités du serveur. Une dimension plus petite réduit le stockage et la mémoire nécessaires, mais doit être validée par des tests afin de vérifier que la qualité de récupération reste suffisante pour le corpus concerné.
BGE-M3 est plus volumineux, mais ses besoins supplémentaires peuvent être justifiés lorsqu’une seule exécution doit produire les représentations dense, sparse et multivecteur.
Test 5 : vérifier le français, l’anglais et les recherches croisées
Les deux modèles sont multilingues. EmbeddingGemma a été entraîné sur des données couvrant plus de 100 langues. BGE-M3 prend également en charge plus de 100 langues, même si sa documentation précise que la quantité de données varie selon les langues et que les résultats peuvent donc être inégaux.
Le test doit notamment vérifier les situations suivantes :
- question française et document français ;
- question anglaise et document anglais ;
- question française et document anglais ;
- question anglaise et document français ;
- sigles techniques identiques dans les deux langues ;
- termes métier propres à l’entreprise.
Aucun résultat global publié ne remplace cette validation. Une entreprise travaillant principalement avec des notices techniques anglaises n’obtiendra pas nécessairement le même classement qu’une organisation indexant des documents administratifs rédigés uniquement en français.
Synthèse de la comparaison
| Critère |
EmbeddingGemma |
BGE-M3 |
| Nombre de paramètres |
Environ 308 millions |
Environ 569 millions |
| Longueur maximale |
2 048 tokens |
8 192 tokens |
| Dimension dense |
768 à 128 |
1 024 |
| Recherche dense |
Oui |
Oui |
| Recherche sparse native |
Non présentée comme fonction native |
Oui |
| Interaction multivecteur |
Non présentée comme fonction native |
Oui, type ColBERT |
| Multilingue |
Plus de 100 langues |
Plus de 100 langues |
| Documents longs |
Découpage plus fréquent |
Fenêtre plus étendue |
| Faibles ressources |
Très favorable |
Plus exigeant |
| Références exactes |
Recherche dense ou ajout d’un moteur lexical |
Recherche hybride native possible |
| Complexité d’intégration |
Faible en recherche dense |
Plus importante si les trois modes sont exploités |
Les caractéristiques techniques synthétisées dans ce tableau proviennent des documentations officielles de Google et de BAAI. Elles permettent d’orienter la sélection, mais pas de désigner automatiquement un vainqueur pour tous les projets.