Sentence Transformers v6.0 permet d'entraîner des embeddings multi-vecteurs
- 01Sentence Transformers v6.0 introduit le MultiVectorEncoder pour entraîner des embeddings multi-vecteurs.
- 02Les modèles multi-vecteurs décomposent les textes en plusieurs représentations partielles, améliorant la précision des recherches.
- 03Un modèle entraîné sur des données médicales a surpassé des modèles généralistes en 14,5 heures sur une RTX 3090.
Sentence Transformers v6.0 intègre désormais un MultiVectorEncoder pour entraîner des modèles d’embeddings multi-vecteurs, une méthode de late interaction inspirée de ColBERT.
La version 6.0 de Sentence Transformers ajoute un quatrième type de modèle, le MultiVectorEncoder, conçu pour des tâches de retrieval avancé comme la recherche sémantique ou l’amélioration de modèles de génération augmentée par récupération (RAG). Contrairement aux embeddings denses qui compressent un texte en un seul vecteur, les modèles multi-vecteurs décomposent le texte en plusieurs représentations partielles, permettant une interaction tardive (late interaction) entre les segments. Cette approche, popularisée par ColBERT, vise à améliorer la précision des recherches en comparant des parties spécifiques des documents plutôt que des vecteurs globaux.
Le blog de Hugging Face détaille les composants nécessaires à l’entraînement ou à l’affinage de ces modèles : choix du modèle de base, préparation des jeux de données, sélection des fonctions de perte, configuration des arguments d’entraînement, évaluation des performances et optimisation des index. La bibliothèque permet désormais d’entraîner un modèle multi-vecteurs à partir de zéro ou d’affiner un modèle existant, avec des exemples concrets d’implémentation. L’article mentionne également un cas pratique où un modèle entraîné sur des données médicales, en 14,5 heures sur une RTX 3090, surpasse des modèles de retrieval généralistes (denses, clairsemés, lexicaux ou multi-vecteurs) sur une évaluation dédiée.
L’entraînement repose sur des outils intégrés à Sentence Transformers, accessibles via pip install -U "sentence-transformers[train]". Les utilisateurs peuvent exploiter des données locales ou hébergées sur la Hugging Face Hub, avec des formats de jeu de données adaptés aux besoins des modèles multi-vecteurs. Le processus inclut une évaluation systématique des performances, permettant d’optimiser l’indexation des vecteurs pour des applications spécifiques.
Articles liés
Hugging Face introduit des embeddings multi-vecteurs pour les recherches en temps différé
Découvrez comment les nouveaux modèles d'embeddings multi-vecteurs de Hugging Face améliorent les interactions en temps différé pour les applications IA.
Hugging Face intègre l'hindi et l'anglais indien à son classement ASR open
Pour les développeurs travaillant sur des modèles multilingues, cette intégration élargit les possibilités de reconnaissance vocale.

Nvidia annonce le rachat de Hugging Face pour 12,9 milliards de dollars
Nvidia renforce son contrôle sur l'écosystème open source des modèles d'IA avec l'acquisition de la plateforme Hugging Face.