Le RAG d'entreprise souffre d'une perte de précision critique lors de la compression de documents complexes. Sentence Transformers 6.0 résout ce problème en introduisant le composant MultiVectorEncoder. Cette interaction tardive native élimine l'OCR et augmente la précision de recherche jusqu'à 35 %, au prix d'un stockage d'index accru. Le RAG (Retrieval-Augmented Generation) s'appuie souvent sur des embeddings denses qui transforment chaque passage en un vecteur unique de 384, 768 ou 1024 dimensions. Cette compression reste efficace pour la recherche sémantique générale, mais elle peut atténuer le poids d'une entité rare, d'un identifiant exact ou d'une clause décisive au sein d'un texte long. Plus le passage contient d'informations concurrentes, plus le modèle doit les condenser dans la même représentation. Sentence Transformers 6.0 élargit désormais la boîte à outils avec une interface dédiée aux modèles multivectoriels. Cette évolution ne supprime pas l'arbitrage entre qualité, latence et capacité de stockage, mais elle facilite l'expérimentation. Elle renforce également l'intérêt des fonctions multivectorielles dans l'infrastructure de bases de données vectorielles à l'échelle . Sentence Transformers ne fournit toutefois pas son propre index de production : l'équipe renvoie notamment vers fast-plaid, Qdrant, Weaviate, Vespa, LanceDB, Milvus ou VectorChord. L'interface unifiée réduit le code nécessaire pour charger, encoder, comparer et évaluer ces modèles. La mise à l'échelle reste néanmoins un chantier d'ingénierie à part entière, notamment pour la compression, le choix de l'index, le dimensionnement matériel et l'évaluation sur les données réelles de l'entreprise. L'arrivée de Sentence Transformers 6.0 illustre une évolution importante de la recherche vectorielle : la représentation unique n'est plus la seule abstraction proposée par la bibliothèque. L'interaction tardive accepte une structure plus volumineuse afin de préserver davantage d'indices locaux et de rendre le classement plus interprétable au niveau des tokens. Cette évolution rappelle que la simplicité d'un pipeline n'est utile que si elle reste adaptée au besoin. Résumer un passage technique ou une clause contractuelle dans un vecteur unique peut suffire pour une recherche thématique, mais montrer ses limites lorsque la pertinence dépend d'un identifiant, d'une nuance ou de plusieurs contraintes simultanées. MultiVectorEncoder permet désormais de tester cette hypothèse sans reconstruire toute la couche de modélisation. Le volet visuel est particulièrement prometteur. Les modèles de la famille ColPali peuvent retrouver des pages à partir de leur contenu graphique et de leur mise en page sans commencer par une transcription OCR. Cette approche ne signe pas la disparition de l'OCR, mais elle dissocie la recherche de pages de leur extraction textuelle. Pour les plans techniques, les rapports financiers et les documents complexes, cette séparation ouvre des architectures plus souples, à condition d'en mesurer précisément les coûts.
Chargement de KingLand…
Sentence Transformers 6.0 : l'interaction tardive du RAG