Guide

Statut éditorial : En attente de relecture

Comprendre les embeddings et la recherche sémantique

Comprendre comment un texte devient un vecteur, comment mesurer sa proximité et comment évaluer une recherche.

Classification du contenu

Types

  • RAG et recherche vectorielle
Niveau
Débutant
Publié le
13 août 2026
Dernière relecture
Relecture en attente
Prochaine vérification
13 novembre 2026

Un embedding transforme un texte en vecteur numérique afin que des contenus proches par le sens se retrouvent dans la même région de l’espace. Il ne stocke pas une vérité et ne « comprend » pas au sens humain : il encode des régularités apprises utiles pour classer des candidats.

Du document au vecteur

Découpez les sources en fragments qui gardent une idée cohérente, puis calculez un vecteur avec un modèle d’embedding. Stockez texte, vecteur et métadonnées : identifiant, source, date, langue, tenant et droits. La requête est transformée par le même modèle, puis l’index cherche les voisins selon une distance.

Similarité et index

Cosinus, produit scalaire ou distance euclidienne ne sont pas interchangeables sans tenir compte de la normalisation et des recommandations du modèle. Une recherche exacte maximise le rappel mais coûte davantage à grande échelle. HNSW ou IVFFlat accélèrent au prix d’un rappel approximatif à mesurer.

Limites

Les embeddings peuvent rater identifiants, nombres et mots rares. Une recherche hybride avec BM25 ajoute le signal lexical. Les filtres de métadonnées doivent être appliqués avant restitution pour isoler tenants et versions. Changer de modèle ou de dimension exige généralement une réindexation.

Évaluer

Créez des questions avec les fragments attendus et mesurez rappel et précision dans les premiers résultats. Segmentez par langue, type et longueur. Inspectez les échecs avant de changer de base : le problème vient souvent du chunking, des métadonnées ou du corpus.

FAQ

Peut-on reconstruire le texte depuis un embedding ?

Pas directement comme un encodage réversible, mais il ne faut pas le considérer automatiquement anonyme.

Plus de dimensions signifie-t-il meilleur résultat ?

Non. Modèle, tâche et qualité de l’index comptent davantage.

Un score élevé prouve-t-il que le document est vrai ?

Non. Il indique une proximité selon le modèle.

Sources utilisées