Un embedding transforme un texte en vecteur numérique afin que des contenus proches par le sens se retrouvent dans la même région de l’espace. Il ne stocke pas une vérité et ne « comprend » pas au sens humain : il encode des régularités apprises utiles pour classer des candidats.
Du document au vecteur
Découpez les sources en fragments qui gardent une idée cohérente, puis calculez un vecteur avec un modèle d’embedding. Stockez texte, vecteur et métadonnées : identifiant, source, date, langue, tenant et droits. La requête est transformée par le même modèle, puis l’index cherche les voisins selon une distance.
Similarité et index
Cosinus, produit scalaire ou distance euclidienne ne sont pas interchangeables sans tenir compte de la normalisation et des recommandations du modèle. Une recherche exacte maximise le rappel mais coûte davantage à grande échelle. HNSW ou IVFFlat accélèrent au prix d’un rappel approximatif à mesurer.
Limites
Les embeddings peuvent rater identifiants, nombres et mots rares. Une recherche hybride avec BM25 ajoute le signal lexical. Les filtres de métadonnées doivent être appliqués avant restitution pour isoler tenants et versions. Changer de modèle ou de dimension exige généralement une réindexation.
Évaluer
Créez des questions avec les fragments attendus et mesurez rappel et précision dans les premiers résultats. Segmentez par langue, type et longueur. Inspectez les échecs avant de changer de base : le problème vient souvent du chunking, des métadonnées ou du corpus.
FAQ
Peut-on reconstruire le texte depuis un embedding ?
Pas directement comme un encodage réversible, mais il ne faut pas le considérer automatiquement anonyme.
Plus de dimensions signifie-t-il meilleur résultat ?
Non. Modèle, tâche et qualité de l’index comptent davantage.
Un score élevé prouve-t-il que le document est vrai ?
Non. Il indique une proximité selon le modèle.