Guide

Statut éditorial : En attente de relecture

RAG sur des PDF complexes : tableaux, images et mise en page

Construire un pipeline RAG fiable pour des PDF comportant colonnes, tableaux, schémas, scans, en-têtes et références visuelles.

Classification du contenu

Types

  • RAG et recherche vectorielle

Technologies

Niveau
Avancé
Publié le
24 août 2026
Dernière relecture
Relecture en attente
Prochaine vérification
24 octobre 2026

Pourquoi ce sujet est important

Extraire le texte brut d’un PDF suffit rarement. L’ordre de lecture peut être faux, un tableau perdre ses colonnes et une image contenir l’information essentielle. Un pipeline RAG doit préserver structure et provenance avant de produire des embeddings.

Classifier les documents

Distinguez PDF natif, scan, formulaire, rapport multi-colonnes, article scientifique et présentation. Détectez pages sans texte, rotation, langue et densité d’images. Routez chaque type vers le parseur ou l’OCR approprié plutôt que d’appliquer une seule méthode.

Préserver la mise en page

Conservez page, blocs, coordonnées, titres, listes, légendes, notes et ordre de lecture. Reconstituez les paragraphes sans fusionner colonnes. Enregistrez le fichier et la version du parseur afin de reproduire l’extraction.

Traiter les tableaux

Un tableau doit garder cellules, en-têtes, unités et relations ligne-colonne. Stockez une représentation structurée et une version textuelle adaptée à la recherche. Pour un grand tableau, indexez description, en-têtes et groupes de lignes, puis renvoyez les cellules sources à la génération.

Traiter images et schémas

Utilisez OCR pour le texte dans l’image et un modèle visuel seulement lorsque l’information visuelle est nécessaire. Conservez légende et page. Ne décrivez pas automatiquement chaque image décorative. Pour un graphique, distinguez valeurs lisibles et interprétation.

Chunker par structure

Découpez selon sections, paragraphes, tableaux et figures, avec un contexte parent. Évitez les chunks traversant deux colonnes ou séparant une légende de sa figure. Stockez page et coordonnées pour afficher une citation ou une vignette.

Construire le retrieval

Combinez recherche lexicale et vectorielle. Les références, numéros et unités bénéficient du lexical. Un reranker peut améliorer les premiers résultats. Pour une question sur un tableau, routez vers la représentation structurée plutôt que vers un résumé imprécis.

Évaluer la fidélité

Créez des questions textuelles, tabulaires, visuelles et multi-pages. Mesurez récupération de la bonne page, exactitude des valeurs, citations et capacité à dire que l’information n’est pas extractible. Comparez les parseurs sur un corpus annoté.

Exemple concret

Un rapport financier contient un tableau sur deux pages et une note en bas de page. Le pipeline relie les en-têtes répétés, conserve les unités et indexe des groupes de lignes. La réponse cite la cellule et la note, au lieu de demander au LLM de reconstruire le tableau depuis du texte désordonné.

Les erreurs fréquentes

Checklist

FAQ

Quel parseur choisir ?

Testez plusieurs outils sur vos documents. La structure de vos PDF compte plus qu’un classement général.

Faut-il un modèle multimodal ?

Seulement si l’information dépend réellement de l’image ou de la mise en page.

Comment citer un tableau ?

Conservez page, identifiant du tableau, ligne, colonne et unités, puis affichez l’extrait source.

L’OCR corrige-t-il les scans ?

Il extrait du texte mais peut introduire des erreurs. Mesurez nombres, noms et symboles critiques.

Sources utilisées