Pourquoi ce sujet est important
Extraire le texte brut d’un PDF suffit rarement. L’ordre de lecture peut être faux, un tableau perdre ses colonnes et une image contenir l’information essentielle. Un pipeline RAG doit préserver structure et provenance avant de produire des embeddings.
Classifier les documents
Distinguez PDF natif, scan, formulaire, rapport multi-colonnes, article scientifique et présentation. Détectez pages sans texte, rotation, langue et densité d’images. Routez chaque type vers le parseur ou l’OCR approprié plutôt que d’appliquer une seule méthode.
Préserver la mise en page
Conservez page, blocs, coordonnées, titres, listes, légendes, notes et ordre de lecture. Reconstituez les paragraphes sans fusionner colonnes. Enregistrez le fichier et la version du parseur afin de reproduire l’extraction.
Traiter les tableaux
Un tableau doit garder cellules, en-têtes, unités et relations ligne-colonne. Stockez une représentation structurée et une version textuelle adaptée à la recherche. Pour un grand tableau, indexez description, en-têtes et groupes de lignes, puis renvoyez les cellules sources à la génération.
Traiter images et schémas
Utilisez OCR pour le texte dans l’image et un modèle visuel seulement lorsque l’information visuelle est nécessaire. Conservez légende et page. Ne décrivez pas automatiquement chaque image décorative. Pour un graphique, distinguez valeurs lisibles et interprétation.
Chunker par structure
Découpez selon sections, paragraphes, tableaux et figures, avec un contexte parent. Évitez les chunks traversant deux colonnes ou séparant une légende de sa figure. Stockez page et coordonnées pour afficher une citation ou une vignette.
Construire le retrieval
Combinez recherche lexicale et vectorielle. Les références, numéros et unités bénéficient du lexical. Un reranker peut améliorer les premiers résultats. Pour une question sur un tableau, routez vers la représentation structurée plutôt que vers un résumé imprécis.
Évaluer la fidélité
Créez des questions textuelles, tabulaires, visuelles et multi-pages. Mesurez récupération de la bonne page, exactitude des valeurs, citations et capacité à dire que l’information n’est pas extractible. Comparez les parseurs sur un corpus annoté.
Exemple concret
Un rapport financier contient un tableau sur deux pages et une note en bas de page. Le pipeline relie les en-têtes répétés, conserve les unités et indexe des groupes de lignes. La réponse cite la cellule et la note, au lieu de demander au LLM de reconstruire le tableau depuis du texte désordonné.
Les erreurs fréquentes
- faire confiance à l’ordre du texte extrait
- transformer tout tableau en paragraphe
- ignorer pages scannées silencieusement
- découper par nombre de caractères seulement
- perdre page et coordonnées
- évaluer uniquement des questions narratives
Checklist
- [ ] Types de PDF détectés
- [ ] OCR appliqué seulement si nécessaire
- [ ] Ordre de lecture contrôlé
- [ ] Tableaux structurés
- [ ] Figures reliées aux légendes
- [ ] Chunks avec provenance
- [ ] Questions visuelles et tabulaires testées
FAQ
Quel parseur choisir ?
Testez plusieurs outils sur vos documents. La structure de vos PDF compte plus qu’un classement général.
Faut-il un modèle multimodal ?
Seulement si l’information dépend réellement de l’image ou de la mise en page.
Comment citer un tableau ?
Conservez page, identifiant du tableau, ligne, colonne et unités, puis affichez l’extrait source.
L’OCR corrige-t-il les scans ?
Il extrait du texte mais peut introduire des erreurs. Mesurez nombres, noms et symboles critiques.