Tutoriel

Statut éditorial : En attente de relecture

Configurer RAGFlow pour indexer des documents

Déployer RAGFlow, créer un dataset, régler le parsing et contrôler les chunks avant de lancer les requêtes.

Classification du contenu

Types

  • RAG et recherche vectorielle
  • Outils

Technologies

Niveau
Avancé
Publié le
14 août 2026
Dernière relecture
Relecture en attente
Prochaine vérification
14 novembre 2026

RAGFlow associe extraction documentaire, découpage, indexation et conversation. La qualité dépend d’abord du parsing : si un tableau ou un titre est mal extrait, le modèle ne peut pas le reconstruire fidèlement.

Déployer proprement

Utilisez le fichier Docker Compose et les prérequis de la version officielle. Vérifiez mémoire, espace disque et ports avant le démarrage. Épinglez l’image au lieu d’utiliser latest en production, puis ouvrez l’interface uniquement derrière TLS et authentification.

Créer le dataset

Créez un dataset par domaine ayant les mêmes règles d’accès et une stratégie de parsing cohérente. Choisissez le modèle d’embeddings avant l’ingestion. Le changer ensuite impose une réindexation.

Importez d’abord trois documents représentatifs : un PDF simple, un document avec tableau et un fichier difficile. Conservez titre, source, version, date et niveau d’accès dans les métadonnées.

Régler le parsing

Sélectionnez le modèle de parsing adapté au contenu. Contrôlez dans l’interface : ordre des paragraphes, titres, tableaux, pages et chunks. Ajustez taille et séparateurs sur des erreurs observées, pas au hasard.

Pour les PDF scannés, activez l’OCR et comparez quelques pages au document original. Les noms propres et valeurs numériques méritent une vérification particulière.

Tester le retrieval

Utilisez le test de retrieval avec des questions dont vous connaissez la réponse. Notez si le bon chunk apparaît dans les premiers résultats. Testez également une question sans réponse : le système doit pouvoir s’abstenir.

Brancher la génération

Demandez au modèle de répondre uniquement depuis le contexte et de citer les documents. Limitez le nombre et la longueur des chunks transmis. Un contexte énorme augmente coût et bruit sans garantir la précision.

Production

Séparez collections par droits, sauvegardez les volumes, surveillez files d’ingestion et erreurs de parsing. Versionnez les paramètres. Lors d’une mise à jour, réindexez un échantillon et comparez la qualité avant migration complète.

FAQ

Un document indexé est-il immédiatement fiable ?

Non. Vérifiez les chunks et exécutez un jeu de questions de référence.

Peut-on mélanger des documents confidentiels et publics ?

Évitez-le. Séparez les datasets et appliquez l’autorisation avant toute récupération.

Vérifier l’indexation par API

Après avoir créé la base documentaire dans l’interface, gardez son identifiant dans une variable locale et interrogez son état plutôt que de supposer que l’import est terminé.

~~~bash export RAGFLOW_BASE_URL=http://localhost export DATASET_ID=remplacer-par-identifiant curl -fsS \ -H "Authorization: Bearer $RAGFLOW_API_KEY" \ "$RAGFLOW_BASE_URL/api/v1/datasets/$DATASET_ID" ~~~

Testez ensuite cinq questions dont la source attendue est connue. Pour chacune, notez document retrouvé, section, score et présence de la réponse dans le chunk. Si le bon passage n’apparaît pas, corrigez parsing, taille de chunk ou métadonnées avant de modifier le prompt. Ne placez jamais la clé API dans une capture ou un fichier versionné, et appliquez les mêmes droits d’accès aux documents et à la recherche.

Sources utilisées