RAG multi-documents : indexer des PDF par plan hiérarchique
La gestion de répertoires contenant des documents hétérogènes et sans métadonnées communes pose un défi majeur aux systèmes de génération augmentée par récupération ou RAG en entreprise. Lorsque des dossiers mêlent des normes de sécurité, des articles de recherche et des rapports financiers, l’indexation traditionnelle par champs partagés devient impossible. Une approche technique récente propose de traiter ce type de répertoire comme un document unique structuré, éliminant ainsi la nécessité de bases de données relationnelles complexes ou d’ontologies personnalisées. Le principe repose sur la construction d’un index à deux niveaux. Le premier niveau consiste en une ligne de résumé concise pour chaque fichier, générée une seule fois lors de l’ingestion. Ce résumé agit comme un filtre de routage précis, indiquant le contenu du document et les sujets qu’il ne couvre pas. Le deuxième niveau exploite automatiquement le sommaire ou les titres déjà extraits par l’outil de lecture des PDF. Ensemble, ces deux niveaux forment un plan hiérarchique qui remplace l’indexation classique. Lors d’une requête, le modèle procède en deux étapes. Il analyse d’abord la liste complète des résumés pour identifier les fichiers pertinents, généralement un ou deux. Cette phase s’appuie également sur un comptage de mots-clés pour capturer les codes techniques ou les références spécifiques. Une fois les fichiers cibles sélectionnés, le système descend dans leurs sommaires pour localiser les sections exactes, suivant une logique de navigation hiérarchique jusqu’au contenu pertinent. Cette méthode garantit un processus de récupération borné, traçable et économique en ressource de calcul. Cette architecture offre plusieurs avantages opérationnels. Elle supprime les étapes lourdes d’extraction d’entités et de construction d’index relationnel. La précision est renforcée par la traçabilité des décisions de routage, permettant de remonter facilement à l’origine d’une réponse. De plus, le coût computationnel reste maîtrisé car le modèle ne lit que la liste des résumés et les plans des fichiers sélectionnés, évitant le chargement inutile de milliers de pages. Malgré ses atouts, la solution présente des limites à surveiller. La précision du routage peut diminuer au-delà de quelques centaines de fichiers en raison de la saturation décisionnelle du modèle. Dans ce cas, l’ajout d’un niveau intermédiaire de regroupement par dossier ou par source permet de rétablir l’efficacité. La qualité des résumés est également critique : une formulation trop générique conduit à un mauvais filtrage initial. Enfin, les fichiers longs et sans structure hiérarchique identifiable nécessitent une étape de reconstruction de plan préalable. Cette approche simplifie considérablement l’architecture RAG pour les environnements documentaires disparates. En traitant un répertoire hétérogène comme un document unique à navigation par plan, les entreprises peuvent déployer des systèmes de recherche documentaire précis, modulaires et moins dépendants de la maintenance des métadonnées. La solution s’inscrit dans une évolution plus large des outils d’intelligence documentaire, privilégiant la structure native des fichiers à l’ingénierie complexe d’indexation.
