Intelligence artificielle5 août 2026· via MarkTechPost

RAG natif pixel : indexation des documents sous forme d'images pour une recherche plus int

RAG natif pixel : indexation des documents sous forme d'images pour une recherche plus int

Imaginez rechercher un PDF ou une page web non pas par son texte, mais par son apparence. Un nouveau pipeline open source appelé Pixel-Native RAG fait exactement cela : il convertit les documents en images, les découpe en tuiles chevauchantes, puis indexe leur contenu visuel à l'aide d'embeddings multimodaux avant d'exposer les résultats via un service FastAPI. Cette approche contourne l'analyse HTML traditionnelle ou le découpage fixe, s'appuyant plutôt sur des modèles vision-langage comme SigLIP ou CLIP pour capturer la sémantique de la mise en page, les relations spatiales et même les éléments non textuels.

Au-delà de l'extraction de texte : indexation visuelle en pratique

Le tutoriel présente un pipeline complet : conversion des pages en PNG avec Chrome en mode headless, découpage de chaque page en tuiles de 1024×1024 pixels avec un chevauchement de 128 pixels, et génération d'embeddings pour chaque tuile à l'aide de SigLIP ou CLIP. Optionnellement, un backend Qwen3-VL est pris en charge pour une précision accrue. Les vecteurs sont stockés dans un index FAISS optimisé avec la recherche IVF et les fichiers inversés, tandis que les scores BM25 issus de l'OCR complètent la récupération dense. Une étape de fusion des rangs réciproques combine les deux signaux, et les résultats au niveau des tuiles sont agrégés en résultats au niveau des documents. Le système expose un point de terminaison FastAPI pour des requêtes en temps réel et inclut des scripts d'évaluation qui rapportent le Recall@k et le rang moyen réciproque sur un ensemble de requêtes de test.

Des tuiles aux réponses

En phase d'inférence, le système récupère les top-k tuiles et, si activé, transmet les preuves les plus solides à un modèle vision-langage comme Qwen2.5-VL-3B-Instruct pour générer des réponses ancrées. Les auteurs fournissent également un adaptateur résiduel léger, entraîné par apprentissage contrastif, pour affiner les embeddings sur des documents spécifiques à un domaine. Des visualisations affichent les captures d'écran récupérées accompagnées de scores de pertinence, offrant aux utilisateurs une vision transparente du processus de récupération.

Pourquoi c'est important

Pixel-Native RAG réoriente la récupération documentaire de l'extraction textuelle vers la compréhension visuelle, ce qui permet de préserver le contexte de mise en page et de gérer des mises en page complexes à plusieurs colonnes sans recourir à des règles d'analyse fragiles. Pour les secteurs qui s'appuient sur des PDF scannés, des tableaux de bord ou des médias mixtes, cette méthode peut réduire le bruit et améliorer la précision. En open sourçant le code et le pipeline d'évaluation, le projet abaisse la barrière à l'expérimentation avec l'indexation multimodale, invitant les équipes à l'adapter pour des jeux de données propriétaires ou des domaines spécialisés.


Source : MarkTechPost. Synthèse éditoriale assistée par IA — TechnoExpress.

Lire la source originale sur MarkTechPost →

← Retour à l'accueil