Marker 2 révolutionne la conversion de documents en vitesse et précision

Marker 2 de Datalab vient de redéfinir les standards de la conversion open source de documents : il offre jusqu’à 5 fois la vitesse des outils leaders tout en améliorant la précision sur un benchmark tiers exigeant. Cette nouvelle version convertit les PDF, images, PPTX, DOCX, XLSX, HTML et EPUB en blocs propres de markdown, JSON, HTML ou texte, grâce à un pipeline repensé qui exploite Surya OCR 2 (un modèle de disposition à 20 millions de paramètres) et un composant pdftext désormais trois fois plus rapide. Sur le benchmark olmOCR-bench d’Allen AI, le mode équilibré de Marker 2 atteint 76,0 % de précision globale et 83,5 % sur les PDF natifs, avec un débit de 2,9 pages par seconde sur un GPU B200. Cela dépasse de plus de cinq fois les 72,7 % de MinerU à 0,54 page par seconde et surpasse Docling, qui affiche 50,3 % à 2,1 pages par seconde.
Trois modes de conversion adaptés aux appareils
Marker 2 propose désormais trois modes adaptés aux capacités matérielles. Le mode équilibré utilise le modèle vision-langage Surya pour ré-OCRiser la page entière lorsque le texte intégré est peu fiable, idéal pour les configurations GPU et offrant le meilleur score global. Le mode rapide associe un détecteur de disposition léger à une utilisation minimale du VLM, réduisant les coûts tout en atteignant 66,6 %. Pour les workflows CPU uniquement, le mode sans OCR extrait directement les couches de texte à 43,6 % de précision et jusqu’à 23,7 pages par seconde. Chaque mode est sélectionné automatiquement en fonction du matériel disponible, sauf indication contraire.
Améliorations architecturales pour une mise à l’échelle
Derrière cette augmentation de vitesse se cache une nouvelle architecture multi-processus : de nombreux processus CPU partagent un même serveur d’inférence Surya, permettant au débit de s’adapter à la capacité du serveur plutôt qu’à la VRAM par processus. Datalab indique que le mode équilibré peut maintenir environ 2,9 pages par seconde contre environ 0,3 page par seconde dans une configuration mono-flux sur le même matériel. Le pipeline a également été entièrement porté sur CPU, permettant au modèle de disposition de 20 millions de paramètres de détecter colonnes, tableaux et en-têtes sans GPU.
Modifications pratiques pour les utilisateurs
La mise à jour introduit des changements majeurs : Python 3.10+ est désormais requis, l’emballage est passé de Poetry à uv avec hatchling, et le convertisseur d’extraction structurée ainsi que les extracteurs ont été supprimés. Les utilisateurs sont dirigés vers l’API hébergée ou un nouveau workflow --use_llm. Les notes de version détaillent les étapes de migration et les nouveaux indicateurs.
Pourquoi c’est important
Marker 2 relève les standards de la conversion de documents en combinant une précision supérieure sur un benchmark tiers rigoureux avec des gains de débit remarquables — une avancée utile pour les équipes traitant de grandes archives ou alimentant des pipelines de génération augmentée par récupération. Les modes adaptés aux appareils et la conception à inférence partagée rendent la conversion haute performance accessible sur du matériel d’entrée de gamme, élargissant son adoption. Pour quiconque évalue les parseurs open source de documents, l’environnement reproductible de Marker 2 impose une réévaluation des compromis actuels entre vitesse, précision et contraintes matérielles.
Source : MarkTechPost. Synthèse éditoriale assistée par IA — TechnoExpress.

