Intelligence artificielle28 août 2026· via MarkTechPost

Cohere Parse 5 transforme les documents d'entreprise en Markdown structuré

Cohere Parse 5 transforme les documents d'entreprise en Markdown structuré

Cohere a lancé Parse v5.0, un modèle vision-langage de 2,3 milliards de paramètres qui convertit PDF, PowerPoints et pages JPEG en Markdown structuré en une seule étape. Avec une fenêtre de contexte de 8 192 jetons et une empreinte d’environ 4,6 Go, le modèle ingère des pages encodées en base64 et renvoie un Markdown propre qui préserve l’ordre de lecture, les tableaux rendus en HTML, les listes, les paires clé-valeur de formulaires, les descriptions d’images et les encadrés de délimitation — sans étape d’OCR distincte nécessaire.

Conçu pour l'échelle, optimisé pour le pragmatisme

Proposé à 1,50 $ pour 1 000 pages, Parse mise sur un rapport performance-prix plutôt que sur une précision maximale. Cohere cite un score ParseBench de 79,2, moyenne de trois des cinq dimensions du benchmark — tableaux, fidélité du contenu et mise en forme sémantique —, le plaçant devant Mistral OCR 4 (74,5), Azure Document Intelligence (74,3) et Databricks AI Parse (72,4). L’entreprise souligne que ParseBench évalue environ 2 078 pages d’entreprise vérifiées par des humains, mais exclut les graphiques et l’ancrage visuel, deux domaines où de nombreux parseurs peinent.

Des options de déploiement adaptées à chaque besoin

Parse est disponible via l’API Cohere Parse, Microsoft Foundry, AWS SageMaker et Model Vault en mode mono-tenant. Une clé d’essai gratuite est proposée aux équipes utilisant déjà des piles RAG, tandis que les grandes entreprises avec des exigences de résidence ou d’air-gap peuvent le déployer en privé. Cohere cible les secteurs gourmands en documents — services financiers, assurances, santé, sciences de la vie, secteur public, télécoms, énergie et industrie — où les formulaires scannés et les tableaux denses sont fréquents.

Deux modes de sortie pour différents flux de travail

Par défaut, Parse renvoie une chaîne Markdown par page. En activant output_format="blocks", il fournit des blocs typés avec des tableaux en HTML, des encadrés de délimitation et des descriptions, permettant une traçabilité au niveau des citations. Les langues prises en charge incluent l’arabe, l’anglais, le français, l’allemand, l’italien, le japonais, le coréen, le portugais et l’espagnol, avec une couverture zero-shot pour les autres.

Pourquoi cela compte

Parse comble l’écart entre les documents d’entreprise bruités et des données structurées prêtes à l’emploi pour les systèmes en aval. En intégrant raisonnement vision-langage et OCR dans un seul modèle, Cohere réduit les frictions et les coûts des pipelines pour les équipes qui traitent des milliers de pages chaque mois. Les équipes de taille moyenne peuvent tester l’API dès aujourd’hui, tandis que les secteurs régulés bénéficient d’une option sur site sans liste d’attente. Le vrai gain réside dans le passage d’un traitement de documents fragmenté à une compréhension unifiée à l’échelle.


Source : MarkTechPost. Synthèse éditoriale assistée par IA — TechnoExpress.

Lire la source originale sur MarkTechPost →

← Retour à l'accueil