Intelligence artificielle25 août 2026· via MarkTechPost

Fastino lance GLiNER2.5 : une révolution dans l'extraction d'informations

Fastino lance GLiNER2.5 : une révolution dans l'extraction d'informations

Fastino vient de publier GLiNER2.5, une mise à jour majeure qui abandonne l'ancienne méthode d'énumération de tous les segments possibles au profit de la prédiction des débuts et fins des entités. Ce changement élimine la nécessité de fixer une largeur maximale d'entité, permet de traiter des documents de 4 096 mots et maintient un calcul linéaire par rapport à la longueur de la séquence pour un schéma fixe. Il ajoute également un décodage joint des entités et relations, ainsi que des attributs par segment. Trois modèles Apache 2.0 sont disponibles sur Hugging Face avec 74 M, 194 M et 287 M de paramètres, utilisables en inférence locale sur CPU, CUDA ou MPS via une simple installation avec pip.

Une approche simplifiée pour l'extraction

Les anciens modèles GLiNER évaluaient chaque segment candidat en associant chaque position de début à chaque largeur autorisée. GLiNER2.5, lui, calcule les probabilités des bornes (début, fin et intérieur), puis utilise une étape de proposition éparse pour associer les débuts et fins les plus prometteurs par requête. Plus de restrictions de distance, plus de grille de largeurs : seulement deux passes qui restent linéaires par rapport à la longueur de la séquence pour un schéma et un budget de candidats fixes. L'équipe annonce un score macro F1 de 56,17 sur 16 benchmarks en zero-shot, une légère amélioration par rapport aux 56,09 de GLiNER2, mais avec un gain notable de 24,75 points sur XNLI.

Ce que ces nouveaux chiffres permettent

La suppression des représentations explicites de segments permet à GLiNER2.5 de s'entraîner sur des séquences allant jusqu'à 4 096 jetons. La bibliothèque inclut des outils comme extract_entities_long, qui mappe les longs segments aux décalages de caractères dans le document original. La longueur des segments n'est désormais plus limitée : une clause d'indemnisation de 40 mots coûte la même puissance de calcul qu'un nom de deux mots. Les utilisateurs peuvent déclarer des types d'entités, des relations typées et des règles structurelles, puis décoder conjointement entités et relations à partir du même pool de candidats.

Compatible avec toute infrastructure

Fastino propose trois modèles – petit (74 M), de base (194 M) et grand (287 M) – tous sous licence Apache 2.0 sur Hugging Face. L'inférence locale fonctionne sur CPU, CUDA ou MPS ; aucun endpoint hébergé n'est disponible pour l'instant, donc le déploiement implique un hébergement en interne. Une équipe de deux personnes peut faire tourner le modèle de 74 M sur une machine standard en CPU, tandis que les grandes organisations disposent d'une alternative préservant la confidentialité aux méthodes d'extraction par LLM jeton par jeton, pour des tâches comme la rédaction de données personnelles, l'extraction de clauses contractuelles ou l'étiquetage d'entités cliniques avec négation et dosage.

Pourquoi c'est important

GLiNER2.5 réduit l'écart entre les encodeurs légers et les LLMs coûteux pour l'extraction d'informations, sans sacrifier la flexibilité. En supprimant l'énumération des segments, il réduit la mémoire nécessaire, élargit les fenêtres de contexte et simplifie le décodage joint. Résultat : une extraction de haute qualité accessible aux startups et évolutive pour les entreprises. Les poids ouverts et les modèles optimisés pour le CPU abaissent encore la barrière du déploiement, laissant entrevoir que les architectures basées sur les bornes pourraient bientôt devenir la norme pour les pipelines d'extraction en production.


Source : MarkTechPost. Synthèse éditoriale assistée par IA — TechnoExpress.

Lire la source originale sur MarkTechPost →

← Retour à l'accueil