Intelligence artificielle19 août 2026· via MarkTechPost

NVIDIA lance TensorRT Model Connect pour simplifier l'inférence IA en C++

NVIDIA lance TensorRT Model Connect pour simplifier l'inférence IA en C++

NVIDIA dévoile TensorRT Model Connect (TRTMC), un nouvel outil open source qui permet aux équipes de convertir un modèle Hugging Face compatible en un moteur d'inférence C++ natif en seulement deux commandes—sans passer par l'export ONNX. Le résultat est un artefact versionné .bundle exécutable directement dans des environnements C++ comme les systèmes embarqués, les piles robotiques ou les microservices, éliminant ainsi PyTorch de la chaîne d'exécution.

Un flux de travail en deux commandes

Le processus est simplifié : d'abord, construire le modèle avec trtmc build en spécifiant la précision et les paramètres de cache, puis exécuter l'inférence avec trtmc run. Par exemple, la conversion du modèle Qwen3-0.6B ne nécessite que :

trtmc build Qwen/Qwen3-0.6B --precision bf16 --max-cache-length 16384 --output qwen3-0.6b.bundle trtmc run ./qwen3-0.6b.bundle --prompt "Quelle est la capitale de la France ? Répondez en un seul mot." --chat-template --no-thinking

Le fichier .bundle généré contient tout ce qui est nécessaire pour un déploiement en C++, y compris les poids du modèle, les moteurs TensorRT et les métadonnées pour l'audit via trtmc inspect.

Conçu pour la production, pas seulement le prototypage

TRTMC s'adresse aux équipes utilisant déjà des piles natives—entreprises de robotique, fabricants d'appareils embarqués et plateformes d'inférence d'entreprise—plutôt qu'aux services centrés sur Python. NVIDIA souligne que l'outil est sous licence Apache-2.0 et distribué sous forme d'implémentations modulaires de référence, et non comme un convertisseur universel. Bien que les wheel actuels supportent Linux aarch64 avec Python 3.10/3.12 et TensorRT 11.1.0.106, les utilisateurs x86_64 doivent compiler à partir des sources via Docker.

Le projet a été développé avec l'aide d'OpenAI Codex sous supervision humaine, et NVIDIA présente TRTMC comme une alternative plus propre au pipeline traditionnel : PyTorch → ONNX/TorchScript → TensorRT → colle C++ personnalisée. En supprimant ces étapes, TRTMC élimine les lacunes d'export, les intégrations redondantes et les surcoûts de validation.

Pourquoi c'est important

Pour les secteurs où l'inférence doit s'exécuter dans des binaires C++—robotique, calcul de bord automobile, dispositifs médicaux—TRTMC réduit les obstacles de déploiement et les dépendances à l'exécution. Les équipes peuvent désormais livrer des modèles sans maintenir de pipelines de conversion séparés ni PyTorch en production. Les premiers adopteurs bénéficient d'une itération plus rapide et d'artefacts auditable, mais les petites équipes ou les environnements réglementés pourraient attendre une version stable. Le vrai changement ne réside pas seulement dans la vitesse, mais dans la dissociation de la livraison des modèles des contraintes d'exécution de Python.


Source : MarkTechPost. Synthèse éditoriale assistée par IA — TechnoExpress.

Lire la source originale sur MarkTechPost →

← Retour à l'accueil