NVIDIA lance un modèle d'agent IA à 30 milliards de paramètres optimisé par routage intell
NVIDIA vient de publier deux outils open source qui pourraient rendre les agents IA continus moins chers et plus rapides à exécuter. Nemotron 3.5 Lightning est un modèle de mélange d'experts (MoE) ouvert de 30 milliards de paramètres, dont seulement 3 milliards sont actifs simultanément. NeMo Switchyard agit comme un aiguilleur qui oriente chaque étape d'un agent vers le bon modèle spécialisé. Ensemble, ils ciblent le coût caché des agents IA : la majorité des jetons sont consommés par les appels d'outils, la validation et la délégation à des sous-agents, et non par le raisonnement.
Routage intelligent et agents plus performants
NeMo Switchyard est une bibliothèque open source qui relie une flotte de modèles spécialisés et décide en temps réel lequel doit traiter chaque tâche. Au lieu d'envoyer chaque étape à un modèle haut de gamme coûteux, Switchyard sélectionne le modèle le plus performant tout en restant efficace, réduisant ainsi la latence et les coûts de calcul. NVIDIA le présente comme le gestionnaire de trafic des workflows multi-modèles, sans remplacer les couches de planification.
Optimisations de vitesse et calcul matériel
L'architecture de Lightning combine Mamba-2, MoE et attention avec une fenêtre de contexte d'un million de jetons – une longueur inhabituelle pour un modèle de cette taille. NVIDIA attribue sa vitesse à deux astuces : un décodage spéculatif intégré à l'entraînement préalable et un point de contrôle de quantification NVFP4 fonctionnant efficacement sur les GPU Blackwell, Hopper et Ampere. Sur PinchBench, le modèle a atteint 86 % de précision tout en accomplissant 10 000 tâches 30 % plus vite que le Qwen3.6 35B à précision comparable, et jusqu'à 4 fois plus vite que des modèles de taille similaire.
Prêt pour le banc d'essai
La pile est entièrement open source et licenciée sous OpenMDW-1.1, avec des poids et des recettes ouverts. Les développeurs solo peuvent l'exécuter sur un seul DGX Spark (GB10) ou H100, tandis que les équipes de taille moyenne peuvent opter pour des solutions hébergées par Baseten, Together AI ou Nebius. Les secteurs réglementés peuvent tout conserver en local. Les premiers adopteurs incluent déjà des équipes en cybersécurité, services juridiques, ingénierie logicielle, finance et santé.
Pourquoi c'est important
Pour les équipes développant des agents IA, Lightning et Switchyard déplacent le goulot d'étranglement de la puissance brute de raisonnement vers le routage intelligent et l'efficacité d'exécution. En réduisant le nombre de paramètres actifs et en optimisant le flux de jetons, NVIDIA rend plus accessible le déploiement de charges de travail agentiques à haut volume sans sacrifier la qualité. La licence open source et les options mono-GPU permettent aux startups comme aux entreprises de prototyper et de faire évoluer leurs projets sans budget supercalculateur.
Source : MarkTechPost. Synthèse éditoriale assistée par IA — TechnoExpress.

