Intelligence artificielle26 août 2026· via MarkTechPost

Alibaba lance Qwen3.8-Flash-Next : un modèle multimodal de 125 milliards de paramètres ave

Alibaba lance Qwen3.8-Flash-Next : un modèle multimodal de 125 milliards de paramètres ave

Image : MarkTechPost

L'équipe Qwen d'Alibaba repousse à nouveau les limites de l'efficacité avec Qwen3.8-Flash-Next, un modèle multimodal MoE de 125 milliards de paramètres qui n'active que 6 milliards de paramètres par jeton — tout en dévoilant l'architecture qui alimentera Qwen4. Conçu pour une inférence économique, le point de contrôle en poids ouvert combine une table d'embeddings N-gram de 51 milliards de jetons et un module de prédiction multi-jetons de 4 milliards de paramètres, totalisant 180 milliards de paramètres sur disque tout en maintenant une puissance de calcul allégée.

Une nouvelle recette pour la vitesse et l'échelle

Quatre innovations techniques expliquent ces gains. Une pile d'attention hybride alterne des couches Gated DeltaNet — des blocs d'attention linéaire compressant l'historique dans un état récurrent fixe — avec des couches Qwen Sparse Attention (QSA) qui sélectionnent le contexte à une granularité de micro-blocs. Un mécanisme Gated Residual divise le flux résiduel en quatre branches parallèles dotées de portes de lecture/écriture par branche, tandis qu'une table d'embeddings N-gram de 20 millions d'entrées à la deuxième couche ajoute de la capacité via des recherches déterministes pouvant être externalisées vers la mémoire hôte. L'entraînement utilise l'optimiseur Muon, une variante d'AdamW supprimant la phase de préchauffage de la taille de lot et ajustant les lois d'échelle pour plus d'efficacité.

Le modèle active des paramètres de manière éparse, sans sacrifier le stockage : la version FP8 pèse 172,78 Gio et la version BF16 335,28 Gio. Pour le déploiement, les configurations recommandées pour vLLM et SGLang exigent au moins TP2 sur GB300 pour FP8 ou TP4 pour BF16, avec une parallélisation tensorielle de 8 sur des nœuds 8×H200 pour un débit optimal. Les fournisseurs rapportent des accélérations jusqu'à 7,6× pour le préremplissage et 4,9× pour le décodage avec 1 million de jetons grâce au noyau QSA.

Performances : solides mais pas universelles

Sur les tâches de programmation et d'agents, Qwen3.8-Flash-Next obtient 58,7 sur DeepSWE 1.1, 62,5 sur SWE-bench Pro, 81,0 sur SWE-bench Multilingual et 91,9 sur LiveCodeBench v6. Les benchmarks agentiques affichent 73,9 sur CoWorkBench, 55,7 sur JobBench et 73,5 sur Toolathlon Verified. Les évaluations multimodales atteignent 84,5 sur AndroidWorld, 76,6 sur LVBench, 88,5 sur RealWorldQA et 95,7 sur MathVision avec interpréteur de code. Il reste en retrait face à des rivaux comme Claude Opus 4.6 (Max) sur HumanEval et DeepSeek-V4-Flash-0731 sur NL2Repo-Bench, soulignant des marges de progression en raisonnement de pointe.

Pourquoi c'est important

Qwen3.8-Flash-Next marque un tournant vers des modèles multimodaux ultra-efficaces alliant puissance et accessibilité. En n'activant que 6 milliards de ses 125 milliards de paramètres par jeton et en réduisant les coûts d'entraînement d'environ 89 %, il abaisse la barrière de déploiement de l'IA avancée sur cloud et périphérie. Son architecture annonce également Qwen4, suggérant une consolidation des techniques — attention hybride, experts épars et embeddings N-gram — qui pourraient devenir la norme dans les modèles ouverts de nouvelle génération. Pour les équipes cherchant un équilibre entre performance et budget, ce point de contrôle représente un compromis attractif, bien que son déploiement reste sensible à l'infrastructure et que les vitesses annoncées par les fournisseurs attendent une validation indépendante.


Source : MarkTechPost. Synthèse éditoriale assistée par IA — TechnoExpress.

Lire la source originale sur MarkTechPost →

← Retour à l'accueil