Intelligence artificielle29 août 2026· via MarkTechPost

Modèles chinois d'IA GLM-5.3-Flash et Qwen3.8-Flash-Next : des choix architecturaux simila

Modèles chinois d'IA GLM-5.3-Flash et Qwen3.8-Flash-Next : des choix architecturaux simila

Deux modèles ouverts de pointe ont été publiés à moins de 24 heures d'intervalle cette semaine, bien que leurs créateurs affirment avoir travaillé de manière indépendante. Z.ai a lancé GLM-5.3-Flash, un modèle multimodal à mélange d'experts (MoE) comptant 320 milliards de paramètres, dont 18 milliards actifs, tandis que l'équipe Qwen d'Alibaba a publié Qwen3.8-Flash-Next, une préversion de la famille Qwen4 avec 125 milliards de paramètres, dont 6 milliards actifs. Ce qui les unit est plus frappant que ce qui les divise : des ratios de couches, des mécanismes d'attention et des astuces de gestion de contexte presque identiques.

Une recette écrite deux fois

Les deux équipes ont adopté un ratio de 3:1 entre couches linéaires et couches d'attention totale. GLM-5.3-Flash empile 45 couches — 34 linéaires et 11 d'attention totale — tandis que Qwen3.8-Flash-Next utilise 48 couches organisées en blocs de trois couches Gated DeltaNet et une couche d'attention éparse, reproduisant le même équilibre 3:1. Les couches linéaires compressent l'historique dans un état récurrent de taille fixe, maintenant un calcul par token constant même pour des contextes d'un million de tokens. GLM s'appuie sur l'attention Delta Kimi avec des portes de décroissance par canal, tandis que Qwen utilise son propre Gated DeltaNet avec des portes par tête ; les deux appartiennent à la famille des règles delta.

La sélection de contexte est la seconde astuce partagée. Chaque modèle intègre un indexeur appris de petite taille qui note les segments d'historique et conserve uniquement les 2048 meilleurs candidats pour les couches d'attention totale, réduisant la croissance du cache KV sans perte de précision. Les couches éparse de GLM utilisent un indexeur 32 têtes issu de DSA de DeepSeek, tandis que l'indexeur de Qwen est optimisé pour son attention à requêtes groupées dans QSA. Les paramètres et seuils de sélection s'alignent presque parfaitement.

Revendications d'efficacité et premiers retours

Z.ai affirme que GLM-5.3-Flash surpasse son prédécesseur à un dixième du coût, tout en approchant les performances de Claude Opus 4.8 en programmation et en tâches d'agents, au prix de 0,15 $ par million de tokens en entrée et 0,50 $ par million en sortie. La fiche technique du modèle indique également une fenêtre de contexte native d'un million de tokens et un entraînement sur un corpus multimodal de 30 000 milliards de tokens. Qwen3.8-Flash-Next, en revanche, met en avant une fenêtre native de 262 144 tokens extensible à un million avec YaRN et revendique une consommation de calcul d'entraînement environ neuf fois inférieure à celle de Qwen3.7-Plus.

Pourquoi c'est important

Cette convergence quasi simultanée suggère un nouveau palier d'efficacité pour les modèles à long contexte. Lorsque deux laboratoires rivaux aboutissent indépendamment aux mêmes ratios de couches, types d'attention et schémas de compression de contexte, cela indique que ces choix s'approchent d'une frontière d'optimalité plutôt que d'innovations ponctuelles. Pour les développeurs, cette similitude réduit les incertitudes : des recettes éprouvées existent aujourd'hui pour équilibrer vitesse, mémoire et précision à grande échelle. Pour les utilisateurs, le résultat est un accès plus rapide et moins coûteux à des modèles capables de conserver et de raisonner sur des entrées massives. L'enjeu réel ne réside pas dans la nouveauté architecturale, mais dans la rapidité avec laquelle l'industrie peut transformer ces meilleures pratiques convergentes en outils standards.


Source : MarkTechPost. Synthèse éditoriale assistée par IA — TechnoExpress.

Lire la source originale sur MarkTechPost →

← Retour à l'accueil