Intelligence artificielle1 août 2026· via MarkTechPost

DeepSeek V4-Flash-0731 : des gains majeurs pour l'agentique et le code

DeepSeek V4-Flash-0731 : des gains majeurs pour l'agentique et le code

DeepSeek a poussé son modèle Mixture-of-Experts (MoE) à poids ouverts vers une nouvelle phase. Le 31 juillet 2026, l'équipe a publié discrètement DeepSeek-V4-Flash-0731 sur Hugging Face et promu l'API V4-Flash en bêta publique. L'objectif est clair : conserver la même architecture de 284 milliards de paramètres, mais avec un réentraînement qui améliore les performances en agentique et en génération de code, sans modifier la conception de base.

Un modèle optimisé pour les agents et le code

Cette mise à jour constitue un point de contrôle accompagné du module de décodage spéculatif DSpark, reflétant la structure de la variante DSpark séparée. DeepSeek annonce des progrès sur les benchmarks axés agentique et code, dont Terminal Bench 2.1 et NL2Repo, où cette nouvelle version surpasse souvent les préversions V4-Flash et V4-Pro. Les tâches d'agent de code ont été évaluées avec un mode minimal du cadre DeepSeek Harness, et l'entreprise souligne que les scores peuvent varier selon les configurations du cadre. Les jeux de tests internes DSBench-FullStack et DSBench-Hard révèlent une force accrue du modèle dans les scénarios full-stack.

Comment l'utiliser dès aujourd'hui

Deux options de déploiement sont disponibles. Côté API, le modèle est accessible à presque tous : la grille tarifaire de DeepSeek indique 0,14 $ pour 1 million de tokens en entrée en cas de cache manquant, 0,0028 $ en cas de cache présent, et 0,28 $ pour 1 million de tokens en sortie, avec un plafond de 2 500 requêtes simultanées. Cela représente environ un tiers du prix de sortie de V4-Pro, rendant les boucles d'agents accessibles aux startups en phase de semence et aux développeurs indépendants. L'auto-hébergement reste plus exigeant : les poids, sous licence MIT et sans restriction, nécessitent que chaque expert reste en mémoire, bien que seuls 13 milliards de paramètres soient activés par token. L'exemple de vLLM de DeepSeek permet de servir le modèle sur un seul nœud 4×GB300, tandis que les builds dynamiques GGUF d'Unsloth atteignent 162 Go en 8 bits sans perte et 103 Go en 3 bits, requérant environ 110 Go de RAM et VRAM combinées.

Une architecture inchangée en profondeur

Le rapport technique confirme que V4-Flash reste un MoE de 284 milliards de paramètres avec 13 milliards activés par token, un contexte de 1 million de tokens et une attention hybride combinant CSA et HCA. Le routage utilise les trois premières couches MoE avec hash routing, puis bascule vers 256 experts routés par couche, dont six activés par token. Les claims d'efficacité du rapport — 27 % des FLOPs par token et 10 % du cache KV par rapport à DeepSeek-V3.2 à 1 million de tokens — concernent V4-Pro, et non la variante Flash.

Pourquoi cette sortie est importante

Cette version baisse les barrières pour l'inférence agentique et code de haute qualité, sans imposer de nouveau matériel ni de refonte des stacks. Pour les startups et équipes indépendantes, la tarification API rend réaliste l'exécution de boucles d'agents multi-étapes à grande échelle. Les entreprises ayant besoin de contrôle total peuvent s'auto-héberger, mais au prix d'un budget mémoire et calcul conséquent. Le paysage plus large est celui d'un écosystème open source en maturation, où les gains de performance proviennent de réglages d'entraînement plutôt que de refontes architecturales, ouvrant la voie à une experimentation plus large.


Source : MarkTechPost. Synthèse éditoriale assistée par IA — TechnoExpress.

Lire la source originale sur MarkTechPost →

← Retour à l'accueil