Le Kimi K3 de Moonshot échoue aux tests de cybersécurité malgré ses bons scores en IA

Des instituts de sécurité de l'IA britanniques et américains ont soumis le Kimi K3 de Moonshot AI à des tests de cybersécurité rigoureux – et les résultats sont préoccupants. Lors d'épreuves portant sur des tâches offensives de cybersécurité, le K3 n'a atteint que 32 % de précision sur ExploitBench, un benchmark conçu pour évaluer la capacité des modèles d'IA à générer des exploits ou simuler des attaques. À titre de comparaison, les principaux modèles frontaliers américains ont obtenu 76 %, soit plus du double du score du K3. Pire encore, les protections intégrées du K3 n'ont pas empêché le modèle de développer ou d'affiner du code d'exploit, un signal d'alarme pour tout système destiné à un déploiement sécurisé.
Un écart croissant entre performances générales et robustesse réelle
L'écart entre les fortes performances générales du K3 et ses faibles résultats en cybersécurité reflète des inquiétudes plus larges sur la formation et l'évaluation des grands modèles de langage actuels. Bien que le K3 obtienne d'excellents scores sur les benchmarks IA classiques, ses difficultés dans des scénarios adversariaux à haut risque suggèrent que ces tests ne capturent pas les risques pertinents en conditions réelles. Les chercheurs évoquent une explication possible : la distillation de modèles, où un modèle plus petit et moins performant imite le comportement d'un modèle plus grand et sophistiqué. Si le K3 a été distillé à partir des systèmes d'Anthropic, ce processus pourrait avoir dilué sa capacité à gérer des tâches complexes et critiques pour la sécurité, comme la génération ou la défense contre des exploits.
Pourquoi les protections seules ne suffisent pas
Les résultats soulignent une limite majeure des mesures actuelles de sécurité IA : des protections robustes intégrées à un modèle ne garantissent pas une sécurité réelle en conditions opérationnelles. Même avec les filtres du K3 activés, ceux-ci n'ont pas systématiquement bloqué la création de code d'exploit. Cela soulève des questions pour les organisations envisageant d'utiliser le K3 dans des applications sensibles, qu'il s'agisse de réponse aux incidents ou de révision de code. Cela met aussi en lumière la nécessité de cadres d'évaluation spécialisés, dépassant les benchmarks généraux pour tester directement la robustesse face à des attaques ciblées.
Pourquoi c'est important
Les enjeux dépassent la simple performance d'un modèle. Si les systèmes frontaliers d'IA sont distillés en versions plus légères et économiques – et que ces alternatives sous-performent dans des tâches critiques pour la sécurité –, cela pourrait ébranler la confiance dans le rôle de l'IA en cybersécurité et en développement logiciel. Pour les secteurs qui s'appuient sur l'IA pour détecter ou atténuer des menaces, cet écart exige une transparence accrue sur les méthodes de formation et une orientation vers des tests spécifiques à la sécurité. Sans cela, des scores généraux impressionnants pourraient masquer des vulnérabilités que des adversaires n'hésiteront pas – et sauront – exploiter.
Source : The Decoder. Synthèse éditoriale assistée par IA — TechnoExpress.

