GLM-5.3 double son score SWE-Marathon et prend la tête de CyberGym
Tang Jie, le scientifique en chef de Zhipu AI, a répondu à une question sur GLM-5.3 sur X par un mot étiré en forme de promesse : « sooooooon ». Quelques heures plus tard, GLM-5.3 était officiellement lancé. Sa cible est claire : pas toutes les tâches, mais le codage, la cybersécurité et les agents capables d’utiliser un ordinateur, poussés aussi loin que Zhipu peut les mener.
La plus forte progression concerne l’ingénierie logicielle. GLM-5.3 a fait passer SWE-Marathon de 19,4 à 42,5, tandis que FrontierSWE progressait de 67,5 à 78,1. Sur Terminal Bench 3.0, qui simule un travail en plusieurs étapes dans un terminal Linux, le score est passé de 4,6 à 28,3. Zhipu affirme que les modèles de base comptent le même nombre de paramètres, faisant du post-entraînement la source annoncée de cette amélioration.
La cybersécurité est le domaine où cette sortie devient la plus concrète. CyberGym évalue la capacité d’un modèle à trouver des vulnérabilités, à construire des attaques et à en vérifier les effets — pas seulement à produire du code qui semble sécurisé. GLM-5.3 a obtenu 84,5, se classant premier parmi les modèles évalués. Le registre de sécurité de Z.ai recense 2 436 découvertes dans 269 projets open source, dont 1 097 vulnérabilités de gravité Critique ou Élevée. La plus ancienne remontait à 1981 et les vulnérabilités étaient restées dans le code pendant 26,6 ans en moyenne, selon les travaux de divulgation de l’entreprise.
Le modèle permet également aux utilisateurs de choisir la quantité de raisonnement à mobiliser, grâce à quatre réglages Effort Level allant de Non-Thinking à Max. Les courbes officielles montrent une précision passant d’environ 24,5 % en Low à 34,5 % en Max, contre une progression d’environ 20 % à 23,5 % pour GLM-5.2. Sur les benchmarks d’agents, GLM-5.3 a atteint 73,0 sur Toolathlon Verified et 48,2 sur AutomationBench, ainsi que des résultats de premier plan sur plusieurs autres tests.
Concrètement, GLM-5.3 vise le débogage, les opérations dans un terminal et la découverte de vulnérabilités, avec un réglage permettant d’arbitrer entre vitesse et profondeur du raisonnement. Ses limites sont également visibles : les chiffres de sécurité proviennent du propre registre de Z.ai, et aucune reproduction indépendante n’est citée ici. GLM-5.3 pourrait aussi constituer une version de transition ; Zhipu affirme que le prochain modèle majeur reposera sur une nouvelle architecture dotée de deux fois plus de paramètres et visera Fable 5 sur tous les plans.
Sources — lire les originaux(heure de Paris)
À lire ensuite
- GLM-5.3 est disponible : Zhipu renforce le codage et les capacités d’agent avec 700 milliards de paramètres
- GLM-5.3-Flash tourne sur plus de 100 000 puces chinoises
- Kanana2 de Kakao devance les modèles d’IA légers de Google et Alibaba dans l’évaluation de la sécurité
- Le système Nvidia porte Claude Opus 5 à 100 % sur ARC-AGI-3
Commentaires
Chargement du fil…
Connectez-vous pour écrire un commentaire. Se connecter