Jeudi 27 août 2026

Aube.

Les nouvelles du progrès
LaboCorroboré · 2 sources

GLM-5.3 double son score SWE-Marathon et prend la tête de CyberGym

Langues de cet articleComparer à l’original

Traduit par IA, langue d’origine : anglais — voir le texte original. 2 langues disponibles, la vôtre s’ajoute en un clic.

Tang Jie, le scientifique en chef de Zhipu AI, a répondu à une question sur GLM-5.3 sur X par un mot étiré en forme de promesse : « sooooooon ». Quelques heures plus tard, GLM-5.3 était officiellement lancé. Sa cible est claire : pas toutes les tâches, mais le codage, la cybersécurité et les agents capables d’utiliser un ordinateur, poussés aussi loin que Zhipu peut les mener.

La plus forte progression concerne l’ingénierie logicielle. GLM-5.3 a fait passer SWE-Marathon de 19,4 à 42,5, tandis que FrontierSWE progressait de 67,5 à 78,1. Sur Terminal Bench 3.0, qui simule un travail en plusieurs étapes dans un terminal Linux, le score est passé de 4,6 à 28,3. Zhipu affirme que les modèles de base comptent le même nombre de paramètres, faisant du post-entraînement la source annoncée de cette amélioration.

La cybersécurité est le domaine où cette sortie devient la plus concrète. CyberGym évalue la capacité d’un modèle à trouver des vulnérabilités, à construire des attaques et à en vérifier les effets — pas seulement à produire du code qui semble sécurisé. GLM-5.3 a obtenu 84,5, se classant premier parmi les modèles évalués. Le registre de sécurité de Z.ai recense 2 436 découvertes dans 269 projets open source, dont 1 097 vulnérabilités de gravité Critique ou Élevée. La plus ancienne remontait à 1981 et les vulnérabilités étaient restées dans le code pendant 26,6 ans en moyenne, selon les travaux de divulgation de l’entreprise.

Le modèle permet également aux utilisateurs de choisir la quantité de raisonnement à mobiliser, grâce à quatre réglages Effort Level allant de Non-Thinking à Max. Les courbes officielles montrent une précision passant d’environ 24,5 % en Low à 34,5 % en Max, contre une progression d’environ 20 % à 23,5 % pour GLM-5.2. Sur les benchmarks d’agents, GLM-5.3 a atteint 73,0 sur Toolathlon Verified et 48,2 sur AutomationBench, ainsi que des résultats de premier plan sur plusieurs autres tests.

Concrètement, GLM-5.3 vise le débogage, les opérations dans un terminal et la découverte de vulnérabilités, avec un réglage permettant d’arbitrer entre vitesse et profondeur du raisonnement. Ses limites sont également visibles : les chiffres de sécurité proviennent du propre registre de Z.ai, et aucune reproduction indépendante n’est citée ici. GLM-5.3 pourrait aussi constituer une version de transition ; Zhipu affirme que le prochain modèle majeur reposera sur une nouvelle architecture dotée de deux fois plus de paramètres et visera Fable 5 sur tous les plans.

84,5Score de GLM-5.3 sur CyberGym, le plus élevé parmi les modèles évalués

Sources — lire les originaux(heure de Paris)

TechNodeEN
PandailyEN
0000

À lire ensuite

Commentaires

Chargement du fil…

Connectez-vous pour écrire un commentaire. Se connecter