Jeudi 27 août 2026

Aube.

Les nouvelles du progrès
Original et traduction

GLM-5.3 double son score SWE-Marathon et prend la tête de CyberGym

Quitter la comparaison

Les deux versions sont alignées bloc par bloc, dans l’ordre du texte : titre, l’essentiel, puis paragraphe par paragraphe. Quand la traduction a fusionné ou scindé un paragraphe, la case correspondante reste vide — on ne rapproche jamais deux passages au jugé.

Original · anglais
GLM-5.3 doubles SWE-Marathon score and tops CyberGym
Traduction · français
GLM-5.3 double son score SWE-Marathon et prend la tête de CyberGym
Original · anglais
- Zhipu released GLM-5.3 hours after its chief scientist teased “sooooooon.”
Traduction · français
- Zhipu a lancé GLM-5.3 quelques heures après que son scientifique en chef a laissé entendre que ce serait « sooooooon »
Original · anglais
- The model doubled its SWE-Marathon score from 19.4 to 42.5.
Traduction · français
- Le modèle a doublé son score SWE-Marathon, passé de 19,4 à 42,5.
Original · anglais
- It ranked first on CyberGym after finding 2,436 security flaws.
Traduction · français
- Il s’est classé premier sur CyberGym après avoir découvert 2 436 failles de sécurité.
Original · anglais

Tang Jie, Zhipu AI’s chief scientist, answered a question about GLM-5.3 on X with one word stretched into a promise: “sooooooon.” A few hours later, GLM-5.3 was officially released. Its target is clear—not every task, but coding, cybersecurity and computer-use agents pushed as far as Zhipu can take them.

Traduction · français

Tang Jie, le scientifique en chef de Zhipu AI, a répondu à une question sur GLM-5.3 sur X par un mot étiré en forme de promesse : « sooooooon ». Quelques heures plus tard, GLM-5.3 était officiellement lancé. Sa cible est claire : pas toutes les tâches, mais le codage, la cybersécurité et les agents capables d’utiliser un ordinateur, poussés aussi loin que Zhipu peut les mener.

Original · anglais

The biggest movement is in software engineering. GLM-5.3 lifted SWE-Marathon from 19.4 to 42.5, while FrontierSWE moved from 67.5 to 78.1. On Terminal Bench 3.0, which simulates multi-step work inside a Linux terminal, the score rose from 4.6 to 28.3. Zhipu says the base models have the same parameter count, making post-training the stated source of the improvement.

Traduction · français

La plus forte progression concerne l’ingénierie logicielle. GLM-5.3 a fait passer SWE-Marathon de 19,4 à 42,5, tandis que FrontierSWE progressait de 67,5 à 78,1. Sur Terminal Bench 3.0, qui simule un travail en plusieurs étapes dans un terminal Linux, le score est passé de 4,6 à 28,3. Zhipu affirme que les modèles de base comptent le même nombre de paramètres, faisant du post-entraînement la source annoncée de cette amélioration.

Original · anglais

Cybersecurity is where the release becomes more concrete. CyberGym tests whether a model can find vulnerabilities, build attacks and check their effects—not merely produce secure-looking code. GLM-5.3 scored 84.5, ranking first among the models evaluated. Z.ai’s security ledger lists 2,436 findings across 269 open-source projects, including 1,097 Critical or High severity findings. The oldest dated to 1981, and the vulnerabilities had remained in code for an average of 26.6 years, according to the company’s disclosure work.

Traduction · français

La cybersécurité est le domaine où cette sortie devient la plus concrète. CyberGym évalue la capacité d’un modèle à trouver des vulnérabilités, à construire des attaques et à en vérifier les effets — pas seulement à produire du code qui semble sécurisé. GLM-5.3 a obtenu 84,5, se classant premier parmi les modèles évalués. Le registre de sécurité de Z.ai recense 2 436 découvertes dans 269 projets open source, dont 1 097 vulnérabilités de gravité Critique ou Élevée. La plus ancienne remontait à 1981 et les vulnérabilités étaient restées dans le code pendant 26,6 ans en moyenne, selon les travaux de divulgation de l’entreprise.

Original · anglais

The model also lets users choose how much reasoning to spend, through four Effort Level settings ranging from Non-Thinking to Max. Official curves show accuracy rising from about 24.5% at Low to 34.5% at Max, whereas GLM-5.2 moved from about 20% to 23.5%. On agent benchmarks, GLM-5.3 reached 73.0 on Toolathlon Verified and 48.2 on AutomationBench, alongside first-tier results on several other tests.

Traduction · français

Le modèle permet également aux utilisateurs de choisir la quantité de raisonnement à mobiliser, grâce à quatre réglages Effort Level allant de Non-Thinking à Max. Les courbes officielles montrent une précision passant d’environ 24,5 % en Low à 34,5 % en Max, contre une progression d’environ 20 % à 23,5 % pour GLM-5.2. Sur les benchmarks d’agents, GLM-5.3 a atteint 73,0 sur Toolathlon Verified et 48,2 sur AutomationBench, ainsi que des résultats de premier plan sur plusieurs autres tests.

Original · anglais

Concretely, GLM-5.3 is aimed at debugging, terminal operations and vulnerability discovery, with a control for trading speed against reasoning depth. The limits are visible too: the security figures come from Z.ai’s own ledger, and no independent reproduction is cited here. GLM-5.3 may also be a bridge release; Zhipu says the next major model will use a new architecture with doubled parameters and target Fable 5 across the board.

Traduction · français

Concrètement, GLM-5.3 vise le débogage, les opérations dans un terminal et la découverte de vulnérabilités, avec un réglage permettant d’arbitrer entre vitesse et profondeur du raisonnement. Ses limites sont également visibles : les chiffres de sécurité proviennent du propre registre de Z.ai, et aucune reproduction indépendante n’est citée ici. GLM-5.3 pourrait aussi constituer une version de transition ; Zhipu affirme que le prochain modèle majeur reposera sur une nouvelle architecture dotée de deux fois plus de paramètres et visera Fable 5 sur tous les plans.

Revenir à l’article