Jeudi 27 août 2026

Aube.

Les nouvelles du progrès
DéployéSource unique

GLM-5.3 est disponible : Zhipu renforce le codage et les capacités d’agent avec 700 milliards de paramètres

Langues de cet articleComparer à l’original

Traduit par IA, langue d’origine : chinois — voir le texte original. 3 langues disponibles, la vôtre s’ajoute en un clic.

Sur l’écran d’un ordinateur, une page web 3D simulant la circulation sanguine humaine a été créée : il est possible de changer de vue et de couche, d’ajuster la fréquence cardiaque et la pression, voire de simuler un choc hémorragique. Mais le corps ressemble davantage à un bonhomme bâton, les organes sont empilés les uns sur les autres et l’ensemble reste loin d’une simulation médicale détaillée. C’est le premier enseignement du lancement de GLM-5.3 : le modèle sait déjà transformer rapidement une idée en page web interactive, mais il ne peaufine pas encore chaque détail au niveau d’un outil professionnel.

Zhipu n’a pas continué à augmenter la taille du modèle. GLM-5.3 reste dans la catégorie des 700 milliards de paramètres et ses progrès proviennent principalement du scaling du post-entraînement, c’est-à-dire de la poursuite de l’apprentissage par renforcement et de l’entraînement aux capacités sur une base existante. Selon le blog technique officiel, le modèle utilise une base de 743B et applique l’apprentissage par renforcement sur la même base que GLM-5.2. Le framework open source Slime qui l’accompagne couvre l’ensemble du workflow nécessaire au post-entraînement de modèles destinés à la mise en production et prend en charge GLM, certains modèles Qwen et DeepSeek, ainsi que Llama 3.

Les progrès apparaissent d’abord dans les tâches de codage et d’agent. Sur six benchmarks, GLM-5.3 arrive premier dans l’évaluation GDPVal, tandis que ses résultats sur AutomationBench et Agents’ Last Exam figurent également parmi les meilleurs. Ces deux derniers benchmarks portent respectivement sur l’orchestration de workflows interapplications et les capacités d’agent. La cybersécurité constitue un autre point fort : dans ExploitGym, le modèle a été confronté à 898 problèmes dans une limite de 6 heures et en a résolu 130, égalant les performances de Claude Mythos 5. Zhipu a également publié un registre des failles de cybersécurité recensées, qui répertorie les vulnérabilités découvertes par le modèle ; la plus ancienne remonte à environ 40 ans.

Les écarts observés lors des essais sont tout aussi nets. Le jeu de skateboard en forme de pyramide généré par GLM-5.3 offre une expérience convaincante, tandis que la scène 3D du lac aux méduses présente des effets visuels assez complexes. En revanche, la simulation de la circulation sanguine est rudimentaire et les projets complexes nécessitent souvent davantage de cycles de test. Dans Zcode, le modèle peut appeler des outils, lire des captures d’écran de pages web, vérifier les problèmes et poursuivre les modifications. Une page simulant la collision d’une planète avec la Terre a ainsi fonctionné pendant plus d’une heure avant de produire les effets de fissuration de la croûte, d’éruption de lave et de formation d’un anneau planétaire constitué de débris. Avec Claude Code, l’approbation automatique des commandes peut également afficher un message indiquant qu’il est impossible de déterminer si une commande Bash est sûre, un problème attribué à l’incompatibilité des modèles tiers avec le mécanisme de l’application.

Les tests montrent que GLM-5.3 peut appeler des outils et effectuer des modifications successives dans des applications web et des workflows automatisés : il est désormais intégré à Zcode et AutoClaw de Zhipu et accessible aux utilisateurs de GLM Coding Plan. Des plateformes tierces comme WorkBuddy, QwenWork et TraeWork proposent également un accès anticipé. L’API devrait ouvrir mardi prochain et les poids complets seront publiés en open source dans les deux semaines. Le modèle ne réussit pas nécessairement chaque page 3D du premier coup, mais il démontre des capacités correspondantes dans les tests de codage, d’appel d’outils et de sécurité. En contrepartie, les modèles évoluent si rapidement que le favori du jour pourrait bientôt devoir être comparé à nouveau.

130 problèmesNombre de problèmes résolus par GLM-5.3 lors du test de cybersécurité ExploitGym

Sources — lire les originaux(heure de Paris)

爱范儿ZH
0000

À lire ensuite

Commentaires

Chargement du fil…

Connectez-vous pour écrire un commentaire. Se connecter