Thursday, 27 August 2026

Aube.

News of progress
DeployedSingle source

GLM-5.3上线:智谱用7000亿参数强化编程与智能体能力

Languages for this article
Original · 中文ENFR

Originally written in Chinese. 3 languages available; yours is one click away.

电脑屏幕上,一个人体血液循环3D网页被搭了出来:能切换视图图层,也能调整心率、压力,甚至模拟失血性休克。但人体看起来更像火柴人,器官堆在一起,离精细医学仿真还有距离。这正是GLM-5.3上线后的第一个信号:它已经能把想法快速变成可交互的网页,却还没有把每个细节都打磨到专业工具的程度。

智谱这次没有把参数规模继续推高。GLM-5.3仍处于7000亿参数级别,升级主要来自后训练 Scaling,也就是在已有基座上持续进行强化学习和能力训练。官方技术博客称,模型使用743B基模,在与GLM-5.2相同的基座上推进强化学习;配套开源的Slime框架,则覆盖发布级模型后训练所需的完整工作流,并支持GLM、Qwen、DeepSeek部分模型和Llama 3。

能力提升首先出现在编程和智能体任务中。六项benchmark里,GLM-5.3在GDPVal评估中拿到第一名,AutomationBench和Agents’ Last Exam的成绩也处于前列。后者分别关注跨应用工作流编排和智能体能力。网络安全则是另一块高地:在ExploitGym中,模型面对898道题、限时6小时,完成了130道,表现与Claude Mythos 5持平。智谱还公开了网络安全披露账本,记录模型发现的漏洞,其中最早的漏洞可追溯到大约40年前。

实测中的差距同样清楚。GLM-5.3生成的金字塔滑板游戏体验不错,水母湖的3D场景也能呈现出较复杂的视觉效果;但人体循环仿真较粗糙,复杂项目往往需要更长的反复测试。在Zcode里,模型可以调用工具、读取网页截图、检查问题并继续修改,一个行星撞地球的网页运行超过一个小时后,才完成地壳开裂、熔岩喷出和碎片形成行星环等效果。使用Claude Code时,自动审批命令还可能出现无法判断Bash安全性的提示,原因被认为与第三方模型尚未适配该应用机制有关。

测试显示,GLM-5.3可以在网页应用和自动化流程中调用工具并持续修改:它已进入智谱的Zcode和AutoClaw,并向GLM Coding Plan用户开放,WorkBuddy、QwenWork、TraeWork等第三方平台也提供抢先体验。API预计下周二开放,完整权重将在两周内开源。它并非每个3D页面都能一次成功,但在编程、工具调用和安全任务测试中展现了相应能力;代价是模型更新太快,今天的首选可能很快就要重新比较。

130道GLM-5.3在ExploitGym网络安全测试中完成的题目数

Sources — read the originals(Paris time)

爱范儿ZH
0000

Read next

Comments

Loading the thread…

Sign in to leave a comment. Sign in