智谱宣布正式发布 GLM-5.3。且 GLM Coding Plan 全员额度在今天 13:00 重置,所有用户后台「用量统计」可见使用额度回满。
与 GLM-5.2 相比,GLM-5.3 基座模型没变,但通过极致的后训练 Scaling 大大提高了模型的智能上界:数十倍的长程任务环境、更丰富多样的环境类型、超长的后训练时间。
公告称,充分的模型后训练涌现出超出预期的模型能力。相比前代,GLM-5.3 的新能力包括:
- 更强的编程能力。GLM-5.3是编程能力最强的开源模型,在内部自建体感评测中较GLM-5.2提升50%,在包括Terminal Bench 3.0、Agents' Last Exam (CLI)在内的公开基准测试中取得开源第一。
- 网络安全能力。在白盒代码审查与漏洞发现等安全任务中,GLM-5.3的表现持平Mythos 5,展现出面向网络安全防御场景的强大潜力。
- 后训练Scaling。上述全部提升都来自后训练。基于IndexShare、SAO、以及持续演进的新一代Slime框架,在与GLM-5.2完全相同基座上高效推进强化学习,“可能我们还远未开发出这个基座的智能上界”。
- 开源。团队计划将在发布两周后开放模型权重,此前完成安全评估与模型加固。
在多项主流基准测试中GLM-5.3是当前排名最高的开源模型,编程与智能体能力接近Claude Fable 5,编程体感超过其他国产模型。
在衡量模型于真实终端环境中完成复杂任务的Terminal-Bench 3.0上,GLM-5.3得分从4.6提升至28.3;在聚焦长程软件工程与持续代码修改能力的DeepSWE v1.1上,得分从46.2提升至66.9;在覆盖多类真实专业场景、强调跨工具协作与长程任务的Agents' Last Exam上,得分从23.8提升至28.5。在覆盖44种职业、考察真实高价值知识工作的GDPval-AA v2中得分1769,展现基于编程能力涌现的专业任务执行能力。


此外,模型在网络安全领域的表现也超出预期。
在CyberGym测试中,模型从白盒源代码出发,通过触发程序故障来识别和验证漏洞。GLM-5.3得分为84.5%,高于GLM-5.2的77.2%,也略高于Mythos 5的83.8%和GPT-5.6 Sol的83.6%。
在更考验深度推理能力的ExploitBench中,模型需要进一步理解真实漏洞的成因,并完成相应的利用。GLM-5.3得分为54.4%,是GLM-5.2(24.4%)的两倍多,但仍低于Mythos 5的78.0%和GPT-5.6 Sol的76.5%。
ExploitGym考察模型在限定时间内能够完成多少漏洞利用任务,按吞吐量对预算进行归一化后,GLM-5.3在两小时内完成105项任务,六小时内完成130项,相对于GLM-5.2分别完成29项和39项提升巨大。Mythos 5仍然领先,两个时间段分别完成181项和247项。

三个基准呈现出相同的趋势:越接近漏洞利用链的前端,GLM-5.3相较GLM-5.2的提升越明显;越深入完整利用,模型与Mythos 5等闭源前沿模型之间的差距也越大。换句话说,GLM-5.3进步最快的方向,正是当前仍需要重点追赶的方向。
智谱方面表示,其针对 GLM-5.3 构建了迄今为止最稳健的风险审查系统。
“人工智能发展不应该是某个国家的独奏,而应当是全球合作的交响。随着 GLM-5.3 的发布及开源,安全防御能力将不再是少数机构的特权,而是全球开发者都能平等获得和共同完善的公共能力。”