8月14日消息,智谱今日正式发布新一代开源大模型 GLM-5.3。与 GLM-5.2 相比,其基座模型保持不变,但通过后训练 Scaling 显著提升了模型的智能上限,带来了数十倍更长的任务环境、更丰富多元的环境类型,以及更长时间的后训练过程。
相比上一代版本,GLM-5.3 的新增能力主要包括:
更强的编程能力。GLM-5.3 被认为是当前编程能力最强的开源模型,在智谱内部自建体感评测中,相较 GLM-5.2 提升 50%;在包括 Terminal Bench 3.0、Agents' Last Exam (CLI) 在内的公开基准测试中,也取得了开源模型第一的成绩。
网络安全能力。在白盒代码审查、漏洞识别与发现等安全任务中,GLM-5.3 的整体表现持平 Mythos 5,展现出其在网络安全防御、代码审计等应用场景中的突出潜力。
后训练 Scaling。上述性能提升均来自后训练阶段。基于 IndexShare、SAO 以及持续演进的新一代 Slime 框架,智谱在与 GLM-5.2 完全相同的基座模型上高效推进强化学习,这也意味着智谱或许仍未完全释放这一基座模型的智能上界。
开源。智谱将在模型发布两周后开放模型权重,在此之前将完成安全评估与模型加固工作。
智谱表示,在多项主流基准测试中,GLM-5.3 已成为当前综合排名最高的开源模型,其编程能力与智能体能力接近 Claude Fable 5,在编程实际体验方面也超过其他国产模型。
在衡量大模型于真实终端环境中完成复杂任务能力的 Terminal-Bench 3.0 测试中,GLM-5.3 得分由 4.6 提升至 28.3;
在聚焦长程软件工程任务与持续代码修改能力的 DeepSWE v1.1 基准中,得分由 46.2 提升至 66.9;
在覆盖多类真实专业场景、强调跨工具协作与长程任务处理能力的 Agents' Last Exam 上,得分由 23.8 提升至 28.5;
在覆盖 44 种职业、重点考察真实高价值知识工作的 GDPval-AA v2 中,GLM-5.3 得分达到 1,769,展现出基于编程能力涌现而形成的专业任务执行水平。
智谱自研的 Z.ai Code Bench 主要用于评估模型在真实编程场景中的综合体感表现。测试中,模型会被置于复杂的本地开发环境,并在不同思考档位下完成端到端任务,因此更贴近开发者实际使用 Coding Agent 时的真实体验。

从测试结果来看,GLM-5.3 在效果表现与 Token 使用效率之间实现了更优平衡。以 High 档位为例,其准确率达到 31.4%,高于 Claude Opus 4.8 最高档位的 29.5%;与此同时,GLM-5.3 每项任务平均仅输出约 5 万 tokens,而 Opus 4.8 约需 12 万 tokens。换句话说,GLM-5.3 能以更短的执行路径完成复杂任务,体现出更高的推理与执行效率。

即日起,智谱最新编程工具 ZCode、效率工具 AutoClaw 正式上线,同时面向 GLM Coding Plan 全量用户开放,并支持订阅使用。
TraeWork / TraeCode / 扣子、WorkBuddy / CodeBuddy、Qoder / QwenWork、CatPaw、JoyCode、OpenCode 等多个编码平台也已开放抢先体验。
API 将很快上线,完整模型权重将在两周内开源。在此之前,智谱仍需完成必要的安全加固工作,尽可能限制模型潜在攻击能力,同时保留其在网络安全防御方面的应用价值。
根据智谱公告,今天 13:00,GLM Coding Plan 全员额度已完成重置,所有用户可在后台「用量统计」中查看使用额度恢复至满额状态。
