游乐游手机版
首页/AI热点日报/热点详情

智谱发布GLM-5.3开源模型:编程能力升级较GLM-5.2提升50%

类型:热点整理2026-08-17
8 月 14 日消息,智谱今日正式发布 GLM-5 3。与 GLM-5 2 相比,该模型基座保持不变,但通过后训练 Scaling 显著提升了模型的智能上限,包括数十倍扩展的长程任务环境、更丰富多元的环境类型,以及更长时间的后训练过程。与上一代版本相比,GLM-5 3 的新增能力主要包括:更强的编程

8 月 14 日消息,智谱今日正式发布 GLM-5.3。与 GLM-5.2 相比,该模型基座保持不变,但通过后训练 Scaling 显著提升了模型的智能上限,包括数十倍扩展的长程任务环境、更丰富多元的环境类型,以及更长时间的后训练过程。

智谱正式发布 GLM-5.3:编程能力最强开源模型,较 GLM-5.2 提升 50%

与上一代版本相比,GLM-5.3 的新增能力主要包括:

更强的编程能力。GLM-5.3 被认为是当前编程能力最强的开源模型,在内部自建体感评测中,相较 GLM-5.2 提升 50%;同时在 Terminal Bench 3.0、Agents' Last Exam (CLI) 等公开基准测试中位列开源模型第一。

网络安全能力。在白盒代码审查、漏洞挖掘等安全任务中,GLM-5.3 的整体表现持平 Mythos 5,展现出其在网络安全防御与安全审计场景中的应用潜力。

后训练 Scaling。上述所有性能提升均来自后训练。基于 IndexShare、SAO,以及持续演进的新一代 Slime 框架,智谱在与 GLM-5.2 完全相同的基座模型上高效推进强化学习,这也意味着该基座的智能上界或仍有较大挖掘空间。

开源。智谱将在发布两周后开放模型权重,在此之前将完成安全评估与模型加固工作。

智谱表示,在多项主流基准测试中,GLM-5.3 已成为当前排名最高的开源模型,其编程能力与智能体能力接近 Claude Fable 5,实际编程体感也超过其他国产大模型。

在用于衡量模型在真实终端环境中完成复杂任务能力的 Terminal-Bench 3.0 测试中,GLM-5.3 得分从 4.6 提升至 28.3;

在聚焦长程软件工程任务和持续代码修改能力的 DeepSWE v1.1 基准中,得分从 46.2 提升至 66.9;

在覆盖多类真实专业场景、强调跨工具协作与长程任务执行能力的 Agents' Last Exam 测试中,得分从 23.8 提升至 28.5;

在覆盖 44 种职业、重点考察真实高价值知识工作的 GDPval-AA v2 中,GLM-5.3 得分达到 1,769,体现出基于编程能力涌现出的专业任务执行水平。

智谱自研的 Z.ai Code Bench 主要用于评估模型在真实编程场景中的综合使用体感。测试中,模型会被置于复杂的本地开发环境,并在不同思考档位下执行端到端任务,因此更贴近开发者实际使用 Coding Agent 的真实体验。

从测试结果来看,GLM-5.3 在模型效果与 Token 消耗之间展现出更优的平衡表现。以 High 档位为例,GLM-5.3 的准确率达到 31.4%,高于 Claude Opus 4.8 最高档位的 29.5%;与此同时,其单项任务平均输出约为 5 万 tokens,而 Opus 4.8 约为 12 万 tokens,表明 GLM-5.3 能以更精简、更高效的执行路径完成复杂任务。

即日起,智谱最新编程工具 ZCode、效率工具 AutoClaw 正式上线,并同步向 GLM Coding Plan 全量用户开放订阅服务。

TraeWork / TraeCode / 扣子、WorkBuddy / CodeBuddy、Qoder / QwenWork、CatPaw、JoyCode、OpenCode 等编码平台也已开放抢先体验。

API 即将上线,完整模型权重将在两周内开源。在此之前,官方将完成必要的安全加固,尽可能限制其潜在攻击能力,同时保留其在安全防御场景中的使用价值。

根据智谱公告,今天 13:00,GLM Coding Plan 全员额度已完成重置,所有用户均可在后台「用量统计」中查看恢复后的可用额度。

来源:https://www.ithome.com/0/989/689.htm

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。