发布日期:2026年8月14日
数据来源:智谱AI公开信息整理
关键词:GLM-5.3、智谱AI、开源大模型、AI Agent、代码智能体

2026年8月14日,智谱AI正式推出GLM-5系列最新版本——GLM-5.3。

与此前大模型升级通常依赖参数规模增长不同,GLM-5.3采用了一条更加明确的技术路线:保持基础模型架构不变,通过扩大后训练规模提升模型实际任务能力。

根据官方披露,GLM-5.3仍采用约7430亿参数MoE架构,模型能力提升主要来自训练环境扩展、任务复杂度增加以及强化训练周期延长。

在编程Agent相关测试中,GLM-5.3相比GLM-5.2取得明显进步。其中在Z.ai Code Bench高难度任务测试中,模型完成率达到31.4%,超过Claude Opus 4.8的29.5%,同时消耗Token数量明显降低。

此外,GLM-5.3还首次公布网络安全方向评测数据,在CyberGym测试中取得84.5%的成绩,并披露了模型辅助发现真实开源项目漏洞的实践结果。


一、GLM-5.3升级重点:模型结构不变,强化后训练能力

从技术路线来看,GLM-5.3并没有重新设计基础模型规模,而是继续优化后训练阶段。

智谱AI表示:

“基座模型保持稳定,通过后训练Scaling提升模型智能上限。”

简单理解,就是模型基础能力框架没有变化,但通过增加更多真实任务训练,让模型积累更强的问题解决能力。

此次优化主要集中在三个方向:

1. 长周期任务训练规模扩大

过去的大模型训练更多关注单轮问答或短流程任务。

而AI Agent应用需要模型持续完成:

  • 项目分析;
  • 多文件修改;
  • 长流程代码调试;
  • 系统设计任务。

GLM-5.3增加了更加复杂、更接近真实开发环境的任务训练,使模型在连续任务执行方面获得提升。


2. 训练环境更加丰富

GLM-5.3训练任务覆盖范围进一步扩大。

除了传统代码生成外,还加入:

  • 软件工程任务;
  • 安全分析;
  • 系统级问题处理;
  • 复杂工程场景。

这意味着模型目标从“生成代码”逐渐转向“完成开发任务”。


3. 后训练时间增加

大模型能力提升并不完全依赖参数增加。

近年来,行业逐渐关注后训练阶段的重要性。

通过更多高质量任务反馈,让模型学习如何:

  • 分析问题;
  • 制定计划;
  • 验证结果;
  • 修正错误。

GLM-5.3的升级路线正体现了这一趋势。


二、编程能力测试:高难度任务超过Claude Opus 4.8

对于开发者而言,模型是否适合实际使用,代码能力是重要指标。

GLM-5.3主要参考Z.ai Code Bench测试。

测试结果如下:

模型 高难度任务完成率 Token消耗
GLM-5.3 31.4% 约5万Token
Claude Opus 4.8 29.5% 约12万Token

在高难度任务中,GLM-5.3完成率略高于Claude Opus 4.8,同时减少了大量Token消耗。

对于开发者而言,这意味着:

相同复杂度任务下,模型可能通过更少上下文调用完成目标。

这对于API调用成本、响应速度以及Agent运行效率都有实际影响。


三、第三方测试表现:Agent能力明显提升

除了官方测试外,GLM-5.3在多个公开评测中也取得提升。

部分测试结果:

测试项目 GLM-5.2 GLM-5.3 提升
DeepSWE v1.1 46.2 66.9 +20.7
Terminal-Bench 3.0 4.6 28.3 +23.7
Agents’ Last Exam 23.8 28.5 +4.7

其中:

  • DeepSWE v1.1主要关注软件工程任务;
  • Terminal-Bench测试模型使用终端工具完成任务能力。

GLM-5.3在Terminal-Bench 3.0中达到28.3分,目前在公开开源模型中处于领先位置。

相比简单代码补全,Agent时代更加关注模型是否能够独立完成完整任务流程。


四、网络安全能力增强:CyberGym测试排名靠前

除了编程能力,GLM-5.3此次重点展示了安全领域表现。

官方公布数据显示:

模型 CyberGym成绩
GLM-5.3 84.5%
Mythos 5 83.8%
GPT-5.6 Sol 83.6%

在CyberGym测试中,GLM-5.3取得较高成绩。

同时,智谱AI披露:

模型联合安全团队,在269个真实开源项目中发现2436个漏洞,其中包含1097个中高危漏洞。

这说明大模型应用方向正在从内容生成逐渐扩展到:

  • 软件安全检测;
  • 自动化测试;
  • 工程维护。

五、Token效率成为模型竞争的新指标

过去比较大模型能力,通常关注:

  • 参数数量;
  • benchmark分数;
  • 上下文长度。

但随着企业大量使用API,Token效率也成为重要因素。

例如:

同一个代码任务:

GLM-5.3:

约5万Token完成。

Claude Opus 4.8:

约12万Token完成。

如果应用场景涉及大量Agent调用,Token消耗差异会直接影响整体使用成本。

因此,模型选择已经不只是比较单次能力,也需要考虑长期运行效率。


六、GLM-5.3开源计划与API接入

根据智谱AI公布信息:

  • GLM-5.3 API将陆续开放;
  • 模型权重计划在发布后两周内开源;
  • 开源协议预计延续宽松模式。

开源路线对于企业和开发者来说具有一定吸引力。

相比只能通过API调用的模型,开源模型可以提供:

  • 私有化部署可能;
  • 自定义微调空间;
  • 更灵活的数据管理方式。

不过,企业实际使用时,也需要考虑:

  • 部署成本;
  • 算力要求;
  • 运维能力。

七、GLM-5.3与DeepSeek V4 Pro如何选择?

近期国产大模型市场竞争进一步加剧。

DeepSeek V4 Pro与GLM-5.3几乎同期更新,两者定位存在一定差异。

简单来看:

GLM-5.3:

  • 更强调开源生态;
  • 编程Agent能力提升明显;
  • 适合关注模型可控性的团队。

DeepSeek V4 Pro:

  • API生态成熟;
  • 推理能力受到开发者关注;
  • 适合快速接入应用。

实际选择需要结合业务需求:

如果需要模型私有部署,可以关注开源路线。

如果更关注快速调用和应用开发,则API方式可能更加方便。


八、通过API聚合平台接入GLM-5.3也是一种方案

对于很多开发团队来说,并不是所有场景都需要自行维护多个模型接口。

目前市场上也存在API聚合类型服务,例如4SAPI这类模型接口管理平台,可以帮助开发者通过统一入口调用不同大模型。

这类方式主要解决:

  • 多模型接口维护复杂;
  • 不同平台账号管理困难;
  • 项目切换模型成本较高。

尤其是在DeepSeek近期价格调整、模型调用成本受到关注的情况下,一些开发者会考虑通过统一API入口寻找更灵活的调用方式。

通过API聚合平台,可以根据项目需求选择不同模型,在模型能力、调用成本和开发便利性之间进行平衡。


九、开发者使用GLM-5.3需要关注什么?

虽然GLM-5.3在多个测试中表现提升明显,但实际应用仍需要结合业务场景。

建议关注几个方面:

1. 模型稳定性

测试成绩代表能力上限,生产环境还需要关注:

  • 响应速度;
  • 调用稳定性;
  • 长任务连续性。

2. Agent权限管理

如果用于代码开发,需要合理控制:

  • 文件访问范围;
  • 自动执行权限;
  • 项目数据安全。

3. 根据任务选择模型

不同模型存在优势方向。

例如:

  • 普通代码补全;
  • 架构设计;
  • 安全分析;
  • 长流程Agent任务。

选择适合的模型比单纯追求参数规模更重要。


总结

GLM-5.3的发布代表国产大模型竞争进入新的阶段。

此次升级没有依赖更大参数规模,而是通过后训练Scaling提升模型实际任务能力。

从公开数据来看,GLM-5.3在代码Agent、终端任务以及安全测试方向都有明显提升,高难度编程任务表现超过Claude Opus 4.8,同时保持开源路线。

随着GLM-5.3开源计划推进,以及API服务逐步完善,开发者未来可以根据需求选择:

  • 本地部署;
  • 官方API调用;
  • 第三方API聚合接入。

对于希望快速构建AI应用的团队而言,模型能力、调用成本和工程便利性将成为选择大模型时的重要考量因素。

本文信息整理截至2026年8月14日,具体模型接口、价格及开源细节请以智谱AI官方平台后续公告为准。

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐