智谱放大招:GLM-5.3 编程逼近 Claude,还揪出 2436 个老漏洞
一个不换基座、只靠"加练"就暴涨 50% 编程能力的国产模型,还专门练出了一套找漏洞的本事——它找到的最老的 bug,在代码里潜伏了 40 多年。

先把时间线摆出来:8 月 13 日晚刚经历完 DeepSeek 的狂欢,第二天一早智谱不声不响放出了 GLM-5.3。
更反常识的是它的训练方式——没有换更大的"大脑"(基座模型和 GLM-5.2 完全一样),所有提升都来自"加练"(后训练)。
结果呢?按智谱官方口径,编程能力较 GLM-5.2 提升约 50%,在 Terminal Bench 3.0、Agents’ Last Exam 等公开基准上拿下开源第一,整体逼近 Claude 顶级编程模型 Fable 5。
但真正让圈内人坐直的,是另一个数字:智谱把模型放到真实开源项目里扫代码,累积扫出了 2436 个漏洞,其中 1097 个是中高危,最老的一个是 1981 年写进代码的——比你我的年龄可能都大。
大家以为的 vs 实际发生的
大家以为的剧本:国产模型发布 = 又一个跑分新闻,堆参数、刷榜单、发通稿。
实际发生的剧本分两步。
第一步,“不换大脑,只加练”。 基座模型不动,智谱在过去一个月做的是:更多任务环境、更多样的任务、更多算力砸在后训练上。用他们自己的话说,“Scaling post-training is all we did for GLM-5.3”——GLM-5.3 做的全部事情,就是扩展后训练。
这轮"加练"练的是什么?不是教科书式练习题,而是**“一个有经验的工程师要干好几天的活”**。比如一个 ML 基础设施任务:给模型和真工程师一模一样的工作环境——算力集群、存储系统、内部文档、代码库、实验结果,让它诊断训练栈的瓶颈、做优化、跑实验、交付一个可量化的端到端提速,还要保证正确性。
第二步,安全能力涨得比预期快得多。 智谱在后训练里专门加入了漏洞发现的数据和环境,原本只是想让模型更会找漏洞、更会推理漏洞。
结果超出预期:在安全评测 CyberGym 上,GLM-5.3 拿到 84.5,超过 Mythos 5(83.8)和 GPT-5.6 Sol(83.6),排到第一。模型不只会找孤立的单点缺陷,开始跨多个攻击阶段推理,能形成完整攻击链的连贯计划。

2436 个漏洞:不是跑分,是真实战绩
从 GLM-5.2 时代起,智谱就和国内多家安全团队合作,把模型放到真实开源代码库上跑。专家审核、筛查、去重之后,累积结果如下:
- 找到 2436 个漏洞,覆盖 269 个开源项目;
- 其中 1097 个是中高危(Critical 107 个 + High 990 个);
- 范围横跨系统内核、操作系统、浏览器引擎、开源基础设施、Web 应用、网络协议;
- 平均每个漏洞在代码里潜伏了 26.6 年,最老的一个 1981 年就写进去了。
- 这批漏洞大多埋在内核、浏览器引擎这类维护了几十年的老牌基础设施里——它们不是没人查,是查了几十年没查出来。
这些发现不是发完新闻就完事。智谱建了一个公开的"安全披露台账"(Z.ai Security Disclosure Ledger),漏洞按负责任披露流程走:目前已公开 53 个,其余 2383 个还在保密期,等厂商修复后再逐批公开,公开时记录受影响项目、严重程度、CVE 编号(如有)和潜伏年数。
一个可能被大家忽略的判断:AI 找代码漏洞这件事,正在从"实验室跑分"变成"真实生产力"。 以前找漏洞靠资深安全研究员一枚一枚地筛,一个 1981 年的内核 bug 能躲过几十年的代码审计;现在模型批量扫、人只做复核,安全行业的工作方式正在被改写。
这次反常识为什么成立
三个站得住的理由:
1. 后训练 scaling 的杠杆被低估了。 大众叙事里"模型更强 = 参数更大、算力更多",但 GLM-5.3 证明了另一条路:基座不变,把"环境"做厚——把专家级真实工作流变成可执行、可验证的训练任务,模型就能持续变强。这对行业的含义是:你手里的旧模型,可能远没到它的上限。
2. 能力涌现不可预测,但方向可引导。 智谱的工程师没打算把 GLM-5.3 训成攻击武器,他们只是喂了漏洞发现数据。但能力涨得比预期快得多——"顺着链推"的能力涌现了。反过来对普通读者的启示是:AI 最值钱的能力,往往不是工程师计划出来的,而是练着练着冒出来的。
3. 开源策略本身就是差异化。 权重两周后开源(安全评估和加固完成后)。当闭源厂商把最强编程能力锁在 API 后面时,智谱选择把"开源第一"的编程模型放出来。结合 07-28 那场"OpenAI 想封中国开源模型"的争议,这已经是国产开源在用行动站队。
旧模型的上限,比你想的高得多
如果你是开发者:直接受益群体。GLM-5.3 已上线智谱 API 和 Coding Plan,可以直接用在 ZCode、Claude Code、OpenCode 这些编程智能体里。订阅制有峰谷点数:工作日 14:00-18:00 是高峰,其余时段只消耗一半点数。
一个迁移坑要提前知道:GLM-5.3 不再支持关闭思考。 老应用如果用了 thinking.type: disabled,要改成 enabled 并设 reasoning_effort: low,否则请求直接失败。
权重两周后开源(如安全评估按期完成),届时本地部署、微调都会解锁——重度用户可以再等等。
如果你是创业者:一个值得抄的作业。智谱的做法是让智能体去真实工作里收集任务,自动生成能运行的环境让模型练,再由另一个智能体验证做没做对——本质上是把"专家级工作流"工程化成训练数据。你的领域里如果有"可验证的专家工作"(审计、测试、合规审查),这就是可复制的打法。
如果你是普通用户:短期感受不明显,但两件事和你有关。一是你手机、电脑里跑的开源软件,可能正被 AI 扫出一批陈年漏洞并逐批修复——软件世界的地基正在被 AI 重新安检一遍。二是"AI 找漏洞"变便宜后,防御方的 AI 也在同步变强,你日常遇到的漏洞攻击反而可能减少。
现在可以怎么做
- 想尝鲜:直接在 z.ai 的 ZCode 或 Claude Code / OpenCode 里切换到 GLM-5.3 试试(心疼 token 就设
low,想跑最佳编程效果设max,会更慢更贵)。 - 关注披露台账:cvd.z.ai,看你的项目/依赖有没有中招。
- 等两周:权重开源后(如安全评估按期完成),本地跑、微调、二次开发成本更低,重度用户可以等这一波。
- 观察指标:Terminal Bench 3.0 上 GLM-5.3 是 28.3 vs GPT-5.6 Sol 的 34.6——开源与闭源旗舰的差距正在收窄,但还没到"平替"程度,选型时别神化。
结语
回到开头那个反常识:基座没换、参数没涨,光靠"加练"就涨了 50%,还练出了没人预告过的安全能力。
这个叙事对普通读者的真正含义是:AI 的进步不只有"更大的模型"一条路。把"专家的活"变成训练环境,旧模型就能继续变强——而这条路,恰恰是开源玩家玩得起、玩得好的路。
两周后权重开源,你可以亲自验证这个判断。一个国产开源模型正在把"找漏洞"从手艺变成批发生意,这事值得知道。
更多推荐




所有评论(0)