GLM-5.3-Flash 正式发布并开源:320B-A18B 原生多模态,前沿智能进入普惠时代

2026 年 8 月 26 日,智谱 AI(Zhipu AI / Z.ai)正式发布并开源 GLM-5.3-Flash(320B-A18B)。这是 GLM-5 系列首个原生多模态模型,以「Frontier Intelligence, Flash Cost」为产品方向,在逼近前沿智能水平的同时把单任务成本压到极低。本文基于智谱官方技术博客(z.ai/blog/glm-5.3-flash)与官方公开信息整理。

一、核心要点速览

  • 模型规格:总参数量 320B(3200 亿),推理时仅激活 18B 参数,官方型号记为 320B-A18B。
  • 定位:GLM-5 系列首个原生多模态模型,从训练阶段即面向文本、图像等模态的联合输入设计。
  • 性能:AA(Artificial Analysis)综合智能指数 v4.1.1 得分 57,与 Anthropic Claude Opus 4.8 持平;整体能力超越上一代 GLM-5.2。
  • 价格:常规定价为 GLM-5.3 的 1/10;限时折扣期间约为 GLM-5.3 的 1/20、Claude Opus 4.8 的 1/40;官方博客给出的折扣价指标为每任务约 $0.045
  • 上下文:最高支持 100 万 Token(1M / 1048576 Token) 的超长上下文。
  • 架构:首次在开源前沿模型中采用稀疏注意力 + 线性注意力混合架构,并引入 mHC(流形约束超连接),注意力计算量较 GLM-5.3 降低约 3 倍、KV 缓存降低约 4.4 倍。
  • 基础设施:发布前匿名测试(ox-alpha / 中文社区称「牛来」)期间,请求流量全部由国产 AI 芯片集群承载,端到端服务性能较初始基线提升 3 倍。
  • 开源:模型权重已在 HuggingFace 公开(zai-org/GLM-5.3-Flash),支持 SGLang、vLLM、TokenSpeed 等推理框架。

二、性能:「前沿智能,Flash 成本」

智谱官方用「Frontier Intelligence, Flash Cost」概括 GLM-5.3-Flash 的产品逻辑:用接近前沿旗舰的智能水平,配上 Flash 级的低成本。

  • 在 Artificial Analysis Intelligence Index v4.1.1 中,GLM-5.3-Flash 得分 57,仅以约 $0.045/任务(折扣价)即可达到——此前同等智能水平大约需要 10 倍的成本。智谱称其显著推动了该指数「智能—成本」帕累托前沿。
  • 编码与智能体方向(官方基准数据):
基准(Benchmark)GLM-5.3-FlashGLM-5.2DeepSeek-V4-Vision-ExpClaude Opus 4.8GPT-5.6 TerraGemini 3.7 Flash
Terminal Bench 2.184.381.083.985.087.485.8
DeepSWE v1.163.446.259.358.069.665.3
NL2Repo56.348.957.769.7
Toolathlon Verified78.459.975.976.274.9
AutomationBench v1.0.648.826.238.841.037.252.3
Agents’ Last Exam26.320.427.327.028.0
GDPval-AA v2177315041675158215711527
  • 智谱自研的 Z.ai Code Bench v1.0(运行于 Claude Code 2.1.207)上,GLM-5.3-Flash 在每一档 effort 下都明显优于 GLM-5.2;在 max effort 档位得分 29.0,逼近 Claude Opus 4.8 的 29.5。
  • 官方明确表示:GLM-5.3-Flash 在编码与智能体(agentic)基准上整体逼近 Claude Opus 4.8,同时在多个场景显著超越 GLM-5.2(如 DeepSWE v1.1:63.4 vs 46.2;AutomationBench:48.8 vs 26.2)。

三、架构:为极致推理效率而生的混合注意力

GLM-5.3-Flash 没有继续单纯堆参数,而是从架构层面压低了实际推理的激活与计算成本:

  • 更轻的激活与层数:相比 GLM-4.5 系列(总参约 355B、激活约 32B、92 层),GLM-5.3-Flash 总参 320B 基本持平,但激活参数降至 18B、层数缩减到 45 层,接近减半——既保留完整推理能力,又大幅降低运行负担。
  • 混合注意力架构(Mixed Linear + Sparse Attention):线性注意力通过状态建模(递归机制)捕获局部依赖,稀疏注意力借助轻量级索引器召回全局上下文。效果上相当于给长上下文处理加了一个「智能索引系统」:大部分内容快速略过、关键段落精读。
  • IndexPool(索引池化):为在 100 万 Token 超长上下文下压低索引器的时延与内存开销,智谱通过加权池化把索引器的 4 个缓存向量压缩为 1 个
  • mHC(Manifold-Constrained Hyper-Connections,流形约束超连接):进一步提升模型 Scaling 能力,为后续更大规模模型铺路。
  • 效率量化结果:与 GLM-5.3 相比,GLM-5.3-Flash 的注意力计算量降低约 3.0 倍、KV 缓存占用减少约 4.4 倍,在所有对比基线模型中注意力计算量最低(KV 缓存均值仍略高于 Kimi-K3 与 DeepSeek-V4-Flash,官方已列为后续优化方向)。
  • 训练数据:配合约 30T Token 的最新多模态预训练语料,实现「用更少计算产出更多智能」。

基座模型(Base)评测也佐证了架构的有效性:GLM-5.3-Flash-Base(18B 激活 / 320B 总参)在 MMLU 88.1、BBH 86.6、HellaSwag 87.1、LiveCodeBench-Base 37.6、SimpleQA 33.5 等指标上整体超越 GLM-4.5-Base,并与总参 744B 的 GLM-5-Base 在多数组件上保持竞争力。

四、原生多模态:视觉智能进入编码闭环

GLM-5.3-Flash 是 GLM-5 系列首个原生多模态模型,与 8 月中旬发布的、主打代码与 Agent 的 GLM-5.3 形成互补:

  • 视觉不再只是「图片问答」——官方强调「视觉编码」的价值:前端、游戏、3D 仿真等任务的最终交付物是界面、交互或用户可体验的「世界」,很多缺陷只有在渲染、交互、试玩中才会暴露。CUA(Computer Use Agent)把编码能力延伸到可见、可交互的环境,因此视觉需要原生集成进模型,让它自主决定何时观察、并用视觉反馈指导后续动作。
  • 智谱为此构建了面向视觉编码的数据合成管线,重点训练自我视觉判断(self-visual judgment)与测试时改进(test-time improvement):模型要与环境交互、检查自身输出并迭代修正;前端编码还探索了基于环境反馈的强化学习,并结合真实用户流程的 agent 验证强化 GUI 判断。
  • 在办公与知识工作场景,视觉智能让模型能直接理解文档、表格、演示文稿、仪表盘、界面等异构视觉与结构化信息,对着原始工作产物联合推理,而不是要求用户先转写成文字;它还能评估自身输出是否契合视觉上下文与预期结果,做出更好的自检与优化——包括对呈现质量与美感的判断。

五、服务底座:10 万级国产芯片集群跑通前沿模型

GLM-5.3-Flash 的推理服务完全构建在国产 AI 芯片集群之上(自研高带宽互联网络连接),这是其另一大看点:

  • 发布前的压力测试:8 月 20 日起,智谱以匿名模型 ox-alpha(中文社区称「牛来」)在 OpenCode 与 OpenRouter 平台大规模开放测试,迅速成为当周双平台最受欢迎模型之一,并刷新调用量纪录——期间产生的所有请求流量全部由国产芯片承载。
  • 专用推理引擎:为克服单芯片算力与内存容量限制(尤其在 100 万 Token 上下文下),团队在 SGLang 之上为这套架构定制了推理引擎,组合了节点内张量并行(Linear Attention 与 LM head)、ReplaySSM、W8A8 量化、混合 INT8/FP8/BF16 缓存量化、Layer Split 等手段,并大量使用 compute-for-bandwidth / communication-for-bandwidth 类内存优化。
  • EPD 分离式架构:生产级 Encode–Prefill–Decode(EPD) 将多模态编码、Prompt 预填充与逐 Token 解码拆分为可独立调度、独立扩缩容的工作池,实现跨数万张国产加速卡的稳定服务。
  • 自我进化的正循环:这项工作由 GLM-5.3 驱动的 infra agent(基建智能体) 参与加速完成——它协助工程师开发与优化算子、诊断性能瓶颈、改进服务栈,形成「模型帮助优化服务模型自身的系统」的反馈闭环。
  • 结果:与同一硬件上的初始基线相比,端到端服务性能提升 3 倍,硬件效率与单 Token 成本已达到与主流 NVIDIA GPU 相当的水平,验证了国产芯片可规模化、经济地支撑前沿模型推理。

六、开源与上手路径

  • 权重开源:GLM-5.3-Flash 权重已在 HuggingFace 公开(zai-org/GLM-5.3-Flash),面向全球开发者开放。
  • 本地部署:当前支持 SGLang、vLLM、TokenSpeed 等推理框架,其余框架也在陆续适配中。
  • 官方服务:已全量接入 GLM Coding Plan 用户(可用额度为 GLM-5.3 的 3 倍),并接入 ZCode 等官方编码平台;同步开放 API 调用。
  • 多模态 Agent 能力:在 ZCode 中可通过 Browser Use 与 Computer Use 解锁:让 Agent 点开网页并可视化验证界面、操作桌面应用。

七、总结

GLM-5.3-Flash 的意义不仅在于「又一款开源模型」,而在于一套可复制的组合方法:更强能力的架构 + 更丰富的多模态预训练语料 + 与推理硬件协同设计的服务基础设施。智谱官方表示,这套理念正在向更大模型扩展,GLM-5.3-Flash 推动的成本—性能前沿,以及构建过程中沉淀的经验,已经在塑造下一代前沿模型。「前沿智能不必付出前沿价格」——这正是 GLM-5.3-Flash 想要证明的事情,而开源加国产算力的组合,让它变得可以让整个行业直接上手验证。


参考资料(官方权威来源)

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐