智谱发布今日上线并开源多模态模型GLM-5.3-Flash:320B总参数

8月26日消息,智谱今日上线并开源GLM-5.3-Flash (320B-A18B),这是GLM-5系列的首个原生多模态模型。320B总参数,能力超过GLM-5.2,在全球权威的Artificial Analysis Intelligence Index(AA综合智能指数)中取得57分,进入全球前沿模型能力区间,与Anthropic最受欢迎的模型Claude Opus 4.8得分持平。

在自研Z.ai Code Bench体感评估中,其编程表现与Claude Opus 4.8相当。

与此同时,GLM-5.3-Flash定价为GLM-5.3的1/10,限时折扣内为GLM-5.3的1/20,为Opus 4.8的1/40。同样智力,1/40价格,前沿智能,第一次不需要省着用。

为收集广大用户的广泛、专业反馈,公司在正式发布前,以匿名模型Ox-Alpha(中文社区称作牛来)在OpenCode和OpenRouter上进行了大规模测试。Ox-Alpha迅速成为当周最受欢迎的模型,创下双平台调用量新高。而这些请求流量全部由国产芯片提供算力支持。

GLM-5.3-Flash在各项基准测试和实际使用中,全面超越参数量高出一倍的GLM-5.2,定价却仅为后者的1/10。这得益于其全新模型架构。GLM-5.3-Flash的架构专为极低成本而设计,总参数量与GLM-4.5相当(355B vs. 320B),但激活参数量(32B → 18B)与层数(92 → 45)几乎减半。

结合智谱最新的30T Token多模态预训练语料,GLM-5.3-Flash能够以更少的计算资源实现更强的性能。GLM-5.3-Flash同时进行了多项架构升级,是首个采用稀疏注意力与线性注意力混合架构的开源前沿模型,在保持精准长上下文能力的同时,大幅降低长上下文服务成本;并采用流形约束超连接(Manifold-Constrained Hyper-Connections,mHC)提升模型Scaling能力。

极致低成本架构

为降低模型长上下文场景下的注意力成本,智谱采用线性注意力与稀疏注意力相结合的混合架构。其中,线性注意力通过递归机制捕获局部依赖关系,稀疏注意力则借助轻量级索引器召回全局上下文。

智谱引入IndexPool为进一步降低1M上下文下索引器的时延与内存开销,通过加权池化将索引器的4个缓存向量压缩为1个。为展示架构效率,智谱将GLM-5.3-Flash与GLM-5.3、DeepSeek-V4-Flash和Kimi-K3进行对比,重点考察单Token计算量和KV缓存大小。

为公平比较不同规模的模型,智谱分别展示每个Head、每层注意力计算量,以及每层平均KV缓存大小(BF16)。相较于GLM-5.3,GLM-5.3-Flash的注意力计算量与KV缓存大小分别降低了3.01倍和4.44倍。

在所有基线模型中,GLM-5.3-Flash的注意力计算量最低。不过其KV缓存大小仍略高于Kimi-K3和DeepSeek-V4-Flash,这也是我们在后续工作中进一步优化的方向。

跑在国产芯片上

过去一周,智谱首次在大规模流量中尝试用大国产芯片集群提供服务,这些芯片通过自研高带宽互联网络连接。为克服单张芯片算力与内存容量相对有限的问题,智谱在SGLang 基础上构建了专用的推理引擎。

值得一提的是,整个构建工作由GLM-5.3驱动的infra agent 大大加速,它协助工程师开发与优化算子、诊断性能瓶颈、改进部署服务栈,形成了“模型优化系统,系统承载模型”的正向循环。这些芯片主要瓶颈在于内存容量与带宽,尤其是支持长达1M上下文长度很有挑战。

这要求针对底层架构进行激进的内存优化,包括以算力换带宽、以通信换显存等定制优化。智谱的技术栈结合了用于线性注意力和LM head的节点内张量并行、ReplaySSM、W8A8量化、INT8/FP8/BF16混合缓存量化,以及Layer Split等技术。

在集群层面,智谱采用生产级Encode–Prefill–Decode(EPD)分离式架构,将多模态编码、prompt预填充和逐token解码拆分为可独立调度、独立扩缩容的工作池,从而在国产加速芯片上实现了高效、可靠的服务。

与同一硬件上的初始基线相比,端到端服务性能提升了3倍,硬件效率和单token成本已达到与主流英伟达GPU相当的水平。这证明国产芯片完全可以在大规模场景下高效、经济地支撑前沿模型的推理需求。

现在,GLM-5.3-Flash正式面向全球开源,已接入ZCode等编码平台,并纳入GLM Coding Plan(每天限量发放10,000张体验卡),同步开放API调用。

Copyright © DoNews 2000-2026 All Rights Reserved
京ICP备2025120072号