JOTO
Contact us
← AI 智库
开源模型

GLM-5.3-Flash开源:人人都可低成本获得前沿智能

2026 年 8 月 27 日

智谱发布开源模型GLM-5.3-Flash(320B-A18B),首个原生多模态GLM-5系列模型,在AA综合智能指数中获57分,能力对标Claude Opus 4.8,但定价仅为后者的1/40。其采用稀疏+线性混合注意力、流形约束超连接等架构创新,激活参数量与层数减半,并全程基于国产芯片集群实现高效推理。

首个原生多模态GLM模型

今天,我们上线并开源GLM-5.3-Flash (320B-A18B),这是GLM-5系列的首个原生多模态模型。

GLM-5.3-Flash模型能力对比图
GLM-5.3-Flash在AA综合智能指数中取得57分,与Claude Opus 4.8持平

能力对标Opus,成本降至1/40

大家好像已经习惯将前沿智能与前沿价格绑定,并认为这是技术进步必须支付的成本。今天,GLM-5.3-Flash来了:320B总参数,能力超过GLM-5.2,在全球权威的Artificial Analysis Intelligence Index(AA综合智能指数)中取得57分,进入全球前沿模型能力区间,与Anthropic最受欢迎的模型Claude Opus 4.8得分持平。在自研Z.ai Code Bench体感评估中,其编程表现与Claude Opus 4.8相当。

与此同时,GLM-5.3-Flash定价为GLM-5.3的1/10,限时折扣内为GLM-5.3的1/20,为Opus 4.8的1/40。同样智力,1/40价格,前沿智能,第一次不需要省着用。

GLM-5.3-Flash与竞品模型性能-成本对比图
GLM-5.3-Flash以显著更低成本实现与Claude Opus 4.8相当的智能水平

Ox-Alpha匿名测试与国产算力验证

为收集广大用户的广泛、专业反馈,我们在正式发布前,以匿名模型Ox-Alpha(中文社区称作牛来)在OpenCode和OpenRouter上进行了大规模测试。Ox-Alpha迅速成为当周最受欢迎的模型,创下双平台调用量新高。而这些请求流量全部由国产芯片提供算力支持。

GLM-5.3-Flash在各项基准测试和实际使用中,全面超越参数量高出一倍的GLM-5.2,定价却仅为后者的1/10。这得益于其全新模型架构。GLM-5.3-Flash的架构专为极低成本而设计,总参数量与GLM-4.5相当(355B vs. 320B),但激活参数量(32B → 18B)与层数(92 → 45)几乎减半。结合我们最新的30T Token多模态预训练语料,GLM-5.3-Flash能够以更少的计算资源实现更强的性能。

GLM-5.3-Flash同时进行了多项架构升级,是首个采用稀疏注意力与线性注意力混合架构的开源前沿模型,在保持精准长上下文能力的同时,大幅降低长上下文服务成本;并采用流形约束超连接(Manifold-Constrained Hyper-Connections,mHC)提升模型Scaling能力。具体技术细节见Blog:https://z.ai/blog/glm-5.3-flash

极致低成本架构

为降低模型长上下文场景下的注意力成本,我们采用线性注意力与稀疏注意力相结合的混合架构。其中,线性注意力通过递归机制捕获局部依赖关系,稀疏注意力则借助轻量级索引器召回全局上下文。我们引入IndexPool为进一步降低1M上下文下索引器的时延与内存开销,通过加权池化将索引器的4个缓存向量压缩为1个。

为展示架构效率,我们将GLM-5.3-Flash与GLM-5.3、DeepSeek-V4-Flash和Kimi-K3进行对比,重点考察单Token计算量和KV缓存大小。为公平比较不同规模的模型,我们分别展示每个Head、每层注意力计算量,以及每层平均KV缓存大小(BF16)。相较于GLM-5.3,GLM-5.3-Flash的注意力计算量与KV缓存大小分别降低了3.01倍和4.44倍。

GLM-5.3-Flash与其他模型注意力计算量与KV缓存对比图
GLM-5.3-Flash在注意力计算量上最低,KV缓存大小较GLM-5.3降低4.44倍

在所有基线模型中,GLM-5.3-Flash的注意力计算量最低。不过其KV缓存大小仍略高于Kimi-K3和DeepSeek-V4-Flash,这也是我们在后续工作中进一步优化的方向。

代码循环中的视觉反馈

GLM-5.3-Flash是GLM-5系列的首个原生多模态模型。视觉编码(Visual Coding)并不只是处理图像,它拓展编程所能触及的边界。对于前端开发、游戏开发、3D仿真等任务而言,最终产物包括用户能够感知的界面、交互或虚拟世界,视觉能力被原生集成进模型中,使其能够自主判断何时需要“观察”,并利用视觉反馈来指导下一步行动。

我们针对视觉编码开发了数据合成流水线,重点聚焦于模型的自我视觉判断与测试时改进。最终生成的轨迹要求模型与环境交互、检视自身输出,并进行迭代式改进。在前端Coding方面,我们还探索基于环境反馈的强化学习,并通过基于真实用户流程的Agent验证,进一步强化GUI判断能力。这将验证的范畴从功能正确性延伸至渲染效果与交互体验层面。

令人意外的是,Coding为模型提供了一种表达并检验其世界知识的代理。在Blender中构建一个连贯的场景,需要将几何、材质、光照与空间等知识转化为一个在不同视角下都保持一致的3D结构。在没有任何外部素材的情况下,GLM-5.3-Flash自主运行16个小时搭建了一套约400平方米的专业主厨自宅与测试厨房。

在ZCode中,Browser Use Agent(BUA)与Computer Use Agent(CUA)进一步拓展多模态能力,使模型能够在代码、浏览器与图形界面之间协同工作,同时观察并验证自身的输出结果——许多问题只有在渲染、交互或试玩过程中才会暴露出来。以下是在ZCode中使用GLM-5.3-Flash实测合集:从图像到可运行工程,从两小时电影到8分钟成片,以及可直接交付的白领专业文档。

超越Coding的工作伙伴

GLM-5.3-Flash在专业工作中的表现相较同级别模型显著提升。针对PPTX、PDF、DOCX和XLSX等Office与文档类任务,新增的视觉理解能力使模型能够检查并优化自身输出,并具备更强的审美判断。模型还可以将自己的输出结果与视觉上下文以及预期的结果进行对比,从而实现更有效的自我验证和优化——包括更准确的呈现质量评估以及审美判断。

我们专门针对金融、法律等专业工作进行优化。在金融方面,GLM-5.3-Flash可以覆盖从基于来源的金融研究、报告生成到金融建模与分析的完整流程,在整个过程中提供可追溯的参考依据。在法律方面可以审查合同中的费用、账户与责任条款,并按律师惯例批注留痕。它也能起草律师函、合同与诉讼文书,格式与版式符合实务规范,生成即可交付。

跑在国产芯片上

过去一周,我们首次在大规模流量中尝试用大国产芯片集群提供服务,这些芯片通过自研高带宽互联网络连接。

为克服单张芯片算力与内存容量相对有限的问题,我们在SGLang 基础上构建了专用的推理引擎。值得一提的是,整个构建工作由GLM-5.3驱动的infra agent 大大加速,它协助工程师开发与优化算子、诊断性能瓶颈、改进部署服务栈,形成了“模型优化系统,系统承载模型”的正向循环。

这些芯片主要瓶颈在于内存容量与带宽,尤其是支持长达1M上下文长度很有挑战。这要求我们针对底层架构进行激进的内存优化,包括以算力换带宽、以通信换显存等定制优化。我们的技术栈结合了用于线性注意力和LM head的节点内张量并行、ReplaySSM、W8A8量化、INT8/FP8/BF16混合缓存量化,以及Layer Split等技术。

在集群层面,我们采用生产级Encode–Prefill–Decode(EPD)分离式架构,将多模态编码、prompt预填充和逐token解码拆分为可独立调度、独立扩缩容的工作池,从而在国产加速芯片上实现了高效、可靠的服务。

与同一硬件上的初始基线相比,端到端服务性能提升了3倍,硬件效率和单token成本已达到与主流英伟达GPU相当的水平。这证明国产芯片完全可以在大规模场景下高效、经济地支撑前沿模型的推理需求。

现在,GLM-5.3-Flash正式面向全球开源,已接入ZCode等编码平台,并纳入GLM Coding Plan(每天限量发放10,000张体验卡),同步开放API调用。

JOTO 企业落地观察

  • 企业部署长上下文RAG系统时,GLM-5.3-Flash的1M上下文能力与国产芯片兼容性,使其成为替代高成本闭源模型的务实选择,尤其适合需高频解析长篇幅PDF、扫描合同等非结构化文档的合规与法务场景。
  • 这类系统在GUI自动化与办公文档生成任务中,因具备原生视觉反馈与自我验证能力,可减少对传统规则引擎和人工标注数据的依赖,降低智能体工程中环境适配与迭代验证的开发成本。
  • 模型在金融、法律等垂直领域已具备开箱即用的格式规范与流程覆盖能力,企业无需投入资源进行全量微调,可直接通过提示词工程快速启动概念验证,显著压缩AI落地路径。
  • 开源模型底座配合API开放策略,为企业AI安全治理提供了关键可控性:支持私有化部署、数据本地处理、模型行为日志审计,满足金融、政务等强监管行业对模型可解释性与合规性的基础要求。

立即咨询 JOTO

JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询

想把这些做法用到你的业务里?

留下你的场景和痛点,我们帮你判断从哪一步开始。

联系我们
Contact Us

Start your enterprise AI rollout

Tell us your industry, team, and current pain points. We'll get back to you within one business day to help you decide what to tackle first, what data to prepare, and which platform fits.

WeChat
Scan to add us for a 1:1 chat
JOTO WeChat consultation QR code

Tell us what you need

Once we receive your details, we'll be in touch within one business day.