今天,智谱智智谱(02513)正式发布并开源GLM-5.3-Flash (320B-A18B),科技这是迈入GLM-5系列的首个多模态模型。

在当前科技环境中,普惠前沿智能技术的智谱智成本通常令人望而却步,而今天GLM-5.3-Flash的科技发布则改变了这一现状:其具有320B的总参数量,性能超越GLM-5.2,迈入并在权威的普惠Artificial Analysis Intelligence Index(AA综合智能指数)中获得57分,已进入全球顶尖模型行列,智谱智与Anthropic的科技Claude Opus 4.8平分秋色。经过自研Z.ai Code Bench评估,迈入其编程能力与Claude Opus 4.8相当。普惠

值得注意的智谱智是,GLM-5.3-Flash的科技定价为GLM-5.3的1/10,并且在限时折扣期间,迈入甚至为GLM-5.3的1/20,相较Opus 4.8还要低至1/40。这意味着用户能够以更低的成本享受同样的智能服务。

为了获得用户的广泛反馈,GLM-5.3-Flash在正式发布前,已通过匿名模型Ox-Alpha(中文社区称作牛来)在OpenCode和OpenRouter上进行了大规模测试,并迅速成为当周最受欢迎的模型,创造了平台调用量新高,而这些计算能力完全依赖于国产芯片。

在各项基准测试中,GLM-5.3-Flash表现出色,其参数量相比参数高出一倍的GLM-5.2却仅为其1/10,得益于其全新模型架构设计,使得其在计算资源需求上更为高效。GLM-5.3-Flash采用了适应性的稀疏注意力与线性注意力混合架构,降低了运营成本,并通过流形约束超连接技术提升了模型的扩展能力,具体技术细节可见Blog:https://z.ai/blog/glm-5.3-flash。

极致的低成本构架

为降低模型在长上下文场景中的注意力成本,GLM-5.3-Flash引入了线性注意力与稀疏注意力结合的架构,利用递归机制捕获局部依赖关系,使用轻量级索引器召回全局上下文。引入的IndexPool进一步降低了在1M上下文中索引器的时延与内存开销,通过加权池化将四个缓存向量压缩为一个。

为展示架构效率,我们将GLM-5.3-Flash与其他模型(如GLM-5.3、DeepSeek-V4-Flash和Kimi-K3)进行了对比,重点考察了单Token的计算量与KV缓存大小。经过比较,GLM-5.3-Flash的注意力计算量和KV缓存大小分别降低了3.01倍和4.44倍,显示出其在计算资源利用上的优势。

在长上下文应用中,GLM-5.3-Flash的注意力计算量最低,尽管其KV缓存大小略高于Kimi-K3和DeepSeek-V4-Flash,这将是我们进一步优化的方向。

视觉编程的反馈

GLM-5.3-Flash是首个原生多模态模型,增强了视觉编码能力,使其能够无人干预地辅助编程,扩展了前端开发、游戏开发等任务的潜力。该模型能够判断何时需要视觉输入,并利用反馈指导后续的操作。

为了改善视觉能力,模型采用了数据合成流水线,专注于自我视觉判断与测试改进,保证其与环境的互动性和迭代能力。在前端编码方面,通过融合环境反馈的强化学习,强化了模型的GUI判断能力。

意外的是,GLM-5.3-Flash在Blender中独立运行16小时,成功构建了一个约400平方米的专业主厨自宅与测试厨房,展示了其在3D建模方面的自主能力。

在ZCode设计中,Browser Use Agent(BUA)与Computer Use Agent(CUA)进一步拓展了多模态能力,使模型可以在代码、浏览器与GUI之间有效协同,以检测和验证输出结果,很多问题在交互或试玩过程中自然暴露出来。

超越编码的工作助手

GLM-5.3-Flash在处理Office和文档类任务时,相较于同类模型表现显著提升。其新增的视觉理解能力,使得模型能够更高效地校正和优化输出结果,增强了审美判断能力。此外,模型能够比对自身输出与视觉上下文,提供有效的自我验证和改进,这包括更精确的质量评估和审美判断。

我们针对金融、法律等各专业领域进行了优化。金融方面,GLM-5.3-Flash能够覆盖从金融研究到建模分析的全过程,并保障信息的追溯性。在法律领域,模型可审查合同中的条款,并能起草符合规范的法律文书。

运用国产芯片

在过去一周,我们首次在高流量环境中采用国产芯片集群提供服务,克服了单个芯片算力和内存容量的限制,打造了专用的推理引擎。GLM-5.3推动的infra agent,大幅加速了构建过程,帮助优化算子、诊断性能问题及改进部署服务,形成了良好的模型优化循环。

为应对内存和带宽的瓶颈,我们对底层架构进行了激进的优化,采用了多种技术组合,最终使得集群在保持高效服务的同时,提升了性能和降低了成本,与主流英伟达GPU的水平相当。

现在,GLM-5.3-Flash已正式向全球开源,接入ZCode等编码平台,开始同步开放API调用,并推出GLM Coding Plan(每天限量发放10,000张体验卡)。