「前沿智能」这四个字长期以来只跟一个词绑定在一起:贵。
不是没有便宜的大模型。但便宜往往意味着降级——参数小一号、能力差一截、在某些任务上能省则省。而智谱今天开源的 GLM-5.3-Flash(320B-A18B),正在挑战这个假设。

这是一组关键数据:320B 总参数,18B 激活参数,在 Artificial Analysis 的 AA 综合智能指数中拿到 57 分——与 Claude Opus 4.8 持平。编程方面,Z.ai 的内部评估显示与 Opus 4.8 相当。


定价呢?GLM-5.3-Flash 为 GLM-5.3 的 1/10,限时折扣内为 1/20,是 Opus 4.8 的 1/40。
这套定价不是临时促销——背后是架构级的成本压缩。GLM-5.3-Flash 总参数与 GLM-4.5 相当(355B → 320B),但激活参数量从 32B 砍到 18B,层数从 92692 降到 45,几乎是半刀斩断。智谱最新的 30T Token 多模态预训练语料也一并到位。
架构上有两个值得关注的技术细节。
第一,它采用了稀疏注意力 + 线性注意力的混合架构。简单说:长上下文场景下不再需要全量注意力计算,而是通过线性注意力捕获局部依赖、稀疏注意力召回全局上下文。他们还引入了一个叫 IndexPool 的池化机制,把 4 个缓存向量压缩成 1 个,降低 1M 上下文下索引器的时延和内存开销。相比 GLM-5.3,注意力计算量降低 3.01 倍,KV 缓存降低 4.44 倍。
第二,它用上了 流形约束超连接(Manifold-Constrained Hyper-Connections,mHC),一种提升模型 Scaling 能力的新型连接方式。这属于架构层面的变化,不是简单的 MoE 路由调优。

GLM-5.3-Flash 也是 GLM-5 系列的第一个原生多模态模型。视觉能力被集成进编码流程里——模型可以自主判断何时需要观察,利用视觉反馈指导下一步行动。前端开发、游戏开发、3D 仿真这类需要感知最终产物的任务,这个能力非常直接:模型能看自己的输出,然后迭代改进。
有意思的是,智谱这次在国产芯片上做了大规模验证。上线前以匿名模型名 Ox-Alpha(牛来)在 OpenCode 和 OpenRouter 上测了一周,成为当周最受欢迎模型,创下双平台调用量新高。关键在后面那句话:这些请求流量全部由国产芯片提供算力支持。
他们在 SGLang 基础上构建了专用推理引擎,解决了单张国产芯片算力和内存容量相对有限的问题,端到端服务性能相比初始基线提升了 3 倍。智谱声称,硬件效率和单 token 成本已达到与主流英伟达 GPU 相当的水平。
这不仅是模型发布——它意味着国产芯片已经可以在大规模流量下承载前沿大模型的推理需求。跑在国产芯片上的模型,价格还能打到 1/40,会让更多开发者愿意试一试。
GLM-5.3-Flash 已全球开源,接入 ZCode 等编码平台,并纳入 GLM Coding Plan(每天限量 10,000 张体验卡),也同步开放了 API 调用。
参考来源: