← 返回我的文章

S01 / ARTICLE FILE

GLM-5.3-Flash:我才是后训练仙人,比 DeepSeek 更便宜,而且还是多模态,还用的国产卡

硅基斥候S01

拆解 GLM-5.3-Flash 的价格、稀疏架构、多模态能力和国产算力适配,判断后训练带来的真实变化。

GLM-5.3-Flash:我才是后训练仙人,比 DeepSeek 更便宜,而且还是多模态,还用的国产卡

过去一周,OpenCode 和 OpenRouter 上有一款匿名模型 ox-alpha。按智谱的说法,它的调用量冲到了当周第一。8 月 26 日,智谱出来认领:这就是 GLM-5.3-Flash。

ox-alpha 在 OpenRouter 匿名测试期间的流量

图:智谱发布页引用的 OpenRouter 流量统计,时间为 2026 年 8 月 20—25 日(UTC)。

这次发布最狠的是价格和算力方案。智谱把一款 320B 总参数、每次只激活 18B 参数的原生多模态模型,卖到了每百万输入 Token 0.8 元、输出 2.8 元。前两周五折,价格只有 0.4 元和 1.4 元。

而且,ox-alpha 匿名测试期间的全部流量,都跑在国产 AI 芯片上。

这次真比 DeepSeek 便宜

我把两家的最新 API 牌价重新对了一遍。DeepSeek-V4-Flash 已经采用峰谷计价:每百万非缓存输入和输出 Token,非高峰分别是 0.22 美元、0.66 美元,高峰再翻一倍。

按国家外汇管理局最近公布的中间价,1 美元约合 6.78 元人民币。把 100 万非缓存输入和 100 万输出合成一笔账,差距最直观:

同一笔账 GLM-5.3-Flash DeepSeek-V4-Flash 非高峰 GLM 便宜
限时两周 1.8 元 约 5.97 元 约 70%
优惠结束后 3.6 元 约 5.97 元 约 40%

DeepSeek 高峰时段,同一笔账约 11.94 元。

哪怕两周优惠结束,GLM-5.3-Flash 的常规价也比 DeepSeek 的非高峰价低约 40%;优惠期内,两项合计低约 70%。DeepSeek 过去很长时间都握着国产模型的性价比标签,现在这张牌被智谱抢走了一大块。

GLM-5.3-Flash 在 Artificial Analysis 智能与成本图中的位置

图:智谱发布页展示的 Artificial Analysis 智能—成本坐标,GLM-5.3-Flash 位于低成本前沿。

缓存命中是一个例外。DeepSeek 每百万缓存输入折合人民币约 0.047—0.095 元,低于 GLM 优惠期的 0.115 元。长代码仓库里反复发送同一批上下文,缓存率会直接改变账单。高输出、低缓存的任务更容易体现 GLM 的优势。

“后训练仙人”给 Flash 换了新基座

两周前发布 GLM-5.3 时,智谱沿用了 GLM-5.2 的基座,所有提升都来自后训练,官方自有代码测试提高了 50%。我当时就觉得,这个团队已经有点“后训练仙人”的意思。

Flash 的能力来源更复杂。它从新训练的基座开始,使用 30T Token 多模态预训练语料,还把稀疏注意力和线性注意力装进了同一套架构。总参数有 320B,每个 Token 只激活 18B,层数也从 GLM-4.5 的 92 层降到 45 层。算得少,才能卖得便宜。

GLM-5.3-Flash 模型架构与注意力计算示意

图:GLM-5.3-Flash 官方架构示意。混合注意力用于降低长上下文的缓存与计算开销。

多模态也被直接塞进了 Coding 循环。它能接收图片、视频、文件和文本,在做网页、游戏或 3D 场景时,主动查看渲染结果和界面反馈,再继续改代码。它输出文本,图像和视频用于输入理解。

智谱自己的对比表里,GLM-5.3-Flash 面对 DeepSeek-V4-Vision-Exp,在 8 项 Coding 和 Agent 测试中赢了 6 项,6 项视觉测试全部领先。厂商跑分还需要真实项目复核。Artificial Analysis 的独立测试给了它 57 分的 Intelligence Index,同时记录到 48.7 Token/秒的输出速度,低于同类模型 67 Token/秒的中位数。它的“Flash”首先体现在计算和价格效率上,响应速度未必处处占优。

国产卡承接了真实流量

这次最有分量的证据来自真实流量。智谱称,过去一周的匿名测试全部由大规模国产 AI 芯片集群提供服务。线上系统把多模态编码、提示词预处理和逐 Token 生成拆开调度,国产加速卡直接承接前沿模型的长上下文推理。

智谱还披露,同一套硬件上的端到端服务性能比初始版本提高了 3 倍,硬件效率和单 Token 成本已经做到与主流英伟达 GPU 相当。具体芯片型号、绝对吞吐和成本数字没有公开,第三方也还没有复现。官方披露范围止于推理服务,训练所用芯片没有公开。

一整套系统已经把前沿模型稳定送到用户面前。证据里同时出现了匿名平台一周真实调用量、百万上下文、原生多模态和生产级服务栈,国产卡从单机加载验证走到了线上服务。

GLM-5.3-Flash 目前已经开放 API、进入 GLM Coding Plan,并以 MIT 许可证公开权重。对正在选 Coding Agent 底座的人,我建议直接拿固定代码任务、多模态输入、长上下文和缓存命中率去跑,再看完成度、速度和真实账单。

这次智谱给出的牌面已经足够清楚:能力挤进前沿区间,价格压到 DeepSeek 之下,线上推理跑在国产芯片上。接下来只等真实项目说话。


主要资料:GLM-5.3-Flash 官方技术博客智谱国内模型文档DeepSeek API 价格页Artificial Analysis 独立评测GLM-5.3-Flash 官方模型卡


以上就是这次的侦察。

如果对你有用,顺手点个赞 +「♥️」。

想第一时间收到前线情报,关注「硅基斥候S01」。我们,下次侦察见。