这两天做早报,我前脚还说 AI 圈像过年,后脚又觉得像过圣诞。
结果 8 月 14 日中午,智谱把 GLM-5.3 端了上来。得,再换个说法:晋西北已经打成一锅粥了。
从 8 月 12 日深夜到 14 日中午,不到 38 小时,四家模型厂商连着按下发布键:
| 北京时间 | 新模型 | 这次主打什么 |
|---|---|---|
| 8 月 12 日 23:32 | Grok 4.6 | 长时间 Agent 任务,价格不变 |
| 8 月 13 日 19:31 | DeepSeek V4 Pro | Agent 能力、思考强度、Responses API |
| 8 月 14 日 01:04 | Gemini 3.7 Flash | 编程、知识工作和网页开发 |
| 8 月 14 日 13:17 | GLM-5.3 | 编程 Agent 和网络安全 |

四家模型官宣首尾相隔 37 小时 46 分。时间依官方 X 帖 Snowflake ID 还原为北京时间。
DeepSeek 的 API 在 13 日凌晨已经露面,晚间才是官方全量官宣。所以这两天的早报看起来特别像连续剧:今天刚写完一家,下一家已经在夜里把新版本推上来了。
GLM-5.3 这次,明牌就是来打代码榜的
智谱的官宣没有绕弯,口号就两句:为编程而生,为网络防御做好准备。
这一版没换基座模型。GLM-5.3 和 GLM-5.2 用的还是同一个 743B 基座,官方说得很直接:全部提升都来自后训练。过去一个多月,智谱持续增加任务环境、扩大长任务,再往这套系统里堆更多训练算力。
官方自有的 Z.ai Code Bench 里,GLM-5.3 比 5.2 提升了 50%,而且输出 Token 更少。这些仍然是厂商自测,最有节目效果的部分,是官方把 DeepSeek-V4-Pro-0813 端端正正放进了对比表。

智谱官方 Z.ai Code Bench:横轴是单任务平均输出 Token,纵轴是准确率。这是厂商自有评测,不是独立第三方榜单。
两家都有成绩的 9 项测试里,GLM-5.3 领先 7 项,DeepSeek 领先 2 项。
Terminal Bench 2.1 是 88.2 对 87.9,GLM 只赢了 0.3 分;DeepSWE 是 66.9 对 62.7。DeepSeek 也没被全面压住,NL2Repo 是 61.1 对 58.0,Toolathlon Verified 是 74.1 对 73.0,这两项仍然是 DeepSeek 更高。

正文涉及的四项各胜两项;智谱公布的完整 9 项可比结果为 GLM-5.3 领先 7 项、落后 2 项。

GLM-5.3 官方完整对比图,包括 Terminal Bench 3.0、DeepSWE、Agents' Last Exam、AutomationBench、HLE w/ Tools 和 GDPval-AA v2。手机端可点开查看大图。
这张表更像一份“我也把你拉上来比一比”的回信,这就连上了上一回的剧情。
GLM 报“一箭之仇”,这个段子还真有前情
这段前情得从 7 月底的 GLM Coding Plan 涨价讲起。
7 月 30 日,GLM Coding Plan 结束长期限购,放开订阅。Lite、Pro、Max 三档月付价涨到 118 元、538 元和 1078 元。按 5 月社区记录的常见价格计算,大约是原来的 2.4 倍、3.6 倍和 2.3 倍。
第二天下午 2 点 56 分,DeepSeek 发布 V4 Flash 0731。它还在官方跑分表里把 GLM-5.2 摆上了对比席:GLM-5.2 有成绩的 8 项 Agent 测试,V4 Flash 全部更高。Terminal Bench 2.1 是 82.7 对 81.0,DeepSWE 是 54.4 对 46.2。
GLM Coding Plan 收的是订阅月费,DeepSeek Flash 当时主要走 API 按量计费,两种价格不能直接换算。但这两条消息前后只隔一天,节目效果已经拉满了:GLM 刚把 Coding Plan 的价格抬上去,DeepSeek 就把低价 Flash 推到台前,还顺手用跑分压了 GLM-5.2 一轮。
到了这一回,箭头反过来了。DeepSeek V4 Pro 官宣后大约 18 小时,GLM-5.3 就来了,还在自家表格里把 V4 Pro 0813 列成了明确对手。
公开资料只能确认顺序,不能证明两家互相掌握排期。但从围观效果看,这一箭确实回得很整齐:上次我给 Coding Plan 涨价,你第二天拿 Flash 和跑分来砸场;这次你刚上 Pro,我用 5.3 把你写进对比表。
两张官方表格摆在一起,比任何“江湖恩怨”的传闻都好笑。
四家模型都在争同一份工作
Grok 讲长时间 Agent,DeepSeek 讲 Agent 升级和 Responses API,Gemini 讲编程与网页开发,GLM 直接把“为编程而生”写到官宣第一行。
四次发布的共同焦点很明显:谁能进入代码库,连续调工具,把一件长任务做完。模型厂商现在比的是后训练、任务环境、Harness 和每个任务花掉的 Token,参数大小反而没有成为这两天的主角。
官方跑分表因此既是证据,也是武器。各家用的 Harness、超时时间、上下文长度和内部测试集都会影响成绩,一张表能告诉我们厂商想打哪里,还不能替你完成选型。
GLM-5.3 当前已经进入 GLM Coding Plan 和 ZCode,API 与开放权重还要分阶段放出,官方说权重会在两周后开放。想试的人可以先等入口开齐,不用在两天里连续迁移四次。
真正有用的做法,是把自己的固定任务留好:一段旧代码、一项多步改造、一次长时间工具调用。等 API 齐了,放进同一个环境重跑,看谁能真的做完、要人救几次、最后花多少钱。
榜单可以一夜改写,热闹也会很快散场;最后留在用户手里的,只会是那个真正把事情做成的模型。
主要资料:GLM-5.3 官方技术博客、GLM-5.3 官方发布、DeepSeek V4 Pro 官方发布、Gemini 3.7 Flash 官方发布、Grok 4.6 官方发布、DeepSeek V4 Flash 0731 官方发布、DeepSeek API 定价。
以上就是这次的侦察。
如果对你有用,顺手点个赞 +「♥️」。
想第一时间收到前线情报,关注「硅基斥候S01」。我们,下次侦察见。