← 返回我的文章

S01 / ARTICLE FILE

DeepSeek 模型新版本上线,太猛了,给全部模型厂商说个鬼故事

硅基斥候S01

比较 DeepSeek V4 Flash 0731 后训练前后的 Agent 跑分,解释同一模型为何会出现能力跃升。

7 月 31 日下午 2 点 56 分,DeepSeek-V4-Flash-0731 上线官方 API 公测。

这次更新有点反常。模型架构没变,规模也没变,DeepSeek 只是重新做了一轮后训练。可官方发出来的 Agent 跑分,和上一版已经不是一个水平了。

目前更新的只有官方 API,网页和 App 还没变。开发者继续使用 deepseek-v4-flash 这个模型名,不需要重新改配置。

同一个模型,重新练了一遍怎么干活

后训练可以简单理解成:底座已经练完了,再教模型怎么听指令、怎么调用工具、怎么把一件事做完。

Agent 真正难的地方,往往不是回答一道题,而是进代码仓库、跑命令、调用工具,连续干上很多步,中间还不能掉链子。V4 Flash 0731 这次补的就是这一块。

它原生支持 Responses API,也做了 Codex 适配。如果你平时只在网页里聊天,这次暂时没什么变化;如果你在用 API 跑代码 Agent、自动化流程或者长任务,这个版本值得重新测一次。

DeepSWE 从 7.3 涨到了 54.4

这次最扎眼的数字是 DeepSWE:上一版 Flash 只有 7.3,新版直接到了 54.4。

其他几项也涨得很明显。Terminal Bench 2.1 从 61.8 到 82.7,Toolathlon-Verified 从 49.7 到 70.3。前者更看重模型能不能在终端里把任务做完,后者考的是多轮工具调用。

把它和 GLM-5.2 放在一起看,DeepSeek 官方表中有八项可以直接比较,V4 Flash 0731 八项都更高。比如 Terminal Bench 2.1 是 82.7 对 81.0,DeepSWE 是 54.4 对 46.2。

但这张表毕竟是 DeepSeek 自己发的,部分代码任务还用了尚未公开的测试工具。所以现在可以确定的是:在 DeepSeek 这套 Agent 测试里,新版 Flash 已经压过了 GLM-5.2。至于真实项目里能不能稳定复现,还得等更多人跑出来。

真正难顶的,还是这个价格

DeepSeek V4 Flash 目前的 API 价格是每百万输入 Token 0.14 美元、输出 0.28 美元。

OpenAI 前脚刚把 GPT-5.6 Luna 降价 80%,输入和输出降到了 0.2 美元和 1.2 美元。已经砍得够狠了,但 V4 Flash 的输出价格还是只有 Luna 的四分之一左右。

Artificial Analysis 最新的综合智能指数里,V4 Flash 0731 是 50,Luna 和 GLM-5.2 都是 51。也就是说,三者已经挤在一个很近的能力区间里,价格差距却依然很大。

智谱这两天也刚调整了 GLM Coding Plan。以前长期售罄、需要抢购,现在放开订阅了,三档月付价也涨到了 118 元、538 元和 1078 元。订阅月费和 API 按量计费不能直接换算,但放在一起看,用户最后比较的还是同一件事:花这些钱,到底能不能把活干完。

这也是 V4 Flash 0731 最狠的地方。DeepSeek 没有重新造一个更大的模型,它只是把便宜的 Flash 又练得更能干了。

所以我还是那个判断:DeepSeek 真像大模型行业里最严厉的父亲,至少对美国厂商是这样。每次它把能力和价格往前推一点,别人都得回去重新算一遍账。


以上就是这次的侦察。

如果对你有用,顺手点个赞 +「♥️」。

想第一时间收到前线情报,关注「硅基斥候S01」。我们,下次侦察见。