8 月 3 日上午,阿里 Qwen 正式发布 Qwen3.8-Max。
这次最醒目的数字是 2.4T 参数,但真正值得注意的消息其实有三条:这是 Qwen 第一次准备开放 Max 级模型的权重;模型已经进入 Qwen Chat 和 API;官方还把一段持续 16 天的自主编程过程放到了公开 GitHub 仓库里。
不过,权重要到下周才发布。今天能确认的是官方技术资料、API 信息、公开代码轨迹和早期榜单,还不能确认社区部署成本与第三方复现结果。
这次到底发布了什么?
Qwen3.8-Max 基于 Qwen3.5 架构,总参数达到 2.4T,每次推理激活约 95B。后一个数字很重要,它意味着这不是每次都让 2.4T 参数全部参与计算。
模型支持 100 万 Token 上下文,API 最多可输出 131,072 Token。目前它已经可以通过 Qwen Chat 和 Qwen Cloud 使用,并兼容 OpenAI 与 Anthropic 两套常见接口协议。
API 定价也同步公布:输入每百万 Token 2 美元,输出 6 美元,隐式缓存 0.25 美元。Qwen 同时宣布,下周将开放 Qwen3.8-Max 和 Qwen3.8-27B 的权重,但具体日期、许可证与本地部署要求还没有公开。

Qwen 官方发布视频画面:模型被设定为连续进行芯片设计。来源:Qwen 官方 X 账号
跑分很强,但不是“全项第一”
官方博客放出了两张很长的语言和视觉能力表。只挑几个有代表性的项目看,结论其实比“全面领先”更具体。

Qwen3.8-Max 官方 LM Performance 完整跑分表。来源:Qwen 官方 X 账号;图中结果以官方自测为主。
| 测试项目 | Qwen3.8-Max | 表中更高或最接近的成绩 |
|---|---|---|
| Terminal-Bench 2.1 | 86.6 | GPT-5.6 Sol:88.8 |
| SWE-bench Pro | 67.7 | Claude Fable 5:80.0 |
| PaperBench | 93.0 | GPT-5.6 Sol:90.5 |
| CoWorkBench | 74.8 | Claude Fable 5:75.9 |
| OSWorld-Verified | 86.1 | Claude Fable 5:85.0 |
| WebArena | 66.8 | Claude Fable 5:71.3 |

Qwen3.8-Max 官方 VL Performance 完整跑分表。来源:Qwen 官方 X 账号;部分项目使用内部基准或特定评测设置。
它在 PaperBench、OSWorld 等项目上领先,但在 SWE-bench Pro、Terminal-Bench、WebArena 和 Humanity's Last Exam 等项目上仍落后于部分对手。更准确的说法是:Qwen3.8-Max 已经进入旗舰模型第一梯队,但官方表格本身也不支持“每一项都第一”。
这些数字还要再加一层脚注。博客中的不少对手成绩由 Qwen 团队自行复测,部分视觉测试来自内部基准,个别数据集还人工修订了标准答案。不同项目使用的工具、搜索、记忆和裁判模型也不完全相同,所以它们适合判断能力方向,不适合被压缩成一个绝对排名。
官方另外给出了 Arena 链接。8 月 1 日的 Text Arena 页面中,Alibaba 在 Lab 维度暂列第 2,Qwen3.8-Max 得分为 1496±10、模型总榜第 5。但页面仍标注 Preliminary,名次区间也比较宽,这仍是早期信号,不是稳定结论。
“连续自主编程 16 天”,公开仓库比宣传片更值得看
Qwen 这次反复强调的不是一次答题,而是让模型持续工作十几天。
最具体的案例是 oh-my-cli:一个由 Qwen Code 构建的自主代码 Agent。官方发布材料记录了 265 次提交和 127 个 PR。我在 8 月 3 日上午再次查看时,GitHub 分页信息已经显示约 424 次提交和 208 个 PR,说明它在官方统计截点后仍在运行。抽查最近 100 次提交,作者均显示为 qwen-code-dev-bot。
这比剪辑好的演示视频更有价值,因为提交、分支和 PR 都能被外部检查。
但“没有人类帮助”也需要说清边界。仓库的自治规则明确保护工作流、CODEOWNERS 和自治配置,关键治理变更仍由独立维护者批准和合并。换句话说,产品代码循环可以高度自治,项目治理并没有消失。
公开仓库证明了模型可以长时间沿着一套规则持续推进任务,却还不能单独证明代码已经达到生产级质量,也没有回答完成这些任务消耗了多少 Token 和算力。

Qwen 官方发布视频画面:模型在用户运动期间持续核对财务数据。来源:Qwen 官方 X 账号
评论区最兴奋的是 27B 和价格,真正的问题还在后面
发布后的首轮评论里,最集中的兴奋点并不是 2.4T,而是“27B 也开放”和 API 价格。也有人马上追问更小的 MoE 版本、每秒输出速度、Token 效率,以及这些跑分是否偏向 Claude Code 风格的任务。
这些问题问到了关键处。2.4T 总参数很适合做发布标题,95B 激活参数、推理吞吐和长任务成本才更接近真实使用体验。对准备接入 API 的团队,2 美元/6 美元的标价很有吸引力;对准备本地部署的人,现在还缺模型权重、许可证、量化方案和硬件要求。
所以,Qwen3.8-Max 今天已经完成了一次信息量很大的发布,但还没有完成最终证明。
更值得持续关注的地方,是它把 Max 级能力、开放权重、长时 Agent 和低价 API 放进了同一个产品里。如果权重下周按计划落地,社区能不能复现这些成绩、实际需要多少机器、连续工作十几天会不会失控,才是下一轮更重要的新闻。
主要资料:Qwen 官方发布帖、官方博客、oh-my-cli GitHub 仓库、Arena Text Leaderboard。