8 月 3 日上午,阿里千问正式发布 Qwen3.8-Max。2.4 万亿参数,激活 950 亿,1M 上下文,原生视觉理解,权重下周开源。
如果只看这几个数字,会觉得这只是 Qwen3.8-Max Preview(7 月 19 日静默上线)的正式版收尾。但真正值得看的,是这两周里阿里补上的另外几件事:7 项基准明确超越 GPT-5.6 Sol、QwenWork 工作平台上线、16 天无人干预自主编程的 demo、以及 Max 级模型首次开放权重。
Preview 验证了能力,正式版补齐了生态。
关键信息
| 维度 | 值 |
|---|---|
| 总参数 / 激活参数 | 2.4T / 95B |
| 架构 | MoE,基于 Qwen 3.5 架构扩展 |
| 上下文 | 1M tokens |
| 多模态 | 原生视觉理解 |
| 开源 | 权重下周开放(Max 级首次) |
| 同期发布 | QwenWork AI 工作平台 |
| 定位 | 千问家族迄今规模最大、能力最强 |
对比 Qwen3.8-Max Preview 7 月 19 日的静默接入,正式版有三处关键升级:一是原生多模态能力补齐(Preview 是纯文本),二是基准成绩全面提升,三是开源承诺落地。在大语言模型赛道上,DeepSeek V4-Flash 正式版 也在同周开放公测。
7 项基准超 GPT-5.6:但要分项看
阿里在发布中明确列出 7 项编程和 Agent 评测超越了 GPT-5.6 Sol 和 Claude Fable 5。几个关键单项:
| 基准 | Qwen3.8-Max | 对比 |
|---|---|---|
| PaperBench(论文理解与复现) | 93.0 | 超越 GPT-5.6 Sol |
| Terminal-Bench 2.1 | 86.6 | 低于 GPT-5.6 Sol 的 88.8 |
| 编程/Agent 综合 | 7 项超越 | — |
这里要拆开看,不能笼统说"Qwen 超过 GPT-5.6"。
PaperBench 93 分是真正亮眼的成绩——这个基准测试的是模型读论文、理解方法、复现实验的能力,是科研型 AI 的核心指标。93 分意味着 Qwen3.8-Max 在科研复现任务上已经到了可用水平。
Terminal-Bench 86.6 vs Sol 的 88.8则是诚实的差距。Terminal-Bench 测的是终端环境下的多步任务执行,OpenAI 在这个方向上仍然领先。阿里没有回避这个差距,这是值得肯定的态度。
7 项超越 ≠ 全面超越。Qwen3.8-Max 的优势集中在编程、办公、长程 Agent,通用对话和极限推理仍有差距。
QwenWork:从模型到产品的关键一步
和 Qwen3.8-Max 同天上线的还有 QwenWork——基于该模型的 AI 工作平台。这标志着阿里从"发布模型"升级到"发布产品"。
QwenWork 的定位不是 ChatGPT 的翻版,而是面向工作场景的 Agent 平台。核心 demo 是:从空文件夹开始,Qwen3.8-Max 独立完成一个完整 Agent 框架的编写,16 天无人干预。
这个 demo 的意义不在于"16 天"这个数字,而在于"无人干预"这四个字。过去 AI 编程的 demo 大多是"人写一段,AI 补一段",或者"AI 写完人 review 一遍"。16 天无人干预意味着模型能自己规划任务、自己调试、自己修复错误、自己推进项目——这是 Agent 能力的真正考验。
当然,demo 终归是 demo。真实工程场景下的复杂度、不确定性、需求变更,比"从空文件夹写一个 Agent 框架"要难得多。但这个 demo 至少证明了 Qwen3.8-Max 在长程任务上的上下文保持和自我纠错能力。
Max 级首次开源:阿里的生态赌注
Qwen3.8-Max 是千问家族首个计划开放权重的 Max 级模型。这件事的战略意义大于技术意义。
过去阿里的开源策略是:Max 级闭源 API 商业化,中小模型开源建生态。这次把 Max 级也开源,是在回应 DeepSeek V4 和 Kimi K3 的开源压力——当竞争对手把旗舰模型开源时,Qwen 如果还守着 Max 不放,生态就会被蚕食。
开源的代价是 API 收入减少,收益是生态话语权。阿里选了后者。
局限:几个要冷静的点
开源时间"下周"不是"现在"。 截至发稿,权重还没放出。阿里的开源历史上有过延迟,建议等权重真正上 Hugging Face 再下结论。
16 天自主编程是受控 demo。 真实工程场景的需求变更、依赖冲突、跨系统兼容,远比"从空文件夹写 Agent 框架"复杂。把这个 demo 等同于"AI 能独立当程序员"是过度解读。
原生多模态的具体能力边界未公开。 阿里说"原生视觉理解",但没给出具体的视觉基准成绩(OCR、图表理解、视频理解等)。在 Gemini 3.5 和 GPT-5.6 都已建立多模态基准的背景下,Qwen 这部分的数据缺失是个疑问。
"7 项超越"的基准选择有偏向性。 任何厂商发布时都会挑自己强的基准说事。Terminal-Bench 落后 Sol 2.2 分这个数据,是第三方挖出来的,不是阿里主动宣传的。看跑分要看全维度,不能只看赢的那几项。
行业影响
国产大模型进入"发布密度"竞赛。 8 月第一周,Qwen3.8-Max、DeepSeek-V4-Flash 正式版、OpenAI Astra 接连发布。这种密度意味着模型迭代周期已经从季度压缩到周。对开发者来说是好事——选择更多、价格更低;对厂商来说是坏事——利润空间被快速压缩。
Agent 能力成为新的竞争维度。 Qwen3.8-Max 的 16 天自主编程、OpenAI Astra 的数学证明、GPT-5.6 Sol 的 Terminal-Bench,都在指向同一个方向:模型能力的衡量标准正在从"答题"转向"干活"。跑分时代没有结束,但 Agent 基准的权重在快速上升。
开源 Max 级会成为新常态。 阿里这次开源 Max 权重,会倒逼其他厂商跟进。DeepSeek 已经在 V4 上做了 Apache 2.0 全开源,Kimi K3 也开源了完整权重。当头部玩家都开源旗舰时,闭源 API 的溢价空间会持续被压缩。
结论
Qwen3.8-Max 正式版本身是一个扎实的迭代——2.4 万亿参数、7 项基准超越 GPT-5.6、Max 级首次开源、QwenWork 平台上线。但它不是"国产 AI 全方位超越 OpenAI"的标志,而是在编程、办公、长程 Agent 三个方向上达到了和 GPT-5.6 Sol 同一梯队,部分单项领先,部分单项仍有差距。
真正值得关注的不是 Qwen3.8-Max 本身,而是它代表的趋势:开源旗舰正在从"追赶闭源"变成"和闭源同周发布",Agent 能力正在从"demo"变成"可用工具",AI 模型的竞争维度正在从"跑分"转向"干活"。
- 千问官网:tongyi.aliyun.com/qianwen
- QwenWork 工作平台:qwenwork.aliyun.com