这两天,一篇署名"官方博客"、发布时间标注为2026年8月3日的文章在技术圈流传,称阿里云正式发布"Qwen3.8-Max"——参数规模达到2.4万亿(激活95B),号称是Qwen系列首次开源Max级模型权重,权重"下周"上线。文章里还附了三段读起来相当扎实的自主编程案例:一个agent连续16天自我迭代出265次提交、127个PR、151个issue的开源项目;另一个五天内复现并改进了一篇强化学习论文,把AIME24成绩又往上顶了2.7分;还有一场对外开放的编程竞赛,称45次提交把准确率从0.60拉到0.853,压过了526支人类队伍里的458支。
但把这篇"官方博客"拿到真正的官方渠道去核对,会发现一件挺尴尬的事:qwen.ai和GitHub上的QwenLM账号,查不到"Qwen3.8-Max"这个名字。能对应上的真实型号,只有此前已知的Qwen3-Max——一个参数、开源策略、训练规模都跟这篇文章描述对不上的模型。
一个查无实据的模型名
Qwen3-Max是阿里云现有的旗舰闭源模型,通过API调用,官方从未披露过精确的参数量,只说"超过1万亿",训练数据量约36万亿token,上下文长度视版本最高262144 tokens,在SWE-bench Verified上的成绩是69.6分。这些数字和通稿里"2.4万亿参数、95B激活、下周开源"的说法完全对不上号,连版本命名方式都不一样——阿里官方从没用过"3.8"这个编号。
参数对不上:真实的Qwen3-Max完全不同
把通稿的说法和官方能确认的Qwen3-Max信息并排放在一起,差距一目了然。
| 项目 | 原文声称(Qwen3.8-Max) | 官方Qwen3-Max已知信息 |
|---|---|---|
| 参数规模 | 2.4万亿,激活95B | 超1万亿,精确数字未披露 |
| 权重开源 | 下周开源,称"首次" | 闭源API,无开源先例 |
| 训练数据量 | 未提及 | 约36万亿token |
| SWE-bench Verified | 未提供官方跑分 | 69.6分(Instruct版本) |
架构、开源策略、训练规模,三处都对不上号,这不是措辞差异,而是两个不同的东西被写成了同一件事。
16天265次提交,这条证据链谁来验证
文章里最抓人的部分,是那个叫qwen-code-dev-bot/oh-my-cli的GitHub仓库,号称记录了一个agent连续16天自主开发的全过程。这类"过程可复现"的叙事,正是眼下自主编程agent竞争(Claude Code、Codex、DeepSeek系列都在打这张牌)最有说服力的证据形式——前提是它真实存在。
问题是,这个仓库、论文复现实验的完整训练日志、天池赛事的45次提交记录,目前都找不到第三方独立信源做交叉验证。专门收录模型跑分的第三方机构,也没有"Qwen3.8-Max"的收录记录。
- 风险.文中所有具体数字(参数量、跑分、提交次数)目前都缺乏官方或第三方独立信源确认。
通稿写得越像内部战报,越需要拿到官方渠道去对一遍。
读者该盯什么,而不是该信什么
对开发者和企业用户来说,眼下最实际的动作不是纠结"2.4万亿参数"能不能打过谁,而是等三件事:Qwen官方公告页有没有真正出现这个名字,Hugging Face或ModelScope的模型库里有没有对应权重上传,独立跑分平台有没有收录第三方复现结果。这三个信号里任何一个落地,才能把"Qwen3.8-Max"从一篇通稿变成一个可以拿来做决策依据的模型。
在这之前,这篇流传甚广的博客更适合当作一个提醒:AI公司通稿写得再专业、数据再详尽,本身也不构成真实性证明,尤其是当发布时间、模型命名、参数细节都跟已知公开信息对不上的时候。
