AI评测网站Artificial Analysis最近把首页标题写成"Qwen3.8 Max现居Agentic Index综合最佳",听起来像是一条硬新闻。但把网页正文翻到底,能看到的只是一份日常更新日志:8月5日新增了几个模型评测条目,Qwen3.8 Max和Ling-3.0-flash、Muse Spark 1.2排在一起,没有配分数表,没有排名对照,也没有说明这个结论是怎么算出来的。
这就是问题所在。标题给了一个确定性很强的判断,正文却拿不出任何能验证这个判断的东西。查了一圈阿里巴巴和Qwen官方的产品线,也没找到叫"Qwen3.8 Max"的正式模型——闭源旗舰目前的官方名字是Qwen3-Max,只通过阿里云Model Studio的API提供,没有可下载的模型卡。开源系列另有Qwen3-235B-A22B、Qwen3-30B-A3B、Qwen3-32B这几档,跟闭源Max完全是两条线。"3.8"这个版本号,目前对不上任何官方公告。
一个查不到的名字
命名对不上号,可能是网站抓取时的笔误,也可能是评测机构给内测版本临时起的代号,甚至可能是转述链条里自己生出来的名字。三种情况里没有一种能支撑"全球最佳模型"这个结论——如果连模型叫什么都没说清楚,谈何登顶。
在没有阿里官方确认之前,比较审慎的说法是:这条"登顶"新闻目前只有一个私有榜单页面在说,模型身份本身存疑。
榜首换得比榜单版本号还快
更有意思的是时间线。这同一个页面上还挂着一篇7月24日的旧文章,标题是"Claude Opus 5: the new leader in agentic knowledge work"——也就是说,如果8月5日的Qwen3.8 Max条目成立,这个榜单的agentic榜首在不到两周内换了人。
Artificial Analysis自己的Intelligence Index也在频繁迭代:当前是v4.1.1,7月30日刚刚更新过Cost per Task的计算方法,官方说明写着"会导致成本估算小幅上升,但对相对排名影响不大"。方法论都在改,排名自然会跟着抖。
- 风险.中间没有公开任何具体分数或对比表,"易位"本身只能靠网站自述,无法独立核实。
私有指标不是行业公论
Artificial Analysis的Agentic Index,测的是工具调用、规划、自主性这类能力,方法上参考了GDPval、τ³-Banking、Terminal-Bench之类任务组合。但这只是它自己设计的一套私有指标。行业里另外还有SWE-bench、GAIA、WebArena、OSWorld,各家选的任务集完全不同,谁登顶谁垫底,换一套基准就可能反过来。
独立评测社区目前的普遍判断,仍然是Claude和GPT系列在自主编码、长程agentic任务上处在第一梯队,Qwen更常被归为"性价比选项"而不是公认的榜首挑战者。这跟"Qwen3.8 Max综合最佳"的说法之间,有一段没解释的落差。
一个私有榜单的"第一名",不等于行业的"第一名"
该怎么看这类"登顶"新闻
对企业选型的人来说,这条新闻的实际参考价值不高——名字对不上、分数没公开、结论只有一家在说。真正要盯的,是三件事:阿里巴巴或Qwen团队是否出来确认或澄清这个名字;Artificial Analysis是否补发具体分数和任务明细;SWE-bench、GAIA这类独立榜单是否给出印证。
- 建议.看到"某模型登顶"类新闻,先查官方命名对不对,再看有没有分数表,最后看是不是只有一家机构在说。
三条都没满足之前,"全球最强"这个说法,暂且只能挂在问号后面。
