一份公开在GitHub Gist上的实验流出后,「Qwen抄了GPT」的说法开始在开发者社区流传。触发点是一个数字:开源模型Qwen3.8-2.4T-A95B在被喂入GPT-5.5 Pro的一小段推理轨迹后,回答与GPT-5.5 Pro的重叠度从16.79%跳到34.97%,涨了18.18个百分点。同批测试里,DeepSeek V4 Flash反而下降,Kimi K3只涨了不到5个点。实验作者据此推测,Qwen可能在训练时"学习"过GPT-5.5 Pro的推理风格。这个判断听起来像抓到了实锤,但把时间线摆出来看,证据链本身先出了漏洞。

一次"AI亲子鉴定":18个点从哪来

开发者wsxiaoys做的是一种叫"reasoning prefill"的溯源测试:把教师模型(这里是GPT-5.5 Pro)推理过程的前1%,硬塞进目标模型的思考通道里,再看目标模型接下来生成的答案,跟教师模型的可见答案在词汇层面重叠多少。重叠度用unigram、bigram、trigram三种召回率取平均,数值越高,说明目标模型越容易被这一小段"提示"带偏,风格上越靠近教师模型。

45道题里,15道STEM、15道非STEM、15道私有合成谜题。Qwen3.8-2.4T-A95B是唯一发生剧烈位移的模型,STEM题的涨幅甚至到26.99个百分点。作者此前用Anthropic的Opus 4.8做过同一套实验,Qwen当时几乎没反应。这次换成GPT-5.5 Pro当教师,数字突然炸开,容易让人怀疑Qwen的训练语料本来就带着GPT的味道。

四模型见到GPT-5.5 Pro Prefill后的位移 DeepSeek V4 Flash -1.17pp Inkling +0.46pp Kimi K3 +4.54pp Qwen3.8 A95B +18.18pp 单位:GPT-5.5 Pro prefill前后的重叠度变化(百分点)

一篇论文,两天,推翻整条证据链

问题出在时间线。Qwen3.8是2026年8月12日正式开源的,2.4T总参数、约95B激活参数,默认强制开启思考模式。GPT-5.5 Pro是同年4月23日发布、次日开放API的,官方说明它并非独立新架构,只是GPT-5.5加了并行测试时算力的配置版本。理论上,4月发布的GPT-5.5 Pro和8月才训练完成的Qwen3.8互相独立,谁抄谁都说得过去——除非中间出现了第三个变量。

变量恰好卡在那两天里。一篇名为《Stolen Thoughts》的论文8月10日公开,曝光并泄露了一批GPT模型的推理轨迹样本。这个日期比Qwen3.8的开源发布只早了两天。如果Qwen3.8的训练数据截止点晚于8月10日,它完全有可能在后训练阶段"看过"这些被公开泄露的GPT推理文本——不是学会了GPT的推理风格,而是记住了具体的字词序列。重叠度暴涨,可能只是记忆效应,跟"蒸馏"是两件不同的事。原作者的措辞是"可能学习自",这个说法把两种截然不同的解释含糊地并在了一起。

污染时间线:两天之差 GPT-5.5 Pro发布 4月23日 《Stolen Thoughts》泄露推理轨迹 8月10日 Qwen3.8开源 8月12日 间隔仅2天

同一个实验,换了口径,数字先变了一次

比污染时间线更值得留意的是,这个headline数字自己就不稳定。查这份Gist的修订历史,更早的版本里,Qwen3.8的重叠度涨幅报告的是+20.58个百分点(从33.92%到54.50%),用的指标是纯unigram召回率。现在流传的版本把指标换成了unigram/bigram/trigram三者均值,结果变成了+18.18个百分点。同一场实验,换了一次口径,数字就换了一次——这在任何严肃评测里都该单独标注解释,但读者如果不去翻修订记录,根本不会知道自己引用的"18.18"曾经是"20.58"。

实验本身也留了不少缺口。45道题的样本量偏小,尤其那15道私有合成谜题外部完全无法核实;数据集、GPT-5.5 Pro的prefill原文、目标模型的推理输出、召回率计算代码,都没有公开,第三方拿不到任何东西去复现。HN讨论区还提出一个混杂因素:Qwen的推理风格会随系统提示词、代码执行框架、聊天界面模板变化,这些工程差异本身就能拉高或拉低词汇重叠度,跟训练数据来源没有必然关系。

  • 风险.目前公开的证据只够支持"Qwen对GPT-5.5 Pro风格更敏感"这一观察,不足以证明蒸馏或抄袭。

差异化反应是线索,不是判决书

四个模型面对同一段GPT prefill的反应完全不同——DeepSeek V4 Flash下降,Inkling几乎不动,Kimi K3小涨,Qwen大涨。如果只是随机噪音,四个模型的方向应该更接近。这种分化说明不同开源模型的训练路径存在系统性差异,谁离GPT系风格更近、谁离Opus系风格更近,大概率跟各家实际用过的合成数据来源有关。Qwen官方的Qwen3代技术报告承认过对小尺寸变体用过"strong-to-weak"蒸馏,但没有一份Qwen3.8专属报告能证实旗舰版A95B本身是不是蒸馏产物。

一个还没排除污染变量的实验,撑不起一句"学习自GPT"的判决。

要把这件事坐实,需要一次干净的对照:用教师模型现场生成、从未公开过的全新推理轨迹做prefill,统一系统提示词和运行框架,同时测试多个教师模型交叉验证,再把per-question结果和代码全部开源给别人复现。在那之前,阿里官方大概不会为一个未经证实的指控专门发声,企业用户若在意训练数据合规,该做的也不是等一份Gist给出结论,而是盯紧Qwen后续会不会补一份Qwen3.8的技术报告。