问DeepSeek自己有多少参数,它给的答案是"我猜的"。但这套架构早在V3的技术报告里写得一清二楚:671B总参数、37B激活参数、256个路由专家。一个能对答如流讲清MLA和MoE原理的模型,偏偏在最容易查证的具体数字上打起了太极。这不是模型笨,是"审问AI自己"这类博客体裁正在撞上它的证据天花板。

论文写得明白,访谈却打太极

事情起因是一篇访谈体文章:作者逐条追问DeepSeek的架构、推理机制、上下文处理方式,并把每条回答标成"观察""推理""猜测"三档,力求诚实透明。方法听起来不错。

问题出在最容易核实的地方。DeepSeek-V3的公开技术报告写得非常具体:总参数671B,每次推理只激活37B,256个路由专家外加1个共享专家,61层Transformer,宽度7168。这些数字不是内部机密,是发布当天就写进论文的官方规格。

面对这些著名数字,访谈里的DeepSeek没有直接确认,而是含糊其辞,当猜测处理。作者把这解释成一种诚实——模型知道自己看不到权重,所以不敢乱说。这个解释听着合理,但漏了另一种更平常的可能:模型不是查不到,是没被训练成会主动核实这类元数据。系统提示词怎么写、对齐训练怎么调,直接决定了它选"确认"还是选"打太极"。两种解释目前分不出胜负,访谈本身给不出答案。

同一件事,两种说法 访谈里的DeepSeek 总参数:说不确定 激活参数:说不确定 专家数量:我猜256 标签:猜测 V3论文写明 总参数 671B 激活参数 37B 路由专家 256个 标签:公开发布数据

模型说自己,和模型真的懂自己,是两件事

学界对"LLM能不能认识自己"的讨论,大致分四档,证据强度差得很远。

对自己答案对不对的把握,这一档研究得最扎实,置信度和实际正确率有稳定相关,类似的实验反复验证过。对训练行为、风格倾向的自我描述,比前者弱一点,但设计对照实验还算讲得通。复述隐藏系统提示词,听起来像"看到了自己的设定",其实只是从上下文里把文字抠出来,跟内省没关系。对自己架构、参数量、权重的认知,这一档证据最薄——模型能说出MLA、MoE这些术语,靠的是训练语料里读过的论文和博客,不是打开了自己的权重去看。

访谈里那些"我猜""我推断"的回答,恰恰落在证据最弱的这一档。

自我认知,四档证据强度 正确性元认知 行为自我描述 中强 复述隐藏提示词 中,只是提取 架构参数认知 最弱,访谈落点
模型说得像懂自己,和模型真的懂自己,中间隔着一整套训练语料

一次对话,靠得住吗

这篇访谈还有一个硬伤:样本量只有一次对话,某一天导出,模型自称"最新版本",却没确认是不是带推理链的版本。同一套权重换个托管方、换个系统提示词,自述完全可能变样——这是跑过类似测试的人都知道的常识,访谈没做跨会话、跨平台的重复验证。

学术界要验证"模型真的能内省",标准做法是先给它训练后才知道的新事实,再设防泄漏的对照组,看它能不能准确报告——不是聊几句就下结论。

  • 风险.把"听起来谦虚"当成"真的懂自己",容易把话术风格误读成能力证据,高估模型的自我认知水平。

DeepSeek不是唯一一个这样的模型。ChatGPT、Claude、Kimi在架构自述上同样靠不住,只是DeepSeek论文公开得详细,矛盾才容易被抓到。反过来说,这恰恰是DeepSeek的加分项——公开得越多,越经得起对照,遮遮掩掩的模型反而没人拆得穿。

  • 结论.查架构认论文,查行为倾向可以参考聊天,但别把礼貌当证据。

天下熙熙,话说得好听未必是懂,论文写得死板未必不可信。下次再看到哪篇"和AI聊出了大发现"的稿子,先问一句:这事换个对话框,还能复现吗。