一台笔记本电脑,跑通一个2.8万亿参数的大模型,速度稳定在每秒1个token——这句话贴在朋友圈,大概会被当成又一条"AI又炸场了"的转发素材。但翻开这份GitHub仓库,细看它给出的数字,你会发现更值得琢磨的不是"能不能跑动",而是:文中说的这个模型,和这块芯片,好像都查不到。

数字给得很细,细到不像民间项目

仓库叫argonautlabsai/deltafin,fork自另一个项目gavamedia/deltafin,自称做的是"ARGODRIVE"存储优化。核心卖点很清楚:Kimi K3,2.8万亿参数的MoE模型,16个专家权重"一个不裁剪、一个不跳过",总共1.45TB,靠四块SSD流式加载,跑在一台M5 Max、128GB内存的MacBook Pro上。

给出的跑分精确到小数点后四位:512-token稳定解码1.00 tok/s,128-token时1.13 tok/s,某个历史issue里用过的17-token提示词跑出0.9631 tok/s,还特意标注"上游同一提示词只报告过0.684"。

这种精确度本身就是一种说服力——普通读者很难对着四位小数产生怀疑。

一份自称"诚实"的报告,还主动交代了短板:512-token提示词首个token要等约376秒,原因被定位为prefill阶段每层专家权重被重复读取了8次,修复方案"已规划、未实现"。SSD数量的扩展性实验也给了曲线:一块盘只有四盘速度的52%,两块73%,三块90%——瓶颈是每层16次读取里最慢的那一次,不是总带宽。这套解释逻辑自洽,读起来很像一份认真做过的工程笔记。

问题是,"Kimi K3"是什么

翻查公开资料,Moonshot AI这边能确认的最新一代模型是K2系列,没有查到官方发布或预告过叫"Kimi K3"的东西。苹果这边同理,目前能确认的最新芯片系列是M4,"M5 Max"这个型号在公开产品线里也找不到对应信源。

再看仓库自己留下的时间戳:所有基准测试和更新记录,标注的日期全部落在2026年——一个还没到来的时间点。模型名字查无此物,芯片型号查无此物,测试日期集体指向未来,三件事叠在一起,已经不是"细节记错了"能解释的巧合。

如果这三个基础实体都无法核实,那么1.00 tok/s、376秒、52%/73%/90%这些具体数字,也就跟着失去了被验证的地基。它们看起来是测试结果,但眼下更准确的说法是:这是一份自称的测试结果。

精确的细节,骗过的是核实的直觉

这类内容为什么容易在极客社区里传开,倒不难理解。项目通篇强调的是一种"纯粹主义"立场——16个专家全保留、不做低比特量化,还顺手踩了一脚同类项目"把权重压到3bit、质量代价没人测过"。这套价值观正好对上本地大模型爱好者的胃口:比起谁跑得快,他们更认同谁"没作弊"。价值观先站对了队,数字对不对,很容易就被放在了第二位。

细节堆砌得越像论文,越该多问一句:这模型,真的存在吗
  • 风险.如果读者把这类未经证实的跑分当作硬件采购或技术路线的参考依据,很容易在错误的地基上做出真实的决策。
  • 提醒.遇到这类"极客向"benchmark,先查三件事——模型有没有官方发布记录,硬件型号是否出现在厂商产品线,仓库的真实提交时间是否和标注日期一致。

Moonshot AI如果关心自己的产品线不被混用命名,这类内容值得留意;硬件圈观察者也可以顺手核实一下"M5 Max"到底存不存在。但对普通读者来说,更现实的收获是一条经验:小数点后四位不是真实的证明,一个能被独立复现的结果才是。这份仓库目前给不出后者。