一个叫 Deltafin 的开源项目最近做成了一件听起来不太现实的事:参数规模达到 2.8万亿(2.8T)的 MoE 大模型 Kimi K3,被搬到了一台内存只有 64GB 的 M1 Max Mac 上跑了起来。Kimi K3 完整权重约 1.56TB,比这台笔记本的内存大出二十几倍,Deltafin 没有让模型整体常驻内存,而是靠磁盘缓存和按需从 Hugging Face 拉取专家权重的方式,把"装不下"这个问题绕了过去。
这个结果说明,超大规模 MoE 模型本地推理的门槛,并不完全等于"内存必须大于模型体积"——只要愿意用磁盘和网络延迟换空间,普通消费级硬件也能把 2.8T 参数的模型跑起来。但代价同样清楚:官方给出的最好成绩是每个 token 生成要等 15秒左右,一次完整聊天回复往往要等上几分钟到更久,加上只支持贪心解码、单请求运行等限制,这更像一次验证可行性的工程实验,还谈不上能替代云端 API 的生产方案。
模型怎么"塞"进一台Mac
Kimi K3 是 MoE(混合专家)架构,理论参数 2.8T,但每生成一个 token 只会激活其中一小部分。Deltafin 正是利用这一点,把模型拆成两块处理:一块是常驻的"骨架"(attention、共享专家、embedding 等),约114GB,量化成int8后每个token都要从磁盘重新读一遍;另一块是 82,432个路由专家,总共约1.45TB,每个token的路由器只会从中挑出16个专家、跨92层,加起来大约 25.8GB 数据需要临时读取——不管是从本地磁盘还是通过HTTP从Hugging Face现拉。
这也是理解Deltafin最容易被忽略的一点:模型从没有整体装进64GB内存,而是靠"边算边读"撑住的,本质是磁盘和网络承担了内存本该做的事。
安装分两种路数:一次性下载完整权重,之后靠本地磁盘读取;或者先只下一部分,边推理边从云端补齐缺失的专家权重。
| 项目 | 完整安装(--full) | 流式模式(--stream) |
|---|---|---|
| 硬盘占用 | 约1.7TB | 约215GB |
| 下载耗时 | 5-10小时,可断点续传 | 约30分钟 |
| 推理速度(安装页数据) | 约60-76秒/token | 未缓存时3分钟以上/token |
| 推理时是否联网 | 不需要 | 持续需要 |
能跑起来,不等于跑得动。
速度是唯一的门槛,产能撑不起替代云端
Deltafin公布的数字里,速度差距是最扎眼的部分。完整安装、专家权重全在本地磁盘时,解码速度大约15秒一个token;一旦专家权重还没缓存到本地、要实时从网络拉取,等待时间会拉长到3分钟以上,慢了十几倍。
值得留意的是,安装说明页给出的"完整安装"速度是每token约60-76秒,和上面这组15秒的测试数据对不上。两者更可能出自不同版本或不同测试口径,读者引用前最好核对一下具体来源,不必默认二者矛盾。
限制条件也不少:目前只支持贪心解码,temperature、top_p参数会被接受但直接忽略;服务端一次只处理一个请求,第二个并发请求会直接收到429错误;给编码智能体这类需要长系统提示词的场景喂任务,光是"读题"阶段就要多等很久,项目自己的原话是"a curiosity, not a workflow"(一个新奇玩法,不是能用的工作流)。
- 风险.完整安装占用近1.7TB硬盘,流式模式响应仍以分钟计,且不支持并发,目前不适合当生产环境的推理后端。
Deltafin确实提供了OpenAI兼容的API服务,改一下base_url就能接进openai SDK或编码助手。但兼容的只是调用格式,不是吞吐、并发和响应速度——这些才是真正决定"能不能用"的东西。
对研究者来说,Deltafin是研究MoE路由行为、验证专家选择机制的一个趁手工具——它会把每次路由选择记录到日志,生成结果也是确定性、可复现的。但对普通开发者而言,如果是想找一个替代云端API的私密推理方案,或者因此考虑专门去买一台大内存Mac,目前的速度和限制还撑不起这个决定。项目作者自己也只在一台M1 Max上测过,M3、M4或128GB机型能快多少,官方原话是"还没人验证过",欢迎外部实测提交issue。
- 结论.Deltafin证明了磁盘缓存能顶替部分内存需求,但把"能运行"读成"可替代云端服务",是眼下最容易踩的坑。
