一张消费级显卡装不下405B参数的模型,这是常识。Petals给出的绕开方法很直接:你不用装完整模型,只装一部分,剩下的层交给网络里陌生人的显卡接力算完。
官网给出的速度是Llama 2 70B单批推理下最高6 tokens/s,Falcon 180B最高4 tokens/s。这两个数字来自旧模型,不是Llama 3.1 405B的实测——想拿这套系统跑最新最大的模型,速度目前没人给出保证。
模型怎么被拆开
Petals的做法像BitTorrent,但共享的不是文件,是协同推理。
你的机器加载模型的一部分层。请求发出后,流经网络里其他人加载的其余部分,拼出一次完整的前向计算,再把结果传回来。
没有人本地拥有完整模型。大家分摊的是算力,不是文件——这一点和传统P2P下载完全不是一回事,不能简单类比成“下载大模型”。
目前支持的模型量级不小:
- Llama 3.1,最高405B
- Mixtral 8x22B
- Falcon 40B以上
- BLOOM 176B
这四个名字放一起,基本覆盖了开源社区里参数量最夸张的几个选择。
封闭API卖确定性,Petals卖控制权
两条路线要解决的不是同一个问题,放在一起比价没有意义。下面这张表说明差在哪:
| 维度 | 封闭商用API | Petals |
|---|---|---|
| 速度和可用性 | 固定延迟,厂商给SLA | 依赖陌生节点,官网未给出405B的实测数据 |
| 数据流向 | 请求只经过你和厂商两方 | 隐藏状态开放,推理过程流经多个陌生节点 |
| 控制权 | 黑箱调用,改不了执行路径 | 能改采样方法、改执行路径,能微调,能看隐藏状态 |
| 适合场景 | 需要稳定服务的产品和企业 | 缺显存、想碰模型内部结构的研究和实验 |
材料里也没有给出节点规模、成本、恶意节点应对机制的数据。这不是厂商藏着掖着,是这类去中心化项目本身还没走到能拿SLA说话的阶段。
研究者该怎么用,谁该先观望
对缺整机显存、又想碰400B级模型内部结构的研究者和开发者,Petals现在能干的事很具体:改采样方法、改执行路径、看隐藏状态、拿去做小规模微调实验。这些操作在封闭API上做不到。
拿它跑教学实验、跑论文复现、跑不涉及敏感数据的原型验证,是合适的用法。
如果任务涉及用户隐私数据、商业机密,或者产品需要固定延迟和可用性承诺,现在还不该指望Petals——隐藏状态开放意味着推理过程要经过陌生机器。
关注去中心化算力和开源AI基础设施的读者,可以把Petals当一个观察窗口。它证明协同推理这条路走得通,但走得稳不稳,要看后续有没有人拿出节点数量、延迟曲线、恶意节点应对机制的真实数据——这些现在都还没有。
孟子说“众人拾柴火焰高”,但柴火潮湿,火也旺不到哪去。Petals省下的是显卡钱,搭进去的是别人给的不确定性,这笔账现在还没算完。
