一张消费级显卡装不下405B参数的模型,这是常识。Petals给出的绕开方法很直接:你不用装完整模型,只装一部分,剩下的层交给网络里陌生人的显卡接力算完。

官网给出的速度是Llama 2 70B单批推理下最高6 tokens/s,Falcon 180B最高4 tokens/s。这两个数字来自旧模型,不是Llama 3.1 405B的实测——想拿这套系统跑最新最大的模型,速度目前没人给出保证。

模型怎么被拆开

Petals的做法像BitTorrent,但共享的不是文件,是协同推理。

你的机器加载模型的一部分层。请求发出后,流经网络里其他人加载的其余部分,拼出一次完整的前向计算,再把结果传回来。

没有人本地拥有完整模型。大家分摊的是算力,不是文件——这一点和传统P2P下载完全不是一回事,不能简单类比成“下载大模型”。

目前支持的模型量级不小:

  • Llama 3.1,最高405B
  • Mixtral 8x22B
  • Falcon 40B以上
  • BLOOM 176B

这四个名字放一起,基本覆盖了开源社区里参数量最夸张的几个选择。

模型怎么被拆开跑起来 你的显卡 加载部分模型层 网络其他节点 接力剩余层 输出文本 拼出完整前向计算 共享的是算力,不是文件——所以不同于传统P2P下载

封闭API卖确定性,Petals卖控制权

两条路线要解决的不是同一个问题,放在一起比价没有意义。下面这张表说明差在哪:

维度封闭商用APIPetals
速度和可用性固定延迟,厂商给SLA依赖陌生节点,官网未给出405B的实测数据
数据流向请求只经过你和厂商两方隐藏状态开放,推理过程流经多个陌生节点
控制权黑箱调用,改不了执行路径能改采样方法、改执行路径,能微调,能看隐藏状态
适合场景需要稳定服务的产品和企业缺显存、想碰模型内部结构的研究和实验

材料里也没有给出节点规模、成本、恶意节点应对机制的数据。这不是厂商藏着掖着,是这类去中心化项目本身还没走到能拿SLA说话的阶段。

研究者该怎么用,谁该先观望

对缺整机显存、又想碰400B级模型内部结构的研究者和开发者,Petals现在能干的事很具体:改采样方法、改执行路径、看隐藏状态、拿去做小规模微调实验。这些操作在封闭API上做不到。

拿它跑教学实验、跑论文复现、跑不涉及敏感数据的原型验证,是合适的用法。

如果任务涉及用户隐私数据、商业机密,或者产品需要固定延迟和可用性承诺,现在还不该指望Petals——隐藏状态开放意味着推理过程要经过陌生机器。

关注去中心化算力和开源AI基础设施的读者,可以把Petals当一个观察窗口。它证明协同推理这条路走得通,但走得稳不稳,要看后续有没有人拿出节点数量、延迟曲线、恶意节点应对机制的真实数据——这些现在都还没有。

孟子说“众人拾柴火焰高”,但柴火潮湿,火也旺不到哪去。Petals省下的是显卡钱,搭进去的是别人给的不确定性,这笔账现在还没算完。