开源开发者 Sparticle62ops 最近公开了一个名叫 PSSA 的语言模型架构,代码完全用 Rust 从零手写,底层没有 PyTorch 也没有 TensorFlow。在 1.5M 参数量和 12.7M token 的 WikiText-103 语料测试中,PSSA 的训练交叉熵降到 3.98,而同样参数规模的 Transformer 基线只停在 4.43;在同一块 CPU 上生成 200 个 token,PSSA 耗时 226 毫秒,比 Transformer 基线的 2,735 毫秒快了约 12 倍。
这组数字在开源社区引起了相当多的讨论。人们对 Transformer 沉重的自注意力计算早有微词,任何声称在线性复杂度和端侧推理上取得重大突破的新尝试,都很容易被推到聚光灯下。但抛开跑分带来的第一眼冲击,这件事究竟是一场精巧的仿生架构突围,还是一次由特殊实验条件催生的数据偏科?
缝合仿生机制的非典型架构
与近年流行的 Mamba、RWKV 等线性状态空间模型相比,PSSA 的设计要复杂得多。它不仅是一个单纯维护固定状态转移矩阵的线性递推系统,还把脑科学里的几种记忆假说直接做进了前向传播管线中。

PSSA 由四个关键机制串联而成。最底层是一个固定尺寸状态矩阵的状态空间核心,负责单向流动的信息传递;其上挂载了一个拥有 512 个槽位的情景记忆库,检索方式采用了庞加莱双曲空间度量,在单步推理中做 Top-4 受限搜索,允许模型动态读写显式记忆。
更激进的是它的权重可塑性。传统神经网络在推理阶段参数完全冻结,而 PSSA 在前向运行过程中会动态改写自身部分权重,并设立了不应期门控来限制频繁覆写的幅度;在随后的阶段,它利用一个闭式解的岭回归步骤,把这些临时产生的快速更新折叠回底层的转移矩阵中,以此模仿生物大脑在睡眠期间对清醒时经验的巩固。
为了将这个非标准流程榨出极致性能,作者直接用 Rust 实现了整套线性代数运算,既有供 CPU 验证的标量参考实现,也挂了供训练用的 CUDA 路径,并将标量参考梯度的最大差异精度控制在了 2.98e-8 以内。
跑分领先背后的工程疑云
在未见过的 198,939 个 token 独立切片评测中,PSSA 拿下了 3.997 的交叉熵和 24.1% 的预测准确率,全面领先 Transformer 基线的 4.429 与 18.0%。不过,如果把这些指标直接等同于架构代差,很容易产生误判。

玩具尺度的跑分优势,往往源自基线缺失的工程防线而非纯粹理论碾压。
问题的第一个症结出在 12 倍的 CPU 生成加速上。项目文档明确指出,基准 Transformer 在每一步生成时都“重新读取了全部上下文”。这就意味着,作者对照的 Transformer 基线很可能没有配置生产环境标配的 KV Cache 优化。在未缓存前序键值对的情况下,朴素自注意力机制在生成新 token 时的每一步都要重算全部历史,时间复杂度被放大为平方级,以此测出的 12 倍差距在很大程度上是由工程实现的不对称带来的。
| 评测维度 | PSSA 实测值 | Transformer 基线 | 核心变量与现实限制 |
|---|---|---|---|
| 训练集交叉熵 | 3.98 | 4.43 | PSSA 约 2M tokens 达到对方全预算水平 |
| 未见切片准确率 | 24.1% | 18.0% | 验证集规模近 20 万 tokens,未交叉发散 |
| CPU生成200词耗时 | 226 ms | 2,735 ms | 基线或未启用 KV Cache,差距受工程实现影响 |
| 语料生成质量 | 无连贯语义 | 无连贯语义 | 受限于 1.5M 参数量,两模型均处在胡话阶段 |
第二个关键盲点在于极小规模下的泛化断层。1.5M 参数在今天的大语言模型体系里属于绝对的微型玩具,在这个量级下,两者的实际输出都是无法阅读的无序词块,PSSA 会吐出类似“a barget of the Prian Academy”的无意义词串。模型在这个尺度展示出的拟合速度,不能作为数十亿参数规模下语言理解能力的充要凭据。
此外,该项目目前尚未完成关键的消融实验。我们暂时无法得知那 0.45 nats 的损失优势,究竟是由双曲记忆检索提供,还是可塑权重的功劳。一旦将那 512 个记忆槽位剔除,这套系统的基础建模能力是否还能保住优势,至今依然是一个问号。
动态权重自改写的代价与出路
从理论角度看,PSSA 最引人注意的尝试是把突触可塑性引入到序列模型中。学术界很早就在探索无反向传播情况下的快速权重更新,试图解决神经网络持续学习中的灾难性遗忘。但这一方向多年来未能进入主流视野,根本原因在于其极难驯服的数值稳定性。

Mamba 等现代状态空间模型之所以能在大规模训练中保持稳定,核心在于它们严格区隔了隐藏状态与网络权重,参数始终保持确定性。而 PSSA 让模型在推理期根据即时输入不断重写局部权重,虽然配备了不应期门控和岭回归固化,但在缺乏自动微分生态全盘约束的环境里,极易随着上下文语料的多样化而累积漂移误差。
- 风险.在线权重自修改在长跨度、强冲突的跨语料迁移中极易导致状态崩溃,缺乏消融测试与防灾难性遗忘实验是其当前最大隐患。
- 建议.关注嵌入式微型智能体方向的开发者可将其作为离线端侧推理的原型参考,但在基线复现与规模外推明朗前切勿过早押注。
天下熙熙,行业向巨型集群追逐浮点算力的趋势已成定局。PSSA 这种脱离主流深度学习框架、单二进制独立运行的设计,展现了一种可贵的极简工程追求。但在极小尺度下战胜一个实现未尽完善的基准,并不足以宣告自注意力机制的黄昏。它究竟是一套能走通持续学习的仿生新路,还是一座局限在微型参数里的精巧沙雕,还要看它能不能跨过更大参数与严苛消融实验这道坎。
