Cactus Compute这周放出了Needle 2,一个45M参数、单文件14MB的开源模型,专门干一件事:把人说的话翻译成设备能执行的函数调用。官方通稿里最抓耳朵的一句话是,这个体积只有对手几十分之一的小模型,跟FunctionGemma、LFM2.5、Apple FM“trades wins”——翻译过来就是互有胜负。听起来很励志。但把Cactus自己发布的完整基准表摊开看一遍,故事没那么齐平。
发生了什么
Needle 2的卖点很集中:
- 体积.14MB单文件,会话内存峰值约28MB,靠自研CQ2-bit量化把权重压到2比特
- 架构.Simple Attention Network,把大量“世界知识”挪进哈希n-gram表,靠查表而不是矩阵乘法读取,官方测算每token约70 MFLOPs,比LFM2.5-230M的460、FunctionGemma-270M的540低了一个量级
- 训练量.预训练+后训练共约1530亿token,是LFM2.5-230M那19万亿token的约1/120,官方自己在原文里主动摆出这个对比
- 落地.可穿戴戒指Pebble Index 01已经在用它做离线语音指令,官方称目标是Pi 5解码500 tok/s、可塞进ESP32-S3一类微控制器
体积和算力这两项,数字是实打实的,也是这类“工具调用专用小模型”赛道存在的原因:全球联网设备里,真正跑在GPU/NPU上的PC只占一小部分,大头是几十亿台两百美元以下的手机、Raspberry Pi、微控制器和智能家居设备。Needle瞄的就是这块“便宜边缘”。
基准表说了什么
问题出在“trades wins”这句话本身。Cactus公开的五个基准里,真正拿得出手对比的是Mobile Actions、BFCL v4、Seal-Tools域外测试三项,结果并不是各赢一半。
Mobile Actions上,Needle 2整体准确率63.7%,不如LFM2.5-230M的69.1%,也没超过FunctionGemma-270M的64.0%——但工具名识别准确率98.3%是全场最高。BFCL v4上更明显,Needle 2只有42.6%,被Apple FM的61.7%和LFM2.5的60.8%甩开一截。真正拿到领先的是Seal-Tools域外测试:面对训练时没见过的工具schema,Needle 2以28.7%领先LFM2.5的17.0%。
三项加总,这不是“互有胜负”,是赢在两个窄指标(工具名识别、陌生schema泛化),输在两个综合场景。通稿的措辞把窄胜写成了均势。
精度不对等,官方自己也承认
更该注意的是比较方法本身。Needle 2跑的是2-bit量化版本,对手LFM2.5和FunctionGemma跑的是未量化的f16版本——Cactus的原文里明确写了这个skew对基线有利,理应让Needle 2看起来更差,而不是更好。换句话说,即便在精度劣势下,Needle 2还是在两个综合测试里输了,这个结论比表面数字更扎实一点,也说明“互有胜负”这个说法确实经不起细看。
硬件承诺:没人复现,创始人自己先松了口
体积和算力效率之外,最容易让人心动的其实是那两句硬件承诺:Raspberry Pi 5上500 tok/s解码,能装进ESP32-S3。目前能查到的,只有官方在Reddit上的公告,没有测试用的RAM版本、散热、线程数这些条件,也没有第三方复现。第三方Rust/WASM运行时项目needle-rs公开了x86-64、AArch64、WASM32上的实现细节,但同样没有Pi 5或ESP32-S3的独立跑分。
创始人本人在Reddit上说过一句实话:Needle 2“对ESP32来说还是稍微大了一点”(a tiny bit too big for ESP32s)。这和官方产品页“支持ESP32-S3等新款微控制器”的说法直接对不上。GitHub上还有一条开放三个月的issue(#33),有开发者在Jetson Thor上用旧版INT4路径实测,prefill约1200 tok/s,但decode只有100–140 tok/s,公开要求Cactus给出可复现的具体硬件、commit和后端信息,至今没人回应。
- 风险.核心速度和适配承诺缺乏独立复现,创始人非官方表态与官方宣传矛盾,这类落差如果发生在生产环境的可靠性判断上,代价不小。
落到Pebble头上,意味着什么
Pebble把Needle 2用在Index 01戒指里,理由很直接:戒指没屏幕,语音指令必须每次都执行成功,不能靠网络兜底。这种场景要的不是综合准确率最高,而是工具名不能认错——Needle 2在这一项确实是全场第一。这也是为什么Needle 2的真实卡位不在“谁的模型更聪明”,而在“谁能在几十MB内存里把工具认对”。
但如果换一个能联网、能微调的场景,这套优势就没那么稳。Google官方数据显示,FunctionGemma在自家Mobile Actions评测上,基础版58%,微调后能冲到85%,远超Needle 2零样本的63.7%。愿意花时间微调的团队,270M级别的模型在准确率上仍有明显余地。Needle 2的护城河更像是体积、内存和离线场景的极限值,不是准确率竞赛的胜者。
古人讲“尺有所短,寸有所长”,用在这里刚好:14MB的模型认得出工具名,认不全综合任务;19万亿token喂大的模型认得全场景,却塞不进一枚戒指。两边各有各的活法,只是通稿只肯说自己长的那一寸。
