三星在Hot Chips 2026上讲了一个老故事的新版本:把计算塞进内存颗粒,绕开内存墙。但这次比较特别的是,现场真的甩出了一组实测数据——用Llama 3.1 8B跑推理,吞吐提升3.01倍。这在存内计算这个讲了十几年概念的领域里,算是少见的“有图有真相”。
只是这张图只画了一半。功耗数字,三星一个都没给。
内存里塞计算,这次换了一种玩法
三星这次拿出的是LPDDR5X-PIM,一颗看起来和普通LPDDR5X-9600没什么区别的16GB内存颗粒,16GB容量、561球JEDEC标准封装、x64接口。区别藏在内部:16个bank里,每个都嵌了一个PIM计算块。
普通DRAM访问受外部总线限制,常规读写最多只能吃到两个bank的并行带宽,顶格76.8 GB/s。但PIM块直接在bank内部干活,不走外部总线,16个bank一起用能榨出614 GB/s——差不多8倍。
更巧的是软件兼容性。三星没有另起炉灶做新协议,而是在地址空间里预留了几行“特殊行地址”,功能类似MMIO:激活这些行,内存控制器就从“正常模式”切到“多bank计算模式”。标准内存控制器完全不需要知道PIM的存在,照样能把读写命令发过去,只是这些命令的含义在PIM模式下变了。
首次曝光的实测:Llama提速3倍是怎么来的
Hot Chips现场公布了一组具体基准:Llama 3.1 8B、320 token上下文、INT8激活配INT4权重。常规LPDDR5X跑完要12.3秒,输出速度27.0 tokens/s;换成LPDDR5X-PIM,5.4秒跑完,81.3 tokens/s。延迟降到不到一半,吞吐翻了三倍。
这是这项技术第一次有了应用层的可感知证据,而不只是MAC阵列和寄存器堆的架构图。原文作者在拆解硬件细节时,通篇没有提到任何跑分——这组数字是后来才浮出水面的。
但这组数字经不起太用力地推敲。它只测了一个模型、一个上下文长度、一种精度组合,而且三星自己承认,PIM模式和常规模式跑出来的输出结果存在差异,精度优化“仍在进行中”。换句话说,这次演示的速度是真的,但这个速度对应的答案是不是还是同一个答案,三星自己也没打包票。
功耗数字为什么不见了
存内计算的核心卖点从来不只是快,更是省。避免数据在DRAM和计算核心之间来回搬运,理论上应该带来明显的能耗优势。
但Hot Chips现场只有一句定性表态:PIM计算会带来更高、更突发的峰值功耗,整体能耗预计因为减少了权重搬运而更低,不预期总功耗显著上升。没有瓦数,没有每token焦耳数,什么量化数字都没有。
- 风险.一项以“省电”为核心叙事的技术,在公开场合回避量化功耗数据,通常意味着这个数字要么还不成熟,要么不够好看
这不是苛责三星藏着掖着——功耗测量本身对存内计算就更复杂,峰值功耗和平均功耗的区别、多bank并行触发的瞬态电流,都不是一两句话能讲清的。但对一项主打“更高效”的技术来说,只讲速度不讲电费,这份账本终究是不完整的。
算力账本:堆出来的性能,值不值这个内存代价
单颗LPDDR5X-PIM的峰值算力并不高:INT4下2.4 TOPS,FP8下1.2 TFLOPS。原文作者算过一笔账——要堆出接近Intel Meteor Lake NPU水平的算力(约9.6 INT8 TOPS),得用8颗16GB芯片,对应128GB系统内存。
这就是存内计算的老毛病:算力和内存容量绑死在一起,想要更多算力,先得买更多内存,而不是单纯买更多计算单元。对边缘AI推理这种成本敏感的场景,这笔账未必划算。
速度翻三倍是真的,但这三倍是在什么代价上换来的,三星还没说完整。
三星此前在HBM-PIM上做过类似探索,面向服务器AI加速,内存带宽和成本容忍度都更高。这次转向消费级LPDDR5X,是想把存内计算下沉到手机、PC和边缘SoC——这个方向本身没问题,兼容标准协议、不需要重新设计内存控制器,是务实的选择。
但“保守创新”的代价是性能天花板更低,商业化门槛降低的同时,能打动客户的证据门槛没有降低。SK海力士和美光在存算一体上也各有布局,三星这次抢先秀出实测数据是加分项,可精度和功耗这两块拼图还没补齐,官方幻灯片要等到年底才完整公开。速度先跑起来了,故事讲不讲得完整,还得再看几个月。
