AMD在8月6日美股收盘后宣布,签了一份正式收购协议,买下多伦多的AI芯片初创公司Taalas。这家公司干的事听起来有点疯:不用HBM存模型权重,直接把权重蚀刻进硅片本身。交易条款没披露,预计今年四季度完成交割,还得过监管审批这一关。

这笔收购被业内拿来和Nvidia以200亿美元拿下Groq授权的交易做对照——两家芯片巨头都在推理侧找专用硬件补课,逻辑是一样的:Agent类应用要的是低延迟、高吞吐的“高端推理”,通用GPU越来越贵不起。但Taalas的路子比Groq、Cerebras都更极端,也更值得多问一句:它讲的“快”,到底是怎么测出来的。

把模型焊死在芯片里

Taalas管自己的芯片叫MSIC,模型专用集成电路。芯片分两块:一块是mask-ROM,权重直接刻在版图里;另一块是SRAM,负责存KV cache和微调用的适配器。

已经流片的测试芯片HC1,用台积电6nm工艺,芯片面积约815平方毫米,塞了约530亿个晶体管。单卡功耗200到250W,官方整机方案是10张卡凑一台,功耗约2.5kW。这是一张为一个特定模型量身定做的芯片,换模型基本等于换芯片。

48倍是怎么算出来的

Taalas公布的数字很炸裂:用HC1跑Llama 3.1 8B(经过3bit/6bit混合量化),能到16960 tokens/s,比Nvidia GPU快48倍,比Cerebras快8.5倍。EE Times去现场试过官方演示,看到超过15000 tokens/s,量级对得上。

但这组对比数据禁不起细看。Taalas自己测H200、B200,Groq、SambaNova、Cerebras的数据是引用第三方机构Artificial Analysis的,两边不是同一套测试框架跑出来的。厂商自测拼第三方数据,这种“48倍”只能算营销话术里的上限,不是可复现的独立基准。

跑分的两面 Taalas官方说法 16960 tokens/s 比Nvidia GPU快48倍 比Cerebras快8.5倍 Llama 3.1 8B 3/6bit混合量化 可验证的部分 EE Times现场看到超15000 量级吻合,非受控对比 对比数据非同一测试框架 H200/B200自测+第三方拼接 量化精度损失 官方未公布准确率数据

快是真的,代价也是真的

把功耗和吞吐放到一起算,HC1的效率大概在每瓦67.8到84.8个token之间。这数字不差,但也远没到“无代价”的地步——它是在3/6bit混合量化、精度打折的前提下拿到的,官方至今没给出对应的准确率对比。速度背后是牺牲了多少模型质量,外界看不到。

更麻烦的是商业模式本身的节奏错位。AI模型几乎按月更新,Taalas这条路却要求客户先选定一个模型版本再上硅片。换模型不是完全推倒重来,Taalas说只需改动两层金属互连层,换版周期大概两个月。听起来省了不少,但两个月对一个月更一次的行业来说,依然是慢半拍。

三个要盯住的数字 16960 tokens/s,厂商自测 67.8-84.8 tokens/s/W,效率账 2个月 换版周期,模型却月更

AMD打的算盘是disaggregated架构:Instinct的Helios机架管prompt处理,Taalas芯片负责token生成,甚至可能玩一套先在GPU上验证模型、再迁到Taalas芯片的“tick-tock”节奏。这些都还是推测,AMD官方声明里只说了“全栈灵活性”,路线图一个字没漏。

真正能验证这套故事的,是HC2芯片能不能把参数量做到20亿以上、有没有独立机构做统一基准测试、以及OpenAI、Anthropic、Meta这些既是AMD大客户又是模型厂商的公司,是否真的愿意拿产线上的模型去押一次不能后悔的流片。硅片会说话,但要等交割完成、等HC2跑分出来,那时候再看这48倍还剩几倍。