一家11人的法国创业公司,靠一个数字冲上了Hacker News首页:在企业已经买好的AMD MI300X、NVIDIA H200这类标准数据中心GPU上,单请求解码速度跑到了每秒3,000个token。发布之后,Kog收到了200条商业线索。同一个五月,专攻推理的定制芯片公司Cerebras完成IPO,资本市场用真金白银投票表态:推理速度,现在是能直接变现的东西。

一边是换芯片的路子,一边是"你的GPU还没榨干"的路子。Kog赌的是后者,而且赌得不小——它喊出的目标是30倍推理加速。问题是,撑起3,000 tokens/s这个数字的,是一个参数量只有约20亿的自研小模型Laneformer 2B,不是任何一个企业真正在用的大语言模型。

3,000 tokens/s是怎么跑出来的

Kog的思路很直接:企业手里已经有大量GPU,真正的瓶颈不是算力不够,是软件没把带宽用满。CEO Gaël Delalleau 的判断是,新一代GPU的内存带宽增长得比软件利用率快,中间那截差距就是Kog要吃的红利。

这套逻辑不算新鲜。同样来自法国的ZML走的是另一条软件优化路线:绕开Nvidia的CUDA,做硬件无关的推理加速,目标是让一套代码跑遍不同厂商的芯片。Delalleau自己把Kog定位成更接近斯坦福Hazy Research实验室——钻得更深,专啃GPU底层,而不是追求跨芯片通用。

两条软件路线,一个求广,一个求深,听起来互补,但至少目前都还没拿出能让人信服的生产环境数据。

白帽黑客式的优化,代价也是白帽黑客式的

Delalleau本人不是学术研究员出身。他在法国综合理工学院学固体物理,后来转向攻防网络安全,是DEF CON CTF的四届决赛选手。他把这段经历总结成一句话:逆向到汇编和二进制层面,搞清楚一个东西怎么运作,再拿它去做设计者没想到的事

这种打法用在GPU上,意味着每换一款新硬件,团队就要花数周甚至数月去做底层工程研究。听起来是硬核优势,换个角度看也是扩展性的天花板——11个人的团队,能深挖的芯片型号注定有限。Kog自己的答案是往agent化流水线走,让方法论能自动迁移到更多芯片和模型上,但这套自动化目前处在什么阶段,公司还没有拿出细节。

Kog demo的四个数字 3,000 tokens/s,单请求解码速度 20亿 Laneformer 2B的参数规模 200+ 发布后收到的商业线索 0 公开可核实的测试条件文档

数字好看,证据缺席

3,000 tokens/s和30倍加速,这两个数字被反复引用,但精度用的是FP16还是FP8、batch size多少、并发几路、对比的基准模型是谁——这些决定一个跑分能不能拿来横向比较的关键变量,目前找不到任何公开、可独立核实的技术文档。

这不是说Kog在撒谎,而是说这两个数字目前更接近一句营销承诺,而不是一份可复现的基准测试。Delalleau自己也承认,demo模型只有20亿参数,同样的方法能不能在真正的大语言模型上跑出来,他"有信心",但信心不是证据。

  • 提醒.在看到"3,000 tokens/s"或"30倍"这类数字时,先问一句测试条件是什么——没有精度、batch size、baseline的跑分,只能当作意向,不能当作对比基准。

客户教育了Kog:大模型才是真需求

Kog原本的设想是帮企业微调小模型换取速度。市场给的反馈很直接:企业不愿意为了推理速度去微调一个小模型。于是公司调转方向,把资源集中到加速更大的模型上,以匹配软件工程、AI生成游戏/应用这类高频调用场景的真实需求。

这个转向本身说明一件事:Kog最初的产品假设没有对上市场。它现在押注的是Claude Code这类场景——用户等结果动辄数小时,Anthropic自己都要为Fast Mode收溢价,证明速度确实值钱。但从"证明速度值钱"到"证明我能提供这个速度",中间还隔着一个尚未完成的大模型验证。

Delalleau给了一个明确的时间点:如果九月能在某个主流大模型上做到10倍加速,他就有底气去谈客户案例,进而启动A轮融资。这句话比任何demo数字都值得记下来——它把口头承诺变成了一个有截止日期的检验

数字先飞,证据后到,是软件创业公司最常见的节奏,也最考验投资人的耐心。

GPU软件优化 vs 专用芯片,两条路线还没分胜负

Cerebras用定制芯片拿到了资本市场的热烈反应,Kog和ZML押注的是"你不用换硬件,软件就能榨出更多"。哪条路线性价比更高,现在没人能给出结论,这本身就是行业分野的有趣之处——推理这一层,还远没到收敛的阶段。

Kog身上还有一层法国AI主权的叙事:背后站着Scaleway、Bpifrance和French Tech 2030,这类支持能给它一段不完全靠市场检验的生存空间,但撑不起长期估值。真正决定Kog命运的,还是那个九月的10倍测试能不能落地,能不能变成客户愿意付费、外部可以核实的生产基准。在那之前,"GPU还有巨大潜力可挖"更像是一个待证明的信念,而不是一个已经交付的产品。