用户让Grok生成一份PDF,收到的回复是一串没有意义的词:“match it without and your they and two for planets can practical and often cheese”。翻检引用来源,链接指向的是几个强化学习论文网站,跟提问内容毫无关系。这不是孤例——从周三早上开始,Grok.com陆续有用户遇到同样的情况,Reddit的r/grok社区被同类求助帖刷屏。真正让人皱眉的不是bug本身,是官方回应自家状态页对不上口径。

官方说“罕见故障”,状态页什么都没写

Grok账号在X上回应:那是一次“罕见的临时生成故障”,官方状态页status.x.ai显示所有服务正常运行,没有事故记录。问题是,“状态页显示正常”被讲成了“官方已确认故障、但很快恢复”的证据,可status.x.ai从头到尾都没登记过这次事件——它显示的“正常”和“没发生过事故”是一回事,不是“出过事、已解决”。用户拿到的解释,更像公关话术,不是工程复盘。

“小部分用户”这个说法站得住吗

受影响用户自称用的是Grok Lite,问题局限在网页端,X.com上的Grok账号没受影响。但Reddit过去两天冒出的多条独立热帖,涉及不同账号、不同浏览器,报的都是同一类症状:胡言乱语、答非所问、引用链接跑偏。TechCrunch自己没能复现故障,说明影响面没有大到人人可见,但用户端的密集吐槽和“只是Lite层小众问题”这个定性之间,有一段没填上的落差。是订阅层级的问题,还是后端路由的问题,官方没给技术层面的说明。

一个月换代,幻觉率也跟着涨

被反复提及的“最新模型”其实已经不是最新的了。xAI在7月发布Grok4.5,不到一个月后的8月12日又推出Grok4.6,官方说法是在长程任务和模型行为上做了改进。节奏快到一篇报道还没写完,“最新”这个词就已经过期。

更该留意的是Artificial Analysis做的事实性测试:Grok4.5相比上一代,准确率从35%涨到52%,看着是进步;但同一项测试里,幻觉率从25%飙到了54%。这不是说日常聊天有一半答案是编的,这是特定测试项的数字,但足以说明,这一代模型在“说得对”和“说得像”之间,天平明显偏向了后者。一个更容易一本正经胡说的模型,遇上一次生成故障,输出看起来就更像某种倾向的极端表现,而不只是运气不好。

Grok4.5事实性测试:变好还是变差 35% → 52% 准确率上升 AA-Omniscience测试 25% → 54% 幻觉率同步飙升 同一项测试,同一代模型 说得对,也更容易一本正经说错
跑分能刷高,幻觉率也能刷高,这才是真正的代价。

人才流失是背景,不是判决书

今年5月有报道称,xAI自2月以来至少50名研究员和工程师离职,不少是创始团队成员,一部分去了Meta,一部分去了Thinking Machines Lab。这段背景经常被拿来当解释一切故障的万能钥匙,但目前没有任何公开材料把这次胡言乱语和人事变动直接连起来。把组织动荡和产品故障画等号,是一种叙事上的偷懒。更诚实的说法是:核心团队大规模流失之后,公司还在用比对手快得多的节奏发新模型——这两件事同时发生,足够让人多留一个心眼,不足以定罪。

四十天里发生了什么 2-5月 50余人离职 7月 Grok4.5发布 8月12日 Grok4.6发布 8月19-20日 胡言乱语故障

便宜是真本事,靠谱是另一回事

Grok4.6在Artificial Analysis的综合评分是61分,和GPT-5.6 Sol打平,落后Claude Opus5的63分。但它的价格是每百万token输入2美元、输出6美元,明显低于OpenAI和Anthropic的旗舰模型。

项目Grok4.6GPT-5.6 SolClaude Opus5
综合评分616163
输入价格(每百万token)$2更高更高
输出价格(每百万token)$6更高更高

xAI打的是性价比这张牌,这张牌本身没问题。问题是,便宜和稳定从来不是一回事,一次面向真实用户的胡言乱语故障,比任何跑分都更直接地告诉企业客户:低价省下来的钱,可能要花在输出校验和人工兜底上。

  • 风险.低价换不来稳定性,企业客户迟早要自己核对一遍输出。

对普通用户,遇到胡言乱语先刷新会话,大概率能解决;对准备把Grok接进生产流程的开发者,这次故障值得记一笔——不是因为它多严重,是因为它出现在模型快速迭代、幻觉率同步走高、核心团队还在流失的阶段。接下来该盯的是,status.x.ai会不会正式补一条事故记录,Grok4.6会不会重复同样的问题。