AI研究者、Interconnects作者Nathan Lambert最近写完了一本关于人类反馈强化学习(RLHF)的教科书,书名就叫《Reinforcement Learning from Human Feedback》,已经在Manning和Amazon上架。写作过程里他把LLM用了个遍:排LaTeX公式、画TikZ图表、揪错别字,效率提升明显。可一旦让AI去写整整一章正文,问题全暴露了——单句没毛病,整章读下来逻辑打结,还夹杂着莫名其妙的概念性错误。
这跟AI在代码和数学上的超人级进步完全不成比例。Lambert由此给出一个判断:AI写不好长篇技术内容,不是因为笨,而是因为它不会"组织已经确定的知识"。这件小事分量不小——如果AI连整理现成科学知识都做不利索,那些指望它自主捅破开放性科学难题的时间表,恐怕得往后挪。
标杆还是老模型,差距在拉大
行业里公认"写作能力最强"的模型,至今还是相对老旧的OpenAI GPT-4.5和Moonshot Kimi K2。同一时间段,编程和数学能力已经完成了代际跃升,搜索和研究类任务也从"不行"进化到"够用"。写作这一项,几乎是原地踏步。
写作难在哪:组织,不是智力
Lambert在书里试过让GPT系模型帮忙找排版和用词上的小毛病,效果确实好,能在两三百页的手稿里揪出细微的typo。但这类能力和"写好一整章"是两件事。模型能把每一个句子、每一个公式、每一张图单独做对,却不擅长把这些零件拼回一个连贯的整体——新增的内容越多,累积的错误越难自我修正。这在数学和代码里曾经也是老问题,靠强化学习加验证信号基本解决了。写作没有这样的验证信号,也没有针对性的训练数据,所以进步慢下来不是模型被忽视,是这活儿本身缺工具。
组织已知知识是一种压缩,压缩到位才谈得上洞察。这话听起来抽象,落到具体场景就是:一本教材要把某个领域十年积累的方法论梳理成一条清晰的知识脉络,这恰恰是当前LLM最不擅长的事。
黎曼猜想同一天,该信哪个叙事
Lambert提出这个判断的当天,正好是Anthropic发布博客,宣称Claude在黎曼猜想(Riemann zeta函数相关问题)研究上取得了进展。他自己也承认,这个时机让自己的观点显得"有争议"——毕竟一边说AI写不好东西,一边行业里正在宣传AI攻克数学难题。
窄领域里的突破,不等于跨领域组织知识的能力。
这两件事未必矛盾。数学问题往往边界清晰、可验证,正是AI目前最擅长的场景;而写一整章教科书,考验的是跨越大量已知信息、找到叙述主线的能力,边界模糊、没有对错标准。狭窄进展能不能"翻译"成开放性科研自主能力,目前没有答案——现有的评测体系里,严格衡量长篇科学写作准确性、逻辑连贯性的benchmark几乎不存在。多数现有测试基于短答案、靠模型互相打分,容易把"文风流畅"误判成"内容正确"。这意味着,"AI for Science"的热度和"AI能不能整理已知科学知识"之间,还有一段没人认真量过的空白。
- 结论.写整章教材而不是查错别字,才是检验AI科研自主性的更诚实的题目。
- 风险.现有写作类benchmark多依赖模型互评,容易把语言流畅误判为知识正确。
谁该缓一缓期待
对依赖LLM写长篇技术内容、论文或教材的研究者和作者来说,现实的做法是把AI用在重复性劳动上——排版、画图、找错别字、写背景综述,而把摘要、引言、结论这类"故事和灵魂"留给自己。这些部分恰恰是作者理解自己工作的地方,外包给AI等于放弃了这部分理解的机会。
对出版机构和知识付费内容生产者,这暂时是个安慰:优质长篇内容的护城河没有想象中脆弱。对押注AI自主科研叙事的实验室,黎曼猜想式的进展值得关注,但接下来更该盯的是:下一代模型在长章节写作上是否有实质突破,是否有人拿出一套严格、可复现的长篇科学写作评测标准,以及黎曼猜想那项工作能不能经得起同行评审和独立复现。这三件事没有答案之前,"AI很快自主搞科研"更像是一个还没被验证的假设。
