今年,数学家陶哲轩公开了一段与 ChatGPT 讨论雅可比猜想新近发现反例的对话记录。GitHub 工程师 Sean Goedecke 把这段对话当案例分析后得出一个判断:大模型没有抹平专业差距,反而在放大它。他在博客里直言,同样是 ChatGPT,自己“砸再多token”也到不了陶哲轩聊到的深度。

这个判断值得程序员和依赖AI做复杂任务的知识工作者认真看一眼。它戳破了一个流行说法——“大家问的是同一个模型,谁用得好全看提示词技巧”。Goedecke 的观察是:决定产出上限的从来不是话术,而是用户能不能凭专业知识挑出错误、重构问题、持续把方向拉回来

陶哲轩到底做对了什么

翻看那段对话,陶哲轩的操作其实很朴素:消息短,不逐句回应模型,只抓要点;模型给出的回复也明显比对普通用户更简洁——一旦模型判断出对方是行家,就会自动切换到“跟同行说话”模式,而不是“给外行科普”模式。

更关键的是纠错方式。陶哲轩不会直接说“你错了”,而是用“这看起来比我预想的复杂”这类委婉说法推回去。他还常常自己提出下一步该往哪走,很少直接采纳模型的建议。

  • 结论.陶哲轩能做到这些,前提不是话术熟练,而是他真的懂这道数学题——能从模型几段话里揪出关键那一句,判断哪里“看着不对劲”。

Goedecke 说得很直白:普通人照抄陶哲轩的提问句式,学不到他的效果。语言技巧是表象,数学功底才是门槛。

同一个ChatGPT,两种用法 专家用户 指令短,直击要害 主动否定、简化方案 提出替代思路,不等模型给 持续校正,直到方向对 结果:接近专业上限 普通用户 依赖模型给出可用答案 难以判断哪里不对劲 照单全收,少反向推敲 入门任务够用,复杂任务打折 结果:拿到“够用”的答案

门槛降了,但复杂任务里的差距变大了

这不意味着新手用不了大模型。十年前想写像样的CSS,要么靠身边的高手,要么在网上死磕搜索。今天随便一个人都能靠模型写出“凑合能用”的样式代码——这一层门槛确实被踩平了。

但雅可比猜想这种任务不一样。信息“在模型里”,不代表模型一定能给出正确答案,尤其是推理链条长的任务,幻觉和跑偏依旧存在。这时候能不能拉回正轨,考验的是人。

大模型没有抹平专业差距,而是把它放大了。

放到软件开发里也是同样的逻辑:对具体代码库和系统约束的熟悉,往往比记住一堆抽象的软件设计原则更能让AI给出靠谱方案。Goedecke 自己的经验是,如果对一个系统有“自己的理论”,就能说出“这里应该更简单”“我们是不是已经有现成方案了”这类具体质疑,模型会被推着往更好的方向走;换成一个不熟悉这套系统的人,同样的模型只能给出一个说得过去、但未必是最优解的答案。

  • 风险.如果把这类判断当成已被验证的普遍规律,容易误导——目前更像是个人经验总结,不是实验结论;新手依旧能从AI里获得实打实的效率提升,只是复杂任务的上限,仍然卡在人的专业积累上。

对程序员和技术负责人来说,落点很具体:AI适合拿来扩展执行力度——让原本要写一天的代码几小时写完,但架构判断、错误识别、最终验收,这些环节目前还外包不出去。谁在这些环节上更懂行,谁就能把同一个模型用出完全不一样的效果。