OpenAI在自家博客里讲了一个听起来很漂亮的故事:MIT工程量子系统组的研究生Beatriz Yankelevich,把一个她称为“GPT-5.6 Sol”的模型接入Codex,让它自主运行了一块六量子比特超导芯片的常规校准——测频率、校准脉冲、测相干时间。信号干净的时候,AI几乎不需要人管,晚上挂机跑一夜,第二天用手机看结果。

这个案例被包装成“AI已经能帮科学家做实验”的证据。但把细节翻出来对一遍才发现两件事:一是这个叫“GPT-5.6 Sol”的模型,除了OpenAI这篇博客本身,目前找不到第二个公开来源;二是原文自己也承认,一旦信号弱或噪声大,AI就得靠人接手。这两点合在一起,说明这个故事离“AI能独立做实验”还有相当距离。

常规校准变成挂机任务,但前提是信号足够干净

超导量子比特要在稀释制冷机里冷到接近绝对零度,靠微波脉冲操控和读出。校准这类芯片是一连串相互依赖的测量——测出跃迁频率、校准控制脉冲、再测相干时间,每一步的结果决定下一步该测什么。过去这种活儿要老练的研究者盯着屏幕,出现漂移或异常信号就手动调整,一块标准芯片测下来往往要耗掉研究者几天时间。

Yankelevich给Codex配了针对每种测量的“技能说明”,让它自己选参数、跑硬件、分析数据、决定是重测还是保存结果。信号清晰时,GPT-5.6 Sol能连续跑完一整套标准测量序列,人几乎不用插手;信号弱或噪声大时,它要花更长时间试参数,有时还得靠有经验的研究者指点。

所谓“自主”,条件是什么 信号清晰 自动测频率 自动校准脉冲 自动测相干时间 较少人工 可挂机整夜运行 信号弱 / 噪声大 参数难以确定 耗时明显变长 行为易受干扰 需人工介入 依赖研究者经验判断

这张对照说明的问题很直接:AI在这里做的是边界清楚的重复劳动,一旦遇到需要判断和经验的场景,还是要退回给人。这和“AI已经能自主做科学决策”是两件事。

查无此模型:一次只能核实一半的案例

“GPT-5.6 Sol”这个命名本身值得多问一句。它不属于OpenAI已公开的模型体系命名规则,检索也没有找到对应的论文、预印本或代码仓库——唯一可查的来源就是这篇官方博客。这不代表案例是编造的,但至少说明它目前只是厂商单方面的展示材料,而不是经过同行评审或独立复现的科研成果。

能独立核实的部分有多少 0 同行评审论文 0 公开代码仓库 1 可查来源(OpenAI博客)

这类“AI+实验室自动化”的展示,近年不止OpenAI一家在做——本质都是把大模型接进实验控制软件,让它自己决定测什么、怎么测、下一步做什么。这套叙事听起来性感,但判断它是不是真进步,需要一个更硬的标准:跟传统数值优化方法比过没有,比如贝叶斯优化、Nelder-Mead这类早就在用的校准算法。原文只给了“节省大量时间”这种模糊描述,没有耗时、测量次数、人工介入比例这些量化对比,也没提到agent操作硬件时有没有参数边界、审批环节、回滚机制这类安全设计。

  • 风险.让AI直接操控实验硬件,如果缺乏参数边界和审批环节,一次误判就可能损坏昂贵的量子芯片或制冷设备。
自主二字听起来漂亮,落到噪声里就得靠人兜底。

谁该关心这件事,接下来看什么

对MIT这类量子实验室而言,如果Codex真能稳定接管常规校准的重复劳动,省下来的时间确实值钱——一块标准芯片校准动辄要占用研究者好几天,能挂机跑测量、腾出手做实验设计,这个诉求是真实的。但对整个行业判断“AI做科学”走到哪一步,现在能看到的证据还太薄。

接下来值得盯的,是这个案例会不会出一份正式论文或预印本,模型版本和提示词有没有公开,有没有跟贝叶斯优化之类的方法做过量化对比,以及这套流程能不能被MIT之外的团队独立复现。没有这些,这件事就只能停留在一篇公司博客的水位上,离“AI已经能自主做量子实验”的常识化想象,还差着一段没填的空白。