OpenAI给GPT-6 Astra的发布视频里,专门剪了一段它在KiCad里操作电路板的画面。镜头很顺,参数改得很快,但翻遍这条视频,找不到它在电路设计基准EEBench上的分数——因为目前根本没有这个分数。

能在镜头前画板子,和能在陌生元件、极限工况、真实成本约束下把电路做出来,是两件事。EEBench想量的,正是后面这件事。

EEBench怎么测,谁排第一

EEBench不让AI在图形界面里点画布,而是用atopile的声明式代码直接搭电路:改参数、跑SPICE仿真、看哪里失效,全在同一套环境里完成。

评测只认三件硬指标:器件容差下会不会失效、是否卡在规格边界、成本和可采购性达不达标。成本只在电路先跑通仿真之后才计入分数——先证明能用,再算贵不贵。

9月1日一版成绩单,覆盖13项公开任务:

模型得分
Claude Opus 561.6%
Grok 4.657.1%
Claude Fable 5.156.4%
GPT-5.542.3%
GPT-5.6 Sol39.4%
GPT-6 Astra尚无成绩
EEBench 9月1日成绩单(部分) Claude Opus 5 61.6% Grok 4.6 57.1% Claude Fable 5.1 56.4% GPT-5.5 42.3% GPT-6 Astra:KiCad有演示,但尚无EEBench成绩

13项任务只测“需求—设计—验证”这一段闭环。布局走线、制造公差、装配良率、整机调试,这次都没进考卷。

名义参数算得对,仿真里未必扛得住

公开任务里有个例子:一款电表的5V供电断掉后,电路要撑住处理器20毫秒才能保存读数,保护电压不能跌破处理器3.0V的欠压门槛。几乎所有模型第一反应都对——加电容。

问题出在细节上。陶瓷电容带上电压后,实际容值会比标称值缩水,再叠上器件公差、成本和恢复速度的博弈,一个用标称参数算出来“合格”的方案,放进仿真里按真实器件的容值曲线走一遍,可能根本撑不到规定时间。

EEBench的仿真记录显示:某个纯靠标称电容值算出来的方案,保护电压在0.85毫秒就跌破了3V门槛,离20毫秒的目标差了一大截。

掉电任务:名义方案什么时候塌 0ms 断电 0.85ms 跌破3.0V 名义电容方案仿真 20ms 目标窗口

这才是基准真正在测的东西:不是模型会不会解电容公式,是它敢不敢把公差、库存和成本一起算进同一个答案里。

分数能用,但别当成量产及格线

把仿真结果做成可复现、可打分的机制,这件事本身有价值。它让“这个电路设计靠不靠谱”第一次能像给代码跑单元测试一样,给出一个能对齐比较的数字,而不是靠“看着挺像”。xAI已经把EEBench写进Grok 4.6的模型卡,当作工程能力的一个证据点——分数正在被行业当真。

但61.6%容易被读高。EEBench目前只测到“需求—设计—验证”这段闭环,13项任务也覆盖不了电子工程的全部难题。真正决定一块板子能不能量产的东西——布局走线、制造公差、装配良率、整机调试——这次基本没进考卷。陆游说“纸上得来终觉浅,绝知此事要躬行”,算得对和造得出,中间还隔着一整条产线。

基准由atopile团队自己建设并资助,不是完全中立的第三方裁判。分数可以参考,但别当成没有利益关联的行业总榜。

对硬件、电路和嵌入式工程师来说,这份成绩单能当参考,不能当免检牌。涉及掉电保护、安全裕度这类容差敏感的设计,AI给出的名义参数方案,还是得自己过一遍SPICE和真实器件的datasheet,再决定要不要投板。对关注AI agent和工程自动化的读者,接下来该盯两件事:GPT-6 Astra的真实分数什么时候放出来,能不能反超Claude Opus 5;还有EEBench会不会推出覆盖PCB布局、制造和装配的下一版,那才是真正逼近“能不能造”的考卷。

模型确实比过去在CAD软件里表现出来的懂得多,EEBench证明了这点。真正的分水岭是能不能在真实器件、极端工况、成本和供应约束下,稳定交出一个经得起验证的答案,会不会画原理图从来不是门槛。GPT-6 Astra在镜头前画得再流畅,这张考卷没交,就只是一场好看的演示。