來源:EEBench〈Can AI design circuit boards yet?〉,以下整理加上一點我的解讀。
結論先講:可以,但只限一部分電路。心律調節器這種東西,你現在還不會想閉著眼睛裝 AI 畫出來的板子。
起因:兩家 labs 同一時間拿電子電路說事
OpenAI 在 GPT-6 Astra 發布頁放了一個 demo:模型在 KiCad 裡面弄一塊電路板。xAI 則在 Grok 4.6 的 model card 裡面放了 EEBench 成績,歸在 engineering acceleration 章節,跟 3D 建模、參數化 CAD 並列。
這是第一次看到 frontier labs 把電子設計當成正式能力指標。問題也跟著來:電路畫得好不好,要怎麼量?看起來合理不代表上電會動。
EEBench 的做法:不用 GUI agent,用程式碼寫電路
EEBench 是 atopile 團隊做的 benchmark,V1 有 13 個任務,做法很直接:
- 不叫 agent 去點 CAD 軟體。那種做法 context 都耗在座標、選單、視窗狀態。
- 改用 atopile 的宣告式寫法。電路就是 code,agent 直接改元件、連線、電氣約束,改完 build、跑模擬、看哪裡掛掉,全部在專案裡完成。
這讓 benchmark 測的是電子,而不是電腦操作。
真實世界的麻煩:電容不是電容
公開任務裡有一個住宅電表。5V 消失之後,電路要靠自己撐住處理器 20ms,讓它把累計讀數存起來,這段時間保護軌不能掉到 3.0V brownout 以下。
多數模型第一反應都對:加電容。
難在真實零件。陶瓷電容加上偏壓之後,有效容值可能只剩標稱的一小部分,還有容差。電容加大要錢、佔空間,回電時充電也慢。用標稱值算會過的設計,拿到實際零件會掛。
EEBench 就是直接把輸入電源切掉做模擬,看保護軌在斷電期間的電壓、操作點下的有效容值、回電後的恢復,外加封裝、介電材質、耐壓、成本限制一起檢查。文章裡貼了一個 fail 的例子:保護軌從 4.55V 起跳,0.85ms 就跌破 3V,要求的 20ms 連零頭都不到。
更難的類比任務要繞運放兜一個 multiple-feedback 低通濾波器,自己解電阻電容比例湊出要的極點,而且每個零件推到最差容差角落時,gain、截止頻率、Q 值都要留在規格內。harness 會重建 SPICE deck 跑 AC 和 transient,把每個量測綁到具名探棒去對上下限。
而且只能用真實存在、買得到、價格合理的製造商料號,規格從 datasheet 萃取進 SPICE 模型。電性、成本、供貨三邊取捨,這才接近真的硬體設計,而不是課本選理想值。
評分:確定性量測,先會動再比便宜
流程是 build 送審設計、建 circuit graph 和 BOM、跑一組 SPICE 和設計檢查,每個需求都是一筆帶上下限的量測。技術分過了,才比 BOM 成本效率。跟給 coding agent 編譯器加測試差不多,只是這裡的測試量的是電壓和零件行為。
V1 只做到模擬階段的類比和數位設計。layout、打件、bring-up 整塊還沒放進來。團隊的意思很明白:先把需求、設計、驗證這個迴圈做成可以客觀評分的樣子。
Leaderboard:9 月 1 日成績
| 名次 | 模型 | 分數 |
|---|---|---|
| 1 | Claude Opus 5 | 61.6% |
| 2 | Grok 4.6 | 57.1% |
| 3 | Claude Fable 5.1 | 56.4% |
| 4 | Claude Fable 5 | 54.3% |
| 5 | Claude Opus 4.8 Max | 51.4% |
| – | GPT-5.5 | 42.3% |
| – | GPT-5.6 Sol | 39.4% |
幾點值得記:幾個月前沒人預期模型能到六成。Anthropic 在這個環境一直偏強,Grok 4.6 往上衝也對得上 xAI 自述的高品質工程資料加 domain RL。xAI 自跑 Grok 4.6 在 xhigh reasoning 下是 60.0%,跟 EEBench 公開跑的 57.1% 差異不大。OpenAI 受測的兩個 5.x 都在四成區。GPT-6 Astra 還沒有 EEBench 成績,考慮到發表 demo 就是畫 PCB,這個數字出來會很有意思。Musk 說 Grok 4.7 用大量 SpaceX 資料特訓工程,幾週內出。出貨時程一向會飄,真出了就等 EEBench 跑分。
順手做成 RL 環境
有 grading harness,就有 RL 環境雛形。同樣的檢查可以直接當 reward signal。fail run 不是只有對錯,還知道哪個電壓沒過、哪個角落掛掉、是不是用太貴的料解掉的。這比叫模型看 schematic 說看起來合理,資訊量大得多。
EEBench 公開的只是小版本,團隊也有跟 labs 合作更大的 eval 和 simulation-backed 訓練環境。商業模式大概就是這條線。
我的解讀
這篇最打中我的不是排行榜,是它把電子工程的本質講得很白:取捨。容值、容差、降額、成本、供貨、恢復時間,每個都合理,合在一起才難。這也是為什麼它適合拿來評模型:不能靠背課本,要在約束裡找可行解。
回到標題。AI 可以設計電路了嗎?一部分可以。把需求寫清楚、給它能跑的模擬和真實料號,現在的模型已經解得動不少題目。但整機產品還早,layout 和實測都還沒進 benchmark。先把它當很強的電路助手,而不是可以放生不管的工程師,這個定位目前最準。
