OpenAI 發表 GPT-6 Astra,ARC-AGI-3 接近滿分。Hacker News 當天最熱就是這則,1190 分,934 則留言。吵的不是分數本身,是這算不算 AGI。
另外兩則相關討論剛好可以一起看:ARC Prize 官方寫 Astra 在 ARC-AGI-3 的表現,以及 LessWrong 上有人問 Astra 的 recurrent 架構該擔心到什麼程度。
分數可信嗎
開場就有人拆台。intenex 說 OpenAI 那張對照表有問題,GPT-5.6 Sol 在同樣 harness 下實測大約 30%,表上卻只標 7.8%。他的解釋是舊模型分數一更新,連 Opus 5 的也要跟著動,所以乾脆不動。
但他話鋒一轉,還是認定結果有效。如果 benchmark 大致可信,這就是實質上的 AGI。他說自己用 Fable 時已經覺得沒什麼事比模型強,Astra 又高出一截,那就該喊了。
mvkel 補了一句 ARC-AGI 創造者的說法。6 個月前的預期,Astra 代表的進展大約提早了 2 倍實現。z7 翻出 Chollet 二月寫過預期一年左右飽和 ARC-3,對得上。
反方也不客氣。ACCount37 說 ARC-AGI 從來就不是飽和即 AGI,而且 ARC-AGI-3 在 day 0 就能被現成 LLM 加 harness 拿到 50% 以上,比前兩代更弱。balefulboy 指出 OpenAI 拒絕用 ARC-AGI 官方提供的 harness,這個滿分要打折扣。
我的看法:harness 爭議每次都一樣,重點不是誰作弊,是 benchmark 一旦變成發表會投影片,數字就只剩一半可信。看趨勢比看單點實在,6 個月提早 2 倍這種說法,比滿分本身更值得記。
AGI 定義被稀釋了嗎
giancarlostoro 直接開罵,AGI 定義被摻水,幫 Altman 在 IPO 前假裝達標。Altman 自己講過 AGI 就是能當遠端聘用的中位數人類,另一邊又跟 Kevin Roose 說沒發現新物理就不算任務完成。標準寬到可以隨便解釋。
butterisgood 的立場最硬。連 strawberry 有幾個 r 都數錯的系統,不配叫 AGI。nearbuy 和 slidehero 回他,那是 GPT-4.5 時代的舊帳,人類自己數 f 也常錯,拿這個當 AGI 門檻本來就沒道理。
refulgentis 講了一句實話。ARC-AGI 那位策展人自己也覺得還沒到,不然不會有 ARC-3、ARC-4。
這段我站中間。定義吵十年了,每次新模型出來就重吵一次。與其問是不是 AGI,不如問它能不能替你把工作做完還不用你收尾。
最嚴格的那份 AGI 清單
zug_zug 列了一份檢查表:寫暢銷書、開公司並經營起來、勸回想自殺的人、當好的 TTRPG 主持人、長期打敗指數基金、提出原創理論、有後設認知、會好奇。他強調 G 才是重點,沒見過的測驗也要一次過。
下面立刻被圍攻。pavitheran 說照這標準多數人類也不及格,kolinko 同意。Tumblewood 拆開來看,一半人類做不到,一半 AI 已經做到。jasonfarnon 補刀,打敗指數基金這種事可能根本沒人穩定做得到。gilbetron 說全過了那叫 ASI,不是 AGI。
tempestn 講到要害。真正的差距可能是能不能講清楚自己知道什麼、不知道什麼。人類自己在這題也不及格,想想 Dunning-Kruger。
知識和智慧是兩回事
zug_zug 還有第二個論點。模型看起來聰明,是因為知識量大到不合理。給人類同樣的閱讀量和算力,人類也能寫書、也能做研究。他主張智慧該用固定起點能推出多少來量。
kolinko 回說平均靠時間,非凡要天賦和品味,zug_zug 的標準是 extraordinary,不是 general。Verdex 賭說砸一千億到三兆美元培養一個人,什麼都練得出來。jimbooonooo 點出差別:人類天才不能複製,模型可以。
這段對做應用的人最有用。知識可以靠檢索補,判斷力不行。27B 這種小模型缺知識不缺推理的話,配上好的檢索和工作流,在地端一樣能打。
還要 prompting 就不算 general 嗎
burrito_brain 說缺的那塊是自主性,還要人下指令就不算 general。arctic-true 回說自主跟通用是兩回事,全自動的東西很多,沒有一個接近通用智慧,人也是被刺激驅動的。reasonableklout 補說人類員工也要主管交辦,靠的是法律和制度兜底,不是心智特殊。
chmod775 講得最狠。現在的 LLM 比多數失智症還慘,沒有長期記憶,開場即巔峰。
責任那條支線很現實。lenerdenator 說不能檢查又不負責的 agent 取代工人,出事只是墊高和解金。degamad 連問三題:agent 把網站改成色情內容、刪掉你的 AWS、駭進別站,誰付錢。答案都是你。
recurrent 架構那篇在擔心什麼
LessWrong 那篇把焦點從分數拉到架構。Astra 用 recurrent 設計,記憶體和長期狀態的處理方式跟 Transformer 不一樣。擔心的人怕的是,能力跳升來自架構切換,評估方式還停在舊典範。樂觀的人覺得 harness 能讓模型持續思考,狀態管理本來就是 chatbot 早就在做的事。
我會這樣記:架構換了,舊的評估心智模型要跟著換。分數會過期,架構帶來的行為差異留得比較久。
來源
- OpenAI: GPT-6 Astra
- ARC Prize: GPT-6 Astra on ARC-AGI-3
- LessWrong: How concerned should we be about Astra's recurrent architecture
- HN 討論:GPT-6 Astra(934 則)、ARC-AGI-3 那篇(82 則)、recurrent 架構那篇(40 則),以及今天完整熱門清單 2026-09-04
