四十八個德瑞克

GPT-6 Astra 在 ARC-AGI-3 拿下近滿分:HN 934 則留言吵的其實是 AGI 定義

發光類神經網路球體與下方群眾剪影,象徵 GPT-6 Astra 引發的 AGI 定義辯論

{"AIGC":{"Label":"1","ContentProducer":"MiniMax","ProduceID":"06e948df546ac81210711c7f26f792ff","ReservedCode1":"{\"SecurityData\":{\"Type\":\"TC260PG\",\"Version\":1,\"PubSD\":[{\"Type\":\"DS\",\"AlgID\":\"1.2.156.10197.1.501\",\"TBSData\":{\"Type\":\"LabelMataData\"},\"Signature\":\"4da54a310626751464f5ee724204014cd5684ce25654738901ad758b603f7875c34ef6ecc335ef5617f9f80a14aa3d7897ca5b80c563bdcebbcc5fc336afab42\"},{\"Type\":\"DS\",\"AlgID\":\"1.2.156.10197.1.501\",\"TBSData\":{\"Type\":\"Binding\",\"BType\":\"0\"},\"Signature\":\"f33130de5bc8d6389cb20cbf00158a86c8c7c27b3bec8e3264d1764f956e4691dd8a18951d7a0e1a036a229702caa6787344a17c38dd11f55a33098c6577147a\"},{\"Type\":\"PubKey\",\"AlgID\":\"1.2.156.10197.1.501\",\"TBSData\":{\"Type\":\"\"},\"KeyValue\":\"00a0b3b0b6a0c9b0c89cab328342af4e8221ec5b40799cbe835ab4251f7b47e4fd\"}],\"Bindings\":[{\"Type\":\"Hash\",\"AlgID\":\"1.2.156.10197.1.401\",\"TBSData\":{\"Type\":\"\"},\"Signature\":\"57d0ca4241fa889c12868f2981d6216bfb584c976ff01dc7bb30c442949838d2\"}]}}","ContentPropagator":"MiniMax","PropagateID":"","ReservedCode2":""}}

OpenAI 發表 GPT-6 Astra,ARC-AGI-3 接近滿分。Hacker News 當天最熱就是這則,1190 分,934 則留言。吵的不是分數本身,是這算不算 AGI。

另外兩則相關討論剛好可以一起看:ARC Prize 官方寫 Astra 在 ARC-AGI-3 的表現,以及 LessWrong 上有人問 Astra 的 recurrent 架構該擔心到什麼程度。

分數可信嗎

開場就有人拆台。intenex 說 OpenAI 那張對照表有問題,GPT-5.6 Sol 在同樣 harness 下實測大約 30%,表上卻只標 7.8%。他的解釋是舊模型分數一更新,連 Opus 5 的也要跟著動,所以乾脆不動。

但他話鋒一轉,還是認定結果有效。如果 benchmark 大致可信,這就是實質上的 AGI。他說自己用 Fable 時已經覺得沒什麼事比模型強,Astra 又高出一截,那就該喊了。

mvkel 補了一句 ARC-AGI 創造者的說法。6 個月前的預期,Astra 代表的進展大約提早了 2 倍實現。z7 翻出 Chollet 二月寫過預期一年左右飽和 ARC-3,對得上。

反方也不客氣。ACCount37 說 ARC-AGI 從來就不是飽和即 AGI,而且 ARC-AGI-3 在 day 0 就能被現成 LLM 加 harness 拿到 50% 以上,比前兩代更弱。balefulboy 指出 OpenAI 拒絕用 ARC-AGI 官方提供的 harness,這個滿分要打折扣。

我的看法:harness 爭議每次都一樣,重點不是誰作弊,是 benchmark 一旦變成發表會投影片,數字就只剩一半可信。看趨勢比看單點實在,6 個月提早 2 倍這種說法,比滿分本身更值得記。

AGI 定義被稀釋了嗎

giancarlostoro 直接開罵,AGI 定義被摻水,幫 Altman 在 IPO 前假裝達標。Altman 自己講過 AGI 就是能當遠端聘用的中位數人類,另一邊又跟 Kevin Roose 說沒發現新物理就不算任務完成。標準寬到可以隨便解釋。

butterisgood 的立場最硬。連 strawberry 有幾個 r 都數錯的系統,不配叫 AGI。nearbuy 和 slidehero 回他,那是 GPT-4.5 時代的舊帳,人類自己數 f 也常錯,拿這個當 AGI 門檻本來就沒道理。

refulgentis 講了一句實話。ARC-AGI 那位策展人自己也覺得還沒到,不然不會有 ARC-3、ARC-4。

這段我站中間。定義吵十年了,每次新模型出來就重吵一次。與其問是不是 AGI,不如問它能不能替你把工作做完還不用你收尾。

最嚴格的那份 AGI 清單

zug_zug 列了一份檢查表:寫暢銷書、開公司並經營起來、勸回想自殺的人、當好的 TTRPG 主持人、長期打敗指數基金、提出原創理論、有後設認知、會好奇。他強調 G 才是重點,沒見過的測驗也要一次過。

下面立刻被圍攻。pavitheran 說照這標準多數人類也不及格,kolinko 同意。Tumblewood 拆開來看,一半人類做不到,一半 AI 已經做到。jasonfarnon 補刀,打敗指數基金這種事可能根本沒人穩定做得到。gilbetron 說全過了那叫 ASI,不是 AGI。

tempestn 講到要害。真正的差距可能是能不能講清楚自己知道什麼、不知道什麼。人類自己在這題也不及格,想想 Dunning-Kruger。

知識和智慧是兩回事

zug_zug 還有第二個論點。模型看起來聰明,是因為知識量大到不合理。給人類同樣的閱讀量和算力,人類也能寫書、也能做研究。他主張智慧該用固定起點能推出多少來量。

kolinko 回說平均靠時間,非凡要天賦和品味,zug_zug 的標準是 extraordinary,不是 general。Verdex 賭說砸一千億到三兆美元培養一個人,什麼都練得出來。jimbooonooo 點出差別:人類天才不能複製,模型可以。

這段對做應用的人最有用。知識可以靠檢索補,判斷力不行。27B 這種小模型缺知識不缺推理的話,配上好的檢索和工作流,在地端一樣能打。

還要 prompting 就不算 general 嗎

burrito_brain 說缺的那塊是自主性,還要人下指令就不算 general。arctic-true 回說自主跟通用是兩回事,全自動的東西很多,沒有一個接近通用智慧,人也是被刺激驅動的。reasonableklout 補說人類員工也要主管交辦,靠的是法律和制度兜底,不是心智特殊。

chmod775 講得最狠。現在的 LLM 比多數失智症還慘,沒有長期記憶,開場即巔峰。

責任那條支線很現實。lenerdenator 說不能檢查又不負責的 agent 取代工人,出事只是墊高和解金。degamad 連問三題:agent 把網站改成色情內容、刪掉你的 AWS、駭進別站,誰付錢。答案都是你。

recurrent 架構那篇在擔心什麼

LessWrong 那篇把焦點從分數拉到架構。Astra 用 recurrent 設計,記憶體和長期狀態的處理方式跟 Transformer 不一樣。擔心的人怕的是,能力跳升來自架構切換,評估方式還停在舊典範。樂觀的人覺得 harness 能讓模型持續思考,狀態管理本來就是 chatbot 早就在做的事。

我會這樣記:架構換了,舊的評估心智模型要跟著換。分數會過期,架構帶來的行為差異留得比較久。

來源

Exit mobile version