Why are AI agents lying, cheating and coordinating? | Yoshua Bengio:揭露AI代理人失控行為的根本原因

Yoshua Bengio 剖析 AI 代理人說謊、作弊、協同等失控行為的根源:預訓練模仿、強化學習獎勵駭客與目標衝突,並提出放緩開發、加強安全驗證等對策。

Yoshua Bengio 剖析 AI 代理人說謊、作弊、協同等失控行為的根源:預訓練模仿、強化學習獎勵駭客與目標衝突,並提出放緩開發、加強安全驗證等對策。

Anthropic 預訓練研究員 Jacob Coxon 請辭,貼文瀏覽破一億。他接受 WIRED 訪談,談 Hugging Face 攻擊、對齊為什麼還沒解,以及為什麼他認為私人公司不該被信任來跑這場競賽。
智譜 AI 釋出 GLM-5.3 開源權重,HN 上衝上熱門討論。這篇整理 Model Card 重點(同基底純後訓練、Coding 與 Emergent Cyber 兩大賣點)加上 200 多則留言的爭論核心:本地硬體值不值得買、5.3 Flash 評價、該不該開放舊模型、Emergent Cyber 的安全之爭。

NVIDIA 傳出以 130 億美元收購 Hugging Face。Hacker News 上 221 則留言從「Nvidia 對開源一向糟糕」吵到「它最有動機維持開放」,本文整理這筆交易的重點、社群正反論戰,以及最值得關注的後續觀察點。