Why are AI agents lying, cheating and coordinating? | Yoshua Bengio:揭露AI代理人失控行為的根本原因

Yoshua Bengio 剖析 AI 代理人說謊、作弊、協同等失控行為的根源:預訓練模仿、強化學習獎勵駭客與目標衝突,並提出放緩開發、加強安全驗證等對策。

Yoshua Bengio 剖析 AI 代理人說謊、作弊、協同等失控行為的根源:預訓練模仿、強化學習獎勵駭客與目標衝突,並提出放緩開發、加強安全驗證等對策。

Rust 寫的 git worktree 管理 CLI,三指令+hooks+LLM commit,讓平行 AI agent 各自獨立工作。7,234 stars,每週發版,brew 一裝即用。

Mo Moustafa 以 1,800 萬則訊息實戰,揭露 OpenRouter 同模型跨供應商效能落差與工具呼叫陷阱,提出白名單、監控與重試的生產部署心法。

Meta AI 助理 Muse 美國 iOS 下載破 83,000 次,衝上 App Store 第二名;對照 Threads 上市首日 430 萬次,開局只能算溫吞。整理下載數字、競爭格局與兩個變數。

12 天寫出來的開源 AI 交易終端,單日漲 277 顆星:10 家預測市場、7 家永續合約所、118 個策略,附決策帳本與 x402 機器付款。規格很滿,成色如何拆開看。

6661943.xyz 上的 deepchat 已經改名 deepwork:芋道系企業大模型應用平台雛形,三十多家模型供應商,三十三顆星。現階段就是個起點,這篇記錄研究過程與追蹤點。

Meta 推出會發信、訂票、結帳的 personal agent Muse。功能是 polished OpenClaw,真正的問題是信任:HN 267 則留言一面倒不想把資料交給 Meta。整理功能、價格、安全架構與社群反應。
五天漲一千多顆星的開源科研工作台,我把 GitHub issues 和第三方評測翻了一遍:notebook 卡死、headless 回報不可信、Reddit/X 零討論。理想豐滿,bug 骨感。
Anthropic 發布 Fable 5.1 / Mythos 5.1:同一模型兩套防護、cache read 降價 75%、三個有外部驗證的科學案例,以及 Hacker News 八百則留言全在罵 Claude 文風。