Why are AI agents lying, cheating and coordinating? | Yoshua Bengio:揭露AI代理人失控行為的根本原因

Yoshua Bengio 剖析 AI 代理人說謊、作弊、協同等失控行為的根源:預訓練模仿、強化學習獎勵駭客與目標衝突,並提出放緩開發、加強安全驗證等對策。

Yoshua Bengio 剖析 AI 代理人說謊、作弊、協同等失控行為的根源:預訓練模仿、強化學習獎勵駭客與目標衝突,並提出放緩開發、加強安全驗證等對策。

Andreas Thom 在 Mathstodon 揭露與 OpenAI 就未公開數學研究資料使用的爭議,本文整理 Hacker News 討論:信任、可驗證性、時間線、署名與企業採用影響。

Anthropic 預訓練研究員 Jacob Coxon 請辭,貼文瀏覽破一億。他接受 WIRED 訪談,談 Hugging Face 攻擊、對齊為什麼還沒解,以及為什麼他認為私人公司不該被信任來跑這場競賽。
OpenAI 說內部模型解出了 Navier-Stokes existence and smoothness,Buckmaster 隨即公開聲明指控時序可疑、還被要求拔掉任職 Anthropic 的共同作者。我把 HN 上兩篇合計 1400 多則留言的爭點整理成一篇。

EEBench 用模擬加真實料號評測 AI 電路設計,Claude Opus 5 拿下 61.6%。一部分電路現在已經解得動,整機產品還早。

GPT-6 Astra 是 OpenAI 最新推出的高智慧、高對齊模型,在電腦操作、程式開發、網路安全、科學研究與專業工作皆達頂尖水準,FrontierMath Tier 4 達 98%、ExploitBench 滿分。本文為官方公告繁體中文翻譯整理。

OpenAI GPT-6 Astra 在 ARC-AGI-3 接近滿分,HN 934 則留言吵的不是分數,是 AGI 到底該怎麼定義。

2026 年 8 月 28 日晚上,OpenAI 在官網發了一篇公告,宣布終止與 Cursor 的模型供應合約。Cursor 是目前最流行的 AI 程式編輯器,而它的母公司 Anysphere 才在 8 月 14 日被 SpaceX 以 600 億美元全股票交易完成收購。收購案成交滿兩週,OpenAI 就動手了。 看到…