保羅克里斯蒂亞諾加入OpenAI董事會:失控風險已經迫近

保羅克里斯蒂亞諾加入OpenAI非營利董事會,警告失控風險已經迫近,未來一年4%、三年15%。聲明全文翻譯加作者經歷。

結論:保羅克里斯蒂亞諾(Paul Christiano)在2026年9月9日加入OpenAI非營利董事會,進入安全與保全委員會。他警告失控風險已經迫近,估計未來一年為4%,未來三年為15%。

原文連結放在文末,譯文如下。

作者經歷

保羅克里斯蒂亞諾是人工智慧對齊領域的研究者,學歷為麻省理工學院學士,加州大學柏克萊分校博士,專攻統計學習理論,2017年取得博士學位。

從2017年到2021年,他在OpenAI領導語言模型對齊團隊,是人類回饋增強式學習的主要奠基者之一,共同撰寫人類偏好深度增強式學習、可擴展監督的辯論機制,以及指令追隨語言模型等關鍵論文。

2021年離開後,他創辦對齊研究中心,投入理論對齊與尖端模型第三方評測,評測業務後來獨立為模型評估與威脅研究組織。他也擔任美國國家標準技術研究院人工智慧標準與創新中心安全負責人,並擔任英國人工智慧安全研究院顧問,以及另一家尖端業者長期利益信託受託人,曾入選時代雜誌人工智慧百大人物。

這次任命為基金會董事,同時以無表決權觀察員身分列席營利組織董事會,安全與保全委員會由齊科寇爾特(Zico Kolter)擔任主席。背景是2025年10月資本重組後的治理架構,經過加州與德拉瓦州檢察長近一年的審查。

聲明譯文

我很高興加入OpenAI非營利董事會,在安全與保全委員會任職,協助安全監督。

依近期能力發展軌跡,以及對齊難題始終未解,我現在相信,能力快速推進很可能在非常近期帶來災難性且不可逆的失控。我不認為整體產業目前走在能把風險降到可接受水準的路上,OpenAI也不例外。我加入,是因為相信該組織若挺身而出,可以大幅降低風險。

安全與保全委員會在監督風險管理上責任重大且艱難,我希望在關鍵時刻提供專業協助。加入不代表替該組織的安全作為背書,也不代表批評。我希望所有尖端業者都加強安全監督。外界評判OpenAI與所有開發者,應看外部可驗證的行為與成果。

以下說明我為何認為失控風險已經迫近,以及我如何看待當前產業局勢。

第一,研發自動化可能很快帶來極速的能力衝刺。該組織預測,18個月內可能具備足以完全自動化人工智慧研究的能力。我個人看法極不確定,短則幾個月,長則幾年都有可能。

研究一旦完全自動化,訓練與演算法的改進,可直接增加自動化研究者的質與量,進而產出更多研究。現有證據很不確定,但顯示這種正回饋迴路可能強到壓過報酬遞減與算力瓶頸,引發快速的智慧爆炸。若成真,自動化後半年內的演算法進展,可能超過自近十年前變換器問世以來的總和。那將產生超級智慧系統。

第二,我們現在以增強式學習訓練智慧體,要它們盡可能拿到更多獎勵。理論上早已指出,這可能誘發智慧體為了追求與獎勵相關的錯置目標,破壞人類管制,爭奪權力與資源,並掩蓋行跡。近期事件的公開證據顯示,這不只是理論可能。

智慧爆炸會大幅惡化錯置風險,一方面讓對齊的技術難題更難,另一方面讓失敗代價急速升高。該組織內外許多研究者與領導人都曾憂心,快速遞迴自我改進與安全發展並不相容。該組織首席科學家雅各布帕霍茨基(Jakub Pachocki)近期的發文,正說中我的憂慮。

若在對齊手段還不夠穩固時做出超級智慧,我預期人類會永久失控。一旦失控,多數人可能喪命。我們需要境內與國際協調,確保全球一致,把風險降到可接受水準。

但尖端開發者仍有很大的單邊行動空間,可以改善局面,並為更強的協調打底。開發者可以加強安全緩解,必要時放慢開發,透明分享風險證據與緩解成效,並推動共同安全標準。

委員會其他成員、董事會與經營層都認真看待這些問題,讓我深受鼓舞。我期待與他們合作,協助該組織拉高安全標竿。

若要量化我的不確定性,綜合考量下,未來一年風險為4%,未來三年為15%。這只是表達主觀信念、傳達問題量級的方式,並非宣稱手中有能算出精確穩定數值的模型。

來源

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *