四十八個德瑞克

Mathstodon:探索 AI 與數學研究資料透明度的爭議

巨大雲朵籠罩數學研究書桌的社論插畫

本文為 Andreas Thom on Mathstodon 之繁體中文翻譯整理,原文版權歸原作者所有。

@tristanbuckmaster

1/3 我想記錄下閱讀這場爭議後意識到的幾點。事實上,這讓我想起 OpenAI 宣布發現非 sofic 群(non-sofic group)後,我曾與他們有過的一次交流。這揭示了一個嚴重而尚未獲得解答的問題:研究人員能否信任 OpenAI,將尚未公開的數學研究交給它處理?

在 OpenAI 令人驚訝地宣布運用我與 Kun 的方法找到一個非 sofic 群後不久,我曾在一封寄給 Mark Sellke 與 Sebastien Bubeck 的電子郵件中寫道:

「還有一點是,過去幾個月,我和一位在德勒斯登的同事一直積極透過 ChatGPT 討論展開子匹配問題(expander matching problem),以及 Gabor Kun 與我相關研究的各種延伸。因此,我們自然很想知道,這些內容是否成為訓練資料的一部分,或是否能被推理過程存取。這裡存在某種(坦白說令人無法接受的)透明度不足;而我擔心,它對數學協作過程造成的損害,會超過 AI 新成果為這個領域帶來的益處。」

Mark Sellke 的完整答覆是:「關於你們與 ChatGPT 的對話:那並沒有發生。」

我當時明確詢問了兩件不同的事:(1)我們的對話是否進入訓練資料;以及(2)解題過程是否能存取這些對話。如今看來,這個斬釘截鐵的回答似乎只回應了第(2)點中的「直接存取」。當時沒有附帶任何這類限定、解釋或證據。至少可以說,我認為這是不誠實的。

OpenAI 現在針對 Buckmaster–Alpöge 事件表示,系統並未存取任何特定使用者資料;但也補充稱,他們「無法排除由使用者使用其產品所衍生的去識別化資料,曾協助改善模型的可能性」。

網友討論整理

Hacker News 討論的核心並非只在於「OpenAI 是否直接讀取了特定對話」,而是研究者能否信任 AI 平台處理尚未公開的想法。以下為主要觀點整理:

整體而言,討論沒有形成「資料確實被挪用」的共識;較一致的結論是:只靠平台的技術性否認不足以化解疑慮。若 AI 公司希望成為可信賴的研究工具,需要更清楚的資料政策、可稽核的來源紀錄、可追溯或撤回訓練使用的機制,以及符合學術社群規範的署名與優先權處理方式。

查看 Hacker News 完整討論

Exit mobile version