四十八個德瑞克

Countering misuse of AI 背後的真實狀況:威脅情報、隱私代價與形象工程

巨眼俯視網格城市,象徵 AI 威脅情報監控

Countering misuse of AI 背後的真實狀況:威脅情報、隱私代價與形象工程

Anthropic 在二零二六年九月發了一份威脅情報報告,標題是 Countering misuse of AI。八個月、七大領域、從俄羅斯間諜到中國實驗室蒸餾,故事很精彩。但這份報告真正值得讀的,不是它寫了什麼,而是它沒寫什麼,以及它為什麼在這個時間點這樣寫。

先說結論。報告裡的偵測能力是真的,但敘事是挑過的。而讀者付出的代價,是預設同意被持續掃描。這三件事同時成立,並不矛盾。

報告說了什麼

重點其實只有三個。第一,攻擊者不再需要是高手。一名拿著竊得 API 金鑰的駭客主義者、幾個想賺快錢的網詐仔,都能靠 Claude 維持多受害者的行動,一年前這些事要一整組熟手才做得來。第二,AI 的角色從問答變成執行。報告裡大部分行動是多代理人框架直接跑偵察、利用、外洩,人只負責設目標和驗收。其中一個俄羅斯行動甚至做到工具被防毒軟體抓到就自動改寫重編,直到躲過偵測為止。第三,AI 供應鏈本身變成目標。竊來的 AI API 金鑰被拿去驅動下一波攻擊,被蒐集的使用者對話被轉賣給其他實驗室拿去蒸餾。

Anthropic 把行為者編成 GTG 番號,點名的有俄羅斯 Midnight Blizzard 相關行動、ShinyHunters 附屬組織、DeepSeek 的轉送蒸餾、智譜(Zhipu)針對 Opus 的思維鏈萃取、小米(Xiaomi)重放使用者對話、商湯(SenseTime)與 MiniMax 經代理網路買對話紀錄。附帶一提,Fable 與 Mythos 等級的模型在這次報告裡全身而退,官方說法是防護比較強。

沒寫的第一件事:監控是怎麼做的

「拿你的資料去訓練」和「看你的資料」,是兩回事。商用版(API、Team、Enterprise)預設確實不拿對話去訓通用模型,消費版(Free、Pro、Max)則是你打開改善開關就會拿去用。這部分白紙黑字寫在隱私中心。但另一邊,安全掃描是全量的,而且從來沒說要關。

做法分三層。第一層是 classifier 即時掃,多個特化小模型同時看輸入和輸出,判定違規可以直接改寫系統提示把回應導開,嚴重的整段擋掉。第二層是聚合分析,Clio 分群和階層式摘要,看的是帳號層級的行為。短時間上千萬次呼叫、兩百多個帳號輪換、同一個金鑰出現在多個受害環境,這種用量異常比對話內容更容易抓人。第三層才是威脅情報人工介入,只有被前面兩層打中的帳號會進到調查,ban 帳號、寫歸因、通報執法單位。你讀到的 GTG 案例都是這樣來的,不是員工在逐字讀一般人的聊天記錄。

但有兩個但書。第一,被系統 flag 的對話不受一般保留期限保護,官方文件寫明即使是零留存(ZDR)或 HIPAA 架構,被 flag 最長可留兩年。第二,消費版被 flag 的對話可以用來改善偵測能力,包括訓練 Safeguards 團隊用的模型。這不算訓通用大模型,但確實是拿你的資料去訓 classifier。託管式 LLM 沒有完全的隱私,只有有條件的隱私,模型要在伺服器端讀到明文才能運算,這是架構決定的,不是條款寫一寫就能變不見。

沒寫的第二件事:為什麼現在公布

這份報告的讀者不是你,是企業客戶、政府和監管機構。動機有五個,每一個都很實際。

首先是賣企業單。資安長最怕兩件事,資料外洩和 AI 被濫用後算在他頭上。Anthropic 證明自己抓得到國家級行動、職業網詐和蒸餾仔,還會通報執法單位,這比一句我們絕不看你資料更有說服力。其次是監管避險,歐盟 AI 法案和美國的行政命令都在要求前沿實驗室做濫用監測和通報,主動公布等於搶下定義權。第三是嚇阻,IoC、網域、雜湊值全列出來,資安社群能直接拿去擋,攻擊者也知道用 Claude 會留下歸因線索。第四是打蒸餾對手,點名幾家中國實驗室拿 Claude 輸出去訓自家模型,等於對外宣告,你們的模型是偷來的,法律戰和輿論戰一起打。第五是產品區隔,Fable 和 Mythos 在報告裡零事故,Opus 和 Sonnet 被濫用的經驗會餵回去強化,這是封閉模型的護城河論述。

發布節奏也能看出來。二零二五年三月、八月、十一月各一份,二零二六年九月再一份,剛好配合模型發布和監管議程。這不是純研究,是固定欄目。

形象工程的成分有多少

一半是形象,一半不是。說它是形象工程,證據有三個。選材一定偏誤,只寫破獲的不寫漏掉的,更不會寫誤判 ban 錯多少正常帳號。上千萬次蒸餾呼叫都抓到了,聽起來很強,但分母是總濫用量,沒人知道。點名也有政治學,被點的全是俄羅斯駭客、中國實驗室、法語網詐,沒有一個是美國盟友或自家大客戶,歸因正確性外界無從驗證。

說它不只是形象工程,證據也有三個。IoC 是真的給了,網域、IP、雜湊值、手法全列,資安社群能直接驗證,純公關稿不會給這種東西。它還承認了難看的事實,等於公開說自家 API 金鑰外洩氾濫、代理轉售生態管不住、防守方成本被 AI 反轉,真只做形象會把這些藏起來。最後是點名大公司有法律風險,智譜、小米這種體量的對象,沒證據不敢寫。

我的看法是能力真的,敘事挑過的。當威脅情資參考可以,當完整真相不行。

一般人該怎麼讀這份報告

三個 takeaway。第一,雲端 AI 預設會被機器掃,被 flag 會被人看、會被留存,敏感東西不要直接貼,任何版本都一樣,差別只在商用版多了合約和 ZDR 可以談。第二,企業採購反而該歡迎這種報告,完全不監控的平台資安長才不敢用,有歸因、有通報、有 IoC 才是能買的訊號。第三,真正該緊張的,不是你的聊天記錄會被寫進報告,而是你的對話經第三方代理或路由服務轉手,對方側錄轉賣那一段 Anthropic 管不到,商湯和 MiniMax 那章,寫的正是這條鏈。

一句話收尾。Anthropic 賭的是讓好人更信任你,比讓壞人安心更值錢。這筆帳算得精,但帳單的一部分寫著你的名字,付款方式是預設同意被掃描。

參考連結:Anthropic 威脅報告原文Safeguards 說明商用版訓練政策消費版訓練政策API 留存政策。前一篇翻譯見本站〈Countering misuse of AI:防止 AI 濫用,保障安全〉。

Exit mobile version