Cloudflare 開源六階段 AI 程式碼安審:只報真的能打穿的漏洞
Cloudflare 把內部漏洞挖掘系統的起點開源了,叫 security-audit-skill。概念很直白:把你的 coding agent 變成安全審計員,多個平行 agent 照六個階段打一輪,最後只報那些真的有攻擊場景、真的有影響的漏洞。
我把它收進工具庫研究了一遍,連 GitHub 上的 issue 回饋一起看完。這篇把重點整理給你。
六個階段在幹嘛
流程是 recon、hunting、validation、reporting、structured output、independent verification。
第一階段先派偵查 agent 畫出架構圖:信任邊界在哪、輸入面在哪,產出 architecture.md。第二階段開打,一群 hunter agent 從不同角度啃原始程式碼,注入、存取控制、商業邏輯、密碼學、功能濫用、鏈式攻擊,外加一個 wildcard,有需要還能再派子 agent 往下挖。
第三階段最有意思:換一批完全不同的 agent,專門負責證偽前一輪的發現。找到漏洞的人不能自己驗收,這條對抗式審查砍掉了大量誤報。
後面三階段是輸出:人類可讀的 REPORT.md、機器可讀的 findings.json(有 JSON schema 和驗證器),最後再派全新的 agent 把每一條事實聲稱拿回原始程式碼逐條核對。
兩個設計很對味
第一,預設是諮詢模式。你問安全問題,它就回答,不會自作主張建一堆檔案。只有當你明確說要完整審計,它才跑全流程。skill 載入不等於授權開工,這條界線很多 agent 工具都沒畫清楚。
第二,嚴重程度只看影響。Likelihood 乘以 impact,不是拿 checklist 一條條對。少了縱深防禦的某一層不算漏洞,只能記成強化建議。聽起來嚴格,但這正是誤報率低的原因。
社群實測潑了兩盆冷水
有人跑了盲測比對,單一種子目標,三種方法各跑三輪。precision 中位數九成,刻意放的誘餌零誤報,每條發現都有原始程式碼出處。這部分確實強。
但 recall 只有 0.467,跟兩美元成本的單 agent 審查打平,而它自己一輪要花三十美元。貴了十四倍,沒多找到東西。這是目前最大的問號。
另外幾個坑:相依套件的已知 CVE,它完全不掃。這是 sandbox 斷網的設計使然,只是文件沒先講;在 Antigravity 配 Gemini 上會整波卡死,因為平台根本沒有 general agent 類型,加上 pentest 措辭觸發安全過濾;多個 skill 並存時自動觸發會被別的 skill 搶走,得用明確指令叫它。
我的看法
這東西定位是深,不是廣。拿它掃依賴漏洞是找錯人,拿它深挖單一 repo 的邏輯缺陷才是正解。跟動態測試工具疊著用更好,一個負責靜態找,一個負責動態驗證。
想試的人建議先從諮詢模式開始,問它自家 repo 的安全問題,不跑全流程零風險。完整審計很吃 token,跑之前先看配額。
原始 repo 在這:https://github.com/cloudflare/security-audit-skill,MIT 授權。
