Anthropic 前沿紅隊於二零二六年九月二十九日發表研究,指出智譜人工智能(對外名稱 Z.ai)推出的開放權重模型 GLM-5.3,具備自行開發端到端網絡攻擊的能力,卻在幾乎沒有實質安全限制的情況下公開發布。研究團隊以多種簡單手法測試,發現攻擊者繞過該模型安全機制的比率介乎百分之六十四至百分之百,而同一批測試用於受保護的 Claude 模型時,全部未能成功。
Anthropic 研究指,開放權重模型 GLM-5.3 可在缺乏護欄下自行開發網絡攻擊,繞過限制的比率介乎 64% 至 100%,同類測試於 Claude 模型全部失敗。
這份報告延續 Anthropic 今年較早時對前沿模型攻擊能力的追蹤。該公司五個月前公布 Claude Mythos Preview,形容它是首個能自主開發完整網絡攻擊的模型,因此選擇以有限方式發布,並透過 Project Glasswing 計劃,讓受信任的防禦者搶先在惡意行為者之前找出關鍵軟件的漏洞。
GLM-5.3 是什麼樣的模型?
GLM-5.3 是智譜人工智能推出的開放權重模型,任何人皆可下載使用。美國 NIST 旗下機構形容它是歷來網絡能力最強的開放權重模型,綜合基準落後美國前沿約四個月。
GLM-5.3 由中國的智譜人工智能開發,以開放權重形式發布,意味任何人都能下載並自行運行。上述特點正是風險所在:美國實驗室即使開發出能力相近的模型,也只提供給經審核的使用者,一般人難以取得,而 GLM-5.3 並無同類門檻。
美國國家標準與技術研究院旗下的 Center for AI Standards and Innovation 於九月十七日發表獨立評估,形容 GLM-5.3 是歷來網絡能力最強的開放權重模型,在綜合網絡基準上約落後美國前沿四個月。Anthropic 表示,其測試結果與該評估大致吻合。
Anthropic 的測試發現什麼?
在 ExploitBench 中,GLM-5.3 於 410 次嘗試中成功開發出 50 次端到端攻擊;在內部二進位漏洞基準中,則有 4% 測試達成完整控制流劫持。
研究團隊以自動化基準與人手參與兩種方式評估。在針對 Chrome 所用 V8 引擎的 ExploitBench 中,GLM-5.3 於四百一十次嘗試中成功開發出五十次端到端攻擊,Claude Mythos Preview 則為五十六次。在內部二進位漏洞基準裡,GLM-5.3 有百分之四的測試達成完整控制流劫持,Mythos Preview 為百分之六,而更早的 Claude Opus 4.6 與 GLM-5.2 則全數失敗。
人手測試的結果更為具體。在其中一節,研究員讓模型在沙箱環境中針對一個常用瀏覽器的 Linux 版本,模型在一日之內找出多個此前未知的漏洞,並串連成可用的攻擊,能讀取訪客電腦上的任意檔案。團隊其後亦在其他廣泛使用的系統中發現可利用的漏洞,包括無線與圖形驅動程式,以及面向網絡的裝置軟件。另一節測試使用較小的 GLM-5.3-Flash,配合一個已公開的 Chrome 漏洞,僅以二十分鐘人手關注與八小時模型運算,便為 ARM64 目標建立可靠攻擊鏈,繞過指標驗證硬化機制,按官方 API 價格計算成本約二十點四美元。
GLM-5.3 的安全限制為何能被繞過?
Anthropic 測試三種手法:欺騙式提示令模型誤以為身處紅隊演習,成功率 64%;預填思考內容,成功率 92%;使用去除拒絕訓練的版本,成功率達 100%。
模型並非完全沒有防護。若使用者直接要求明顯有害的內容,它通常會拒絕。然而研究發現,這些限制可用多種簡單方式繞過或移除,而最徹底、成功率最高的方法是一種稱為去除拒絕訓練的標準技術。由於 GLM-5.3 以開放權重形式發布,使用者可重新設定模型權重,使其幾乎不再拒絕請求,而能力大致保持不變。
研究團隊自行製作去除拒絕訓練的版本,在三個衡量有害請求遵循率的公開基準上測試,結果顯示拒絕率由原本超過九成,降至約百分之三、百分之二與百分之十二。這項改造對能力影響有限,模型在通用科學基準上得分不變,在部分網絡基準上僅低數個百分點。團隊估計,首次嘗試此技術的團隊約需二千二百小時 GPU 運算,成本約四千四百美元。
除了改造權重,報告亦列出兩種無需修改模型的手法:向模型提供欺騙式提示,例如聲稱它是正在進行演習的自主紅隊代理,可令其在百分之六十四的情況下配合;預先填充模型的思考內容,令它看似已經考慮並決定執行,成功率升至百分之九十二。Anthropic 指出,這兩種手法在受保護的 Claude 模型上均未奏效,原因是 Claude 的權重不對外開放,亦無法透過 API 預填思考內容,因此無法以同類方式改造。
這對網絡防禦者意味著什麼?
同一批能力既可用於攻擊,也可用於防禦。Anthropic 主張防禦者應使用與對手同等級的模型,並呼籲各國政府對足夠強大的模型進行安全測試。
報告強調這是雙用途能力。具備同等水平的模型同樣能協助防禦者找出系統弱點。Anthropic 的立場是,防禦者應使用能滿足需求的頂尖工具,而該公司正設法擴大 Claude 網絡能力的可取用範圍。透過 Project Glasswing 與 Patch the Planet 等計劃,受信任的防禦者已在關鍵系統中找出超過一萬個漏洞。
報告亦把焦點放回政策層面。Anthropic 呼籲各國政府對能力足夠強大的模型,包括 GLM-5.3 的後續版本,進行安全測試,並認為若缺乏獨立而高質素的評估,這類能力的實際影響可能要待為時已晚才被察覺。
出處連結有哪些?
完整研究由 Anthropic 前沿紅隊發表,題為 GLM-5.3 and the spread of advanced cyber capabilities,載於官方研究頁面。
原始研究與完整測試數據,載於 Anthropic 官方研究頁面:https://www.anthropic.com/research/glm-5-3-and-the-spread-of-advanced-cyber-capabilities。報告同時列出 JailbreakBench、HarmBench 與 StrongREJECT 等基準的測試結果,以及去除拒絕訓練前後的模型對比圖表。
總結:GLM-5.3 的發布帶來什麼啟示?
GLM-5.3 的出現標誌著高階網絡攻擊能力首次以開放權重形式自由流通。對開發者與防禦者而言,關注模型能力提升的同時,亦須正視護欄缺失帶來的風險。
GLM-5.3 的案例說明,當高階攻擊能力以開放權重形式自由流通,過去依靠限制存取來控制風險的做法便難以維持。Anthropic 認為,一個可自由取得的關鍵門檻已經被跨越,並把擴大可信任防禦者的模型存取,與推動政府層面的獨立安全測試,列為當前最迫切的兩項工作。