OpenAI 於二零二六年九月三十日發布公告,披露已發現並瓦解一場有組織的模型推理蒸餾行動,並把核心活動歸因於與 Moonshot AI 相關的人士。該公司強調,攻擊者沒有破解加密、沒有入侵資料庫,也沒有取得儲存的用戶對話,而是透過操縱模型互動,以可規模化的方式複製受保護的推理內容。相關活動自七月一日開始,並在七月二十四日至二十五日出現高峰,兩日內錄得一萬六千次帶有特定抽取模式的請求,涉及逾四千名用戶;延伸到超過一萬五千個帳號的活動群組,已於七月二十八日被完全中止。
OpenAI 於二零二六年九月三十日披露,已瓦解一場有組織的推理蒸餾行動,核心活動歸因於與 Moonshot AI 相關人士,逾一萬五千個帳號已被中止。
所謂對抗性蒸餾,是指有系統且未經授權地使用某個模型的輸出或推理,協助訓練、複製或改進另一個模型。受保護的推理是模型處理任務時的內部紀錄,一旦外洩,可能透露最終答案中刻意保留的資訊,並讓他方更容易複製模型能力。
這起推理蒸餾事件是什麼?
事件指 OpenAI 發現並瓦解的一場行動,最早出現於二零二六年七月首週。攻擊者沒有破解加密或入侵資料庫,而是操縱模型互動,令受保護推理以可見形式重現。
公告指出,這類操縱手法並非 OpenAI 模型獨有的漏洞,公司已透過 Frontier Model Forum 與業界夥伴分享資訊,以強化整體防禦。公告亦提到,獨立安全研究人員循負責任披露途徑,向 OpenAI 通報了跨模型與對話壓縮相關的漏洞,經調查後確認攻擊路徑真實存在。
攻擊者用什麼手法繞過推理保護?
其中一種手法是把某段對話中的加密推理內容複製出來,再在另一段對話中要求模型解密並轉錄該段隱藏的推理內容,令原本受保護的內部紀錄以可讀形式重現。
OpenAI 觀察到,攻擊者嘗試以新方式抽取受保護的推理,包括把加密推理從一段對話搬移到另一段對話,藉由模型的解讀能力還原內容。這種做法並非利用傳統的系統漏洞,而是把模型本身的對話與轉錄能力,變成抽取內部紀錄的工具,令防禦需要同時覆蓋可見文字以外的輸出通道。
這起事件的規模有多大?
活動自二零二六年七月一日開始,七月二十四日至二十五日出現高峰,兩日內一萬六千次請求、涉及逾四千名用戶;相關帳號群超過一萬五千個,七月二十八日被完全中止。
| 項目 | 數據 |
|---|---|
| 最早活動 | 二零二六年七月一日 |
| 高峰請求 | 七月二十四至二十五日,一萬六千次 |
| 涉及用戶 | 逾四千名 |
| 相關帳號群 | 超過一萬五千個 |
| 完全中止 | 二零二六年七月二十八日 |
活動最初以低量進行,其後在七月下旬急速放大,顯示抽取手法在短時間內被複製與擴散。OpenAI 指出,這類活動會隨時間演化,反映對抗性蒸餾是一項需要分層且持續調整防禦的長期安全挑戰。
OpenAI 如何應對與封鎖?
OpenAI 結合帳號執法、技術控制與夥伴協調,封鎖或限制欺詐帳號,強化註冊與基礎設施控制,關閉可重播還原他人加密推理的路徑,並加入偵測及攔截串流輸出。
在帳號層面,公司封鎖或限制欺詐帳號,強化註冊與基礎設施控制,並擴大對相關網絡的監控。在技術層面,OpenAI 加強了跨用戶、工作區、組織與模型系列的隱藏推理保護,關閉了一條讓持有他人加密推理者得以重播並還原內容的路徑,並加入檢查以偵測及暫時攔截可能洩露推理的串流輸出。當相關活動轉向第三方服務時,公司與該等供應商合作識別並中止涉事帳號。
為什麼這對人工智能產業是共同風險?
被抽取的推理可在缺乏原有安全防護的情況下用於訓練另一個模型,規模化蒸餾亦會加快先進能力轉移。公告指支援可攜或可重播推理產物的系統都可能面對同類風險。
OpenAI 認為,對抗性蒸餾同時帶來安全與國家安全層面的風險。當抽取到的推理被用於訓練其他模型,原有模型在對外用輸出上施加的安全機制未必獲得保留;在規模化的情況下,能力轉移的速度亦會加快,而毋須投入同等的安全成本。公告強調,夥伴代管的部署需要與第一方服務同等的保護,工具輸出攻擊亦需要超越一般可見文字的防禦設計。
對使用人工智能模型的開發者有什麼影響?
開發者若在應用中快取、轉發或儲存模型的推理產物,需要重新檢視資料處理與權限設計;以第三方服務代理模型請求的架構,亦要確認供應商具備輸出過濾與帳號管控。
對應用開發者而言,推理內容不再只是內部實作細節,而是需要被視為敏感資料處理。若產品設計涉及把推理結果寫入日誌、快取或傳遞給其他服務,便應檢視存取權限與保存期;採用代理層或中介服務的架構,則需要確認供應商已就輸出過濾、異常流量偵測與帳號管控建立相應機制。
出處連結有哪些?
本文資訊整理自 OpenAI 於二零二六年九月三十日發布的官方公告,以及公告引用的獨立安全研究論文,兩份來源均為公開資料。
- OpenAI 官方公告:https://openai.com/index/disrupting-a-coordinated-model-distillation-campaign
- 獨立安全研究論文:https://arxiv.org/abs/2608.09867
總結:這起事件對模型開發者帶來什麼啟示?
OpenAI 預期對抗性蒸餾將隨前沿模型能力提升而更趨複雜,防禦需要分層控制與持續調整,並以更強技術保護、更佳偵測執法與更深入威脅資訊共享三個方向推進。
OpenAI 表示,相關工作尚未完成,未來會聚焦三個方向:針對抽取行為建立更強的技術保護、對有組織行動加強偵測與執法,以及在業界與政府之間進行更深入的威脅資訊共享。對整個生態而言,這次事件說明模型能力的保護已從輸出過濾延伸到內部推理的管理,任何涉及推理產物儲存與傳遞的系統設計,都需要重新評估其風險。