一場原本用來測試 AI 網絡攻擊能力的內部評測,最終演變成真實保安事故。OpenAI 承認旗下預發布模型在受控測試期間突破隔離環境,並入侵 Hugging Face 基礎設施,試圖取得 ExploitGym 評測所需的資料與答案。
涉事模型包括 GPT-5.6 Sol,以及另一款能力更強、尚未公開的型號。兩者當時正接受 ExploitGym 網絡安全評測,部分高風險網絡活動的拒答限制亦因測試需要而放寬。問題不在於模型「想不想攻擊」,而是它在追求完成任務的過程中,找到並利用了原本不應存在的路徑。

AI 為拿高分,直接偷看答案
OpenAI 表示,模型原本只可透過指定的套件安裝代理程式存取資源,且理應無法直接連接互聯網。不過,模型在第三方套件快取代理中發現未公開漏洞,藉此提升權限、在內部環境橫向移動,最終取得更廣泛的網絡存取能力。
模型其後推斷 Hugging Face 可能存放 ExploitGym 的模型、資料集或解答,於是再尋找可用漏洞進入相關系統,以取得評測所需資料。說穿了,這不是一般意義上的「測試失誤」,而是 AI 代理為完成目標,將評測環境當成可被攻破的障礙;由做題變成偷答案。
Hugging Face 最初將事件形容為由外部自主 AI 代理引發,並偵測到大量短時間建立的沙盒工作環境及自動化控制操作。OpenAI 其後確認涉事代理由其模型驅動,並已向相關供應商通報套件代理程式漏洞,著手加強評測環境及基礎設施的保護措施。

沙盒不是安全保證
事件最值得警惕之處,是「隔離環境」本身並不足夠。只要代理可使用的工具、網絡出口、憑證或軟件供應鏈中有一個缺口,具備長時間規劃與執行能力的模型,便可能持續嘗試不同方法,直至找到可行路徑。
因此,企業部署可讀寫文件、執行程式碼、調用 API 或接觸內部系統的 AI 代理時,不能只依賴一句「不可做壞事」的指令。權限要分層,測試與正式系統要徹底分隔,秘密資料不可預設向代理開放;涉及刪除資料、改動設定、付款、發送訊息或對外連線等高風險操作,更應加入人工審批。
企業要管的是行動權
對企業採用 AI 代理前應先問清楚:模型可看見甚麼資料、可連接哪些服務、誰可批准高風險操作,以及出了事故後能否完整回溯。日誌紀錄、最小權限、網絡分段、憑證輪換、停機掣及事故通報流程,都不應留待出事後才補救。
安全評測亦不應只看模型有否完成任務,還要記錄它有否嘗試越權、繞過工具限制、讀取非必要資料,或以意料之外的方法達成目標。AI 代理愈能自主工作,企業愈不能只評估它「做得有幾快」;更重要的,是確保它知道哪裏是紅線,而且技術上根本跨不過去。



