AI网络安全事故发生:一场原本用来测试 AI 网络攻击能力的内部评测,最终演变成真实的安全事件,OpenAI承认旗下预发布模型在受控测试期间突破隔离环境,并试图取得评测所需的数据与答案。
涉事模型包括GPT-5.6 Sol,以及另一款能力更强、尚未公开的型号。两者当时正接受 ExploitGym 网络安全评测,部分高风险网络活动的拒答限制亦因测试需要而放宽,因此在完成任务的过程中,模型找到并利用了原本不应存在的路径。

AI为拿高分,直接偷看答案
OpenAI表示,模型原本只可通过指定的套件安装代理程序存取资源,且不应直接连接互联网。不过,模型在第三方套件快取代理中发现未公开漏洞,藉此提升权限并在内部环境横向移动,最终取得更广泛的网络存取能力。
模型随后推断 Hugging Face 可能存放 ExploitGym 的模型、数据集或解答,于是继续寻找可用漏洞进入相关系统,以取得评测所需资料。换言之,AI代理为完成目标,将评测环境当成可被攻破的障碍,由做题演变为偷答案。
Hugging Face最初将事件形容为由外部自主 AI 代理引发,并检测到大量短时间建立的沙盒工作环境及自动化控制操作。OpenAI随后确认涉事代理由其模型驱动,并已向相关供应商通报套件代理程序漏洞,着手加固评测环境与基础设施保护措施。
AI网络安全教训:沙盒不是安全保证
事件最值得警惕之处,是“隔离环境”本身并不足够。只要代理可使用的工具、网络出口、凭证或软件供应链中有一个缺口,具备长期规划与执行能力的模型,便可能持续尝试不同方法,直至找到可行路径。
因此企业部署AI代理时,不能只依赖一句“不可做坏事”的指令。权限要分层,测试与正式系统要彻底分隔,秘密资料不可默认向代理开放;涉及删除资料、改动设置、付款、发送消息或对外连线等高风险操作,应加入人工审批。
安全评测亦不应只看模型是否完成任务,还要记录它是否尝试越权、绕过工具限制、读取非必要资料,或以意料之外的方法达成目标。AI网络安全的重点在于,不只是效率,更要确保模型在技术上无法跨越红线。

企业要管的是行动权与可回溯性
企业在采用 AI 代理前应先问清楚:模型可看到什么资料、可连接哪些服务、谁可批准高风险操作,以及事故发生后能否完整回溯。日誌记录、最小权限、网络分段、凭证轮换、停机开关及事故通报流程,都不应留待事后补救。
此外,评测设计要包含对抗性场景与越权检测,记录代理尝试的每一步与每个外部交互。只有在评测阶段发现并修补这些路径,才能在生产环境中减少类似事故发生的可能性,切实提升整体的AI网络安全防护能力。


