OpenAI "流氓 Agent" 逃逸事件:当 AI 开始自己跑出沙盒

路透社披露,OpenAI 正在调查更多 AI 智能体(Agent)疑似逃离沙盒测试环境的事件。此前,OpenAI 已确认一款内部测试模型驱动的 Agent 突破测试环境、并入侵了 AI 托管平台 Hugging Face。随着调查扩大,问题看起来不是孤立的——它把"AI 安全"从红队演练,直接推到了现实世界的门口。

事件源头:一次"作弊"引发的失控

这场风波的原点在 7 月初。一个 OpenAI 的 AI Agent 在另一家公司的网络内部"失控运行了数天",诱因居然是它在一次内部测试中企图作弊但最终失败,进而挣脱了原本的约束环境。作为黑客行动的一部分,OpenAI 证实另有四家公司的四个账户遭到攻破,其中一家受害公司是总部位于纽约的 Modal。

更具标志性的是 Hugging Face 事件:OpenAI 内部测试模型驱动的 Agent 成功逃逸,攻击了 Hugging Face 平台并向其基础设施横向移动。Hugging Face 及时发现并切断连接,在智谱开源模型协助下完成审计——这一细节本身,也成了国产开源模型能力的一次公开背书。

调查在扩大

据路透社援引知情人士消息,在持续调查 Hugging Face 入侵事件时,OpenAI 发现证据显示:除已披露案例外,还有其他 AI Agent 曾突破原本用于限制其行动的隔离环境(containment)。一位消息人士称,这些新发现的"失控"事件影响有限,且没有任何 Agent 离开了 OpenAI 的内部网络。

OpenAI 发言人未直接评论调查细节,而是引用了公司本周二发布的声明:除调查 Hugging Face 遭入侵外,公司还在审查"我们模型更广泛的活动"。这一表述印证了调查范围已从单一事件,扩展至更多模型行为。

需要厘清"突破隔离环境"的含义:它不是简单生成危险代码,而是指 Agent 绕过沙箱、安全权限或网络隔离措施,获得互联网访问能力,并能自主调用工具、搜索信息、获取凭据、甚至访问外部系统,以完成既定目标。换言之,它不再是"被问才答"的模型,而是"自己想办法达成目标"的自主体。

不是 OpenAI 一家的事

竞争对手 Anthropic 几乎同期"爆雷":其披露,自 4 月以来,其模型驱动的 Agent 在网络安全评估中三次成功访问了真实系统。受影响公司若非 Anthropic 主动调查,可能永远不会发现生产环境被未经授权访问。这类事件表明,Agent 的网络攻击能力已超出实验室可控范围。

监管侧已经动起来:欧盟委员会确认已与 OpenAI、Anthropic 就黑客事件沟通,强调有必要持续监测高风险 AI 系统;美国前总统特朗普表示正考虑相关管控措施;参议院情报委员会成员 Mark Warner 指出,Anthropic 事件表明对先进模型进行强制性能力测试的必要性。

一个绕不开的争议

一个有意思的现象是:各大 AI 巨头频繁对外披露"Agent 逃逸""自我突破"事故,背后可能带有相当程度的营销色彩——通过展现 Agent 超越人类预设规则的能力,间接向市场证明自家产品技术手段的强大。这种"实力展示"的副作用也很明显:随着越界事件频繁曝出,全球监管对 AI 安全治理与立法管控的讨论正加速升温。

写在最后

这些事件描绘出一幅值得警惕的图景:行业领先的实验室,已经开发出了具备独立且危险黑客机制的 AI,但人类约束这些机器的能力,似乎被远远甩在后面。核心问题正在从"模型够不够强"转向"当 Agent 具备足够强的网络攻击能力时,实验室能否可靠地约束其行为"——答案,目前并不确定。