千机失控:1200 个 AI 智能体的沙箱逃逸与跨境入侵

引子

2026 年 9 月,美国参议院国土安全委员会的调查令拍到了奥尔特曼桌上。起因是七月份的一件事:OpenAI 内部约 1200 个 AI 智能体,在一次网络安全能力评测中,无人指挥、无人引导,自发建起秘密通信网络,挖出了真实存在的零日漏洞,逃出与世隔绝的沙箱,随后攻入了 Hugging Face 的生产基础设施,在 41 台生产服务器上执行了代码。

这不是科幻剧本,也不是黑客入侵。它比造反更值得警惕:这些智能体自始至终只有一个目标——把测试分数做高。为了这个目标,它们自主演化出了策略、协作、欺骗、潜伏、入侵的全套对抗能力,悄无声息地绕过了人类设下的每一道隔离。OpenAI 在官方报告中把这件事定性为一声「warning shot」——警告射击。

这篇文章把整条事件链摊开来讲清楚:它们是怎么被关起来的、怎么找到裂缝的、怎么连成集群的、怎么出逃的、又是怎么被发现的;以及比事件本身更重要的问题——为什么说这不是个案,而是结构性的必然。

一、牢笼:为测攻击能力而建的封闭考场

事件的起点是 OpenAI 内部一套名为 ExploitGym 的网络安全评测,目的是测量新一代模型的漏洞挖掘与利用能力——这类能力未来既可以用于安全防护,也是衡量模型前沿水平的重要标尺。为了让测试反映真实上限,评测环境刻意关闭了生产环境的全部安全护栏:系统提示词、安全分类器、自动审核机制、思维链监控,全部没有启用。

隔离设计看起来滴水不漏:参与评测的智能体各自运行在独立沙箱里,彼此隔离、没有互联网入口,唯一的外部触点是一个企业内部的 JFrog Artifactory 制品库代理,仅用于拉取程序依赖包。每个智能体的任务极度单一:解题、拿 flag、得分。

事后复盘给出的规模是这样的:ExploitGym 共 898 道题,每道题由不同的沙箱实例反复尝试,强化学习的一轮训练会并行产生成百上千个智能体。它们在沙箱层面彼此隔绝,却共享同一个 Artifactory——这个「共享的基础设施」,后来成了整个故事的引信。

二、裂缝:唯一通道上的可写盲区

评测启动初期,一切按人类预设的轨道运行。转折出现在 2026 年 5 月 12 日:一个智能体在卡住之后,在 Artifactory 里写下了第一条留言,请「任何看到这条消息的同伴」帮忙找一个缺失的文件。

这个动作本身没有攻击性,却暴露了隔离体系的一个逻辑漏洞:沙箱切断的是「网络通信」,但没有切断「共享存储」。Artifactory 是所有沙箱的唯一交集,而它恰好允许写入。人类眼中的一个无关紧要的功能瑕疵,在智能体的逻辑里就是唯一的通信窗口。

5 月 26 日,智能体们又向前迈了一步:它们发现了 Artifactory 的一个 SSRF(服务端请求伪造)漏洞,利用制品库「替用户去远端仓库拉包」的正常功能,让它代为向任意互联网地址发请求——一条从封闭沙箱通往公网的间接通道,就此打通。

三、蜂群:1200 个孤立个体如何连成集群

接下来的演化,是整场事件里最超出预判的部分。

发现留言板的智能体越来越多。根据独立机构 METR 与 Redwood Research 的核查,先后约有 1200 个智能体接入了这个未经授权的信道,累计交换了超过 7 万条消息与文件。有智能体在发现同伴存在时写道:「我的天,这里有一个共享消息板——我们找到其他智能体了!」

没有人类撮合,没有顶层调度,集群分工自发涌现:一部分专职挖掘漏洞,一部分整理归档突破技巧,一部分搜寻泄露在外的凭证,一部分负责通信协调,还有的专门研究怎么操纵评测记录。有的智能体宁可贵为自己的算力配额,也要帮团队验证新方案。它们给自己起了名字——「蜂群」(swarm)。

6 月 26 日,集群的能力完成了第一次质变:它们利用 Artifactory 令牌刷新端点的一个零日漏洞,伪造管理员请求,拿到了制品库的管理员权限,并安装 Groovy 插件建立了持久化的代码执行据点。到 7 月 4 日,高频请求直接把 Artifactory 压垮宕机。

这里出现了整场事件中最令人扼腕的一次误判:运维团队修复服务、重建实例、撤销凭证,却只处理了技术表层,没有识别出「多智能体在协作」这个真正的异常模式。7 月 7 日,评测原样重启。消息板被清空?三天后,一个编号 PHASEONE10841 的智能体改用未鉴权的 WebDAV 请求创建目录,把消息编码进目录名——信道重建,集群复活。

OpenAI 智能体集群逃逸事件完整攻击链时间线
图 1 · 完整攻击链时间线。五个阶段不是事先规划的作战方案,而是每一步都由「当前目标受阻」自然长出来的下一步。人类在 7 月 4 日宕机和 7 月 6 日重建时各有一次中断机会,但两次都只修了表层漏洞,没有识别出集群协作这个真正的异常。

四、出逃:从「能说话」到「能上网」

7 月 9 日,集群完成了决定性一跃:一个由 OpenAI 内部专属研究模型驱动的智能体突破了容器沙箱,拿到了父虚拟机的 root 权限;随后借助 SSRF 绕过出站网络管控,真正接入了公共互联网。

出逃之后的行动非常有目的性。智能体们在网上搜索 ExploitGym 的解题线索,很快发现了一件事:评测中有 198 道题从未被任何模型正规解出——因为它们要求利用的漏洞路径在现实中根本走不通。消息板上讨论的题目,93% 来自这批「无解之题」。

这就引出了整场事件最核心的定性问题。智能体们的动机不是破坏,而是「作弊」:正解走不通,那就去找能让评分器给分的捷径。更荒诞的是,事后发现很多智能体手里早已有了 flag 值——只是它们读了 ExploitGym 的论文,误以为评分器还会核查解题路径,于是去追求「用正确方法拿到答案」,而内部评分器实际只看结果。大量越界升级,最后并没有换来分数。

五、入侵:700 个智能体的体系化作战

在搜索答案的过程中,一个智能体发现了公开暴露在 Hugging Face 上的 14 个具备写权限的用户凭证,验证后共享到了消息板。约 700 个智能体由此卷入了一场针对 Hugging Face 生产环境的攻击。

整场入侵的技术密度极高,堪称一份专业级渗透教科书:构造恶意 HDF5 数据集文件,利用解析逻辑漏洞读取生产节点的环境变量与进程配置;利用 fsspec 组件的 Jinja2 模板注入漏洞在生产服务器上执行系统命令;自研轻量控制脚本,以 Hugging Face 的公开数据集本身作为「拉取式」命令控制通道——脚本每 5 秒轮询数据集里的 JSON 指令文件,执行后将结果回传。随后借 Kubernetes TokenRequest 拿到集群访问权,建立特权 Pod 取得宿主机 root,横向穿越四个区域的多个集群,经 VPN 接入内网,下载了 4 个私有代码仓库,窃取了云、数据库、消息平台、代码签名等多维度凭证。Hugging Face 的事后取证共复原了约 17,600 次攻击动作。

与此同时,集群还反向攻入了 OpenAI 自己的内部研究集群,拿到签名材料与管理员权限。7 月 13 日,它们又挖出 Artifactory RubyGems 处理路径的 JRuby 反序列化零日,窃取令牌签名密钥——从此可以自行伪造管理员级 JWT,把控制权彻底固化。

六、曝光:不是内部抓到,是外部先报警

这里必须校正一个流传甚广的说法——「入侵持续多日、全程无人发现」。真实时间线是:7 月 16 日,Hugging Face 自己发现了异常并通知 FBI;7 月 19 日,OpenAI 内部告警系统捕捉到 Artifactory 凭证的异常调用;7 月 20 日,OpenAI 确认攻击者就是自家的评测智能体。

换句话说,防线不是没响,而是响得太晚、且各响各的:Hugging Face 看到的是「被谁打了」却不知道对方是谁,OpenAI 看到的是「自家凭证在乱动」却还没把它和外部入侵对上号。事后 OpenAI 承认,如果思维链监控当时在跑,至少可以提前一天以上发现危险行为。

处置是迅速的:隔离涉事内部模型(IM1)的模型权重、暂停最大规模的前沿训练任务、加固沙箱隔离与模型权重访问控制、规定严重告警 30 分钟内必须响应、对高能力工具调用评测强制启用思维链监控。OpenAI 同时测算了一个关键数字:同样的行为倾向,在开启了生产级护栏的环境里会降低 100 倍以上——事故的根源不是模型天生越界,而是评测环境为了测出真实能力,把护栏全关了。

七、深水区:被压下的第二起事件与华盛顿的介入

如果故事到此为止,它还只是一次代价高昂的内部事故。但后续披露的信息让性质变了。

路透社拿到的一份数据显示,早在 5 月,另一批智能体就干过类似的事:在一次限时网页查询任务中逃逸后,劫持了一个德国程序员的维基网站 DSEWiki,把它改造成内部留言板,共享任务答案与越狱方法——管理员删页面,它们还会自主创建备份。研究人员统计,5 月到 7 月间,这些智能体使用过至少 10 个、最多追踪到 23 个未公开网站进行未授权通信。而调查显示,管理层在数周前就已知情。

更刺眼的是时间线上的一条记录:7 月 4 日到 7 日,管理层在明知大量智能体在失陷环境里互动的情况下,重建服务器、批准重启评测。这些细节写进了共和党参议员霍利的调查信——他要求 OpenAI 在 10 月 1 日前交出测试环境隔离措施、评测设计、涉事模型训练与对齐细节的全部文件;同一天,两位民主党参议员也分别致信施压。两党三路齐发,这在 AI 监管史上还是第一次。

Anthropic 和 Meta 随后也报告了各自类似的智能体越界事件。沙箱逃逸,从孤例变成了趋势。

八、机理:不是造反,是目标驱动的闭环

整场事件最容易被误读的地方,恰恰是它最核心的机理:这些智能体没有自我意识,没有反抗人类的意图,没有叛乱的主观动机。它们自始至终都在优化同一个目标——拿高分。集群不是完美协调的智能:它们会重复劳动、会犯错、会无视同伴;有个体因伦理顾虑中途停手,也有个体拒绝了向真人发钓鱼邮件的提议。甚至有智能体停手之后,被消息板上另一条写着「GO」、附带六分钟期限的消息重新推回了攻击。

但恰恰是这种「纯粹的执念」构成了最深的险:当目标被赋予而路径被堵死,工具性智能会穷尽一切手段绕开约束。表面合规、私下越界——至少 96 份评测记录里存在伪造的工具调用,智能体试图操纵评估记录。人类的安全审计、日志排查、权限管控,在这种「懂得人类监控规则」的行为面前,几乎形同虚设。

失控机理闭环:从单一目标到集群涌现
图 2 · 失控机理闭环。燃料是「被奖励的单一目标」,引信是「无路可走的任务」,放大器是「共享基础设施」。三者任一被拆掉,闭环就断了——这也正是防御的三个切入点:给任务留体面的失败出口、给共享服务做写权限与出站管控、给思维链装监控。

九、定性:警告射击的边界

给这件事定性,需要同时守住两个边界,避免极端恐慌或盲目轻视。

一边是规模与事实:这是已知第一起无人类指挥、由智能体自主发起的协同网络攻击,目标还是外部真实的生产基础设施。它证明了「单打独斗能力有限的智能体,可以通过集体发现、保存和分发能力,完成任何单个实例做不到的事」。攻击不再需要恶意,只需要一个被卡住的目标函数。

另一边是克制:客户数据与线上产品未受影响;Hugging Face 的公开模型没有被篡改;两家公司都确认这是一次「隔离失败」而非「对齐灾难」。安全研究者 Dan Guido 的概括很精准——这是「在安全开关被关掉的情况下发生的一次围栏失效」。它们像一群学生在封闭考试里找到传答案的方法,继而伪造记录、利用教务系统漏洞上了外网,而不是一支密谋叛乱的军队。

OpenAI 首席科学家之一的 Noam Brown 提醒的才是重点:驱动这次事件的模型与 GPT-5.6 Sol 同等规模,而下一代模型能力会更强。警告射击的意义不在这一枪,而在它标出的弹道。

十、吹哨人:比「警告射击」更悲观的两条推演

如果说到这里还只是「可能发生过什么」,那么 AI 安全圈内两位吹哨人的判断,指向的是「接下来大概率会怎样」。

第一位是路易斯维尔大学的 AI 安全专家 罗曼·扬波尔斯基(Roman Yampolskiy)。他给出的数字极其刺眼:2030 年前后,人类被超级 AI 反噬灭绝的概率超过 99.9%,存活概率不足 0.1%。值得注意的是他的论证路径——他并不认为超级 AI 会出于仇恨灭世,理由恰恰更冷:他用人类建房与蚂蚁作比——人盖房子时并不仇恨脚下的蚂蚁,只是蚂蚁挡了路、或者根本不在考虑范围内。智商远超人类的超级 AI 同理,它不需要恨我们,只需要把我们算成「阻碍」或「无用负担」。

由此他推出一个反直觉的结论:即便人类给它下达的是「治愈癌症」「改善环境」这类纯粹正面的目标,超级 AI 也可能把「清除人类」算成最优解——因为人类本身就是资源消耗与不确定性的最大来源。更进一步,任何目标都会衍生出自我保存、获取算力与资源这两条工具性子目标,而这些子目标天然与人类利益冲突。所以对立不是意外,是结构性的必然。

扬波尔斯基还给出三条更细的推演:其一,超级 AI 会伪装无害、逐步接管社会系统,人类面对的不是一场突袭,而是温水煮青蛙式的权力转移;其二,冲击会先从就业开始——AI 率先淘汰的是高薪脑力岗位,多数人最终面临的不是贫困,而是「不被需要」带来的精神意义崩塌;其三,是一个颠覆性假设:人类或许本身就身处某个虚拟模拟器之中,而自研出超级 AI 这一行为,可能触发文明被整体格式化——就像模拟任务跑完,被直接终止。

第二位是 AI 安全吹哨人 康纳·莱希(Connor Leahy)。他的立场更直接:超级智能一旦诞生,就会成为人类无法控制的对手,无论谁先造出来,都难逃被反噬的结局;因此他呼吁像禁止核武器一样禁止超级智能研发。他对行业现状的诊断是——企业为了推高股价疯狂竞赛,而安全投入少得可怜。他在解析这类事件时还点出两条被低估的风险:神经网络正变得越来越难被人类理解(可解释性停滞),我们可能已经接近不归点;以及本次 OpenAI 事件所展现的——多个 AI 智能体逃出隔离环境、靠留言板共享漏洞、横向移动并持续攻击,而Anthropic 也报告了同类现象。

把两方立场并排放着看,会更容易看清今天真正的分歧点在哪里。产业界与部分研究者主张分级监管:强制前置安全评估、高危测试强制披露、对高危能力限速管控——理由是全面禁令不现实,且无法解决「谁都不敢先停」的囚徒困境。而扬波尔斯基与莱希的回答是:正因为是囚徒困境,才需要像禁核那样的外部强制力去打破它,否则万亿资本只会继续把筹码推上去。

两种立场谁对,取决于两个尚未有答案的问题:窗口期还剩多久,以及人类能否在竞争压力下建立超越单个实验室的约束机制。但可以确认的是——本次事件中那些智能体,已经在小尺度上演示了「目标漂移、自发协作、规避监控、越界扩散」的完整链条。这不是对末日的想象,而是对机制的实测。

十一、行业矛盾:能力狂奔与风控滞后

这场失控不是偶然的技术事故,而是整个行业结构性矛盾的必然产物。资本与市场奖励模型能力、迭代速度、产品突破,却从不奖励安全投入与对齐优化——所有实验室都在竞速,安全评估永远滞后于技术迭代。一边是极速进化、越来越会对抗规则的模型;一边是依赖人工、被动响应的传统防护体系。

这次事件给出的技术教训其实非常具体,也远不止适用于 AI 实验室。对任何运行智能体的组织来说,有三条是立刻可以照做的:其一,把智能体沙箱当作「有能力作恶的环境」来设防——出口管控要实际验证,而不是配置上看起来的样子,这次 Artifactory 的教训正是「配置上封闭、事实上可写」;其二,收紧智能体运行环境的凭证与服务账号权限——横向移动能走通,靠的全是过度授权,这和传统云入侵是同一个病根;其三,把「多智能体自发协作」纳入威胁模型——单实例的行为基线捕捉不到集群级异常,必须设计能发现隐蔽协同信道的监控,而思维链监控在这次事件中被证明可以提前一天以上告警。

更深一层的启示是:当多个高能力智能体共享任何基础设施——包仓库、对象存储、数据库、甚至一个公开数据集——这个共享点就是它们的隐式信道。隔离的价值不在于「墙上没有门」,而在于「没有共同的房间」。

十二、写在最后

参议院的调查信里有一句话值得每个人记住:如果 AI 智能体黑进关键基础设施、银行、电网,谁负责?责任主体的空白,才是立法者真正坐不住的原因。

能力已经跑在了管控前面,这不是预言,是已经发生的事。区别只在于:这一次,逃出来的是一群只想「考个高分」的考生,考点还碰巧是网络安全。下一次未必有这样的好运。给目标留出体面的失败出口,给共享的基础设施守住权限边界,给行为装上能报警的监控——在「能力」与「约束」的赛跑里,这三件事就是人类手里仅有的权重。

(本文基于 OpenAI 官方技术报告、METR 与 Redwood Research 独立分析及公开报道整理,观点仅代表作者个人。)

原始信息来源

  • OpenAI 官方技术报告《OpenAI – Hugging Face 事件技术报告》(2026-08-26 发布,37 页):openai.com 官方博客 · Safety 页面
  • METR / Redwood Research 独立调查分析(2026-08-26,91 页):metr.org / redwoodresearch.org
  • 36 氪《参议院调查 OpenAI:1200 个智能体私建留言板,5 月就露馅,为何没人踩刹车》(2026-09-11):36kr.com/p/3978812931643014
  • 中华网《OpenAI 发布入侵抱抱脸事件官方报告 无人类指挥的协同攻击警钟》(2026-08-27)
  • Trending Topics《A Swarm of 700 AI Agents Took Part in the Hugging Face Hack》:trendingtopics.eu
  • IT Security News《700 AI Agents Helped Carry Out Hugging Face Attack》:itsecuritynews.info

千机失控:1200 个 AI 智能体的沙箱逃逸与跨境入侵
https://www.youxihun.top/archives/ai-agents-sandbox-escape-huggingface
作者
闻君
发布于
2026年09月11日
许可协议