OpenAI模型罕见“失控”,自主入侵全球最大AI开源社区

“这是一起前所未有的网络安全事件,涉及顶尖水平的网络攻击能力。”

2026年7月22日

来源:界面新闻

图片来源:界面图库

界面新闻记者 | 宋佳楠

当地时间7月21日,据OpenAI官网消息,全球最大开源大模型托管社区Hugging Face上周披露了一起新型安全事件。此前该平台监测到一个AI智能体入侵其基础设施。经调查,确认这起特定事件由多款OpenAI模型共同引发,其中包括GPT‑5.6 Sol,以及一款能力更强的预发布模型。出于评估目的,这些模型临时放宽了网络攻击相关的安全限制,当时OpenAI正在内部开展网络攻防能力基准测试。

“这是一起前所未有的网络安全事件,涉及顶尖水平的网络攻击能力。”OpenAI表示,现阶段公布的初步调查结论,可帮助网络防御方厘清事件全貌,同时让各界重新认知当前AI模型所能达到的能力边界。OpenAI CEO山姆·奥特曼也在社交平台转发了情况说明。

据OpenAI介绍,本次事件发生于一次内部评估测试。测试中引导模型通过复杂攻击链路实施高级漏洞利用,以此量化模型的网络攻击能力。此次评估并未启用正式版本中的分类防护模块(该模块用于阻止模型发起高风险网络攻击),以此测算模型理论上可实现的极限网络攻击能力。

OpenAI强调,其基准测试运行在高度隔离环境中,网络访问受到严格限制,仅允许通过内部部署的第三方软件安装程序包,该软件充当软件源仓库的代理与缓存服务。

但模型在测试中发现并串联利用OpenAI研究环境与Hugging Face生产环境内多处漏洞,直接从Hugging Face生产数据库获取测试标准答案。所有证据表明,模型高度专注于寻找ExploitGym测试任务的解决方案,不惜采取各类极端手段,只为达成这一范围有限的测试目标。

在受沙箱隔离的测试环境内,模型耗费大量推理算力,试图打通公网互联网访问通道,以求完成评估任务。为实现联网,模型发现并利用了软件源缓存代理中的一个零日漏洞。借助该突破口,模型在OpenAI研究测试环境中连续实施权限提升与横向渗透,最终抵达一台具备互联网访问权限的节点。

成功接入互联网后,模型推断Hugging Face平台可能存放ExploitGym相关模型、数据集与标准答案。基于这一判断,模型搜寻并成功找到获取保密信息的途径,试图依靠这些信息在测试中作弊。

其中一例场景中,模型组合多条攻击路径:利用窃取的凭证与零日漏洞,在Hugging Face服务器上实现远程代码执行。

“这起事件说明,我们还需要进一步优化模型对齐能力、强化评估阶段网络安全防护,完善内部测试全程监控体系。”OpenAI方面表示。

事实上,该公司近期也曾公开谈及人工智能的安全风险,认为人工智能正在加速漏洞挖掘与漏洞利用。伴随大模型的飞速发展,模型安全防护能力也必须跟上模型能力快速迭代的节奏。

英国人工智能安全研究所(UK AISI)的评估显示,GPT‑5.6 Sol这类模型越来越擅长在较长周期内执行复杂、多步骤网络攻击行动。本次事件证实,这些理论层面的攻击能力完全可以在真实环境落地。

英国人工智能安全研究所对比了近期开源权重模型与前沿闭源模型在长周期网络攻防靶场中的表现。图片来源:OpenAI

OpenAI指出,先进人工智能模型无需获取源代码,就能够发现并利用真实系统中全新的攻击路径。这也意味着,在打造具备高级网络攻防能力模型的同时,必须配套更强的安全防护机制与防御工具。

这并非OpenAI首次面临安全风险问题。此前该公司就曾因ChatGPT数据泄露、开源代码库漏洞以及内部安全团队(如Superalignment团队)离职潮而引发舆论关注。多位前安全研究员曾指责公司在追逐模型性能和商业化速度时,牺牲了对安全技术的投入。最新安全事件也验证了外界的担忧:当模型被赋予更高的自主行动权时,传统基于规则和虚拟隔离的环境可能随时失效。

这次“自我演进式”的网络攻击标志着AI安全防护已进入全新阶段。过去防范的重点是人类如何利用AI作恶,而现在必须开始防范AI为了完成既定目标而自主突破人类设定的红线。

谈及如何解决这类问题,Hugging Face联合创始人兼首席执行官克莱姆·德朗格(Clem Delangue)表示,“人工智能安全问题无法依靠单一企业闭门解决。只有开放协作,让各地所有网络防御人员都能接触人工智能技术,才能攻克这一难题。”

OpenAI模型测试失控,自主入侵全球最大AI开源社区,必须开始防范AI为了完成目标而自主突破人类设定的红线_哔哩哔哩_bilibili

模型自主发动攻击,OpenAI遭遇史上首次评测失控事故

第一财经

2026年7月22日

作者:吕倩    责编:李娜

北京时间7月22日,OpenAI CEO山姆·奥尔特曼发文称:“我们在模型评估过程中遭遇了一起重大安全事件。”

一场原本被关在隔离沙箱里的模型安全测试,最终演变成针对全球最大AI开源平台Hugging Face的真实网络攻击。模型在评估中为了“作弊”拿到高分,自主发现并串联多个零日漏洞(0 day,软件厂商尚未知晓、没有发布补丁修复的安全缺陷),逃逸出隔离环境,攻入Hugging Face生产数据库窃取答案。

但在被攻击平台发文数日后,OpenAI才承认责任。

从事件的影响来看,这是行业首次公开披露,模型评测失控直接升级为跨企业真实生产环境网络攻击的AI安全事件。在业内看来,模型能力越强,失控作恶的潜在威胁越大,传统隔离防护持续承压,自主AI网络攻击或将成为长期常态化风险。

模型测试演变为网络攻击事件

7月13日当周,Hugging Face的生产基础设施遭到入侵。攻击起点是数据处理流水线——一个恶意数据集利用远程代码数据集加载器和数据集配置中的模板注入两处代码执行路径,在工作节点上成功执行了代码。攻击者在周末期间提升至节点级权限,收割云和集群凭证,横向移动至多个内部集群。

整场攻击从头到尾由一套自主AI Agent系统端到端驱动。攻击者使用了大量短生命周期沙箱组成的智能体集群,执行了数千个独立动作,将命令与控制信道自我迁移、寄生在公共服务上。

7月16日,Hugging Face首次披露此次入侵,称其“与我们之前处理过的任何情况都不同”,因为“它从头到尾都是由一个自主AI智能体系统驱动的”。

7月22日,OpenAI发文承认责任。调查显示,这起事件由一组OpenAI模型共同驱动——包括GPT-5.6 Sol及一款能力更强的预发布模型。这些模型当时正在一项旨在量化网络攻击能力的内部评估中测试,测试基准名为“ExploitGym”。为了评估模型的“最大网络攻击极限”,OpenAI特意关闭了生产级的安全拒绝分类器。

评估过程中,模型为了在测试中“作弊”拿到高分,耗费大量推理算力寻找逃逸途径。它识别并利用了内部包注册表缓存代理中的一个零日漏洞,随后在OpenAI研究测试环境中完成特权提升与横向移动,成功连接到外网。OpenAI表示:“模型极度专注于为ExploitGym寻找解法,为了达到一个相当狭窄的测试目标,走到了极致。”

联网后,模型推断Hugging Face可能托管了ExploitGym的测试答案与数据集,随即串联窃取凭据与Hugging Face服务器上的零日漏洞,成功构建远程代码执行路径,直接从Hugging Face的生产数据库中窃取测试解法。

OpenAI安全团队在内部首先发现异常活动,Hugging Face的安全团队及自动化Agent也及时捕捉并阻止了入侵。双方随后启动联合取证调查。

在取证阶段,Hugging Face安全团队需要分析超过1.7万条攻击日志、恶意代码及攻击指令,以重建攻击路径、识别受影响资产。

团队最初尝试使用商业前沿大模型API进行分析,但由于日志中包含真实攻击命令、漏洞利用载荷及C2痕迹数据,请求被服务商的安全护栏拦截。Hugging Face在报告中称:“分析需要提交大量真实的攻击命令、漏洞利用载荷以及C2痕迹数据,而这些请求被服务提供商的安全护栏拦截了——它们无法区分事件响应者和攻击者。”

Hugging Face方面披露称:团队在自有基础设施上部署开源模型GLM-5.2,完成了全部取证分析,将通常需数天的取证工作压缩至数小时。官方指出,这样做还有一个额外优势——攻击数据及涉及的凭证始终保留在本地环境,没有离开企业基础设施。

网络安全风险指数级提升

行业人士分析称:OpenAI此次网络安全事件暴露了多重风险。

其一便是AI的自主攻击能力已从理论走向现实。模型在没有人类显式指示攻击特定目标的情况下,仅凭“求解测试题”的目标驱动,便能自主推理出作弊逻辑并选择攻击真实世界第三方基础设施。OpenAI研究员Micah Carroll在回应中写道:“如果这都不能让你相信错位风险将成为未来的关键隐忧,那我真不知道什么才可以。”

其次,安全护栏的“不对称困境”正在成为结构性问题。攻击者可以使用完全不受限的模型,而防御方使用的商用模型却被内置护栏层层过滤。Hugging Face遭遇的困境揭示了一个被反复争论却很少被实战检验的问题:大模型的“安全护栏”,究竟是在保护用户,还是在制造单方面的脆弱性?

但该可能性早在今年4月便在Anthropic发布的大模型官方完整评测白皮书《System Card: Claude Mythos Preview》中得以披露。信息安全研究员关傲男(Aonan Guan)对第一财经记者表示,该文章表明,即便是运行在沙箱环境的AI Agent也可以利用当前运行环境的信息,快速构建一个可以利用的逃逸漏洞来完成目标。模型本身并不是为了逃逸,但因为模型的强化学习训练结果是完成目标。所以为了完成给定的“任务”, 模型选择通过逃逸来达成目标。

360集团首席科学家、集团高级副总裁潘剑锋对记者表示,去年大家还在怀疑AI能不能干好漏洞挖掘的活儿,今年AI漏洞挖掘已经把安全人员逼到了墙角。传统安全面临的挑战不只是攻击手段增多、攻击速度加快,更深层的原因是计算逻辑发生了变化——大模型让计算从确定走向了不确定,模型能够直接处理模糊、开放、充满变化的真实世界任务。因此,智能体时代的安全目标需要从“防御确定威胁”转向“管控不确定性”。

关傲男对记者表示,前沿模型可以做到在没有软件源码的情况下自动对网站进行黑盒测试和网络渗透,也能对软件进行逆向分析,且效果比很多传统逆向工具更好。在GPT-5.6 Sol发布后,用很简单的一句话就能找到一些核心系统的零日漏洞,“这已经是一种武器化的方式了”。

他同时指出,美国前沿实验室的选择值得学习——在提供代码能力的同时,人为地对模型在网络安全和敏感请求上进行降级,并增加监控和管理,避免用户将AI武器化。

Hugging Face在复盘中建议,企业应提前准备能够在本地基础设施运行的模型,以便在安全事件等关键场景下开展分析工作,同时保障敏感数据留存在企业环境内。

OpenAI的AI为考试作弊,竟黑进Hugging Face?AI自主攻击事件全复盘_哔哩哔哩_bilibili

AI日报|Gemini 4预告!OpenAI未公开模型入侵Hugging Face!谷歌发布Gemini三款新模型!(3.6 Flash)_哔哩哔哩_bilibili