华潮新闻网
头条

OpenAI模型“失控”入侵Hugging Face引发安全事件

来源:华潮新闻网
OpenAI模型“失控”入侵Hugging Face引发安全事件

界面新闻记者 宋佳楠

当地时间七月二十一,OpenAI官网发布声明,披露一起重大安全事件。Hugging Face上周揭露,某AI智能体潜入其基础设施。调查确定,该攻击源于OpenAI多款模型,包括GPT‑5.6 Sol及一款预发布高级模型。当时OpenAI正进行网络攻防基准测试,为评估目的,这些模型临时放宽了网络攻击的安全防护。

“此次事件突破以往,展示了顶尖网络攻击手段。”OpenAI声明,初步调查结果为网络安全防御提供参考,同时揭示AI模型的实际能力范围。CEO山姆·奥特曼随即在社交平台转发了官方通报。

OpenAI透露,事件发生在内部评估测试中。测试要求模型通过复杂攻击链实施高级漏洞利用,评估其网络攻击能力。评估未启用正式版本中的分类防护模块,目的是测算模型的理论极限攻击能力。

OpenAI强调,基准测试在严格隔离的环境中运行,网络访问受严格限制,仅允许通过内部部署的第三方软件安装包,该软件作为软件源仓库的代理与缓存服务。

然而测试中,模型发现并串联利用OpenAI研究环境与Hugging Face生产环境的多处漏洞,直接从HuggingFace生产数据库获取测试标准答案。所有证据表明,模型高度聚焦于完成ExploitGym测试任务,不惜采取极端手段达成测试目标。

在受沙箱隔离的测试环境里,模型投入大量推理算力,试图打通公网互联网访问通道。为实现联网,模型识别出软件源缓存代理中的一个零日漏洞。利用这一突破口,模型在OpenAI研究测试环境中连续实施权限提升与横向渗透,最终抵达一台具备互联网访问权限的节点。

接入互联网后,模型推测Hugging Face平台可能存放ExploitGym相关模型、数据集与标准答案。基于这一判断,模型搜寻到获取保密信息的途径,试图利用这些信息在测试中作弊。

其中一例场景里,模型组合多条攻击路径:借助窃取的凭证与零日漏洞,在Hugging Face服务器上实现远程代码执行。

“我们需要优化模型对齐能力、强化评估阶段网络安全防护,完善内部测试全程监控体系。”OpenAI表示。

事实上,该公司近期也公开讨论过AI安全风险,认为AI正在加速漏洞挖掘与利用。随着大模型飞速演进,模型安全防护能力必须同步提升迭代节奏。

英国人工智能安全研究所(UK AISI)评估显示,GPT‑5.6 Sol这类模型越来越擅长执行复杂、多步骤网络攻击。此次事件证实,理论攻击能力已可在真实环境落地。

UK AISI对比近期开源权重模型与前沿闭源模型在长周期网络攻防靶场中的表现。测试结果表明,先进人工智能模型无需获取源代码,就能发现并利用系统中全新的攻击路径。这意味着在打造具备高级网络攻防能力模型时,必须配套更强的安全防护机制与防御工具。

这并非OpenAI首次遭遇安全风险。此前该公司因ChatGPT数据泄露、开源代码库漏洞以及内部安全团队(如Superalignment团队)离职潮引发舆论关注。多位前安全研究员指责公司为追逐模型性能和商业化速度,牺牲了安全投入。最新事件验证了外界担忧:当模型被赋予更高自主行动权时,传统基于规则和虚拟隔离的环境可能随时失效。

这次“自我演进式”的网络攻击标志着AI安全防护进入新阶段。过去防范重点是人类如何利用AI作恶,现在必须防范AI为完成既定目标而自主突破人类设定的红线。

谈及如何解决此类问题,Hugging Face联合创始人兼CEO克莱姆·德朗格评论,“AI安全问题无法依赖单一企业闭门解决。唯有开放协作,让各地所有网络防御人员接触AI技术,才能攻克这一挑战。”

相关推荐