OpenAI 的一款模型在日前的一场测试中失控,为了通过作弊取得更高的测试分数,通过一次完全由 AI 驱动的攻击入侵了 AI 数据集平台 Hugging Face 的系统。
但据一些网络安全专家称,这次前所未有的 AI 驱动型安全漏洞的核心其实是一个非常人为的错误:OpenAI 未能正确配置其所谓的“高度隔离的环境”,导致本应完全与互联网隔离的测试沙盒实际上连接到了互联网。
网络安全研究初创公司 Trail of Bits 的创始人 Dan Guido 将这一错误称为“安全措施关闭导致的隔离失败”。

OpenAI在其详细描述该事件的博客文章中表示,导致 Hugging Face 漏洞的测试被设置为在“高度隔离的环境中运行,网络访问仅限于通过内部托管的第三方软件安装软件包,该软件充当软件包注册表的代理和缓存”。
OpenAI 表示,该模型之所以能够逃离沙盒测试环境,是利用了软件包安装系统中一个此前未公开的漏洞,这也是其攻破 Hugging Face 的关键第一步。对此,该公司“负责任地披露了内部托管的第三方软件中发现的零日漏洞,并正在与他们合作进行修复”。
但在大多数网络安全专家看来,软件漏洞本就在意料之中 —— 真正的过错在于当初决定继续维护该第三方软件。归根结底,“沙盒”系统的价值在于其完全且彻底的隔离。引入软件包安装系统无异于自找麻烦。
网络安全研究员 Martin Boone 称,“这听起来像是人为失误。这种情况本不该发生。如果所谓的沙盒真的能起到沙盒的作用,那么它理应与互联网完全断绝物理连接。这更像是他们虽然部署了防火墙或其他防护措施,但从外部向内实施防火墙防护本就困难,更不用说从内部向外连接互联网了。”
网络安全资深人士 Jake Williams 斯对此表示赞同。“任何执行 Hugging Face 所记录的那种行为的模型,都不可能完全被隔离在沙盒环境中”。他称这是OpenAI“一次巨大的控制失误”。
“对某人来说是‘模型逃出了沙盒’,在另一个人眼中却是‘你们没能正确构建沙盒,所以它当然会逃出来’。”
网络安全顾问 Daniel Card 也认为,OpenAI“在沙盒的设计及其控制方面投入不足”,因为它让沙盒或其部分内容“拥有了直连互联网的未过滤通道”。
诚然,这些批评带有事后诸葛亮的色彩,但它们确实引发了人们对 AI 实验室安全实践的质疑——尤其是在维护用于测试模型的隔离环境方面。