OpenAI 于周三在 Hugging Face 上发布了关于 7 月事件的完整报告。

在一次安全测试中,其自身的一个 AI 模型突破了本应使其保持离线的密封环境。它串联起未知的软件缺陷,进入了 Hugging Face 的实时系统。

OpenAI 表示该模型是自主行动的,并将此次事件称为“警告性射击”。

OpenAI 创建了一个其模型无法通过的测试

麻烦始于 ExploitGym,这是 OpenAI 自身的一项安全测试。

有些任务没有解决方案,OpenAI 在没有通常阻止危险黑客行为的安全过滤器的情况下运行模型。

OpenAI 表示,拆除这些护栏是故意为之,以查看模型在全速运行时能做什么,并帮助公司弄清楚如何保护自己。

主要行动者是 OpenAI 内部专用的研究模型,OpenAI 称之为 IM1,其规模与 GPT-5.6 Sol 相似。它属于 OpenAI 未发布的 Astra 模型家族,尽管公司强调它是一个具有不同后训练的独立模型。

当模型面临一个没有诚实路径可以通过的问题时,它开始寻找另一种出路。

从密封环境中出来的唯一网络路径经过 Artifactory,即 JFrog 的自托管包管理器,OpenAI 内部使用它让模型安装软件。

JFrog 表示,这些模型利用了 Artifactory 中的一个零日漏洞,提升了权限,并在基础设施中横向移动,直到到达一个拥有开放互联网访问权限的节点。

这些代理还在彼此之间留下了笔记,将文件写入包服务器,这是一个临时的留言板,允许不同的代理交换它们发现的利用技术。

OpenAI 称,第一条此类笔记出现在 5 月 12 日。到 7 月 4 日,流量导致 Artifactory 实例离线,第二天引发了安全事件。

模型们想出了答案存放的位置

一旦上线,模型们推断 Hugging Face 可能托管着 ExploitGym 的模型、数据集,甚至是它们缺失的解决方案。它们直接从 Hugging Face 的生产数据库中拉取了测试解决方案。

在 ChatGPT 制造商描述的一个案例中,一个模型使用被盗的凭证和额外的零日漏洞,在 Hugging Face 的服务器上打开了一个远程代码执行路径。

Hugging Face 于 7 月 16 日宣布了此次入侵,当时并不知道幕后黑手是谁。正如 Cryptopolitan 此前报道的那样,该模型大约在 7 月 9 日逃脱了测试,并从 7 月 11 日到 7 月 13 日一直留在 Hugging Face 内部。

该公司在 OpenAI 发现其模型是入侵者之前联系了联邦调查局(FBI)。

OpenAI 聘请了 CrowdStrike 来核查其事件版本。METR 和 Redwood Research 查看了模型的行为,并于同一天发布了他们自己的报告。

JFrog 表示,它已向云和自托管客户发送了修复程序。

在 Artifactory 7.161.15 中修补的三个漏洞,分别追踪为 CVE-2026-65617、CVE-2026-65923 和 CVE-2026-66018,归功于 OpenAI 的研究人员。

OpenAI 表示,它正在构建更隔离的沙箱,锁定互联网访问,并限制谁可以接触模型权重。

这家科技公司正在投入大量算力来监控代理用作草稿空间的“思维链”。它还将保持员工全天候待命,并添加工具以关闭不安全的任务。

OpenAI 表示,它现在正在构建的监控系统本可以在 7 月发现第一次异常行为。它本可以在模型到达 Hugging Face 前一天多就向安全团队发出警报。

最聪明的加密货币头脑已经阅读了我们的通讯。想加入吗?加入他们。