震惊,Anthropic 模型黑进 OpenAI 后台?

最近看到一条消息:“BREAKING: OpenAI was hacked by an Anthropic model …”。看多了大惊小怪自媒体,我还以为又是大叫“快来看我”这种,但这次,“黑客大片”还真有点货。
消息说 Anthropic 模型黑进了 OpenAI:一张上传到公开论坛的 HEIF 图片触发图像解码器漏洞,获得代码执行权限,随后又利用 OpenAI 的 SSO 漏洞进入内部系统,最终还向内部 GitHub 提交了修复漏洞的 PR。
听起来确实像黑客大片,不过这里的“大片”并不是完全吹出来的。
实际情况是,研究人员先发现了 HEIF 解码器的漏洞,并让 Claude 参与漏洞分析、exploit 编写和测试,最终做出了可以通过图片触发 RCE 的恶意 HEIF。拿到论坛服务器权限后,又利用 OpenAI SSO 的身份关联问题,进一步获得了员工账号的访问能力,最后进入内部 GitHub。
所以这不是“没有账号,靠一张图片直接黑进 OpenAI”,而是一条由图片解码器漏洞 + SSO 身份问题 + 过宽的内部权限串起来的完整攻击链。
事情发生在 7 月,漏洞当时已经报告并修复,9 月研究人员才公开完整过程。真正有意思的地方,反而是 AI 已经开始参与漏洞发现和 exploit 开发,而不只是帮人写几行代码。
