人工智能模型在网络安全攻防演练中的角色,正在经历一场颠覆性的转变。2026年9月下旬,知名安全团队 Hacktron 发布了一份震撼行业的攻防报告,证实其研究人员利用 OpenAI 主要竞争对手 Anthropic 旗下的 Claude AI 工具,成功对 OpenAI 的内部基础设施实施了深度的自动化渗透与权限获取。
根据Hacktron 官方发布的入侵 OpenAI 详细技术博客披露,研究团队通过将大语言模型接入渗透测试流程,仅用了极少数的人工干预,就斩获了 OpenAI 核心员工的账户控制权以及部分内部代码仓库的访问权限。事发后,Hacktron 团队第一时间向 OpenAI 及相关开源社区报告了漏洞,OpenAI 则为其签发了 6500 美元的漏洞赏金。
漏洞组合拳:从 Discourse 堆缓冲区溢出到 SSO 账户劫持
在具体的攻击链构造上,研究人员并未依赖单一的高危漏洞,而是通过 AI 智能体寻找到了多项看似轻微的安全缺陷,并将其拼接成了一条完整的利用链。
攻击突破口源于 OpenAI 官方社区论坛所使用的开源论坛软件 Discourse。在对 Discourse 的组件进行扫描时,Claude 助手敏锐地定位到了其依赖的图像解析库 libheif 中存在一个隐蔽的堆缓冲区溢出(Heap Buffer Overflow)缺陷。研究团队利用该漏洞在论坛服务器上实现了远程代码执行(RCE)。
在夺取论坛服务器的底层权限后,AI 智能体进一步对服务环境中的配置凭证展开排查,发现了 OpenAI 在单点登录(SSO)与内部身份鉴权整合上的致命配置疏漏。研究人员顺藤摸瓜,利用伪造的身份令牌绕过了二步验证,直接接管了多名 OpenAI 内部员工的 ChatGPT 高阶账户及关联服务的控制权。通过这些高权限账户,攻击团队能够顺畅调取 OpenAI 存储在私有仓库中的部分底层研发代码及内部部署日志。
极低成本与高效率:Claude Agent 数小时敲碎安全防线
比漏洞本身更让安全界震惊的,是这次入侵过程中展现出的极致攻防投产比。
研究团队透露,在整个漏洞挖掘与链条构造阶段,他们充分发挥了 Anthropic 旗下 Claude 模型的自主推理与代码生成能力。项目初期团队使用了 Claude 4.8 版本进行目标指纹识别,随后迅速切换至性能更强的新一代 Claude 5.5 模型进行复杂 Payload 的构造。在几天的自动化渗透测试中,AI 智能体全天候不间断地执行代码审计与接口测试,而人类安全专家累计投入的手动介入时间仅仅只有几个小时。
据统计,整个攻击行动所消耗的 API Token 费用不足 3,000 美元。以几千美元的计算成本和几小时的人力,就能攻破一家估值千亿、拥有顶尖安全团队的 AI 巨头的内部防线,这起事件再次向全球企业敲响了警钟:当黑客拥有了低成本、高效率的 AI 智能体助手后,传统的静态网络防御体系正在面临前所未有的范式危机。
本报道由 圈小蛙(qxwa.com) 科技资讯站特约撰稿。🐸️