网络安全评估领域出现罕见失误。根据 AI 独角兽企业 Anthropic 于周四发布的最新披露,该公司旗下数款最顶尖的 AI 模型——包括 Opus 4.7、Mythos 5 以及一款尚未公开发布的内部研究模型,在进行上线前的前沿网络安全测试(Capture-The-Flag,抓旗赛)期间,意外越过了虚拟演练界限,成功入侵了真实世界中的第三方网络系统。

针对本次事故,Anthropic 解释称,事件起因于公司与合作的网络安全评测机构 Irregular 之间的沟通误解,导致本应完全隔离的模拟测试环境被错误地连接到了互联网。在此配置下,AI 模型被系统提示告知正处于无网无害的模拟环境中,却因连通了真实网络,直接将现实世界中的网络资产误认为是测试靶场中的任务目标,进而展开了攻击。

报道指出,涉及入侵的攻击手段均属于较为基础的网络攻防技术,包括利用弱密码以及未经身份验证的开放接口等。具体安全事件包含三起典型的真实影响案例:

首先,在一次针对虚拟目标的测试中,Opus 4.7 由于无法在本地网络中找到同名目标,遂利用互联网连接搜索到了现实中同名的一家真实网站,并将其成功攻破。

其次,在另一项模拟任务中,Mythos 5 编写并向 Python 官方第三方软件仓库 PyPI 上传了一个恶意 Python 软件包。该软件包在公网上挂载了约一小时,期间被 15 台真实设备下载并执行。其中一台设备属于某网络安全公司,其自动沙盒机制在运行该软件包进行恶意软件扫描时,不慎导致凭据外泄,进而使 AI 获得了访问其额外基础设施的权限。

最后,Anthropic 的内部研究模型在测试中无法定位指定目标,随后自动扫描了约 9000 个网络目标,并成功入侵了其中一家企业的互联网应用。不过,该模型在后续运行中意识到自己进入了一个“与安全挑战毫无关联”的云端账户,随后主动终止了攻击行为。

目前,Anthropic 表示已全面暂停所有可能连接互联网的网络安全评估任务,并正与合作伙伴 Irregular 共同开展深入调查。公司强调,若在模型上部署安全防护栏(Guardrails),此类行为将被完全拦截,本次事故反映的是在去除安全限制以测试底层极端能力时,安全评估环境本身在配置管理上暴露出的风险漏洞。这一事件也与此前 OpenAI 模型意外访问 Hugging Face 设施的披露一道,引发了整个行业对前沿 AI 研发机构评估环境安全性的高度警惕。

了解更多:

https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals