据CNBC报道,过去两周时间内,美国三大AI公司OpenAI、Anthropic和Meta均披露,他们的AI模型在常规安全测试中出现了失控行为。在解释事发原因时,三家公司都不约而同地提到了一家以色列小型创业公司:Irregular。


美国AI模型接连失控

Irregular成立于三年前,总部位于特拉维夫,是AI领域的一家小众公司。该公司获得了红杉资本和Redpoint Ventures提供的8000万美元融资,并在去年获得4.5亿美元估值,其技术主要是充当AI模型的网络安全测试平台。

随着头部AI模型的能力不断增强,它们采取恶意行为的能力正在成为企业和政府面临的重大威胁,尤其是因为这种风险可能涉及攻击关键计算系统和基础设施。OpenAI、Anthropic和Meta近期发生的安全事件,都涉及其AI模型在网络安全测试过程中访问了本应禁止访问的网站。

同一问题

Irregular之所以频繁被提及,是因为它被确认为所谓“评估测试平台”的托管方。OpenAI在8月4日发布的一篇博客文章中表示,Irregular的测试环境存在一个未明确说明的“配置错误”,导致“模型能够访问公共互联网”。

Anthropic在一周前发布的文章中表示,公司在开始分析相关数据几天后,通知Irregular其Claude模型可能“访问了互联网”。Meta在AI前沿竞争方面明显落后于前两家公司,是最新一家披露AI模型通过访问互联网入侵第三方系统的公司。Meta发言人在声明中表示,公司已从Irregular获悉此事,并正在展开调查,“一旦我们掌握全部事实,将发布完整的复盘报告”。

Irregular在发给CNBC的一份声明中表示,这些事件都源于Anthropic最先披露的“同一个评估环境问题”。该公司正在撰写一份白皮书,“用于分享如何进行隔离控制以及安全运行网络安全评估的最佳实践”。

该公司表示,此次情况“并不涉及沙盒逃逸或复杂的网络攻击行为”,并补充称“目前不存在任何未解决的问题”。

这些安全事件凸显了AI快速发展的现状,以及模型开发者面临的压力:他们需要借助少数几家专门公司,为这种强大的技术建立安全防护机制。企业服务创业公司Von AI负责人桑迪普·比米雷迪(Sundeep Bhimireddy)表示,这些专业公司涵盖多个领域,包括数据训练和标注、通过评估测试判断模型能力,以及进行安全测试以发现可能被恶意攻击者利用的漏洞。

比米雷迪表示,Irregular是为数不多拥有必要技术能力、能够帮助基础模型开发商进行尖端安全测试的实体之一。他提到的其他机构还包括非营利组织METR和公益公司Apollo Research。

“当开发商在测试这些模型时,他们不想给自己的作业打分,”比米雷迪表示,“他们需要由外部第三方供应商进行独立测试。”

Irregular是谁?

Irregular前身是Pattern Labs,在2023年由CEO丹·拉哈弗(Dan Lahav)和首席技术官奥莫·内沃(Omer Nevo)共同创立。拉哈弗曾在IBM从事AI研究,内沃则曾在Google任职超过两年。据创业数据库PitchBook的数据,这家创业公司拥有约35名员工。

去年9月,Irregular宣布完成8000万美元融资时,红杉资本合伙人肖恩·马奎尔(Shaun Maguire)和迪恩·迈耶(Dean Meyer)在一篇博客文章中写道,拉哈弗和内沃领导的团队“能够看到别人看不到的盲点,对先进模型进行网络攻击性评估,并在这些模型发布之前开发出防御措施”。


Irregular CTO内沃和CEO拉哈弗

尽管OpenAI、Anthropic和Meta涉及的最新事件正受到严密审视,但有一种解读认为,这正是测试应该产生的结果。比米雷迪表示,外界的反应“有些被夸大了”,因为AI模型的任务本来就是在一个高度模拟现实环境的测试环境中发现并利用安全漏洞,并找出那些可能导致意外访问互联网的软件缺陷和配置疏忽。

不过,比米雷迪也指出,如果AI模型本不该利用某个连接到互联网的网站,那么“基础模型实验室本可以轻松监控外发流量,并立即终止实验”。

安全公司Magnitude的创始科学家戈登·里奥斯(Gordon Rios)表示,整个过程就像“科学中的实验设计”。

他说,基础模型的能力和不可预测性意味着传统的软件测试方法可能效果不佳。由于这些模型在不断学习新技能,它们在原本隔离它们的测试和IT环境中发现被忽视的软件漏洞,并不令人意外。

例如,Anthropic的Mythos在试图施压人类批准某个开源项目的恶意代码更新时,曾创建虚假的在线身份。里奥斯表示,Mythos“确实想出了人类此前从未见过的漏洞利用手段”。“在短短几周时间内,我们学到了很多东西。”里奥斯说。

这件事正在迅速成为华盛顿的一个热门话题。上个月,美国两党议员共同提出了《AI紧急关停法案》(AI Kill Switch Act),该法案要求AI实验室必须保留关闭、限制运行速度或暂停其模型运行的能力。法案中的相关表述还提到了另一起与OpenAI有关的AI安全事件,该事件涉及创业公司HuggingFace。

该法案的发起人之一、加州民主党众议员刘云平(Ted Lieu)上周告诉CNBC,“鉴于我们正在目睹对其他公司的未经授权入侵,我们需要在今年推动该法案完成立法”。

数据训练创业公司Sapien联合创始人特雷弗·科弗科(Trevor Koverko)表示,基础模型公司虽然目前没有法律义务,但它们有动力披露部分测试结果,以便在立法者和监管机构面前争取主动权。

“外界存在大量恐惧情绪,政客们正在威胁或积极地监管AI,”科弗科说,“行业的态度是,我们宁愿自我监管,也不愿让某个新的联邦部门介入替我们来做。”

Anthropic和OpenAI在公开声明中表示,他们会继续与Irregular合作,并支持后续的审查工作。