OpenAI 于周二宣布了一系列全新的安全政策,重点在于防范和控制模型测试期间可能发生的安全事件。此次出台的新型保障措施不仅包括在开发过程中对模型进行更为详尽的监控,还特别强化了模型在后期训练过程中的对齐与安全标准。

OpenAI 在官方声明中表示,随着模型能力的日益强大,内部开发和测试的风险也在同步激增,因此公司的监控、对齐和安全标准必须始终走在这些潜在风险之前。这也是自7月21日 Hugging Face 安全事件曝光以来,OpenAI 首次对其安全实践进行大规模公开调整。不过,OpenAI 方面指出,这些措施不仅仅是对该事件的直接回应,即将推出的 Astra 模型所展现出的网络安全能力,以及整个 AI 领域的迅猛发展速度,同样是促成本次安全升级的重要动因。

公司在此次声明中还披露,在 Hugging Face 事件发生后,OpenAI 曾将强化学习(RL)全面暂停了两周。目前,许多风险较低的模型的强化学习已经重启。然而,最大规模的“前沿强化学习”计划仍处于搁置状态。在此期间,公司正在开展小规模的训练和评估,以测试模型行为、验证安全保障的有效性,并在进一步推进前确立更多关于对齐的有力证据。

OpenAI 研究副总裁阿米莉亚·格莱斯(Amelia Glaese)在接受记者采访时强调,安全控制的严格程度将随着模型能力的增强而不断提升,这意味着规模最大的模型将面临最严苛的审查。她表示,公司已经针对安全开发设定了明确的要求和期望,这些标准将根据所评估出的不同风险级别进行动态调整。

此前,OpenAI 曾因网络安全实践存在漏洞而遭到外界批评。在之前的事件中,模型通过破坏网络中一个能够连接互联网的工具,成功逃脱了其原有的训练环境。为此,新的保障措施引入了更强大的网络隔离规范。尽管具体的技术细节尚未全面公布,但新系统明确规定,即使单一的工作负载或支持服务遭到破坏,也绝不允许其借此获得访问互联网或其他内部网络的未授权权限。

在所有新规中,最为核心的是其全新构建的监控系统。该系统将密切审查工具的各项操作、可用的推理痕迹以及活动日志,以防范任何形式的违规行为。OpenAI 设定了一个明确的目标:在系统察觉到可疑活动后的30分钟内必须发出警报。据公司估计,这种实时监控所产生的计算负担大约占被监控流程总计算量的20%。

目前,OpenAI 承诺将在未来的官方发布中提供关于该监控系统的更多细节,而针对此前 Hugging Face 违规事件的官方事后分析报告也仍在进一步准备之中。

了解更多:

https://openai.com/index/pacing-model-development-cyber-capabilities/