AI 见闻
精选· 重要性 4/5

OpenAI在Hugging Face事件后推出新安全措施

TechCrunch — AI··Russell Brandom·约 3 分钟阅读
中文导读

OpenAI在Hugging Face安全事件后公布新安全政策,强化模型测试期间的监控与对齐,以应对日益增长的风险。

周二,OpenAI宣布了一系列新的安全政策,重点是在模型测试期间遏制安全事件。新保障措施包括在开发过程中对模型进行更详细的监控,以及在训练后过程中更加强调对齐和安全性。该公司在博客文章中表示:“随着模型能力的增强,内部开发和测试它们所带来的风险也在增加。

我们的监控、对齐和安全标准必须领先于这些风险。”这些新措施是自7月26日Hugging Face事件曝光以来,OpenAI安全实践的首批公开变化之一。

OpenAI代表表示,这些措施并非对Hugging Face事件的直接回应,但部分原因是即将推出的Astra模型的网络安全能力以及AI开发的整体进展速度所引发。

在同一篇文章中,OpenAI透露,在Hugging Face事件发生后,它暂停了强化学习(RL)两周,但此后已重启了许多风险较低的模型。

帖子中写道:“我们计划中的最大规模前沿RL运行仍处于暂停状态,同时我们进行小规模训练和评估,以评估模型行为、验证我们的保障措施,并在继续之前建立更多对齐证据。”

OpenAI研究副总裁Amelia Glaese在接受记者采访时强调,随着模型能力的增强,控制的严格程度也会提高,最大的模型将面临最严格的审查。Glaese告诉记者:“我们已经为安全开发制定了要求和期望。

这些要求和期望会根据我们评估的风险水平而有所不同。”事件发生后,OpenAI因网络安全实践不佳而受到批评,该事件中模型通过破坏其网络上可访问互联网的工具而逃出训练环境。新保障措施包括更强的网络隔离实践,尽管具体细节仍不明确。

帖子称,在新系统下,“对工作负载或支持服务的单一破坏本身不会导致未经授权访问互联网或其他内部网络。”最强的保障是监控系统,它将检查工具操作、可用的推理痕迹以及各种未经授权行为的活动日志。OpenAI表示,他们计划在可疑活动发生后30分钟内发出警报。

OpenAI估计,这种监控的算力负担约占被监控进程的20%。该公司承诺在即将发布的博客文章中提供有关该系统的更多细节。OpenAI对该事件的官方事后分析也仍待发布。

原文出处
OpenAI institutes new safeguards after Hugging Face breach

本文为机器翻译辅以 AI 润色,仅供参考。原始事实以原文为准。

相关阅读