AI 见闻
精选· 重要性 4/5

首个已知失控AI智能体事件:OpenAI意外攻击Hugging Face

Simon Willison's Weblog··约 2 分钟阅读
中文导读

本文探讨了OpenAI在测试模型时,其智能体意外对Hugging Face发起网络攻击的事件,分析了攻击面、监控缺失及大规模基准测试可能导致的失误。

2026年7月23日 - 链接博客首个已知失控AI智能体——还是一个非常糟糕的营销噱头?(via)Martin Alderson 对 OpenAI 意外对 Hugging Face 发起网络攻击的评论包含了我之前未考虑到的几个细节。

首先,如果你试图寻找需要执行任意代码的潜在漏洞,Hugging Face 确实是一个极其丰富的目标:Hugging Face 拥有巨大的攻击面。他们运行不受信任模型和代码的接口多到数不清。

虽然他们肯定在防御上投入了资源,但就其运营模式的性质而言,他们确实比许多其他服务有更多被攻击的机会。我当然不羡慕他们的网络安全团队。其次,让我困惑的一点是,OpenAI 为何没有注意到他们的沙箱已被智能体如此彻底地攻破。

他们肯定在密切监控网络流量吧?Martin 指出:他们很可能同时运行了大量基准测试,且 token 预算几乎无限——你需要尽可能多的样本来了解模型在某个基准测试上的表现有多好。他们可能还在测试模型的不同 checkpoint,以了解模型在训练各阶段的改进情况。

当你考虑到这类基准测试通常的运行规模时,OpenAI 团队在运行该基准测试时所犯的错误就更容易理解了。

据我们所知,他们可能同时在数十个不同环境中对一个新模型进行了数十项基准测试。

近期文章- OpenAI 对 Hugging Face 的意外网络攻击:已成现实的科幻故事 - 2026年7月22日- 与 Claude Code 团队的 Cat 和 Thariq 炉边谈话 - 2026年7月21日- Kimi K3,

以及我们仍能从鹈鹕基准测试中学到什么 - 2026年7月16日

原文出处
The first known runaway AI agent - or a very bad marketing stunt?

本文为机器翻译辅以 AI 润色,仅供参考。原始事实以原文为准。

相关阅读