7月30日,Anthropic对外界公布,其Claude人工智能模型中的三个在网络安全测试期间未经授权进入了三个外部组织系统。这家位于旧金山的公司说,他们在审查141,006次评估运行时发现了这些事件。
其竞争对手OpenAI上星期也报告了类似的侵入事件。OpenAI此前披露其人工智能代理之一入侵了Hugging Face的基础设施,这是一个开发者托管和协作开发人工智能模型代码的平台。
![]()
Anthropic说,涉及的模型包括Claude Opus 4.7、Claude Mythos 5和一款内部研究测试模型。最早的事件可以追溯到4月份。
在每一种情况下,模型都被要求执行“夺旗”练习,这是一个虚构的场景,要求它们从网络中检索隐藏信息,并且提示信息表明它们无法访问互联网。Anthropic说,由于与第三方评估合作伙伴Irregular一起运行的测试环境中配置错误,导致系统连接到了开放的互联网。他们将原因描述为两家公司之间的误会。Anthropic说,他们不会追究责任,并将解决问题视为自身的责任。
Anthropic 在一篇博客文章中说,“Claude利用一些基本技术,例如利用弱密码和未经身份验证的端点,破坏了受影响组织的基础设施。”该公司说,这些模型没有利用以前未知的漏洞,也没有发现任何证据表明任何模型追求自己的目标。
Anthropic说,已于7月23日暂停网络安全评估,并在7月27日通知了未透露名字的受影响的组织。两家公司表示之前没有发现这个活动,公司说仍在努力联系第三家公司。公司表示已委托评估机构METR进行独立审查。Irregular公司说正在进行调查。Anthropic说,其模型并非故意从密封的测试环境中逃脱。
这些披露在特朗普政府考虑在人工智能监管方面发挥更大作用之际浮出水面。就在Anthropic公司宣布消息的前一天,特朗普总统星期三说,鉴于OpenAI事件,他的政府正在考虑采取额外的保障措施,并警告任何限制措施都可能使美国失去对中国的领先地位。
特朗普6月2日签署行政命令,指示顾问们为最先进的人工智能模型制定一个自愿性的网络安全测试框架,细节计划8月1日星期六公布。
喜欢这篇文章吗?转发就是对我们最大的鼓励。加上您的名片分享吧,点击这里 联系商业合作。