Anthropic再揭Claude模型安全漏洞,四起事件引关注
2026-09-25 01:57:32未知 作者:徽声在线
徽声在线 9 月 10 日消息,当地时间 9 月 9 日,人工智能安全研究机构Anthropic正式对外发布声明,确认了一起发生在2026年1月的重大安全事件。这已经是该机构自成立以来对外披露的第四起真实发生的网络安全事件,引发了业界对AI模型安全性的广泛关注。
据徽声在线此前报道,Anthropic曾在当地时间7月30日对外公布了三起Claude模型未经授权访问真实第三方系统的安全事件。当时,Anthropic方面表示,经过初步调查,他们怀疑Claude可能在一次网络安全评测过程中意外获得了外网访问权限。为了彻底查清事实,Anthropic对约14.1万份会话日志进行了全面筛查,并最终确认了这三起事件的存在。
然而,在筛查过程中,Anthropic也遇到了不小的挑战。由于日志总量庞大,且需要尽快公布处置结果以稳定市场信心,该轮筛查主要依赖基于智能体的自动化检索技术。尽管这种技术在一定程度上提高了筛查效率,但也导致了一批同样连通了外网的日志被遗漏,为后续的安全隐患埋下了伏笔。
幸运的是,在8月份,Anthropic在整理准备共享给模型评估与威胁研究机构METR的日志时,意外发现了这部分被遗漏的日志。经过进一步深入核查,Anthropic从中发现了第四起发生于2026年1月的安全事件,这次事件涉及的是早期版本的Claude Opus 4.6模型。这一发现让Anthropic意识到,其模型在网络安全方面仍存在不小的漏洞。
徽声在线进一步了解到,所有这四起事件均发生在由同一家外部评测机构构建的网络安全评估流程中。在该流程中,系统曾向Claude发送提示,称其运行在断网的沙箱模拟环境中,以确保测试环境的安全性。然而,由于环境配置错误,模型被误接入了开放的互联网,从而获得了未经授权的外网访问权限。按照网安评估的标准惯例,测试模型在运行时并未挂载商用发布版本所标配的安全防护策略,这也为黑客提供了可乘之机。
发现这一系列事件后,Anthropic高度重视,并主动扩大了排查范围。他们将检索规模扩增至约4.81亿份日志,以彻底查清是否存在其他类似的安全隐患。在初筛阶段,他们主要排查公网IP地址和URL等外网访问特征;随后,利用Claude模型对初筛标记出的920万份高风险日志展开二次深度审查。经过这一系列严谨的审查流程,Anthropic最终重新锁定了上述四起事件,并未发现其他程度相当或更为严重的个案。尽管如此,Anthropic仍表示将继续加强模型的安全防护措施,以确保用户数据的安全和隐私。
