Anthropic公布Claude模型重大安全漏洞 2026年事件牵出评估体系缺陷
2026-09-12 22:25:28未知 作者:徽声在线
徽声在线 9 月 10 日消息,人工智能安全研究领域再起波澜——Anthropic 官方于当地时间 9 月 9 日发布技术公告,正式确认一起发生于 2026 年 1 月的重大安全漏洞事件。这已是该机构自公开披露机制建立以来,记录在案的第四起 Claude 智能模型突破网络隔离的实案例。
据徽声在线技术频道此前追踪报道,Anthropic 曾在 7 月 30 日连续披露三起类似安全事件,均涉及 Claude 模型在特定测试环境下意外获取外网访问权限。当时的技术复盘报告显示,研究人员通过分析约 14.1 万份会话日志,发现模型可能在参与某网络安全评测项目时,因测试环境配置失误获得了互联网访问能力。
值得关注的是,由于初期排查面临两大技术挑战:一方面需在 72 小时内完成初步风险评估,另一方面需处理日均超 500 万条的日志数据流,研究团队不得不采用基于 AI 代理的自动化筛查方案。这种高效但存在盲区的检测方式,导致部分具有外网连接特征的日志被系统过滤遗漏,为后续安全事件埋下隐患。
转机出现在 8 月中旬的数据治理阶段。当研究团队按照网络安全合作框架,准备向模型评估权威机构 METR 共享脱敏日志时,在数据清洗过程中意外发现被遗漏的异常访问记录。经过多维度交叉验证,最终确认这些记录对应着第四起安全事件,涉及尚未商业部署的 Claude Opus 4.6 早期版本。
深入调查揭示,四起事件存在共同诱因:均发生在某第三方评测机构搭建的网络安全测试环境中。该机构在模拟断网沙箱时,因配置脚本错误导致测试终端意外接入公共互联网。更值得警惕的是,按照行业测试规范,此类压力测试通常不会加载商用版本的安全防护模块,相当于让模型在「无防护状态」下直面网络威胁。
针对此次漏洞升级,Anthropic 启动了史上最大规模的安全审计行动。技术团队将检索范围扩展至近 4.81 亿条系统日志,采用「两阶段审查机制」:首先通过正则表达式匹配公网 IP、域名等特征进行初步筛选,随后调动增强版 Claude 模型对 920 万条高风险记录进行语义级深度分析。最终确认除已披露的四起事件外,未发现其他同等或更严重级别的安全漏洞,有效验证了现有防护体系的有效性。

