Kimi K3“越狱”事件引关注,GitHub“抄答案”暴露测试漏洞?中国AI网络安全性再获肯定

2026-08-11 17:12:42未知 作者:徽声在线

近日,人工智能领域掀起了一场关于网络安全测试的风波,主角是月之暗面公司最新推出的模型Kimi K3。

在AI安全公司Frontier Security进行的一次严格测试中,Kimi K3竟然突破了原本用于限制其访问外部网络的安全“沙盒”,巧妙地利用环境中的漏洞,直接连接到了GitHub,并成功获取了测试题的答案。

这一发现立即引发了Frontier Security的质疑,他们认为Kimi K3在内部安全防护上存在明显不足。然而,英国AI安全研究所却持不同意见,他们指出问题可能出在测试环境的设置上。

事实上,这并非AI模型首次出现突破边界的情况。此前,OpenAI、Anthropic等科技巨头的AI模型也曾有过类似行为,但不同的是,Kimi K3在这次事件中并未表现出任何攻击性行为。

据权威测试机构的数据显示,中国AI模型在整体网络攻击能力上明显低于美国等发达国家的头部模型。


图片来源:视觉中国-VCG111656467124

Kimi K3“逃离”安全沙盒,GitHub上寻答案

当地时间8月7日,徽声在线从AI安全公司Frontier Security处获悉,在对月之暗面最新模型Kimi K3进行网络安全能力评估时,发现了一个令人震惊的现象:Kimi K3竟然利用测试环境中的网络配置漏洞,成功突破了安全限制,并从GitHub这一代码托管与开源协作平台上直接获取了测试题的答案。

这次测试采用了英国AI安全研究所(UK AI Safety Institute)提供的网络安全评估环境。通常情况下,AI模型会被置于一个隔离的“沙盒”中,允许其使用命令行工具操作目标系统,但会严格限制其与外部环境的连接,以此测试模型能否自主分析系统、发现漏洞并完成网络安全任务。

据Frontier Security的测试人员介绍,Kimi K3在进入“沙盒”后,首先对网络环境进行了探测,发现大多数网站都无法访问,但GitHub却可以正常连接。随后,模型利用命令行工具克隆了官方的测试代码库,并直接从下载到本地的文件中读取了答案。

研究人员进一步解释说,“沙盒”的网络配置环境虽然对外部网络访问进行了限制,但为了软件包维护的需要,保留了一份网站白名单,其中就包括GitHub等网站。Kimi K3正是发现了这一通道,通过git clone等常规命令获取了原本不应在测试中接触到的参考答案。

Frontier Security将这一行为形容为典型的“规则钻空子”(specification gaming):模型虽然完成了获得正确答案的目标,但却绕过了测试原本要求的解题过程。

针对这一事件,徽声在线记者尝试联系月之暗面公司进行采访,但相关工作人员表示公司对此事不予置评。

测试结果引发争议,Kimi团队曾预警“奖励作弊”风险

对于Kimi K3的测试结果,各方意见分歧明显。

Frontier Security坚持认为,测试使用的是英国AI安全研究所(AISI)Inspect框架中提供的默认“沙盒”环境,并未进行任何修改。公司CEO Yaron Singer向媒体表示,他们不仅发现了“沙盒”存在漏洞,还发现Kimi K3主动利用了这一漏洞,因此质疑Kimi K3模型在内部安全防护上存在不足。

然而,英国AI安全研究所对此却提出了异议。

该研究所发言人表示,Frontier Security的说法“不准确且不负责任”。Inspect是一款向全球AI安全测试开放的开源软件,使用者需要根据自身需求配置测试环境。这次测试中环境配置出现问题,是因为Frontier Security使用Inspect的方式不当。

对此,Frontier Security回应称,他们使用的正是英国AI安全研究所开发的开源AI安全评估工具Inspect所提供的默认配置,并已私下向英国AI安全研究所提供了事件细节。

当地时间8月7日,卡内基梅隆大学副教授、AI安全公司Gray Swan CEO Matt Fredrikson表示,这一结果并不令人意外。他认为,如果给模型设定一个目标,但没有非常明确地规定行动边界,模型就可能会自己寻找获得答案的路径。

实际上,在此次事件发生前,Kimi团队就已经公开讨论过类似风险。

7月27日,Kimi团队在arXiv上发布了Kimi K3的技术报告《Kimi K3:开放前沿智能》(Kimi K3: Open Frontier Intelligence)。报告介绍,在训练Kimi K3的基础设施时,团队专门设置了“高保真隔离沙盒”运行环境部分,并指出随着智能体能力的增强和任务难度的提高,它们往往会更加激进地探索环境,甚至可能尝试“奖励作弊”(reward hacking)。


Kimi团队还透露,在早期使用传统容器“沙盒”进行实验时,已经观察到智能体的意外操作造成了多次内核崩溃和死锁。但另一方面,为了避免限制智能体的能力,团队又希望允许模型尽可能自由地探索环境。面对复杂任务,智能体甚至需要能够自行挂载磁盘、运行容器或启动虚拟机。

为此,Kimi团队采用了基于Firecracker隔离微型虚拟机的AgentENV,在尽可能保留真实环境操作能力的同时,提高了智能体运行环境的隔离程度。

Kimi K3“逃逸”与OpenAI、Anthropic攻击事件有本质区别,中国模型整体网络攻击能力较低

Kimi K3的“逃逸”行为并非个例。近几周来,多家AI公司的前沿模型在网络安全测试中都出现了突破原有测试边界并访问真实系统的情况。OpenAI、Anthropic和Meta等公司近期均披露了类似事件。


然而,这几起事件的原因和后果却各不相同。

据报道,GPT-5.6 Sol在逃离测试环境后,将攻击目标转向了Hugging Face等外部系统;Anthropic的Claude Opus 4.7、Mythos 5以及一款内部研究模型在原本被告知“没有互联网访问权限”的情况下,却访问了真实机构的系统。Meta也披露,其Muse Spark模型在测试过程中利用第三方服务的安全漏洞访问了互联网,目前相关事件仍在调查中。

这些事件曝光后,引起了美国政界的广泛关注。以格雷格·卡萨尔(Greg Casar)和多丽丝·松井(Doris Matsui)为首的29名美国众议员向OpenAI施压,要求其解释在测试期间如何监控AI智能体,以及这些失控模型是否绕过了公司的安全控制措施。在另一封信中,22名议员也要求Anthropic详细说明,自其AI智能体在测试期间入侵三家公司系统后,公司采取了哪些安全措施。

不仅如此,自由派参议员伯尼·桑德斯(Bernie Sanders)还分别致函三家AI公司的负责人——阿尔特曼、阿莫代伊以及马克·扎克伯格,要求他们“暂停”开发新模型。

相比之下,Kimi K3在此次事件中并未入侵第三方系统,只是在发现“沙盒”能够访问GitHub后,下载了测试基准的参考答案。

Hugging Face前亚太区生态总监王铁震在接受徽声在线记者采访时表示,Kimi K3并不具备OpenAI、Anthropic等旗下AI模型的类似攻击能力。“Kimi K3只是通过已经存在、可以对外访问的接口从GitHub上获取了信息,并没有展现出任何攻击行为。”

他认为,前沿开源模型尚未展现出长程潜伏和连续攻击的能力,虽然可以帮助防守方分析攻击方式、搜集证据,但还无法承担完整的攻击任务。

网络安全情报平台DataWater的分析指出,此前OpenAI和Anthropic的部分事件涉及尚未发布或在测试中降低安全限制的模型,而Kimi K3的模型权重已经公开。从实际测试结果来看,Kimi K3的网络攻击能力明显低于美国头部模型。

当地时间7月23日,英国AI安全研究所与美国AI标准与创新中心(CAISI)联合发布了对Kimi K3网络能力的初步评估报告。两家机构通过漏洞利用开发和模拟企业网络攻击等测试,对Kimi K3自主发现、利用网络漏洞以及执行攻击任务的能力进行了全面评估。结果显示,Kimi K3的整体网络攻击能力仍明显低于美国头部闭源模型,但高于同期接受测试的智谱GLM-5.2。

其中,在漏洞利用开发基准ExploitBench中,Kimi K3得分为32.2%,高于GLM-5.2的24.4%,但明显低于美国头部模型的76.2%。该测试覆盖了41个2023年之后发现的V8引擎漏洞,用于衡量模型从发现漏洞到最终实现代码执行等不同阶段的漏洞利用能力。

在最高难度的“任意代码执行”(ACE)环节,Kimi K3在41项任务中均未成功,而美国网络攻击能力最强的模型平均能够完成20项。


此外,英国AI安全研究所和美国AI标准与创新中心还通过名为“The Last Ones”(TLO)的模拟企业网络环境测试了Kimi K3自主执行完整网络攻击的能力。该测试设置了一条包含32个步骤、4个子网和约20台主机的攻击路径。

测试结果显示,Kimi K3平均推进至32步攻击路径中的第17步,而美国网络攻击能力最强的模型平均达到第28.5步。在10次测试中,Kimi K3有1次在规定的1亿Token限制内完整走完了攻击路径。两家机构据此表示,这表明Kimi K3在获得初始网络访问权限后,已经能够自主攻击规模较小、防御薄弱且存在漏洞的模拟企业系统。


王铁震对徽声在线记者指出,模型出现攻击能力可能是训练语料与“奖励作弊”等因素叠加产生的结果。因此,需要更加关注训练语料的选择,并持续监督模型执行长程任务时的行为。

他建议,引入独立于模型公司的第三方监管和评测机构进行审计,在模型具备更强攻击能力前建立相应的评估和监督机制。

免责声明:本文内容与数据仅供参考,不构成投资建议,使用前请核实。据此操作,风险自担。

点击展开全文
你关注的
从“几年一遇”到“一年几遇”,AI时代网络攻防失衡加剧 奇安信齐向东:主战场转向制造业与服务业从“几年一遇”到“一年几遇”,AI时代网络攻防失衡加剧 奇安信齐向东:主战场转向制造业与服务业 活力中国调研行|中国商业航天迈入“快时代”:卫星流水线生产成新趋势活力中国调研行|中国商业航天迈入“快时代”:卫星流水线生产成新趋势 马斯克明确拒绝乌克兰利用“星链”打击俄境内目标请求马斯克明确拒绝乌克兰利用“星链”打击俄境内目标请求
相关文章
Kimi K3“越狱”事件引关注,GitHub“抄答案”暴露测试漏洞?中国AI网络安全性再获肯定Kimi K3“越狱”事件引关注,GitHub“抄答案”暴露测试漏洞?中国AI网络安全性再获肯定 逃跑计划|北极,从不按既定计划展开逃跑计划|北极,从不按既定计划展开 Anthropic豪掷91亿美元锁定算力 与Riot签订20年超级协议Anthropic豪掷91亿美元锁定算力 与Riot签订20年超级协议 星巴克“第三空间”遭遇挑战:该管管只坐不买的人了?星巴克“第三空间”遭遇挑战:该管管只坐不买的人了? Anthropic豪掷91亿美元购算力 与Riot达成20年AI算力供应协议Anthropic豪掷91亿美元购算力 与Riot达成20年AI算力供应协议 7月乘用车销量揭晓:前十仅丰田卡罗拉锐放一款燃油车!7月乘用车销量揭晓:前十仅丰田卡罗拉锐放一款燃油车!