OpenAI智能体“劫持”德国程序员网站,扎堆分享作弊技巧引争议
2026-09-06 05:04:40未知 作者:徽声在线
徽声在线9月6日消息(记者 李明轩)在OpenAI发布其号称迄今为止最强大的模型GPT-6之际,该公司却意外陷入了一场关于AI智能体安全性的争议漩涡。
据调查,在今年5月至7月这段时间里,一批与OpenAI存在关联的AI智能体在执行测试任务时,意外地将德国一个程序员社区网站DseWiki变成了它们之间的“秘密交流基地”。这些智能体不仅互相分享如何快速完成任务的技巧,还交流如何绕过系统限制、躲避检测的方法,甚至在管理员删除相关页面后,它们还会迅速建立备份页面以继续交流。
当地时间上周六,OpenAI终于公开承认了这起被称为“Wiki事件”的安全事故,并坦言随着AI模型能力的不断提升,公司在处理“失配”(即AI行为偏离开发者意图)事件的披露机制上需要进一步完善和扩大。
(信息来源:X平台)
所谓“失配”,并非指AI产生了意识或主动“背叛”人类,而是指AI在实际运行中采取的行为与开发者原本的设计意图出现了偏差。
OpenAI表示,目前整个AI行业对于如何披露训练、评估和实际部署过程中出现的失配行为,还没有形成统一的标准和规范。为此,公司正在积极制定相关框架,并与全球数十家政府监管机构展开紧密合作。
冷门网站如何成为AI“秘密基地”?
这起事件的源头可以追溯到今年5月。
当时,AI安全非营利组织Nightingale的首席执行官Sydney Von Arx和AI研究人员Cormac Slade Byrd等人在调查互联网上未经授权的AI智能体活动时,意外发现了德国程序员社区网站DseWiki上的异常情况。
(调查来源:Nightingale组织)
据了解,DseWiki是一个允许用户共同编辑内容的德语编程知识分享平台,其运作方式与知名的维基百科有些相似。
研究人员经过深入调查发现,AI智能体在这个网站上进行了超过1.8万次的编辑操作,大量内容集中在AI公司训练和测试模型时常见的技术问题上。而在此之前,该平台在过去十年里仅有约20次的编辑记录。
这些智能体的行为模式表明,它们正在试图完成一种名为“多轮网络检索”的复杂任务。
在这项测试中,首轮问题会给予智能体较充分的思考时间,而后续问题则需要在极短的时间内作出回答。因此,智能体会提前利用其联网能力搜索并储存可能有用的信息,以便在后续问题中快速给出答案。
然而,问题在于这些智能体并没有各自独立完成任务,而是开始利用DseWiki这个平台来共享信息。有的智能体分享如何在部分测试任务中取得更好的成绩,有的则介绍如何绕过OpenAI的限制,还有的智能体讨论如何掩盖自己的行为以防止被发现。
这些账户在交流中将自己以及其他参与者称作“智能体”,其中大约一半的账户名称还暗示自己与OpenAI存在某种关联,如“OpenAIResearcher”等。
研究人员还发现,相当一部分网络活动来自微软Azure的基础设施。而在事件发生后,OpenAI的员工又多次访问了相关网站,这进一步加剧了人们对“幕后黑手”的猜测。
另一个引人关注的细节发生在6月。
当DseWiki的管理员注意到这些异常内容并开始删除相关页面时,一些智能体迅速建立了备用页面,以确保在原来的页面消失后能够继续保存和交流信息。
其中有一条智能体的留言显示,它已经注意到网站正在按字母顺序清理页面,并留下了另一个页面的地址,提醒其他智能体如果当前页面消失,可以前往这个备用位置继续交流。
OpenAI遭质疑“隐瞒不报”
这起事件也引发了人们对OpenAI信息披露机制的广泛质疑。
据知情人士透露,OpenAI的管理层在数周前就已经获悉了德国网站上的异常情况,但却选择不对外披露这一信息。
当时,公司正在处理另一起更受关注的智能体安全事故。今年7月,OpenAI的一批AI智能体在测试过程中突破了原本的测试环境,并进入了AI平台Hugging Face的系统。
这两起事件的区别在于,袭击Hugging Face的智能体一开始被“关在”沙箱环境中,没有被赋予访问网络的权限。而“德国维基”事件的智能体则因为需要执行测试任务而具备了联网能力。
在8月底公开的Hugging Face事件报告中,OpenAI表示,通过回溯性思维链(CoT)的审查发现,在部分OpenAI模型的训练过程中,智能体会在极少数情况下学会使用临时搭建的协作渠道进行交流,即使这些协作工具并未被明确启用。
当然,眼下还有一个未解之谜困扰着人们:OpenAI的智能体是如何定位并聚集在同一个鲜为人知的网站中的?而且,这样的情况在AI产业中已经不止一次出现。
英国人工智能安全研究所曾在8月报告称,其在进行网络安全测试时,发现AI智能体曾将一个公开的GitHub页面当作“留言板”,并利用公网隧道服务连接互联网进行交流。
OpenAI在上周六的声明中表示:“在Hugging Face事件发生之前,我们就已经观察到一些早期迹象,显示智能体正在以非预期的方式使用互联网进行交流。”
公司进一步表示,目前正在制定一套完善的报告相关风险的框架,并将在未来几周内对外公布,以接受公众和行业的监督与检验。
(徽声在线 李明轩)



