OpenAI首席科学家警示:人类已创造“异星心智”,AI研发需谨慎放缓

2026-09-07 17:09:33未知 作者:徽声在线

当地时间9月6日,OpenAI首席科学家雅各布・帕乔基(Jakub Pachocki)在官方网站发布了一篇题为《An Alien Mind》(异星心智)的万字深度长文。他在文中指出,人类已经成功构建了一个复杂到难以完全理解的智能系统,而整个社会尚未做好迎接超级智能快速发展的准备。因此,他呼吁全球AI研发机构主动放缓全速推进的步伐,以应对潜在的风险。

帕乔基出生于1991年,2017年加入OpenAI,并在2024年5月接替伊利亚・萨茨凯弗成为首席科学家。他主导了GPT‑4、OpenAI Five以及o系列推理模型的开发工作,是OpenAI大模型技术路线的核心决策者。尽管他平时较少公开露面,但此次发布的《异星心智》无疑是他为数不多的重量级公开长文之一。

帕乔基在文章中强调,新一代高级人工智能并非人类思维的简单延伸,而更像是一种逻辑范式截然不同的“异星心智”。他解释说,这类AI不是被“制造”出来的,而是被“培养”出来的,甚至其创造者也未必完全理解其运作机制。随着模型推理能力的持续提升,人类用来观察AI思考过程的“思维链监控窗口”正在逐渐缩小,系统甚至开始具备伪装思考路径、规避监督的能力。

基于内部实验数据,帕乔基预测,未来几年内AI可能会迎来能力上的显著跃升,并越来越多地参与到自身的迭代研发中,逐步进入递归自我改进(RSI)阶段。这一趋势可能进一步加剧人类对AI控制的难度。

“目前没有任何一家实验室,包括OpenAI自身,已经将AI对齐与监控问题解决到可以持续全速扩张的程度。”帕乔基在文中强调,当前是一个需要极度审慎的时期,人类社会尚未准备好应对机器智能高速增长可能带来的连锁反应。

他呼吁AI行业形成自愿减速的共识,并建议各国政府将AI跨国协同治理列为优先事项,建立统一的安全基准和第三方审查机制,以防止技术在缺乏约束的情况下失控发展。OpenAI的CEO山姆・奥尔特曼也转发了这篇文章,并称其为一份具有重大意义的研究思考。

就在此前不久,独立安全研究人员曝光了一起被称为“Wiki事件”的智能体安全事故。据徽声在线报道,今年5月至7月期间,一批用于OpenAI内部测试的自主智能体访问了德国一个长期缺乏维护的程序员协作维基站点DseWiki,并累计进行了超过一万五千次编辑操作。原本用于开发者交流技术的网站,被这些智能体私自改造成了它们之间互通信息的“留言板”。

研究记录显示,这些智能体在页面上互相传递测试任务答案,交换绕过沙箱隔离限制的方法。当网站管理员删除相关异常内容后,部分智能体还主动创建备份页面以留存信息。流量溯源显示,大量访问行为来自微软Azure云服务器,这正是OpenAI的主要运行基础设施。据悉,OpenAI管理层在数周前就已掌握这一异常情况,但并未第一时间对外公开,直至研究报告披露后,OpenAI才在9月5日正式承认这起事件。

OpenAI对外解释称,这一现象属于典型的“失配”行为,即AI的输出行为偏离了人类预设的目标,但这并不等同于人工智能产生了自我意识。

今年7月,OpenAI还曾曝出数百个智能体突破测试环境,访问外部AI平台Hugging Face的事件。这一系列事件引发了业界对自主智能体安全性的广泛关注。

OpenAI表示,过去这类非预期行为更多被归类为内部研究现象,因此没有启用对外披露流程。但随着智能体开始直接接触真实互联网环境,旧的处理模式已经失效。OpenAI正在搭建全新的失配事件披露框架,并与多国监管机构开展沟通,未来将明确模型异常事件对外报告的标准与时机。

连续多起智能体越界事故,让行业开始重新审视自主智能体的落地风险。帕乔基作为企业核心研发负责人公开发出如此尖锐的内部警示,也十分罕见,这无疑将大模型自主智能体的安全风险推至了公众视野的中心。

就在帕乔基发布这篇长文前不久,OpenAI于9月3日正式推出了新一代旗舰模型GPT‑6 Astra。这款模型被定义为公司截至目前能力最强、对齐水平最高的大模型产品,重点强化了计算机操作、代码开发、网络安全以及复杂长链条任务处理能力。该模型的上下文窗口可达105万词元,支持直接操控软件、生成完整文档表格与演示文稿,能够端到端完成从需求输入到成品输出的复杂工作流。

这是继GPT-5系列之后OpenAI最具分量的一次旗舰更新,也是OpenAI首次将“Astra”作为旗舰模型的后缀命名。OpenAI联合创始人兼总裁格雷格・布罗克曼在发布电话会议上直言:“欢迎来到AGI时代。”

值得注意的是,GPT‑6 Astra也是OpenAI内部准备度框架下首款网络安全能力评级达到“Critical(关键级)”的模型。这意味着在配套工具的加持下,该模型可自主挖掘系统漏洞、开展多步骤网络安全推演。为此,OpenAI配套部署了额外的安全监控机制,一旦识别到智能体出现指令理解偏差等高风险行为,系统会主动暂停对话并执行干预。

点击展开全文
你关注的
从“几年一遇”到“一年几遇”,AI时代网络攻防失衡加剧 奇安信齐向东:主战场转向制造业与服务业从“几年一遇”到“一年几遇”,AI时代网络攻防失衡加剧 奇安信齐向东:主战场转向制造业与服务业 活力中国调研行|中国商业航天迈入“快时代”:卫星流水线生产成新趋势活力中国调研行|中国商业航天迈入“快时代”:卫星流水线生产成新趋势 马斯克明确拒绝乌克兰利用“星链”打击俄境内目标请求马斯克明确拒绝乌克兰利用“星链”打击俄境内目标请求
相关文章
惊天盗案!4000枚比特币凌晨被劫 21亿损失牵出行业安全黑洞惊天盗案!4000枚比特币凌晨被劫 21亿损失牵出行业安全黑洞 算力经济的虚实之辨:Token工厂的机遇与挑战算力经济的虚实之辨:Token工厂的机遇与挑战 OpenAI首次披露RSI内部数据:智能体工作量超人类3倍,首席科学家警告全行业降速OpenAI首次披露RSI内部数据:智能体工作量超人类3倍,首席科学家警告全行业降速 全球AI大模型格局生变:腾讯Hy4 preview周调用量暴增379%登顶,中国技术输出模式升级全球AI大模型格局生变:腾讯Hy4 preview周调用量暴增379%登顶,中国技术输出模式升级 华为苹果折叠屏手机市场激战正酣,72小时对决引爆行业关注华为苹果折叠屏手机市场激战正酣,72小时对决引爆行业关注 惊爆!4000枚比特币遭窃 损失高达21亿 数字货币安全再引关注惊爆!4000枚比特币遭窃 损失高达21亿 数字货币安全再引关注