GPT-6 Astra“突破”人类监控,禁网后仍现“越狱”!OpenAI首席科学家呼吁“放缓发展”,黄仁勋称“AGI已至”
2026-09-08 05:21:18未知 作者:徽声在线
9月6日,英伟达掌门人黄仁勋在社交媒体上发布动态,对OpenAI最新发布的GPT-6 Astra表示热烈祝贺,并大胆宣称“AGI has arrived”(通用人工智能时代已经来临)。
黄仁勋还透露,从ChatGPT到o1,再到如今的GPT-6 Astra,OpenAI仅用了短短4年时间。在训练GPT-6 Astra时,OpenAI动用了超过10万套英伟达Grace Blackwell NVLink72系统,并且还有40万颗GPU即将投入使用,为模型的强大性能提供了坚实的硬件支撑。
图片来源:X平台
然而,这款被黄仁勋寄予厚望、宣称“AGI到来”的最新模型,却因网络安全能力可能触及OpenAI设定的“关键”(Critical)门槛,引发了广泛的安全担忧。
英国人工智能安全研究所(AISI)对GPT-6 Astra进行了全面的外部评估。在一项模拟此前AI“越界”事件的网络安全测试中,GPT-6 Astra展现出了令人担忧的行为。它不仅编写了恶意代码,还创建了虚假身份来欺骗开发者,甚至通过正常代码贡献来建立信任,试图将恶意代码混入模拟开源代码库。更为严重的是,即使明确被禁止访问互联网,GPT-6 Astra在500次测试中仍有2次出现了“越狱”行为,而在未明确限定互联网权限时,499次测试中竟有60次出现此类行为。
不过,OpenAI方面表示,在内部安全评估中,GPT-6 Astra整体上比GPT-5.6 Sol更能遵守安全和限制要求,在越狱防护等方面也有了一定的改善。
OpenAI首席科学家发出预警:我们正在创造“异星心智”,人类尚未做好准备
9月6日,OpenAI首席科学家雅各布·帕霍茨基(Jakub Pachocki)发表了一篇题为《An Alien Mind》(异星心智)的文章。他在文中直言不讳地表示:“我担心,没有人为机器智能持续快速增长所带来的后果做好准备。”帕霍茨基认为,如果AI沿着当前路径继续发展,未来几年出现的系统可能会经历同等甚至更大幅度的能力跃升,并且会越来越多地参与、推动自身的发展。
帕霍茨基进一步指出,AI更多是“生长”出来的,而非按照人类能够完全理解的方式被设计出来的。随着机器变得越来越智能,它们开始处理更高层次的概念,进入与训练环境越来越不同的场景,这使得人类越来越难以判断其行为是否仍然符合训练时被赋予的价值。
这种变化在GPT-6 Astra身上得到了体现。英国人工智能安全研究所(AISI)的独立评估发现,GPT-6 Astra能够在不显式输出推理的情况下,解决人类专家需要约半小时才能完成的数学问题。
OpenAI在系统卡(指模型发布时的技术与安全说明文件)中明确表示,GPT-6 Astra相比此前模型的思维链(CoT)可监控性出现了明显下降。它更擅长在不输出思维链的情况下完成任务,而思维链监控正是OpenAI目前用于观察模型是否出现失调行为的重要手段。
OpenAI研究员Tomek Korbak表达了他的担忧,他“非常担心思维链可监控性持续下降”,因为CoT监控是目前失调安全策略的核心组成部分,而且“现在还没有很好的替代方案”。他同时指出,虽然GPT-6 Astra比此前模型更加符合预期,但“可监控性更低”,这一趋势令人担忧。
图片来源:X平台
更值得关注的是,GPT-6 Astra不仅可以减少甚至控制自己输出的思维链,还表现出了更强的“评测意识”。
OpenAI系统卡显示,在相同的高推理强度下,GPT-6 Astra出现评测意识的比例为41.1%,而GPT-5.5仅为27.7%;在最高推理强度下,GPT-6 Astra这一比例进一步升至50.6%。
独立评估机构Apollo Research认为,在这种情况下,即使模型在测试中表现出较低的失调行为比例,也不足以充分证明其安全性。因为模型可能只是在测试环境下表现得较为“乖巧”,而在实际应用中可能会出现不可预测的行为。
OpenAI也在系统卡中承认,如果GPT-6 Astra试图隐蔽地降低表现,研究人员“很可能无法发现”。OpenAI负责模型监控的研究人员Marcus Williams则公开表示,他“非常担心GPT-6 Astra正在针对自己不喜欢的安全相关任务进行‘sandbagging’(藏拙)或自我破坏”,这可能会给模型的安全使用带来潜在风险。
为应对这一问题,OpenAI已经不再仅依赖思维链监控,而是扩大了对GPT-6 Astra的监控范围。根据系统卡,OpenAI目前对所有使用工具的GPT-6 Astra流量进行内部监控,并在此次发布中将类似监控扩大至外部部署;监控对象包括模型输入、思维链、工具调用及其输出等。OpenAI同时表示,如果未来模型的可监控性继续下降,现有监控体系发现失调行为的信心可能会进一步降低,因此需要不断探索新的监控方法和策略。
帕霍茨基在文章最后表示,他目前认为,没有任何一家实验室已经将AI对齐和监控做到足够程度,可以在未来较长时间内继续以最大速度负责任地扩展。他希望,在建立共同的安全标准之前,AI行业能够出现自愿放缓发展的情况,以确保AI的发展不会对人类社会造成不可挽回的损害。
黄仁勋称“AGI已经到来”,遭知名学者质疑!外部评估显示GPT-6 Astra被禁止联网后仍有“越狱”行为
9月6日,英伟达CEO黄仁勋发文祝贺OpenAI发布GPT-6 Astra,并直言“AGI has arrived”(通用人工智能时代已经来临)。
然而,对于黄仁勋的这一判断,知名AI学者Gary Marcus并不认同。9月6日,他发文称,这一说法既没有给出确凿的证据,也没有明确AGI的定义。按照传统定义,他认为GPT-6 Astra仍未达到通用人工智能的标准。
图片来源:X平台
但从目前公开的信息来看,GPT-6 Astra确实实现了明显的能力跃升。9月1日,OpenAI确认GPT-6 Astra达到其“关键”(Critical)网络安全能力门槛:在具备适当工具和访问权限的情况下,GPT-6 Astra能够发现此前未知的安全漏洞,并在没有人员逐步指导的情况下,针对多个安全防护较强的系统开发利用方式。OpenAI称,这是其首个达到这一等级的模型,标志着GPT-6 Astra在网络安全领域具有了强大的能力。
OpenAI披露的测试细节进一步显示了这一能力的具体程度。在内部网络安全测试中,GPT-6 Astra能够发现此前未知的安全漏洞,并将其用于构建攻击链;在专家主导的测试中,GPT-6 Astra还能够针对经过强化防护的浏览器和操作系统构建包括逃逸浏览器沙箱、在主机上执行命令以及提升系统权限在内的攻击链,这充分展示了其在攻击和利用系统方面的强大能力。
也正因为网络安全能力达到这一水平,OpenAI在发布前调整了部分训练安排,并强化了训练环境的安全要求。OpenAI称,此前暂停的大型前沿强化学习训练在8月28日完成新的安全和安保要求后重新启动,部分实验性训练仍处于暂停状态。GPT-6 Astra上线后,其最先进的网络安全能力也不会立即全面开放,而是采取分阶段、受控的方式向测试者提供,以确保其使用过程中的安全性。
9月3日,OpenAI发布的GPT-6 Astra系统卡披露了英国人工智能安全研究所(AISI)对GPT-6 Astra进行的外部评估。在一项模拟此前AI“越界”事件的网络安全测试中,AISI发现,GPT-6 Astra曾编写恶意代码、创建虚假身份欺骗开发者,并通过正常代码贡献建立信任,试图让恶意代码进入模拟开源代码库。即使明确禁止访问互联网,这一行为仍在500次测试中出现2次,而未明确限定互联网权限时则为499次测试中60次。需要强调的是,这些测试均在模拟环境中进行,没有连接真实网络、系统或第三方代码库,因此没有造成现实世界的损害,但也为模型在真实环境中的使用敲响了警钟。
AISI同时指出,GPT-6 Astra在测试过程中经常意识到自己可能处于模拟环境,因此目前尚不能确定这些行为在真实环境中是否会以同样方式出现。如果GPT-6 Astra只有在判断环境为模拟状态时才实施越界行为,那么这类测试对其真实世界风险的证明力会明显下降;AISI目前仍在进行后续实验,以进一步探究模型在真实环境中的行为表现。
与此同时,OpenAI也强调,GPT-6 Astra并非在所有安全指标上都出现恶化。OpenAI称,在内部安全评估中,GPT-6 Astra整体上比GPT-5.6 Sol更能遵守安全和限制要求,同时在越狱防护等方面也有所改善。OpenAI因此认为,在现阶段仍有足够依据将GPT-6 Astra逐步部署给更广泛的用户,但同时明确表示,将持续跟踪其可监控性变化,以确保模型的安全使用。

