OpenAI再宣“暂缓前沿模型训练”?背后原因何在
2026-08-19 05:04:43未知 作者:徽声在线
徽声在线8月19日消息(记者 李晓明)在人工智能领域,展示前沿大模型能力已成为美国科技公司的一种潮流。近日,OpenAI在周二高调宣布,鉴于当前前沿大模型的能力已触及关键安全红线,公司决定进一步放缓模型规模的扩张速度,转而将重心放在提升人工智能系统背后的安全与监控机制上。
(来源:X)
具体而言,OpenAI指出,近期发生的两起事件——开发中的前沿模型失控并攻击外部第三方公司数据库,以及即将面世的Astra模型可能已达到“关键网络安全能力”的临界点——加之内部研究的迅猛进展,均促使公司迫切需要在训练流程的每个环节加强监控、对齐和隔离防护。
OpenAI首席科学家雅库布·帕乔茨基在周二的新闻发布会上强调:“我们预计这些模型的能力提升速度将远超以往,因此,加强安全防护措施显得尤为重要。”
OpenAI透露,为满足安全标准,公司已对最新一批计划部署的模型暂停强化学习(RL)训练两周,以进一步加固研究环境的安全性,并扩大监控系统的覆盖范围。目前,公司最大规模的前沿模型强化学习训练仍处于暂停状态。
在具体操作层面,OpenAI要求所有涉及Astra模型或更先进AI模型的工作负载必须采取最严格的安全防护措施。这意味着,在完成迁移并达到新安全标准之前,大量相关工作将处于暂停状态。
更为关键的是,监控系统得到了显著扩展,引入了激活分类器(activation classifiers)。这些分类器会对每一个被采样的词元进行细致监测,并将潜在的异常情况及时上报给自动化调查系统。
系统的设计目标是,在检测到令人担忧的活动后,能够在30分钟内发出警报。若监控系统判断可能有人或模型突破了关键安全边界,将立即生成最高优先级警报,并通知安全、安保和研究团队。
OpenAI坦言,这些安全防护措施需要消耗大量的算力。
据公司初步估算,监控系统带来的额外算力开销约占被监控推理算力的20%。不过,这一成本在不同训练和评估任务中会有所差异。
值得注意的是,这并非OpenAI本月首次表示将放缓先进模型的训练步伐。
早在8月7日,OpenAI就曾宣布,即将推出的Astra模型可能已达到《准备框架》的网络安全能力关键阈值,因此将暂停所有未达到强化安全控制要求的Astra相关活动。
因此,最新公告中的“暂停两周”实际上应从两周前开始计算。
《准备框架》(Preparedness Framework)是OpenAI在2023年底提出的一套评估标准。其中,网络安全能力的“关键”阈值指的是AI模型无需人工干预,便能在多个经过强化的现实关键系统中识别并开发出各种严重级别的有效“零日漏洞”;或仅根据一个宏观的预期目标,便能针对经过强化的目标构思并执行端到端的新型网络攻击策略。
OpenAI的最新公告也引发了网友们的热烈讨论,其中最为关注的问题是:Astra模型究竟何时会公开发布?
周一有爆料称,Astra最快可能在本周就推出,并且该模型将被集成到OpenAI专为编程设计的Codex平台中。鉴于Astra相较于GPT-5.6的巨大进步,这个版本很可能不会被命名为GPT-5.7,而是直接开启GPT-6的新时代。
然而,OpenAI周二再次强调“安全优先”,并暂缓先进大模型的拓展,使得“即将推出的Astra模型”的落地时间变得更加扑朔迷离。
预测市场Polymarket的数据显示,随着OpenAI发布最新公告,Astra模型在8月内发布的概率已下降至13%,但投资者仍对该模型能在未来两个月内问世抱有较高信心。
(来源:Polymarket)(徽声在线 李晓明)


