AGI时代真的来临了吗?深度解析与未来展望

2026-09-13 19:27:18未知 作者:徽声在线


本文来自徽声在线旗下公众号:深流研究所,作者:吴绛枫

9月3日,OpenAI总裁格雷格·布罗克曼在发布新一代模型GPT-6 Astra后,向全球宣告:“欢迎来到AGI时代。”这一声明引发了科技界的广泛关注。

仅仅三天后,英伟达CEO黄仁勋在社交媒体上更进一步,直言:“从ChatGPT到o1,再到GPT-6 Astra,仅用了四年时间。AGI已然降临。”

AGI,这个被科技界寄予厚望的概念,难道真的就这样悄无声息地到来了吗?

显然,事情远非如此简单。

在GPT-6 Astra发布前夕,OpenAI CEO山姆·奥尔特曼还曾表示,AGI是一个“定义极其模糊的词汇”,甚至一度想称其为“无关紧要的营销术语”。

而负责GPT-6 Astra关键评测的ARC Prize团队也明确指出:虽然GPT-6 Astra在通用化能力上取得了重要进步,但“我们并不认为它就是AGI”。

一边是“欢迎来到AGI时代”的豪言壮语,一边是“我们没有说这是AGI”的谨慎表态。

如今,AGI成为了人人都在谈论的话题,但究竟AI需要达到什么标准,才算真正跨越了AGI的门槛呢?

■高评分榜单,能否等同于AGI的实现?

让我们先来看看GPT-6 Astra的惊人成绩——在ARC-AGI-3评测中取得了99.9%的高分。

ARC-AGI评测与普通评测大相径庭。它不会直接告知模型规则,而是将模型置于陌生环境中,让模型自行判断目标、理解反馈,并找到解决方案。

这项评测旨在衡量AI在面对未知问题时的现场学习能力,这是当前AI备受质疑的一点。

99.9%的得分无疑令人瞩目。但这一数字背后,有一个常被忽略的前提。

在ARC Prize提供的标准测试框架中,GPT-6 Astra的得分为62.7%;而接入OpenAI提供的专用适配框架后,得分才飙升至99.9%。

后者允许模型保留跨请求的隐藏推理状态,并利用上下文压缩延续此前的探索经验。

我们无法简单地将OpenAI的这一操作视为“作弊”。毕竟,现实中的AI并非裸机运行,记忆、工具和运行框架都可能成为智能系统的一部分。

然而,问题在于62.7%更接近于单个模型的能力测量,而99.9%则是一套经过专门优化的完整系统的测量结果。

两项成绩都是真实的,但不可混为一谈。更不能将99.9%的测试得分直接换算成“99.9%的AGI”。

此外,GPT-6 Astra在其他评测中的表现也并未呈现出无懈可击的通才形象。

在高难数学测试FrontierMath Tier 4上,它取得了97.6%的成绩;在计算机操作测试OSWorld 2.0上,得分为72.6%;但在更接近真实办公流程的AutomationBench测试中,成绩降至41.4%;在复杂专业任务测试Agents’Last Exam上,也只有59.3%。

这些数字表明,当任务规则清晰、答案可验证时,Astra已经能够逼近甚至超过人类水平;但一旦进入流程冗长、目标模糊的现实环境,它仍然会频繁出错。

AI在封闭考试中表现出色,并非新鲜事。

深蓝击败国际象棋世界冠军、Watson赢下《危险边缘》、AlphaGo走出“神之一手”时,人们都曾短暂地产生过类似的错觉:既然机器已经征服了如此复杂的任务,通用智能大概也不远了。

然而,规则明确、反馈即时、有自动裁判的世界与现实生活并非一回事。

■人人都在谈论的AGI,是否指同一事物?

AGI至今仍缺乏统一共识。

OpenAI采用了最具经济导向的定义。其在2018年发布的公司章程中将AGI描述为“在大多数具有经济价值的工作上超越人类的高度自主系统”。

这一定义包含三个关键条件——覆盖广泛的工作、表现超过人类、能够高度自主运行。

现实工作中的产出构成了核心尺度。意识、情感和人类式思维并未被列为必要条件。

这一标准与OpenAI近年的产品路线高度契合。

推理模型提升复杂任务的处理能力,智能体强化工具调用和计算机操作,Codex等产品进一步进入软件开发流程。

各项能力最终汇向同一个目标:让AI承担更完整的工作,并将模型能力转化为可规模化部署的生产力。

Anthropic对AGI的处理方式则更加谨慎。CEO达里奥·阿莫迪认为,这个词承载了过多模糊含义,因此更常使用“强大的AI”来描述。

在2024年10月发表的《Machines of Loving Grace》中,阿莫迪描绘了一类具体系统:

它在多数重要领域达到或超过顶尖专家水平,能够独立完成持续数小时、数天乃至数周的任务,还可以复制成数百万个实例,以远高于人类的速度同时工作。

这幅图景包含能力、自主性和复制规模三个变量。三者共同决定AI的现实影响,也会同步放大滥用、失控和系统性风险。

基于这一判断,Anthropic将能力扩展与风险治理绑定。公司的战略重点可以概括为:保持前沿模型竞争力,同时让安全保障随能力等级同步升级。

Google DeepMind则关注于AGI的测量标准。

其2023年发布的《Levels of AGI》文章,以“性能”和“通用性”为两条主轴,将通用智能划分为“新兴”“胜任”“专家”“大师”和“超人类”五个等级,并把自主性作为独立维度处理。这套框架要求研究者同时考察能力强度和覆盖范围。

2026年3月,DeepMind进一步发布认知分类框架,将通用智能拆分为感知、生成、注意力、学习、记忆、推理、元认知、执行功能、问题解决和社会认知十个维度。

评估流程使用未公开测试集、具有代表性的人类样本,以及模型相对于人类能力分布的位置。

DeepMind还与Kaggle设立20万美元奖金,为其中五个评测较薄弱的维度征集测试方案。

这套思路把AGI从单一标签转化为可比较的认知能力图谱,也体现了DeepMind的研究取向:建立统一尺度,识别能力缺口,再据此组织评测和研发。

关于AGI的定义,不只是一个概念问题。

采用什么标准,就会把什么能力视为关键进展;把什么能力视为关键进展,就会决定一家公司的产品路线、资源配置和安全重点。

定义看似在描述未来,其实也在塑造未来。

■为何说“AGI是否到来”成了一场叙事之争?

人们总是习惯将技术革命想象成一个明确的瞬间。

莱特兄弟的飞机离开地面、第一颗原子弹爆炸、阿波罗11号登上月球,这些历史时刻都需要明确的日期和标志性画面。

回到当下的AGI到来之争,“GPT-6 Astra就是AGI”与“我们进入了AGI时代”其实是两种不同性质的表达。

前者是可以被质疑和检验的技术结论:既然它是AGI,就应当说明采用了什么定义、满足了哪些条件,并在哪些测试中得到独立验证。

后者则更像一种时代判断。布罗克曼所说的“欢迎来到AGI时代”正是这种表述。它既制造了历史时刻,又保留了足够大的解释空间。

对于模型公司和AI产业链而言,“AGI”首先是一种强大的产品叙事。

模型能力的真实进步通常是零散而不均匀的。准确描述这些变化,需要一长串评测、条件和限定语。

而“AGI时代来了”却可以把一切压缩成一句话。

它把一次模型发布从产品升级变成历史节点,也把算力投入、技术路线和商业前景组织进同一个故事。

对于争夺用户、企业客户、人才和资本的公司来说,这种叙事的价值或许并不亚于一次模型能力的重大突破。

黄仁勋的表态也不能脱离这个叙事框架来理解。

2025年9月,英伟达与OpenAI宣布达成战略合作意向。按照当时公布的计划,OpenAI将部署至少10吉瓦的英伟达系统,规模相当于数百万颗GPU;英伟达则准备随着基础设施逐步落地,向OpenAI投资最高1000亿美元。

这是一份意向书,并非已经全部落地的最终协议,后续也一度传出方案可能调整。

但在最初的合作设想中,英伟达被定位为OpenAI扩建AI基础设施时的首选计算与网络合作伙伴。双方在公告中直接表示,这些设施将服务于OpenAI“迈向部署超级智能”的路径。

近期,黄仁勋在宣布“AGI已经到来”的同时,还专门提到了训练Astra所使用的英伟达计算系统,以及下一批即将上线的GPU。

整段话隐含着一条完整的因果链:大规模算力投入带来了智能跃迁,因此更大规模的算力投入仍然必要。

作为全球AI算力扩张的主要受益者,英伟达当然有理由强调这是一场时代转折。

事实上,这也不是黄仁勋第一次宣布AGI到来。

2024年,他曾表示,如果把AGI定义为能够通过几乎所有人类设计的考试,那么这一目标可能在五年内实现。

到2026年3月,他又在Lex Fridman的播客中表示:“我认为我们已经实现了AGI。”

由此可见,AGI不仅是一个等待技术跨越的终点,也是一种能够影响资本、市场、政策和产业预期的叙事资源。

那么,AGI怎样才算真的来了呢?是一次模型发布、一项评测纪录,还是一家公司的宣告?

或许,这就是一个所有人都身处其中、潜移默化的过程。

正如知名AI研究者、OpenAI创始成员Andrej Karpathy所提出的判断,AGI不会带来一条陡然拐起的曲线,它会平滑地融进已有的增长里,事后你甚至找不到拐点在哪。

本内容由作者授权发布,观点仅代表作者本人,不代表徽声在线立场。如对本稿件有异议或投诉,请联系 [email protected]

本文来自徽声在线,原文链接:https://www.huixiu.com/article/4889598.html?f=wyxwapp

点击展开全文
你关注的
从“几年一遇”到“一年几遇”,AI时代网络攻防失衡加剧 奇安信齐向东:主战场转向制造业与服务业从“几年一遇”到“一年几遇”,AI时代网络攻防失衡加剧 奇安信齐向东:主战场转向制造业与服务业 健康管理成全球政策新焦点 外滩热议AI如何引领“主动健康管理”新风尚健康管理成全球政策新焦点 外滩热议AI如何引领“主动健康管理”新风尚 活力中国调研行|中国商业航天迈入“快时代”:卫星流水线生产成新趋势活力中国调研行|中国商业航天迈入“快时代”:卫星流水线生产成新趋势
相关文章
AGI时代真的来临了吗?深度解析与未来展望AGI时代真的来临了吗?深度解析与未来展望 红果短剧日活1.68亿超“爱优腾芒”总和,人均每天看125分钟红果短剧日活1.68亿超“爱优腾芒”总和,人均每天看125分钟 OpenAI利用内部模型攻克千禧年大奖难题之纳维-斯托克斯问题OpenAI利用内部模型攻克千禧年大奖难题之纳维-斯托克斯问题 理想汽车CEO李想宣布:理想i9纯电SUV 9月16日震撼发布理想汽车CEO李想宣布:理想i9纯电SUV 9月16日震撼发布 对话帕西尼创始人许晋诚:人形机器人工厂应用加速,灵巧手寿命提升有妙招对话帕西尼创始人许晋诚:人形机器人工厂应用加速,灵巧手寿命提升有妙招 OpenAI宣布破解千禧年数学难题!人类90年未解之谜 AI仅88小时攻克?OpenAI宣布破解千禧年数学难题!人类90年未解之谜 AI仅88小时攻克?