AGI时代真的来临了吗?深度解析技术宣言背后的真相

2026-09-11 10:50:27未知 作者:徽声在线


本文来自徽声在线旗下公众号:深流研究所,作者:吴绛枫

9月3日,OpenAI总裁格雷格·布罗克曼在发布新一代模型GPT-6 Astra后,公开宣称:"我们正式迈入AGI时代。"这一宣言引发了科技界的广泛讨论。

仅三天后,英伟达CEO黄仁勋在社交平台发布更直接的论断:"从ChatGPT到o1,再到GPT-6 Astra,仅用四年时间,AGI已然成为现实。"

这场突如其来的AGI宣言,是否意味着人类智能的终极目标已经达成?

现实情况远比表面复杂得多。

就在GPT-6 Astra发布前夕,OpenAI首席执行官山姆·奥尔特曼还在公开场合表示,AGI是个"定义极其模糊的概念",甚至一度想用"无关紧要的营销术语"来描述它。

负责该模型关键评测的ARC Prize团队也特别强调:虽然GPT-6 Astra展现了通用化能力的重大突破,但"我们从未声称这就是AGI"。

这种自相矛盾的表述背后,折射出科技巨头在AGI定义上的战略考量。

当整个行业都在热议AGI时,却鲜有人能明确界定:AI需要达到什么标准才算真正跨越AGI的门槛?

■评测榜单的高分,真能等同AGI吗?

GPT-6 Astra最引人注目的成就,是在ARC-AGI-3评测中取得99.9%的惊人成绩。

与传统评测不同,ARC-AGI-3采用独特测试方式:不提供明确规则,而是将模型置于陌生环境,要求其自主判断目标、理解反馈并寻找解决方案。

这种设计专门针对AI最受质疑的能力——面对未知问题的现场学习能力。

99.9%的得分看似完美,但背后存在关键前提。

在ARC Prize提供的标准测试框架中,GPT-6 Astra实际得分为62.7%;只有接入OpenAI专门开发的适配框架后,成绩才飙升至99.9%。

这个专用框架允许模型保留跨请求的隐藏推理状态,并利用上下文压缩技术延续此前探索经验。

虽然不能简单将这种优化视为"作弊"——毕竟现实中的AI系统本就需要记忆、工具和运行框架的支持——但62.7%与99.9%的差异揭示了重要事实:前者测量的是单个模型的基础能力,后者测试的是经过系统优化的完整解决方案。

将两个不同维度的成绩混为一谈,甚至把99.9%的测试得分直接等同于"99.9%的AGI实现度",显然缺乏科学依据。

更值得关注的是,GPT-6 Astra在其他评测中的表现并不均衡。

在高难度数学测试FrontierMath Tier 4中取得97.6%的高分,计算机操作测试OSWorld 2.0获得72.6%;但在模拟真实办公流程的AutomationBench测试中,成绩骤降至41.4%,复杂专业任务测试Agents’Last Exam也仅有59.3%。

这些数据表明:当任务规则明确、答案可验证时,Astra已能接近甚至超越人类水平;但面对流程冗长、目标模糊的现实场景,其表现仍差强人意。

AI在封闭考试中的优异表现并非新鲜事。

从深蓝击败国际象棋世界冠军,到Watson赢下《危险边缘》,再到AlphaGo走出"神之一手",每次技术突破都曾引发"通用智能即将到来"的猜测。

但规则明确、反馈即时、有自动裁判的测试环境,与复杂多变的现实世界存在本质差异。

■众说纷纭的AGI,究竟指什么?

AGI至今缺乏统一定义,不同机构持有截然不同的观点。

OpenAI采用经济导向的定义方式。其2018年公司章程将AGI描述为"在大多数具有经济价值的工作上超越人类的高度自主系统"。

这个定义包含三个核心要素:覆盖广泛的工作领域、表现优于人类、具备高度自主性。

值得注意的是,意识、情感和人类式思维并未被列为必要条件,现实工作产出成为核心衡量标准。

这种定义与OpenAI近年来的产品路线高度契合。

推理模型提升复杂任务处理能力,智能体强化工具调用和计算机操作,Codex等产品进一步渗透软件开发流程——所有技术路线都指向同一个目标:让AI承担更完整的工作,将模型能力转化为可规模化部署的生产力。

相比之下,Anthropic对AGI的定义更为谨慎。CEO达里奥·阿莫迪认为这个术语承载过多模糊含义,因此更倾向于使用"强大的AI"这一表述。

在2024年10月发表的《Machines of Loving Grace》中,阿莫迪描绘了具体系统图景:

这类系统需在多数重要领域达到或超过顶尖专家水平,能够独立完成持续数小时、数天乃至数周的任务,还可复制成数百万个实例,以远高于人类的速度同时工作。

这幅图景包含能力、自主性和复制规模三个变量,三者共同决定AI的现实影响,也会同步放大滥用、失控和系统性风险。

基于这种判断,Anthropic将能力扩展与风险治理紧密结合,其战略重点可概括为:保持前沿模型竞争力,同时让安全保障随能力等级同步升级。

Google DeepMind则专注于AGI的测量标准。

其2023年发布的《Levels of AGI》论文,以"性能"和"通用性"为双轴,将通用智能划分为"新兴""胜任""专家""大师"和"超人类"五个等级,并将自主性作为独立维度处理。这套框架要求研究者同时考察能力强度和覆盖范围。

2026年3月,DeepMind进一步推出认知分类框架,将通用智能拆解为感知、生成、注意力、学习、记忆、推理、元认知、执行功能、问题解决和社会认知十个维度。

评估流程采用未公开测试集、具有代表性的人类样本,以及模型相对于人类能力分布的位置作为参照。

DeepMind还与Kaggle合作设立20万美元奖金,为其中五个评测较薄弱的维度征集测试方案。

这种思路将AGI从单一标签转化为可比较的认知能力图谱,体现了DeepMind的研究取向:建立统一尺度,识别能力缺口,再据此组织评测和研发。

AGI的定义之争,远不止是学术讨论。

采用何种标准,就会将何种能力视为关键进展;将何种能力视为关键进展,就会决定公司的产品路线、资源配置和安全重点。

定义看似在描述未来,实则在塑造未来。

■AGI是否到来,为何演变为叙事之争?

人类总倾向于将技术革命想象为某个明确瞬间。

莱特兄弟的飞机离地升空,第一颗原子弹爆炸,阿波罗11号登上月球——历史需要标志性日期,也偏爱震撼画面。

回到当前的AGI之争,"GPT-6 Astra就是AGI"与"我们进入了AGI时代"这两种表述,本质上是不同性质的论断。

前者是可被质疑和检验的技术结论:若声称某系统是AGI,就必须说明采用何种定义、满足哪些条件,并在哪些独立测试中得到验证。

后者则属于时代判断范畴。布罗克曼的"欢迎来到AGI时代"正是这种表述,它既制造了历史时刻感,又保留了足够的解释弹性。

对模型公司和AI产业链而言,"AGI"首先是强大的产品叙事工具。

模型能力的真实进步通常零散而不均匀,准确描述这些变化需要一长串评测数据、条件说明和限定语。

"AGI时代来了"却能将复杂信息压缩成简洁宣言。

它把单次模型发布从产品升级提升为历史节点,将算力投入、技术路线和商业前景整合进统一叙事框架。

对于争夺用户、企业客户、人才和资本的公司来说,这种叙事的价值可能不亚于技术突破本身。

黄仁勋的表态也需放在这个语境中理解。

2025年9月,英伟达与OpenAI宣布达成战略合作意向。根据计划,OpenAI将部署至少10吉瓦的英伟达系统,规模相当于数百万颗GPU;英伟达则准备随着基础设施落地,向OpenAI投资最高1000亿美元。

虽然这只是意向书而非最终协议,后续也传出方案可能调整的消息,但在最初合作设想中,英伟达被定位为OpenAI扩建AI基础设施的首选计算与网络合作伙伴。双方公告明确表示,这些设施将服务于OpenAI"迈向部署超级智能"的路径。

近期黄仁勋宣布"AGI已经到来"时,特别提到训练Astra所使用的英伟达计算系统,以及即将上线的GPU新品。

这段表述隐含完整因果链:大规模算力投入带来智能跃迁,因此需要继续扩大算力投资。

作为全球AI算力扩张的主要受益者,英伟达有充分动机强调这是时代转折点。

事实上,这并非黄仁勋首次宣布AGI到来。

2024年他曾表示,若将AGI定义为能通过几乎所有人类设计的考试,这一目标可能在五年内实现。

到2026年3月,他又在Lex Fridman播客中宣称:"我认为我们已经实现了AGI。"

由此可见,AGI不仅是技术终点,更是影响资本、市场、政策和产业预期的重要叙事资源。

那么AGI究竟何时才算真正到来?是某次模型发布、某项评测纪录,还是某家公司的宣言?

或许正如OpenAI创始成员Andrej Karpathy所言,AGI不会带来陡然转折的曲线,而是平滑融入现有增长轨迹,事后人们甚至找不到明确的拐点。

本内容由作者授权发布,观点仅代表作者本人,不代表徽声在线立场。如对本稿件有异议或投诉,请联系 [email protected]

本文来自徽声在线,原文链接:https://www.huixiu.com/article/4889598.html?f=wyxwapp

点击展开全文
你关注的
从“几年一遇”到“一年几遇”,AI时代网络攻防失衡加剧 奇安信齐向东:主战场转向制造业与服务业从“几年一遇”到“一年几遇”,AI时代网络攻防失衡加剧 奇安信齐向东:主战场转向制造业与服务业 活力中国调研行|中国商业航天迈入“快时代”:卫星流水线生产成新趋势活力中国调研行|中国商业航天迈入“快时代”:卫星流水线生产成新趋势 马斯克明确拒绝乌克兰利用“星链”打击俄境内目标请求马斯克明确拒绝乌克兰利用“星链”打击俄境内目标请求
相关文章
AGI时代真的来临了吗?深度解析技术宣言背后的真相AGI时代真的来临了吗?深度解析技术宣言背后的真相 红果短剧日活1.68亿创纪录,短视频颠覆长视频格局背后的机遇与挑战红果短剧日活1.68亿创纪录,短视频颠覆长视频格局背后的机遇与挑战 苹果iPhone 18系列与折叠屏未发先热,代抢费飙升引关注苹果iPhone 18系列与折叠屏未发先热,代抢费飙升引关注 OpenAI凭内部模型攻克千禧年大奖难题,流体力学迎新突破OpenAI凭内部模型攻克千禧年大奖难题,流体力学迎新突破 理想汽车CEO李想宣布:理想i9纯电旗舰SUV 9月16日震撼发布理想汽车CEO李想宣布:理想i9纯电旗舰SUV 9月16日震撼发布 对话帕西尼创始人许晋诚:人形机器人工厂应用加速,灵巧手寿命提升有妙招对话帕西尼创始人许晋诚:人形机器人工厂应用加速,灵巧手寿命提升有妙招