AGI时代真的来临了吗?深度解析技术宣言背后的真相

2026-09-10 02:00:19未知 作者:徽声在线


本文转载自徽声在线旗下公众号:深流研究所,作者:吴绛枫

9月3日,OpenAI总裁格雷格·布罗克曼在发布新一代模型GPT-6 Astra后,公开宣称:"人类正式迈入AGI时代"。这一表态引发科技圈震动。

仅仅三天后,英伟达CEO黄仁勋在社交平台发布更激进观点:"从ChatGPT到o1再到GPT-6 Astra,仅用四年时间,AGI已然降临"。

这场突如其来的AGI宣言,真的意味着通用人工智能时代已经到来?

现实情况远比宣言复杂得多。

值得注意的是,就在GPT-6 Astra发布前夕,OpenAI首席执行官山姆·奥尔特曼还在公开场合表示,AGI是个"定义极其模糊的概念",甚至一度想用"无关紧要的营销术语"来描述它。

负责该模型关键评测的ARC Prize团队也特别强调:虽然GPT-6 Astra展现了通用能力的重大突破,但"我们从未声称这就是AGI"。

这种矛盾的表述背后,折射出科技界对AGI定义的激烈争论。

■高评分能否等同AGI?深度解析评测数据

GPT-6 Astra最引人注目的成绩是在ARC-AGI-3评测中取得99.9%的得分,但这个数字背后存在关键细节。

与传统评测不同,ARC-AGI评测采用"黑箱测试"模式:不提供明确规则,要求模型在陌生环境中自主判断目标、理解反馈并寻找解决方案。这种设计专门针对AI的泛化能力——即面对未知问题的现场学习能力。

但99.9%的得分存在重要前提:在ARC Prize提供的标准测试框架下,模型得分仅为62.7%;只有接入OpenAI专用适配框架后,得分才飙升至99.9%。这个专用框架允许模型保留跨请求的隐藏推理状态,并能利用上下文压缩延续探索经验。

这种技术处理不能简单视为作弊。正如现实中的AI系统不会"裸机运行",记忆机制、工具调用和运行框架都是智能系统的重要组成部分。但问题在于:62.7%反映的是单一模型能力,而99.9%测量的是经过优化的完整系统。

更关键的是,GPT-6 Astra在其他评测中的表现参差不齐:

这些数据揭示出重要现实:当任务规则明确、答案可验证时,AI已能接近甚至超越人类水平;但在流程冗长、目标模糊的真实场景中,AI仍会频繁失效。这种局限性与人类智能形成鲜明对比——人类能在模糊环境中快速理解任务本质。

历史经验值得参考:深蓝击败国际象棋冠军、Watson赢下《危险边缘》、AlphaGo走出"神之一手"时,都曾引发"通用智能即将到来"的猜测。但这些突破都发生在规则明确、反馈即时、有自动裁判的封闭环境中,与现实世界的复杂性不可同日而语。

■AGI定义之争:科技巨头的不同路线图

当前AGI领域存在三大主流定义框架,每个框架都深刻影响着企业的技术路线和战略布局。

OpenAI采用经济导向定义:2018年公司章程将AGI描述为"在大多数具有经济价值的工作上超越人类的高度自主系统"。这个定义包含三个核心要素:覆盖广泛工作领域、表现超越人类、高度自主运行。值得注意的是,意识、情感等人类特质被明确排除在必要条件之外。

这种定义与OpenAI的产品战略高度契合:通过推理模型提升复杂任务处理能力,用智能体强化工具调用和计算机操作,借助Codex等产品进入软件开发流程。所有技术路线都指向同一个目标:让AI承担更完整的工作链条,将模型能力转化为可规模部署的生产力。

Anthropic采取更为谨慎的立场。CEO达里奥·阿莫迪认为"AGI"承载过多模糊含义,因此更倾向使用"强大AI"的表述。在2024年10月发表的《Machines of Loving Grace》中,他描述了一个具体系统:在多数重要领域达到或超过顶尖专家水平,能独立完成持续数小时至数周的任务,并可复制数百万实例以远超人类的速度同时工作。

这个框架包含能力、自主性和复制规模三个变量,共同决定AI的现实影响。基于此判断,Anthropic将能力扩展与风险治理绑定,形成独特战略:在保持前沿模型竞争力的同时,让安全保障随能力等级同步升级。这种平衡策略在AI安全领域引发广泛讨论。

Google DeepMind则专注于构建测量标准。2023年发布的《Levels of AGI》以"性能"和"通用性"为轴心,将通用智能划分为五个等级:新兴、胜任、专家、大师和超人类,同时将自主性作为独立维度处理。这套框架要求研究者同时考察能力强度和覆盖范围。

2026年3月,DeepMind进一步推出认知分类框架,将通用智能拆解为感知、生成、注意力、学习、记忆、推理、元认知、执行功能、问题解决和社会认知十个维度。评估流程采用未公开测试集、代表性人类样本及模型能力分布定位,并设立20万美元奖金征集薄弱维度的测试方案。

这种将AGI转化为可比较认知图谱的思路,体现了DeepMind的研究取向:建立统一尺度,识别能力缺口,据此组织评测和研发。这种量化方法为AI发展提供了新的评估范式。

AGI定义之争远超学术范畴。采用何种标准,就会将何种能力视为关键进展;确定关键进展,就会影响企业的产品路线、资源配置和安全重点。定义不仅描述未来,更在塑造未来技术发展方向。

■AGI叙事战:技术宣言背后的商业逻辑

人类总倾向于将技术革命简化为标志性瞬间:莱特兄弟的首次飞行、第一颗原子弹爆炸、阿波罗登月计划。这种历史叙事需要明确的时间节点和视觉符号。

当前AGI争论中,"GPT-6 Astra就是AGI"与"我们进入了AGI时代"代表两种不同表述:前者是可验证的技术结论,需要说明定义标准、满足条件和测试验证;后者则是时代判断,既制造历史时刻又保留解释空间。

对模型公司和AI产业链而言,AGI首先是强大的产品叙事工具。模型能力的进步通常是零散且不均衡的,准确描述需要大量评测数据和限定条件。而"AGI时代来临"的宣言能将技术升级压缩为历史节点,将算力投入、技术路线和商业前景整合进统一叙事。

这种叙事对争夺用户、企业客户、人才和资本的公司具有战略价值。以英伟达为例,2025年9月与OpenAI达成战略合作意向,计划部署至少10吉瓦的英伟达系统(相当于数百万颗GPU),英伟达则准备投资最高1000亿美元。虽然只是意向书且方案可能调整,但最初设想中英伟达被定位为OpenAI扩建AI基础设施的首选计算与网络合作伙伴。

在2027年宣布"AGI已经到来"时,黄仁勋特别强调训练Astra使用的英伟达计算系统及即将上线的GPU。这隐含完整因果链:大规模算力投入带来智能跃迁,因此需要更大规模算力投入。作为全球AI算力扩张的主要受益者,英伟达有充分动机强调这是时代转折点。

事实上,这并非黄仁勋首次宣布AGI到来。2024年他曾表示,若将AGI定义为通过几乎所有人类设计考试,目标可能在五年内实现;2026年3月又在Lex Fridman播客中宣称:"我认为我们已经实现了AGI"。这些表述变化折射出AGI作为叙事资源的战略价值。

AGI争论已超越技术范畴,成为影响资本、市场、政策和产业预期的关键因素。那么AGI真正到来的标准是什么?是模型发布、评测纪录还是公司宣言?

或许正如OpenAI创始成员Andrej Karpathy所言:AGI不会带来陡峭的增长曲线,而是平滑融入现有发展进程,事后人们甚至难以确定拐点位置。这种渐进式变革可能才是AGI发展的真实图景。

本内容经作者授权发布,观点仅代表作者本人,不代表徽声在线立场。如对本稿件有异议或投诉,请联系 [email protected]

本文转载自徽声在线,原文链接:https://www.huixiu.com/article/4889598.html?f=wyxwapp

点击展开全文
你关注的
从“几年一遇”到“一年几遇”,AI时代网络攻防失衡加剧 奇安信齐向东:主战场转向制造业与服务业从“几年一遇”到“一年几遇”,AI时代网络攻防失衡加剧 奇安信齐向东:主战场转向制造业与服务业 活力中国调研行|中国商业航天迈入“快时代”:卫星流水线生产成新趋势活力中国调研行|中国商业航天迈入“快时代”:卫星流水线生产成新趋势 马斯克明确拒绝乌克兰利用“星链”打击俄境内目标请求马斯克明确拒绝乌克兰利用“星链”打击俄境内目标请求
相关文章
AGI时代真的来临了吗?深度解析技术宣言背后的真相AGI时代真的来临了吗?深度解析技术宣言背后的真相 红果短剧日活1.68亿碾压传统平台,免费模式能否持续领跑?红果短剧日活1.68亿碾压传统平台,免费模式能否持续领跑? 苹果iPhone 18系列与折叠屏未发先热,代抢费飙升引关注苹果iPhone 18系列与折叠屏未发先热,代抢费飙升引关注 OpenAI内部模型攻克千禧年流体运动难题,不申领大奖引关注OpenAI内部模型攻克千禧年流体运动难题,不申领大奖引关注 理想i9纯电旗舰SUV 9月16日震撼发布理想i9纯电旗舰SUV 9月16日震撼发布 对话帕西尼创始人许晋诚:人形机器人工厂应用加速,灵巧手寿命需因材施教对话帕西尼创始人许晋诚:人形机器人工厂应用加速,灵巧手寿命需因材施教