AGI时代来了?一场关于智能未来的深度博弈
2026-09-24 23:49:35未知 作者:徽声在线
本文源自徽声在线旗下公众号:深流研究所,作者:吴绛枫
9月3日,OpenAI总裁格雷格·布罗克曼在发布全新模型GPT-6 Astra后,公开宣称:"我们正式迈入AGI时代。"这一论断引发行业震动。
仅三天后,英伟达CEO黄仁勋在社交平台进一步强化这一观点:"从ChatGPT到o1,再到GPT-6 Astra,仅用四年时间,AGI已然成为现实。"
这场突如其来的AGI宣言,是否意味着人类智能的终极形态已经降临?
现实远比宣言复杂得多。
就在GPT-6 Astra发布前夕,OpenAI首席执行官山姆·奥尔特曼仍公开表示,AGI是"定义极其模糊的概念",甚至一度想称之为"营销术语"。这种前后矛盾的态度,折射出行业对AGI认知的深层分歧。
负责关键评测的ARC Prize团队特别强调:"GPT-6 Astra确实展现了通用化能力的重大突破,但我们从未声称它就是AGI。"这种谨慎态度与商业领袖的激进宣言形成鲜明对比。
当科技巨头高呼"AGI已至"时,评测机构却在划清界限,这种割裂现象背后,隐藏着AI行业发展的深层逻辑。
■评测榜单的数字游戏:99.9%等于AGI吗?
GPT-6 Astra在ARC-AGI-3评测中取得的99.9%惊人成绩,成为AGI论者的核心论据。但这个数字背后藏着关键细节:
与传统评测不同,ARC-AGI-3采用"黑箱测试"模式——不提供明确规则,要求模型在陌生环境中自主判断目标、理解反馈并寻找解决方案。这种设计专门针对AI的"零样本学习能力",即面对全新问题时的现场适应能力。
然而,99.9%的得分存在重要前提:在ARC Prize提供的标准测试框架中,GPT-6 Astra实际得分仅为62.7%;当接入OpenAI定制的专用适配框架后,成绩才飙升至99.9%。这个专用框架允许模型保留跨请求的隐藏推理状态,并能利用上下文压缩延续探索经验。
这种技术操作虽非作弊,却揭示了关键问题:62.7%反映的是单一模型的基础能力,而99.9%测量的是包含记忆系统、工具链和运行框架的完整智能体系。两者本质不同,不能简单等同。
更值得警惕的是,当我们将99.9%的测试得分直接换算为"99.9%的AGI"时,已经陷入了概念偷换的陷阱。AI评测与AGI认定之间,存在着难以跨越的逻辑鸿沟。
在其他权威评测中,GPT-6 Astra的表现暴露出明显短板:
- 高难数学测试FrontierMath Tier 4:97.6%
- 计算机操作测试OSWorld 2.0:72.6%
- 真实办公流程测试AutomationBench:41.4%
- 复杂专业任务测试Agents’Last Exam:59.3%
这些数据揭示残酷现实:当任务规则清晰、答案可验证时,AI已能逼近甚至超越人类;但面对流程冗长、目标模糊的真实场景,其失败率仍高得惊人。这种"考场天才,现实菜鸟"的悖论,正是当前AI发展的真实写照。
历史总是惊人相似:深蓝击败国际象棋冠军、Watson赢下《危险边缘》、AlphaGo走出"神之一手"时,人类都曾产生"通用智能近在咫尺"的错觉。但规则明确、反馈即时、有自动裁判的封闭环境,与复杂多变的现实世界存在本质差异。
■AGI定义之争:科技巨头的战略博弈
AGI至今缺乏统一标准,不同机构的定义折射出各自的战略考量:
OpenAI采用最具经济导向的定义:在2018年公司章程中,将AGI描述为"在大多数具有经济价值的工作上超越人类的高度自主系统"。这个定义包含三个核心要素:
- 覆盖广泛的工作领域
- 表现超越人类水平
- 具备高度自主运行能力
值得注意的是,意识、情感等人类特质被明确排除在必要条件之外。这种务实定义与OpenAI的产品路线高度契合:通过推理模型提升复杂任务处理能力,借助智能体强化工具调用和计算机操作,最终让AI承担完整工作流程,转化为可规模化部署的生产力。
Anthropic则采取更为谨慎的态度。CEO达里奥·阿莫迪认为"AGI"承载过多模糊含义,转而使用"强大的AI"这一表述。在2024年10月发表的《Machines of Loving Grace》中,他描绘了具体系统标准:
- 在多数重要领域达到或超过顶尖专家水平
- 能够独立完成持续数小时至数周的任务
- 可复制成数百万实例,以远超人类的速度同时工作
这幅图景包含能力、自主性和复制规模三个变量,共同决定AI的现实影响。基于此判断,Anthropic将能力扩展与风险治理绑定,形成"保持前沿竞争力+同步升级安全保障"的战略双轮驱动。
Google DeepMind则聚焦于AGI的测量标准。其2023年发布的《Levels of AGI》提出"性能-通用性"双轴模型,将通用智能划分为五个等级:
- 新兴:初步具备通用能力
- 胜任:在特定领域表现良好
- 专家:接近人类专业水平
- 大师:超越人类专家
- 超人类:全面超越人类能力
同时将自主性作为独立维度处理,要求研究者同时考察能力强度和覆盖范围。2026年3月,DeepMind进一步发布认知分类框架,将通用智能拆解为感知、生成、注意力、学习、记忆、推理、元认知、执行功能、问题解决和社会认知十个维度,并设立20万美元奖金征集测试方案。
这种将AGI转化为可比较认知能力图谱的思路,体现了DeepMind的研究取向:通过建立统一尺度,识别能力缺口,指导评测研发和产品迭代。定义之争背后,是科技巨头对未来技术主导权的激烈争夺。
AGI定义不仅是学术概念,更是战略罗盘。采用何种标准,决定着哪些能力被视为关键进展;哪些进展被优先发展,又反过来塑造公司的产品路线、资源配置和安全策略。这种定义与发展的双向互动,正在悄然重构AI行业的竞争格局。
■AGI叙事之争:技术革命还是商业包装?
人类总是倾向于将技术革命简化为标志性瞬间:莱特兄弟的首次飞行、第一颗原子弹爆炸、阿波罗11号登月。这种历史叙事需要明确日期和震撼画面,但AGI的发展可能打破这种传统认知模式。
当前AGI之争中,"GPT-6 Astra就是AGI"与"我们进入了AGI时代"代表两种不同表达:前者是可检验的技术结论,需要明确定义、满足条件和独立验证;后者则是充满弹性的时代判断,既制造历史时刻又保留解释空间。
对模型公司和AI产业链而言,AGI首先是强大的产品叙事工具。模型能力的真实进步往往是零散而不均匀的,准确描述需要一长串评测数据和限定条件。而"AGI时代来了"的宣言,能将技术升级压缩为历史节点,将算力投入、技术路线和商业前景编织成统一故事。
这种叙事对争夺用户、客户、人才和资本的公司具有战略价值。黄仁勋的表态需放在这个框架下理解:2025年9月,英伟达与OpenAI宣布战略合作,计划部署至少10吉瓦的英伟达系统(相当于数百万颗GPU),英伟达则准备投资最高1000亿美元。
虽然这只是意向书而非最终协议,且后续传出调整可能,但在最初设想中,英伟达被定位为OpenAI扩建AI基础设施的首选合作伙伴。双方公告明确表示,这些设施将服务于OpenAI"迈向部署超级智能"的路径。
黄仁勋在宣布"AGI已经到来"时,特别强调训练Astra使用的英伟达计算系统和即将上线的GPU,隐含着完整因果链:大规模算力投入带来智能跃迁,因此需要更大规模算力投入。作为AI算力扩张的主要受益者,英伟达有强烈动机强调这是时代转折。
事实上,这并非黄仁勋首次宣布AGI到来。2024年他曾预测,若将AGI定义为通过几乎所有人类考试,这一目标可能在五年内实现;2026年3月,他又在Lex Fridman播客中直言:"我认为我们已经实现了AGI。"
AGI已从技术终点演变为叙事资源,影响着资本流向、市场预期、政策制定和产业布局。那么,AGI究竟如何才算真正到来?是模型发布、评测纪录,还是公司宣言?
或许正如OpenAI创始成员Andrej Karpathy所言,AGI不会带来陡然转折,而是平滑融入现有增长曲线,事后甚至难以确定拐点所在。这场关于AGI的争论,本质上是人类对智能本质认知的持续探索,其意义远超技术本身。
本内容经作者授权发布,观点仅代表作者本人,不代表徽声在线立场。如对本稿件有异议或投诉,请联系 [email protected]。
本文源自徽声在线,原文链接:https://www.huixiu.com/article/4889598.html?f=wyxwapp