AGI时代来临:技术突破还是叙事博弈?
2026-09-12 07:43:51未知 作者:徽声在线
本文源自徽声在线旗下公众号:深流研究所,作者:吴绛枫
9月3日,OpenAI总裁格雷格·布罗克曼在发布新一代模型GPT-6 Astra后,公开宣称:"我们正式步入AGI时代。"这一论断引发科技圈震动。
仅三天后,英伟达CEO黄仁勋在社交平台发文称:"从ChatGPT到o1,再到GPT-6 Astra,仅用四年时间,AGI已然成为现实。"
这场突如其来的AGI宣言,是否意味着人类智能的终极形态已经降临?
现实远比宣言复杂得多。
就在GPT-6 Astra发布前夕,OpenAI首席执行官山姆·奥尔特曼还在公开场合表示:"AGI是个定义模糊的概念,甚至可以视为营销术语。"
负责该模型核心评测的ARC Prize团队特别强调:"尽管GPT-6 Astra展现了通用能力的重大突破,但我们从未宣称它就是AGI。"
这种矛盾表述折射出行业深层分歧——一边是激进的时代宣言,一边是谨慎的技术界定。
当AGI成为科技界高频词,其真正内涵却始终模糊不清:AI究竟要达到何种标准,才能跨越这道智能分水岭?
■评测高分能否等同AGI?
GPT-6 Astra最引人注目的成就,是在ARC-AGI-3评测中取得99.9%的惊人分数。
这项特殊评测与传统测试不同:不提供明确规则,而是将模型置于陌生环境,要求其自主判断目标、理解反馈并寻找解决方案。
该测试旨在衡量AI最受质疑的能力——面对未知问题的现场学习能力。
99.9%的得分看似完美,但隐藏着关键前提:
在ARC Prize标准测试框架下,GPT-6 Astra仅得62.7%;当接入OpenAI专用适配框架后,分数才飙升至99.9%。
这种适配框架允许模型保留跨请求的隐藏推理状态,并利用上下文压缩延续探索经验。
虽然不能简单视为作弊,但这种操作揭示重要差异:62.7%反映的是单一模型能力,99.9%则代表经过优化的完整系统表现。
两项成绩均真实有效,但绝不能混为一谈,更不能将99.9%的测试分直接等同于99.9%的AGI实现度。
在其他评测中,GPT-6 Astra的表现也暴露明显短板:
在高难数学测试FrontierMath Tier 4取得97.6%,计算机操作测试OSWorld 2.0获得72.6%;但在模拟真实办公流程的AutomationBench测试中,成绩骤降至41.4%,复杂专业任务测试Agents’Last Exam也仅有59.3%。
这些数据表明:当任务规则清晰、答案可验证时,Astra已接近或超越人类水平;但面对流程冗长、目标模糊的现实场景,其表现仍差强人意。
AI在封闭测试中的优异表现并非新鲜事。
深蓝击败国际象棋冠军、Watson赢得《危险边缘》、AlphaGo走出"神之一手"时,都曾引发类似猜想:既然机器能征服如此复杂的任务,通用智能或许近在咫尺。
但规则明确、反馈即时、有自动裁判的测试环境,与真实世界存在本质差异。
■AGI定义:科技巨头的认知分野
AGI至今缺乏统一标准,不同机构存在显著认知差异。
OpenAI采用经济导向定义:在其2018年公司章程中,将AGI描述为"在大多数具有经济价值的工作上超越人类的高度自主系统"。
该定义包含三个核心要素:覆盖广泛工作领域、表现优于人类、具备高度自主性。
值得注意的是,意识、情感等人类特质并未被纳入必要条件,现实工作产出成为核心衡量标准。
这种标准与OpenAI的产品路线高度契合:
推理模型提升复杂任务处理能力,智能体强化工具调用与计算机操作,Codex等产品深入软件开发流程,所有能力都指向同一目标:让AI承担更完整的工作,将模型能力转化为可规模部署的生产力。
Anthropic对AGI的界定更为审慎。CEO达里奥·阿莫迪认为该术语承载过多模糊含义,因此更倾向使用"强大AI"的表述。
在2024年10月发表的《Machines of Loving Grace》中,阿莫迪描绘了具体系统图景:
在多数重要领域达到或超越顶尖专家水平,能够独立完成持续数小时至数周的任务,并可复制数百万实例以远超人类的速度协同工作。
这幅图景包含能力、自主性和复制规模三个变量,共同决定AI的现实影响与潜在风险。
基于这种判断,Anthropic将能力扩展与风险治理绑定,其战略重点可概括为:保持前沿模型竞争力,同时让安全保障随能力等级同步升级。
Google DeepMind则聚焦于AGI的测量标准。
其2023年发布的《Levels of AGI》论文,以"性能"和"通用性"为双轴,将通用智能划分为"新兴""胜任""专家""大师"和"超人类"五个等级,并将自主性作为独立维度处理。该框架要求研究者同时考察能力强度与覆盖范围。
2026年3月,DeepMind进一步推出认知分类框架,将通用智能拆解为感知、生成、注意力、学习、记忆、推理、元认知、执行功能、问题解决和社会认知十个维度。
评估流程采用未公开测试集、代表性人类样本,以及模型相对于人类能力分布的位置作为参照。
DeepMind还与Kaggle设立20万美元奖金,为五个评测薄弱的维度征集测试方案。
这种思路将AGI从单一标签转化为可比较的认知能力图谱,体现了DeepMind的研究取向:建立统一尺度,识别能力缺口,据此组织评测与研发。
AGI定义之争远非学术讨论,它深刻影响着技术发展方向:
采用何种标准,就会将何种能力视为关键进展;将何种能力视为关键进展,就会决定企业的产品路线、资源配置与安全策略。
定义不仅描述未来,更在塑造未来。
■AGI之争:技术宣言还是叙事博弈?
人类总倾向于将技术革命具象化为某个决定性瞬间。
莱特兄弟的首次飞行、第一颗原子弹爆炸、阿波罗11号登月,这些历史时刻都需要精确日期与标志性画面。
回到当前的AGI争论,"GPT-6 Astra就是AGI"与"我们进入了AGI时代"代表两种不同性质的表述:
前者是可验证的技术结论:若称其为AGI,需说明采用何种定义、满足哪些条件、通过哪些独立测试验证。
后者则是时代判断,如布罗克曼的"欢迎来到AGI时代"。这种表述既制造历史节点,又保留解释空间。
对模型公司与AI产业链而言,AGI首先是强大的产品叙事工具。
模型能力的进步通常是零散且不均衡的,准确描述需要长串评测数据与限定条件。
"AGI时代来临"的宣言却能将复杂变化压缩为简单口号,将产品升级转化为历史转折,将算力投入、技术路线与商业前景编织成统一叙事。
对争夺用户、企业客户、人才与资本的公司而言,这种叙事的价值不亚于技术突破本身。
黄仁勋的表态需置于这种叙事框架下理解:
2025年9月,英伟达与OpenAI宣布达成战略合作,计划部署至少10吉瓦的英伟达系统(相当于数百万颗GPU),英伟达则准备随基础设施落地向OpenAI投资最高1000亿美元。
虽然这只是意向书而非最终协议,且后续传出方案可能调整,但在初始合作设想中,英伟达被定位为OpenAI扩建AI基础设施的首选计算与网络合作伙伴。双方公告明确表示,这些设施将服务于OpenAI"迈向部署超级智能"的路径。
近期黄仁勋宣布"AGI已经到来"时,特别强调训练Astra使用的英伟达计算系统及即将上线的GPU。
这段表述隐含完整逻辑链:大规模算力投入带来智能跃迁,因此需要更大规模算力投入。
作为全球AI算力扩张的主要受益者,英伟达有充分动机强调这是时代转折点。
事实上,这并非黄仁勋首次宣布AGI到来:
2024年他曾表示,若将AGI定义为通过几乎所有人类设计的考试,该目标可能在五年内实现;2026年3月,他又在Lex Fridman播客中宣称:"我认为我们已经实现了AGI。"
由此可见,AGI不仅是技术目标,更是影响资本、市场、政策与产业预期的重要叙事资源。
那么AGI真正到来的标志是什么?是模型发布、评测纪录还是公司宣言?
或许这将是潜移默化的渐进过程:
正如OpenAI创始成员Andrej Karpathy所言,AGI不会带来陡然转折,而是平滑融入现有增长曲线,事后人们甚至难以确定拐点所在。
本内容由作者授权发布,观点仅代表作者本人,不代表徽声在线立场。如对本稿件有异议或投诉,请联系 [email protected]。
本文来自徽声在线,原文链接:https://www.huixiu.com/article/4889598.html?f=wyxwapp

