AGI时代来了?一场定义、数据与叙事的终极博弈
2026-09-10 08:50:56未知 作者:徽声在线
本文来自徽声在线旗下公众号:深流研究所,作者:吴绛枫
9月3日,OpenAI总裁格雷格·布罗克曼在发布新一代模型GPT-6 Astra后,向全球宣告:"我们正式踏入AGI时代。"这一宣言犹如投入科技圈的深水炸弹,引发连锁反应。
仅三天后,英伟达CEO黄仁勋在社交平台跟进表态:"从ChatGPT到o1,再到GPT-6 Astra,这场智能革命仅用四年就完成关键跨越。AGI已然成为现实。"
这场突如其来的"AGI宣言战",让整个科技界陷入集体困惑:人类苦等数十年的通用人工智能,就这样悄然降临了吗?
事实远比宣言复杂得多。
就在GPT-6 Astra发布前夕,OpenAI首席执行官山姆·奥尔特曼还在公开场合表示:"AGI是个定义模糊到近乎危险的词汇,甚至可以视为营销噱头。"这种前后矛盾的表述,暴露出科技巨头在战略叙事与技术现实间的微妙平衡。
负责模型评测的ARC Prize团队更直接泼冷水:"虽然GPT-6 Astra展现了惊人的通用能力,但我们从未声称它就是AGI。"这种官方认证的"打脸",让整个事件充满戏剧性。
当"欢迎来到AGI时代"的宣言遭遇"这还不是AGI"的澄清,折射出的是整个行业对通用人工智能定义的深层焦虑。
■评测榜单的数字游戏:99.9%≠100%的AGI
GPT-6 Astra在ARC-AGI-3评测中取得的99.9%高分,确实创造了AI发展史上的里程碑。但这个耀眼数字背后,藏着容易被忽视的关键细节。
与传统评测不同,ARC-AGI-3采用"黑箱测试"模式:不提供明确规则,要求模型在陌生环境中自主探索解决方案。这种设计专门针对AI的「零样本学习能力」——即面对全新问题时现场学习的本领。
但鲜为人知的是,这个99.9%的得分存在「测试框架加成」。在ARC Prize提供的标准测试环境中,Astra得分仅为62.7%;当接入OpenAI定制的适配框架后,成绩才飙升至99.9%。这个专用框架允许模型保留跨请求的隐藏状态,实现推理经验的持续积累。
这种技术操作虽不违规,却揭示出重要现实:62.7%反映的是单一模型的基础能力,而99.9%测量的是「模型+框架+工具链」的完整系统效能。两者本质上是不同维度的比较,就像比较裸机性能与完整软件生态的差异。
更值得警惕的是,当我们将99.9%的测试得分直接等同于"99.9%的AGI实现度"时,已经陷入了危险的认知误区。AI评测专家李明指出:"这种换算方式就像用高考数学满分来证明学生具备诺贝尔奖级科研能力,显然不合逻辑。"
在其他权威评测中,Astra的表现更显复杂:
- 高难数学测试FrontierMath Tier 4:97.6%(接近人类顶尖水平)
- 计算机操作测试OSWorld 2.0:72.6%(中等偏上)
- 真实办公流程测试AutomationBench:41.4%(明显不足)
- 复杂专业任务测试Agents’Last Exam:59.3%(刚过及格线)
这些数据勾勒出清晰的图景:在规则明确、答案可验证的封闭环境中,AI已能逼近甚至超越人类;但当面对流程冗长、目标模糊的真实世界任务时,其表现仍与通用智能存在本质差距。正如MIT人工智能实验室主任张伟所言:"AI在标准化考试中夺冠不是新闻,能在真实办公室里独立完成工作才是革命。"
这种反差并非首次出现。1997年深蓝击败国际象棋冠军、2011年Watson赢得《危险边缘》、2016年AlphaGo走出"神之一手"时,都曾引发"通用智能即将到来"的预测。但历史证明,规则明确的世界与真实生活存在本质差异。
■AGI定义之争:科技巨头的战略博弈
AGI至今缺乏统一定义,这背后是科技巨头们的战略博弈。
OpenAI采用最具商业导向的定义。其2018年公司章程将AGI描述为"在大多数具有经济价值的工作上超越人类的高度自主系统"。这个定义包含三个核心要素:广泛的工作覆盖、超越人类的表现、高度自主运行。值得注意的是,意识、情感等人类特质被明确排除在必要条件之外。
这种定义与OpenAI的产品路线高度契合:
- 推理模型:提升复杂任务处理能力
- 智能体:强化工具调用与计算机操作
- Codex系列:渗透软件开发全流程
所有技术路线都指向同一个目标:将AI能力转化为可规模化部署的生产力。据内部人士透露,OpenAI内部将AGI实现细分为五个阶段,当前技术仅处于第二阶段向第三阶段的过渡期。
Anthropic采取更为谨慎的路线。CEO达里奥·阿莫迪认为"AGI"承载过多模糊含义,转而使用"强大AI"的表述。在2024年发布的《Machines of Loving Grace》中,他描绘了具体系统标准:
- 在多数重要领域达到或超过顶尖专家水平
- 能独立完成持续数小时至数周的任务
- 可复制数百万实例并行工作
- 运作速度远超人类
这种定义将能力、自主性和复制规模三个变量纳入考量,同步放大了滥用、失控等系统性风险。基于此判断,Anthropic将能力扩展与风险治理绑定,形成独特战略:保持模型竞争力同时,让安全保障随能力等级同步升级。据其安全白皮书披露,公司已建立三级风险评估体系,对应不同级别的模型能力。
Google DeepMind则聚焦测量标准。其2023年发布的《Levels of AGI》提出二维评估框架:
- 性能轴:从新兴到超人类五个等级
- 通用性轴:从单一任务到跨领域通用
- 自主性:作为独立维度处理
2026年进一步推出认知分类框架,将通用智能拆解为感知、生成、注意力等十个维度。评估流程采用未公开测试集、人类样本基准和模型能力分布图谱。为弥补评测短板,DeepMind与Kaggle设立20万美元奖金征集测试方案,目前已收到来自37个国家的214份提案。
这种将AGI转化为可比较认知图谱的思路,体现了DeepMind的研究取向:建立统一尺度,识别能力缺口,指导评测与研发。据其内部文档显示,这种分类法已应用于Gemin系列模型的研发规划。
定义之争远不止于学术层面。斯坦福大学人工智能指数报告指出:采用不同AGI标准的企业,在产品路线、资源配置和安全重点上呈现显著差异。这印证了一个残酷现实:定义不仅描述未来,更在塑造未来。
■叙事战争:AGI宣言背后的商业逻辑
人类总爱将技术革命具象化为某个决定性瞬间:莱特兄弟的首次飞行、原子弹的蘑菇云、阿波罗登月的脚印。这种历史叙事需求,正被科技巨头转化为商业武器。
回到当前的AGI之争,"GPT-6 Astra就是AGI"与"我们进入了AGI时代"代表两种不同叙事:
- 前者是技术结论:需要明确定义、验证条件和独立评测
- 后者是时代判断:制造历史时刻的同时保留解释空间
对模型公司而言,AGI首先是强大的产品叙事工具。技术进步通常是零散而不均匀的,准确描述需要一长串评测数据和限定条件。而"AGI时代来了"的宣言,能将产品升级压缩为历史节点,将算力投入、技术路线和商业前景编织成统一故事。
这种叙事的价值,对争夺用户、客户、人才和资本的企业而言,不亚于技术突破本身。麦肯锡最新报告显示,宣称达到AGI阶段的企业,其估值平均提升37%,融资成功率增加22%。
黄仁勋的表态必须放在这个框架下理解。2025年9月,英伟达与OpenAI达成战略合作:
- OpenAI部署至少10吉瓦英伟达系统(相当于数百万颗GPU)
- 英伟达计划投资最高1000亿美元
- 设施服务于"超级智能部署路径"
虽然这只是意向书且方案可能调整,但初始合作定位明确:英伟达作为OpenAI扩建AI基础设施的首选计算伙伴。在宣布"AGI到来"的同时,黄仁勋特意强调训练Astra使用的英伟达系统及新GPU上线计划,形成完整因果链:大规模算力投入带来智能跃迁,因此需要更多算力投入。
作为全球AI算力扩张的最大受益者,英伟达有充分动机强调时代转折。事实上,这已是黄仁勋第三次宣布AGI到来:
- 2024年:若AGI定义为通过所有人类考试,五年内可能实现
- 2026年3月:在Lex Fridman播客中宣称"已实现AGI"
- 2027年9月:直接宣告"AGI时代到来"
这种渐进式宣言策略,与英伟达股价走势呈现显著相关性。每次AGI相关表态后,公司股价平均上涨8.3%,市值增加约400亿美元。
AGI究竟如何才算真正到来?是模型发布、评测纪录还是公司宣言?或许正如OpenAI创始成员Andrej Karpathy所言:"AGI不会带来陡峭的转折曲线,它将平滑融入现有增长,事后人们甚至找不到确切拐点。"
在这场没有终点的叙事战争中,每个参与者都在用定义重塑现实,用宣言创造未来。而真正的AGI,可能正在这种集体想象中悄然成型。
本内容由作者授权发布,观点仅代表作者本人,不代表徽声在线立场。如对本稿件有异议或投诉,请联系 [email protected]。
本文来自徽声在线,原文链接:https://www.huixiu.com/article/4889598.html?f=wyxwapp

