AGI时代真的来临了吗?深度解析技术宣言背后的真相
2026-09-11 01:48:04未知 作者:徽声在线
本文源自徽声在线旗下公众号:深流研究所,作者:吴绛枫
9月3日,OpenAI总裁格雷格·布罗克曼在发布新一代模型GPT-6 Astra后,抛出震撼言论:"AGI时代已然开启。"
仅隔三日,英伟达CEO黄仁勋在社交平台进一步宣称:"从ChatGPT到o1,再到GPT-6 Astra,短短四年间,AGI已从概念变为现实。"
这场突如其来的AGI宣言,是否意味着人类智能的终极目标已然达成?
现实远比宣言复杂得多。
就在GPT-6 Astra发布前夕,OpenAI首席执行官山姆·奥尔特曼仍公开表示:"AGI是个定义模糊的术语,甚至可以称之为营销话术。"
负责该模型关键评测的ARC Prize团队也特别强调:"虽然GPT-6 Astra展现了通用能力的重大突破,但我们从未宣称它就是AGI。"
这种矛盾的表述背后,折射出行业对AGI定义的深刻分歧。
当整个科技界都在热议AGI时,却鲜有人能清晰界定:AI究竟要达到什么标准,才算真正跨越了AGI的门槛?
■高评分榜单能否等同于AGI?
GPT-6 Astra最引人注目的成就,是在ARC-AGI-3评测中取得99.9%的惊人分数。
这项评测与传统测试截然不同:它不提供明确规则,而是将模型置于陌生环境,要求其自主判断目标、理解反馈并寻找解决方案。
这种设计正是为了检验AI最受质疑的能力——面对全新问题时能否实现现场学习。
99.9%的得分看似完美,但这个数字背后隐藏着关键前提。
在ARC Prize提供的标准测试框架中,GPT-6 Astra实际得分为62.7%;只有接入OpenAI专门开发的适配框架后,分数才飙升至99.9%。
后者允许模型保留跨请求的隐藏推理状态,并利用上下文压缩技术延续先前的探索经验。
虽然不能简单将这种优化视为"作弊"——毕竟现实中的AI系统本就需要记忆、工具和运行框架的支持——但62.7%与99.9%的差异,本质上反映了单个模型能力与完整系统性能的区别。
将99.9%的测试得分直接等同于"99.9%的AGI",显然是概念混淆。
更全面地看,GPT-6 Astra在其他评测中的表现也暴露出明显短板:
在高难度数学测试FrontierMath Tier 4中取得97.6%的高分,在计算机操作测试OSWorld 2.0中获得72.6%;但在模拟真实办公流程的AutomationBench测试中,成绩骤降至41.4%,在复杂专业任务测试Agents’Last Exam中也仅有59.3%。
这些数据揭示了一个关键事实:当任务规则清晰、答案可验证时,Astra已能接近甚至超越人类水平;但一旦进入流程复杂、目标模糊的现实场景,其表现仍差强人意。
AI在封闭考试中的优异表现并非新鲜事。
深蓝击败国际象棋冠军、Watson赢得《危险边缘》、AlphaGo走出"神之一手"时,都曾引发类似"通用智能即将到来"的猜测。
但规则明确、反馈即时、有自动裁判的测试环境,与充满不确定性的现实世界有着本质区别。
■不同机构眼中的AGI:定义分歧背后的战略考量
AGI至今缺乏统一定义,不同机构有着截然不同的解读。
OpenAI采用最具经济导向的定义。其2018年公司章程将AGI描述为"在大多数具有经济价值的工作上超越人类的高度自主系统"。
这一定义包含三个核心要素:覆盖广泛的工作领域、表现优于人类、具备高度自主性。
值得注意的是,意识、情感和人类式思维并未被纳入必要条件。
这种标准与OpenAI近年来的产品路线高度契合:
推理模型提升复杂任务处理能力,智能体强化工具调用和计算机操作,Codex等产品进一步渗透软件开发流程。
所有能力发展都指向同一个目标:让AI承担更完整的工作,将模型能力转化为可规模化部署的生产力。
Anthropic对AGI的态度更为谨慎。CEO达里奥·阿莫迪认为这个术语承载了过多模糊含义,因此更倾向于使用"强大的AI"这一表述。
在2024年10月发表的《Machines of Loving Grace》中,阿莫迪描绘了一类具体系统:
它能在多数重要领域达到或超越顶尖专家水平,能够独立完成持续数小时、数天乃至数周的任务,还可以复制成数百万个实例,以远高于人类的速度同时工作。
这幅图景包含能力、自主性和复制规模三个变量,三者共同决定AI的现实影响,也会同步放大滥用、失控和系统性风险。
基于这种判断,Anthropic将能力扩展与风险治理紧密结合,其战略重点可概括为:保持前沿模型竞争力,同时让安全保障随能力等级同步升级。
Google DeepMind则专注于AGI的测量标准。
其2023年发布的《Levels of AGI》文章,以"性能"和"通用性"为两条主轴,将通用智能划分为"新兴""胜任""专家""大师"和"超人类"五个等级,并将自主性作为独立维度处理。这套框架要求研究者同时考察能力强度和覆盖范围。
2026年3月,DeepMind进一步推出认知分类框架,将通用智能拆分为感知、生成、注意力、学习、记忆、推理、元认知、执行功能、问题解决和社会认知十个维度。
评估流程采用未公开测试集、具有代表性的人类样本,以及模型相对于人类能力分布的位置作为参考。
DeepMind还与Kaggle设立20万美元奖金,为其中五个评测较薄弱的维度征集测试方案。
这种思路将AGI从单一标签转化为可比较的认知能力图谱,也体现了DeepMind的研究取向:建立统一尺度,识别能力缺口,再据此组织评测和研发。
AGI的定义之争远不止于学术范畴。
采用什么标准,就会将什么能力视为关键进展;将什么能力视为关键进展,就会决定一家公司的产品路线、资源配置和安全重点。
定义看似在描述未来,实则在塑造未来。
■AGI之争:一场关乎技术叙事权的博弈
人类总是倾向于将技术革命想象为一个明确的瞬间。
莱特兄弟的飞机离地、第一颗原子弹爆炸、阿波罗11号登月,这些历史时刻都需要精确的日期和标志性画面。
回到当前的AGI之争,"GPT-6 Astra就是AGI"与"我们进入了AGI时代"这两种表述,本质上属于不同性质的判断。
前者是可被质疑和检验的技术结论:若声称某系统是AGI,就必须说明采用的定义、满足的条件,以及在哪些独立测试中得到验证。
后者则更像一种时代宣言。正如布罗克曼所说"欢迎来到AGI时代",这种表述既创造了历史时刻,又保留了足够的解释空间。
对模型公司和AI产业链而言,"AGI"首先是一种强大的产品叙事工具。
模型能力的进步通常是零散而不均匀的,准确描述这些变化需要一长串评测数据、条件说明和限定语。
而"AGI时代来了"这样的表述,却能将复杂的技术演进压缩成一句简洁有力的宣言。
它把一次模型发布从产品升级提升为历史节点,将算力投入、技术路线和商业前景编织进同一个故事框架。
对于争夺用户、企业客户、人才和资本的公司来说,这种叙事的价值可能不亚于一次真正的技术突破。
黄仁勋的表态也需要放在这个叙事框架中理解。
2025年9月,英伟达与OpenAI宣布达成战略合作意向。根据计划,OpenAI将部署至少10吉瓦的英伟达系统,规模相当于数百万颗GPU;英伟达则准备随着基础设施落地,向OpenAI投资最高1000亿美元。
虽然这只是一份意向书而非最终协议,后续也传出方案可能调整的消息,但在最初设想中,英伟达被定位为OpenAI扩建AI基础设施时的首选计算与网络合作伙伴。双方公告明确表示,这些设施将服务于OpenAI"迈向部署超级智能"的路径。
近期黄仁勋在宣布"AGI已经到来"时,特别强调了训练Astra所使用的英伟达计算系统,以及即将上线的下一代GPU。
这段话隐含着清晰的因果链:大规模算力投入带来了智能跃迁,因此更大规模的算力投入仍然必要。
作为全球AI算力扩张的主要受益者,英伟达有充分理由强调这是一场时代转折。
事实上,这并非黄仁勋首次宣布AGI到来。
2024年,他曾表示如果将AGI定义为能通过几乎所有人类设计的考试,这一目标可能在五年内实现。
到2026年3月,他又在Lex Fridman的播客中宣称:"我认为我们已经实现了AGI。"
由此可见,AGI不仅是一个等待技术跨越的终点,更是一种能够影响资本流向、市场预期、政策制定和产业布局的叙事资源。
那么,AGI究竟怎样才算真正到来?是一次模型发布、一项评测纪录,还是一家公司的宣告?
或许,这本身就是一个潜移默化的过程。
正如OpenAI创始成员Andrej Karpathy所言:AGI不会带来一条陡然拐起的曲线,它会平滑地融入已有的增长轨迹,事后人们甚至找不到明确的拐点。
本内容由作者授权发布,观点仅代表作者本人,不代表徽声在线立场。如对本稿件有异议或投诉,请联系 [email protected]。
本文来自徽声在线,原文链接:https://www.huixiu.com/article/4889598.html?f=wyxwapp

