OpenAI发布最强模型GPT-6 Astra,引领AGI时代新篇章

2026-09-04 15:11:17未知 作者:徽声在线

在9月4日凌晨时分,全球人工智能领域迎来了一次重大突破——OpenAI正式推出了其新一代旗舰大模型GPT-6 Astra。在开发者社区的公告中,OpenAI自豪地宣称这是“当前全球最为智能且对齐程度最高的模型”。此次发布不仅是继GPT-5系列之后的又一次旗舰级更新,更是OpenAI首次将“Astra”作为旗舰模型的后缀,标志着其技术实力的新飞跃。OpenAI联合创始人兼总裁格雷格・布罗克曼在发布会上激动地表示:“我们正式迈入AGI(通用人工智能)时代!”

根据OpenAI官方公布的滚动计划,GPT-6 Astra即日起将首先向“可信访问”(Trusted Access)和Daybreak网络安全项目中的特定企业组织开放,随后在未来几天内逐步扩展至ChatGPT Plus、Pro、Business、Enterprise等订阅用户,并通过OpenAI API和亚马逊AWS平台向全球开发者提供服务。

相较于OpenAI上一代模型GPT-5.6Sol,Astra在数学推理、网络安全、计算机操作以及科学研究等多个领域实现了质的飞跃。据OpenAI官网发布的技术文档显示,GPT-6 Astra整合了多年来在预训练、强化学习以及对齐领域的研究成果,其核心突破主要集中在智能体执行能力和深度推理能力两大方面。


官方测试数据令人瞩目:在衡量自主科学研究能力的Terminal-BenchScience0.1基准测试中,Astra以64.6%的得分遥遥领先,不仅超越了两天前Anthropic发布的Claude Fable5.1的52.6%,而且在完成同等任务时的估计API成本降低了约31%。即便在更低成本设置下,Astra仍能保持61.1%的高分,远超GPT-5.6Sol的最佳表现22.4%,同时成本降低了约27%。在考察终端编程能力的Terminal-Bench4.0测试中,Astra同样以57.9%的得分领先于Claude Fable5.1的55.8%和GPT-5.6Sol的37.3%。


Frontier Math Tier4(v2)测试

在被誉为“最难数学基准之一”的Frontier Math Tier4(v2)测试中,Astra更是取得了惊人的97.6%高分,而Claude Fable5.1和Claude Fable5则并列在87.8%,上一代Opus5仅为73.2%。这一成绩不仅彰显了Astra在数学领域的卓越能力,也为其在解决复杂科学问题方面提供了有力支撑。

OpenAI官方透露,Astra已经在数学领域取得了一系列突破性成果,包括在素数间隔研究中发现了两个新的理论结果。特别是在ARC-AGI-3测试中,这套测试被视为衡量模型在陌生环境中的抽象推理和学习能力、接近通用智能核心指标的测试,Astra以99.9%的接近满分成绩脱颖而出,而GPT-5.6Sol仅为7.8%,实现了短短一代模型内的十余倍提升。

Astra在计算机操作与任务自动化能力方面的提升,更是让其具备了“替代人完成工作”的巨大潜力。在OSWorld2.0测试中,Astra以72.6%的得分领先于GPT-5.6Sol的65.7%;同时,完成单项任务的平均时间从约75分钟大幅缩短至40分钟,效率提升了近47%。这一改进意味着AI操作电脑开始具备实际的生产效率,为用户带来了前所未有的便捷体验。


OSWorld2.0测试

在考察业务流程自动化的Automation Bench测试中,Astra同样表现出色,以41.4%的得分较GPT-5.6Sol的18.1%翻倍有余,也高于Claude Fable5.1的31.4%。官方演示视频显示,Astra能够独立完成填写报税表、更新CRM系统、整理日程安排、制作财务模型、分析科研数据、搭建网站、设计PCB电路板、创建3D游戏场景等复杂工作。用户只需给出最终目标,模型便会自行规划步骤、切换工具、修正错误,整个过程无需人工分步指令。


Automation Bench测试

在定价方面,GPT-6 Astra的API调用价格定为每百万输入Token为10美元、每百万输出Token为50美元,是GPT-5.6Sol当前价格的2.5倍,但与Claude Fable5.1的定价基本持平。此外,模型还提供了缓存读取享受90%折扣、缓存写入加收25%溢价的优惠政策。用户可以根据任务难度灵活调节五级推理强度,从low到max,权衡成本与深度。在上下文窗口方面,Astra总上下文长度为105万Token,最大输出长度为12.8万Token,知识截止时间为2026年4月30日,略晚于Claude Fable5.1的2026年6月。同时,Astra还支持流式输出、结构化输出、函数调用、文件搜索、网页浏览和提示缓存等多种功能。

OpenAI强调,Astra是其“有史以来对齐程度最高的模型”,在理解用户意图和行为边界方面取得了实质性改进。为此,OpenAI专门基于此前Hugging Face模型越权事件设计了一套评估体系,测试模型在面对困难或不可能任务时是否会超出授权范围。结果显示,未加生产安全护栏的GPT-5.6Sol有48%的概率会越权操作,而GPT-6 Astra这一比例降至0%。这一改进对于企业级应用至关重要,当模型被授权访问内部系统和数据时,能否严格守住权限边界直接关系到企业的信息安全。OpenAI表示,Astra在网络安全领域的能力提升伴随着严格的护栏设计,模型可以用于发现软件漏洞,但绝不会用于开发漏洞利用程序。

值得一提的是,在短短一周内,除了OpenAI发布GPT-6 Astra外,Anthropic也推出了Claude Fable5.1、谷歌发布了Gemini 3.8 Flash、Muse则发布了Spark 1.3。头部厂商密集发布新品,迭代速度持续加快。从各维度对比来看,Astra并非在所有方面都全面碾压对手。其优势主要集中在数学、网络安全、计算机操作和自动化等特定领域,而在综合知识、创意写作等维度则并未与对手拉开明显差距。可以看出,当前人工智能领域的竞争正在向精细化、场景化方向深化,没有任何一家厂商能够在所有维度保持绝对领先。

点击展开全文
你关注的
从“几年一遇”到“一年几遇”,AI时代网络攻防失衡加剧 奇安信齐向东:主战场转向制造业与服务业从“几年一遇”到“一年几遇”,AI时代网络攻防失衡加剧 奇安信齐向东:主战场转向制造业与服务业 活力中国调研行|中国商业航天迈入“快时代”:卫星流水线生产成新趋势活力中国调研行|中国商业航天迈入“快时代”:卫星流水线生产成新趋势 马斯克明确拒绝乌克兰利用“星链”打击俄境内目标请求马斯克明确拒绝乌克兰利用“星链”打击俄境内目标请求
相关文章
OpenAI发布最强模型GPT-6 Astra,引领AGI时代新篇章OpenAI发布最强模型GPT-6 Astra,引领AGI时代新篇章 智谱GLM - 5.3 - Flash夜间免费畅用活动限时开启智谱GLM - 5.3 - Flash夜间免费畅用活动限时开启 豆包手机携手长鑫科技内存,开启性能新征程豆包手机携手长鑫科技内存,开启性能新征程 努比亚NaviX Ultra首发长鑫LPDDR5X芯片 国产10667Mbps内存实现量产突破努比亚NaviX Ultra首发长鑫LPDDR5X芯片 国产10667Mbps内存实现量产突破 全球AI深夜遭遇历史级宕机!ChatGPT等集体瘫痪,微软或成关键因素?全球AI深夜遭遇历史级宕机!ChatGPT等集体瘫痪,微软或成关键因素? OpenAI发布GPT-6 Astra:定义AGI新标准,数学推理与自动化能力实现代际飞跃OpenAI发布GPT-6 Astra:定义AGI新标准,数学推理与自动化能力实现代际飞跃