OpenAI旗舰新作GPT-6 Astra震撼发布,引领AGI时代新篇章

2026-09-04 12:41:03未知 作者:徽声在线

在9月4日凌晨时分,全球人工智能领域迎来了一次重大突破——OpenAI正式揭晓了其新一代旗舰大模型GPT-6 Astra。在面向开发者社区的公告中,OpenAI自豪地宣称,这款模型不仅是当前全球最为智能的,更是在对齐用户意图方面达到了前所未有的高度。作为继GPT-5系列之后的又一力作,GPT-6 Astra的发布标志着OpenAI在模型命名策略上的新尝试,首次将“Astra”作为旗舰模型的后缀,彰显了其独特地位。OpenAI的联合创始人兼总裁格雷格・布罗克曼在发布会上更是激动地表示:“我们正步入AGI(通用人工智能)的新纪元。”

根据OpenAI公布的详细滚动计划,GPT-6 Astra将首先向“可信访问”(Trusted Access)计划及Daybreak网络安全项目中的精选企业组织开放使用。随后,在短短几天内,这一创新模型将逐步扩展至ChatGPT Plus、Pro、Business、Enterprise等订阅用户群体,并通过OpenAI API以及亚马逊AWS等云服务平台向全球开发者提供服务,进一步推动AI技术的普及与应用。

相较于OpenAI的上一代模型GPT-5.6Sol,GPT-6 Astra在数学推理、网络安全、计算机操作以及科学研究等多个关键领域实现了质的飞跃。据OpenAI官网发布的技术文档透露,GPT-6 Astra融合了多年来在预训练、强化学习以及对齐技术方面的研究成果,其核心突破聚焦于智能体执行能力与深度推理能力的双重提升,为AI技术的发展开辟了新的道路。


官方公布的测试数据令人瞩目:在衡量模型自主科学研究能力的Terminal-BenchScience0.1基准测试中,GPT-6 Astra以64.6%的得分傲视群雄,不仅远超两天前Anthropic发布的Claude Fable5.1的52.6%,更在同等任务下实现了约31%的API成本降低。即便在更低成本设置下,Astra仍能保持61.1%的高分,远超GPT-5.6Sol的最佳表现22.4%,同时成本降低约27%。而在考察终端编程能力的Terminal-Bench4.0测试中,Astra同样以57.9%的得分领先于Claude Fable5.1的55.8%和GPT-5.6Sol的37.3%,展现了其强大的编程实力。


Frontier Math Tier4(v2)测试

在被誉为“数学基准测试中的珠穆朗玛峰”的Frontier Math Tier4(v2)测试中,GPT-6 Astra更是以惊人的97.6%高分脱颖而出,将Claude Fable5.1和Claude Fable5的87.8%以及上一代Opus5的73.2%远远甩在身后,彰显了其在数学领域的卓越才华。

OpenAI官方进一步透露,GPT-6 Astra已经在数学领域取得了突破性进展,成功解决了长期存在的开放性问题,包括在素数间隔研究中取得了两个全新的理论成果。尤为值得一提的是,在衡量模型在陌生环境中抽象推理和学习能力的ARC-AGI-3测试中,Astra以接近满分的99.9%成绩震撼全场,而GPT-5.6Sol仅为7.8%,短短一代之间实现了十余倍的性能提升,预示着AI技术正朝着通用智能的方向迈进。

除了数学领域的卓越表现,GPT-6 Astra在计算机操作与任务自动化方面也取得了显著进步,使其真正具备了“替代人类完成工作”的潜力。在OSWorld2.0测试中,Astra以72.6%的得分领先于GPT-5.6Sol的65.7%,同时完成单项任务的平均时间从约75分钟大幅缩短至40分钟,效率提升近47%。这一改进意味着AI操作电脑开始具备实际的生产效率,为用户带来了前所未有的便捷体验。


OSWorld2.0测试

在考察业务流程自动化的Automation Bench测试中,GPT-6 Astra同样表现出色,以41.4%的得分较GPT-5.6Sol的18.1%翻倍有余,也高于Claude Fable5.1的31.4%。官方演示视频显示,Astra能够独立完成填写报税表、更新CRM系统、整理日程安排、制作财务模型、分析科研数据、搭建网站、设计PCB电路板、创建3D游戏场景等复杂工作,用户只需给出最终目标,模型便会自行规划步骤、切换工具、修正错误,整个过程无需人工分步指令,极大地提高了工作效率。


Automation Bench测试

在定价策略上,GPT-6 Astra的API调用价格设定为每百万输入Token 10美元、每百万输出Token 50美元,虽为GPT-5.6Sol当前价格的2.5倍,但与Claude Fable5.1的定价基本持平。同时,模型支持缓存读取享受90%折扣、缓存写入加收25%溢价的灵活定价机制。此外,GPT-6 Astra还提供了五级推理强度调节功能,从low到max,用户可根据任务难度灵活权衡成本与深度。在上下文窗口方面,Astra总上下文长度为105万Token,最大输出长度为12.8万Token,知识截止时间为2026年4月30日,略晚于Claude Fable5.1的2026年6月。支持的功能包括流式输出、结构化输出、函数调用、文件搜索、网页浏览和提示缓存等,满足了用户多样化的需求。

OpenAI强调,GPT-6 Astra是其“有史以来对齐程度最高的模型”,在理解用户意图和行为边界方面取得了实质性改进。为此,OpenAI专门基于此前Hugging Face模型越权事件设计了一套评估体系,测试模型在面对困难或不可能任务时是否会超出授权范围。结果显示,未加生产安全护栏的GPT-5.6Sol有48%的概率会越权操作,而GPT-6 Astra这一比例降至0%,为企业级应用提供了坚实的安全保障。当模型被授权访问内部系统和数据时,能否严格守住权限边界直接关系到企业的信息安全。OpenAI表示,Astra在网络安全领域的能力提升伴随着严格的护栏设计,模型可以用于发现软件漏洞,但坚决不能用于开发漏洞利用程序,确保了技术的合规性与安全性。

值得注意的是,在短短一周内,除了OpenAI发布GPT-6 Astra外,Anthropic也推出了Claude Fable5.1、谷歌发布了Gemini 3.8 Flash、Muse则发布了Spark 1.3,头部厂商密集发布新品,迭代速度持续加快。从各维度对比来看,GPT-6 Astra虽非全面碾压对手,但其优势集中在数学、网络安全、计算机操作和自动化等特定领域,而在综合知识、创意写作等维度并未拉开明显差距。可以看出,没有任何一家厂商能够在所有维度保持绝对领先,各家在不同赛道各有千秋,竞争正在向精细化、场景化方向深化,为用户带来了更多选择与可能。

点击展开全文
你关注的
从“几年一遇”到“一年几遇”,AI时代网络攻防失衡加剧 奇安信齐向东:主战场转向制造业与服务业从“几年一遇”到“一年几遇”,AI时代网络攻防失衡加剧 奇安信齐向东:主战场转向制造业与服务业 活力中国调研行|中国商业航天迈入“快时代”:卫星流水线生产成新趋势活力中国调研行|中国商业航天迈入“快时代”:卫星流水线生产成新趋势 马斯克明确拒绝乌克兰利用“星链”打击俄境内目标请求马斯克明确拒绝乌克兰利用“星链”打击俄境内目标请求
相关文章
OpenAI旗舰新作GPT-6 Astra震撼发布,引领AGI时代新篇章OpenAI旗舰新作GPT-6 Astra震撼发布,引领AGI时代新篇章 公私募调研热情爆棚,半导体与医疗成核心关注领域公私募调研热情爆棚,半导体与医疗成核心关注领域 智谱GLM - 5.3 - Flash夜间免费畅用活动限时开启智谱GLM - 5.3 - Flash夜间免费畅用活动限时开启 OpenAI发布GPT-6 Astra:数学推理与自动化能力跃升,AGI时代正式开启OpenAI发布GPT-6 Astra:数学推理与自动化能力跃升,AGI时代正式开启 公私募调研热情高涨,半导体与医疗行业成焦点公私募调研热情高涨,半导体与医疗行业成焦点 小米汽车2027年进军欧洲市场,携手德国经销商共谋发展小米汽车2027年进军欧洲市场,携手德国经销商共谋发展