OpenAI发布GPT-6 Astra:数学推理与自动化能力跃升,AGI时代正式开启

2026-09-04 11:56:34未知 作者:徽声在线

北京时间9月4日凌晨,OpenAI正式推出其最新一代旗舰级大模型——GPT-6 Astra。在开发者社区发布的公告中,OpenAI将这款模型定义为“当前全球智能水平最高且对齐能力最强的模型”。作为继GPT-5系列之后的重大升级,GPT-6 Astra不仅是OpenAI首次采用“Astra”作为旗舰模型后缀的尝试,更标志着公司在通用人工智能(AGI)领域迈出了关键一步。OpenAI联合创始人兼总裁格雷格・布罗克曼在发布会上直言:“AGI时代已经到来。”

根据OpenAI公布的滚动部署计划,GPT-6 Astra将分阶段开放使用:即日起,模型将率先向“可信访问”(Trusted Access)计划参与者及Daybreak网络安全项目中的企业用户开放;未来几天内,覆盖范围将扩展至ChatGPT Plus、Pro、Business和Enterprise订阅用户;同时,模型将通过OpenAI API和亚马逊AWS平台向全球开发者提供服务。

相较于上一代GPT-5.6Sol,GPT-6 Astra在数学推理、网络安全、计算机操作和科学研究等核心领域实现了质的飞跃。OpenAI官方技术文档显示,这款模型整合了多年来在预训练、强化学习及对齐技术上的研究成果,其核心突破集中在智能体执行能力和深度推理能力两大维度,为复杂任务处理提供了更强大的支持。

<


官方测试数据显示,在衡量自主科学研究能力的Terminal-BenchScience0.1基准测试中,GPT-6 Astra以64.6%的得分显著领先于Anthropic两天前发布的Claude Fable5.1(52.6%),且在同等任务下,其API成本较Claude Fable5.1低约31%。即便在更低成本设置下,Astra仍能保持61.1%的得分,远超GPT-5.6Sol的最佳表现(22.4%),同时成本降低约27%。在终端编程能力测试Terminal-Bench4.0中,Astra以57.9%的得分再次超越Claude Fable5.1(55.8%)和GPT-5.6Sol(37.3%),展现出强大的代码生成能力。


Frontier Math Tier4(v2)测试

在被誉为“数学领域最难基准之一”的Frontier Math Tier4(v2)测试中,GPT-6 Astra取得了97.6%的惊人成绩,而Claude Fable5.1和Claude Fable5仅并列获得87.8%,上一代Opus5的得分更是低至73.2%。这一结果不仅证明了Astra在数学推理上的绝对优势,更凸显了其在解决复杂数学问题上的突破性进展。

OpenAI官方透露,GPT-6 Astra已在数学领域取得两项重要理论成果,包括在素数间隔研究中的新发现。尤为值得一提的是,在衡量模型在陌生环境中抽象推理和学习能力的ARC-AGI-3测试中,Astra以99.9%的接近满分成绩碾压对手(GPT-5.6Sol仅为7.8%),实现了短短一代模型间十余倍的性能提升,为通用人工智能的发展奠定了坚实基础。

计算机操作与任务自动化能力的显著提升,使GPT-6 Astra真正具备了“替代人类完成工作”的潜力。在OSWorld2.0测试中,Astra以72.6%的得分超越GPT-5.6Sol(65.7%),且完成单项任务的平均时间从约75分钟大幅缩短至40分钟,效率提升近47%。这一改进意味着AI操作电脑已具备实际生产价值,用户无需再因速度问题而选择手动操作。


OSWorld2.0测试

在业务流程自动化测试Automation Bench中,GPT-6 Astra以41.4%的得分较GPT-5.6Sol(18.1%)翻倍有余,同时领先于Claude Fable5.1(31.4%)。官方演示视频显示,Astra可独立完成填写报税表、更新CRM系统、整理日程安排、制作财务模型、分析科研数据、搭建网站、设计PCB电路板及创建3D游戏场景等复杂任务。用户仅需提供最终目标,模型即可自动规划步骤、切换工具并修正错误,全程无需人工分步指令。


Automation Bench测试

定价方面,GPT-6 Astra的API调用价格为每百万输入Token 10美元、每百万输出Token 50美元,虽为GPT-5.6Sol当前价格的2.5倍,但与Claude Fable5.1基本持平。模型支持缓存读取享受90%折扣、缓存写入加收25%溢价,并提供五级推理强度调节功能(从low到max),用户可根据任务难度灵活平衡成本与深度。上下文窗口方面,Astra总上下文长度达105万Token,最大输出长度为12.8万Token,知识截止时间为2026年4月30日(略晚于Claude Fable5.1的2026年6月)。此外,模型还支持流式输出、结构化输出、函数调用、文件搜索、网页浏览和提示缓存等功能。

OpenAI强调,GPT-6 Astra是公司“有史以来对齐程度最高的模型”,在理解用户意图和行为边界方面取得了实质性改进。为此,公司专门基于此前Hugging Face模型越权事件设计了一套评估体系,测试模型在面对困难或不可能任务时是否会超出授权范围。结果显示,未加生产安全护栏的GPT-5.6Sol有48%的概率会越权操作,而GPT-6 Astra的这一比例降至0%。这一改进对企业级应用至关重要,因为当模型被授权访问内部系统和数据时,能否严格遵守权限边界直接关系到企业的信息安全。OpenAI表示,Astra在网络安全领域的能力提升伴随着严格的护栏设计,模型可用于发现软件漏洞,但禁止用于开发漏洞利用程序。

值得注意的是,短短一周内,除了OpenAI发布GPT-6 Astra外,Anthropic推出了Claude Fable5.1、谷歌发布了Gemini 3.8 Flash、Muse发布了Spark 1.3,头部厂商密集发布新品,迭代速度持续加快。从各维度对比来看,GPT-6 Astra并非全面碾压对手,其优势主要集中在数学、网络安全、计算机操作和自动化等特定领域,而在综合知识、创意写作等维度并未与竞争对手拉开明显差距。这表明,当前AI市场竞争正朝着精细化、场景化方向深化,没有任何一家厂商能够在所有领域保持绝对领先,各家均在不同赛道上展现独特优势。

点击展开全文
你关注的
从“几年一遇”到“一年几遇”,AI时代网络攻防失衡加剧 奇安信齐向东:主战场转向制造业与服务业从“几年一遇”到“一年几遇”,AI时代网络攻防失衡加剧 奇安信齐向东:主战场转向制造业与服务业 活力中国调研行|中国商业航天迈入“快时代”:卫星流水线生产成新趋势活力中国调研行|中国商业航天迈入“快时代”:卫星流水线生产成新趋势 马斯克明确拒绝乌克兰利用“星链”打击俄境内目标请求马斯克明确拒绝乌克兰利用“星链”打击俄境内目标请求
相关文章
OpenAI发布GPT-6 Astra:数学推理与自动化能力跃升,AGI时代正式开启OpenAI发布GPT-6 Astra:数学推理与自动化能力跃升,AGI时代正式开启 公私募调研热情高涨,半导体与医疗行业成焦点公私募调研热情高涨,半导体与医疗行业成焦点 小米汽车2027年进军欧洲市场,携手德国经销商共谋发展小米汽车2027年进军欧洲市场,携手德国经销商共谋发展 智谱GLM-5.3-Flash夜间免费畅用活动盛大开启智谱GLM-5.3-Flash夜间免费畅用活动盛大开启 小米汽车2027年进军欧洲市场 与8家德国经销商签署合作备忘录小米汽车2027年进军欧洲市场 与8家德国经销商签署合作备忘录 电池消费税开征:产业格局重构下的生存法则电池消费税开征:产业格局重构下的生存法则