在人工智能领域,新一代模型GPT-6 Astra的发布引发了广泛关注。这款由OpenAI推出的模型,在数学推理、网络安全、计算机操作和科学研究等多个领域展现出显著进步,标志着人工智能技术又向前迈进了一大步。据OpenAI官方介绍,Astra整合了预训练、强化学习及对齐领域的多年研究成果,尤其在智能体执行能力和深度推理方面实现了重大突破。
在衡量自主科学研究能力的Terminal-BenchScience0.1基准测试中,Astra以64.6%的得分脱颖而出,不仅超越了Anthropic两天前发布的Claude Fable5.1的52.6%,还大幅领先上一代模型GPT-5.6Sol的最佳表现22.4%。更令人瞩目的是,Astra在完成同等任务时的API成本降低了约31%,即便在更低成本设置下,仍能保持61.1%的高分,成本优势显著。在考察终端编程能力的Terminal-Bench4.0测试中,Astra也以57.9%的得分领先于Claude Fable5.1的55.8%和GPT-5.6Sol的37.3%。
数学推理能力的提升尤为突出。在被誉为“最难数学基准之一”的Frontier Math Tier4(v2)测试中,Astra取得了97.6%的惊人成绩,远超Claude Fable5.1和Claude Fable5的87.8%,以及上一代Opus5的73.2%。OpenAI透露,Astra已在数学领域解决了长期存在的开放性问题,包括在素数间隔研究中取得两个新的理论结果。而在衡量模型在陌生环境中抽象推理和学习能力的ARC-AGI-3测试中,Astra更是以99.9%的接近满分成绩,展现了其接近通用智能的潜力,相比GPT-5.6Sol的7.8%,实现了十余倍的提升。
计算机操作与任务自动化能力的增强,让Astra具备了“替代人完成工作”的实用价值。在OSWorld2.0测试中,Astra得分72.6%,高于GPT-5.6Sol的65.7%,且完成单项任务的平均时间从约75分钟缩短至40分钟,效率提升近47%。这一改进意味着AI操作电脑开始具备实际的生产效率,用户不再需要因速度慢而选择自己动手。在考察业务流程自动化的Automation Bench测试中,Astra同样表现出色,得分41.4%,较GPT-5.6Sol的18.1%翻倍有余,也高于Claude Fable5.1的31.4%。官方演示视频显示,Astra能够独立完成填写报税表、更新CRM系统、整理日程安排、制作财务模型、分析科研数据、搭建网站、设计PCB电路板、创建3D游戏场景等复杂工作,用户只需给出最终目标,模型便会自行规划步骤、切换工具、修正错误。
在定价方面,GPT-6 Astra的API调用价格每百万输入Token为10美元、每百万输出Token为50美元,是GPT-5.6Sol当前价格的2.5倍,与Claude Fable5.1定价基本持平。模型支持五级推理强度调节,用户可根据任务难度灵活权衡成本与深度。上下文窗口方面,Astra总上下文长度为105万Token,最大输出长度为12.8万Token,知识截止时间为2026年4月30日,略晚于Claude Fable5.1的2026年6月。Astra还支持流式输出、结构化输出、函数调用、文件搜索、网页浏览和提示缓存等功能。
OpenAI强调,Astra是公司“有史以来对齐程度最高的模型”,在理解用户意图和行为边界方面有实质性改进。为此,OpenAI专门设计了一套评估体系,测试模型在面对困难或不可能任务时是否会超出授权范围。结果显示,未加生产安全护栏的GPT-5.6Sol有48%的概率会越权操作,而GPT-6 Astra这一比例降至0%。这一改进对于企业级应用至关重要,当模型被授权访问内部系统和数据时,能否严格守住权限边界直接关系到企业的信息安全。OpenAI表示,Astra在网络安全领域的能力提升伴随着严格的护栏设计,模型可以用于发现软件漏洞,但不能用于开发漏洞利用程序。
近期,人工智能领域竞争愈发激烈。除了OpenAI发布Astra外,Anthropic推出了Claude Fable5.1,谷歌发布了Gemini 3.8 Flash,Muse也发布了Spark 1.3。从各维度对比来看,Astra并非全面碾压对手,其优势集中在数学、网络安全、计算机操作和自动化等特定领域,而在综合知识、创意写作等维度并未拉开差距。这表明,没有任何一家厂商能够在所有维度保持绝对领先,各家在不同赛道各有千秋,竞争正在向精细化、场景化方向深化。
