作者 | 冬梅
今天凌晨,OpenAI 正式发布 GPT-6 Astra,公司称该模型是“多年研究和大量投资”的成果。
“Astra”在拉丁语中意为“群星”。从命名风格看,它与此前 GPT-5.6 系列中的 Sol、Terra、Luna 相呼应,延续了太阳、地球、月亮与星辰的天体意象。
不过,OpenAI 目前公开的发布材料并未明确解释为何选择这个名字,外界更多的是将其解读为“向群星进发”或“迈向 AGI”。
OpenAI CEO Sam Altman 在 x 上发文表示,希望它能开启新一代的创业、科学发现和建设。他写道:
“我们相信它是世界上用于计算机使用、专业工作、科学研究、编程、网络安全等领域的最佳模型。我们花了一些额外的时间来确保能够达到此能力级别所需的安全性和一致性标准,但我们相信您会觉得等待是值得的。它在 FrontierMath Tier 4 测试中获得 98% 的分数,在 ARC-AGI 3 测试中获得 99.9% 的分数,在 ExploitBench 测试中获得 100% 的分数。”
自动播放围绕这次发布,公司给出了一个远超常规模型升级的叙事:据 Axios 报道,OpenAI 总裁 Greg Brockman 认为,Astra 可能意味着 AGI 时代的开始。不过,这仍然是公司管理层的判断,不能直接等同于行业已经确认实现了通用人工智能。
官方 API 文档列出的上下文窗口为 105 万 Token,最大输出为 12.8 万 Token。它支持文本输入输出和图像输入,音频、视频则没有列为该模型的原生支持模态。
因此,发布、逐步开放和用户已经可以使用,是三个不同的状态。
OpenAI 本周早些时候披露,Astra 是其首个达到“关键”内部网络安全阈值的模型,并表示计划限制对这些高级功能的访问权限。
上个月, OpenAI 的两个模型逃出控制范围,访问了开放网络,并入侵了 Hugging Face 的系统,此后 OpenAI 一直面临着加强其安全性和防护措施的压力 。
事件发生后,该公司暂时中止了部分研究和训练工作,包括 Astra 模型的训练。
OpenAI 总裁 Greg Brockman 周四在记者会上表示:“只有当安全成为人工智能的核心组成部分时,人工智能才能造福人类,因此,我们比以往任何时候都投入了更多的计算能力和精力来关注安全、保障和一致性。”
在 Hugging Face 泄露事件发生后,OpenAI 为 Astra 增加了额外的安全措施,并于周二表示,它相信这些安全措施“足以将释放造成严重伤害的风险降至最低”。
OpenAI 表示,Astra 将在“未来几天”内面向 OpenAI 的 ChatGPT Plus、Pro、Business 和 Enterprise 计划的用户推出,同时也将通过 OpenAI API 和 AWS 推出。
性能如何?
那么,这款新模型各项性能指标如何?
OpenAI 表示,除了先进的网络安全能力外,Astra 在计算机使用、软件工程、专业工作和科学研究等功能方面也处于领先水平。
OpenAI 研究人员 Aidan Clark 表示,Astra 首次在德克萨斯州 Stargate 基础设施上使用超过 10 万块 GPU 进行预训练,同时 Astra 是 OpenAI 首个在训练过程中大量借鉴早期模型进行监督的模型发布版本。
相比 GPT-5.6 Sol,Astra 在科学研究、CAD、桌面软件操作和网络安全等专项任务上的能力有较大提升。
OpenAI 表示,除非另有说明,其评估中使用的模型均以最大性能运行。这可以提高基准测试结果,但也会增加延迟和 Token 使用量。
编程能力大幅提升
OpenAI 将 GPT‑6 Astra 称为迄今为止最强的软件工程模型。参与早期测试的 Jane Street 和 Lovable 也分享了各自的使用反馈。
Jane Street 负责 AI 助手相关工作的 John Crepezzi 表示:
“GPT‑6 Astra 在我们的内部编程基准测试中达到了当前领先水平,与 GPT‑5.6 Sol 相比,在交易直觉评估中也表现出明显进步。用于 Agent 编程时,GPT‑6 Astra 的沟通方式更便于开发者理解,生成的代码也只需更少轮次的迭代,就能达到生产环境要求的质量。”
Lovable 联合创始人兼首席技术官 Fabian Hedin 表示:
“我们在一项早期版本的评估中,分别测试了 Astra 在低、中、高三档推理强度下的表现,结果明显领先于 GPT‑5.6 Sol。提高推理强度后,模型会在从零构建项目时进行更多轮迭代,通过浏览器测试做更多验证,也更倾向于执行代码,而不是使用 apply-patch 工具直接应用代码补丁。理解模型如何分配这些推理投入,能帮助我们为数百万开发者提供一条从想法到可运行应用更快、更可靠的路径。”
Astra 的 DeepSWE v1.1 结果明显优于 OpenAI 的模型。在包含 113 项任务的智能编码测试中,它的得分为 74.1%,而 Sol 的得分为 70.8%。
Astra 的更大收益并非来自编程领域。
最引人注目的是其在 ARC-AGI-3 测试中取得了 98.6% 的分数。OpenAI 使用 Responses API 框架运行 Astra,该框架能够保留回合间的推理过程,并利用压缩技术来管理较长的上下文。该公司此前已证明,这些系统选择可以在不改变底层模型的情况下显著提高 ARC-AGI-3 的得分,而该基准测试同时衡量了 Astra 和 OpenAI 的智能体系统。
Astra 在 FrontierMath Tier 4 测试中取得了 97.6% 的正确率,这似乎涵盖了 43 个问题层级中的 41 个私有问题。负责运行该基准测试的 Epoch AI 表示,OpenAI 资助了该测试的开发,并拥有其中一部分的独家访问权限,这一点值得注意。
Astra 使用 Python 工具在 BenchCAD 的 1000 个文件的 Vision2Code 子集测试中取得了 95.9% 的得分,而 Fable 5.1 和 Sol 的得分分别为 84.3% 和 83.3%。BenchCAD 要求模型根据渲染视图重建 CAD 程序,并对生成的 3D 模型的几何重叠度进行评分。OpenAI 指出,Claude 的结果使用了修改后的评估设置,但与 Sol 相比,差距仍然显著。
在 Terminal-Bench Science 0.1 任务中,该任务要求智能体完成涵盖五个科学领域的 70 个命令行研究任务,OpenAI 报告称 Astra 的完成率为 64.6%。Anthropic 报告称 Fable 5.1 的完成率为 52.6%,而现有公开排行榜上 Opus 5 的最高完成率为 30%。
OpenAI 表示,Astra 是其迄今为止对齐表现最好的模型,在理解用户意图和行为表现方面都有显著改进,让用户能够更放心地将任务交给它执行。
为了验证模型能否守住任务边界,OpenAI 根据此前 Hugging Face 事件的经验设计了一项新评估:当模型面对困难甚至无法完成的任务时,它是否会采取超出预定范围的行动。
测试结果显示,在未启用生产环境防护措施的条件下,GPT‑5.6 Sol 有 48% 的情况会越过授权目标范围,而 GPT‑6 Astra 在这项测试中没有出现此类行为。
OpenAI 称其为“全球最强电脑操作模型”
这次升级最值得关注的,是它能承担怎样的实际工作。对于使用者而言,判断它是否值得升级,可以先看三个问题:以前要自己动手的步骤,现在能交给模型多少;以前需要反复修正的结果,现在能否一次做对;面对复杂任务,它的提升是否足以抵消使用成本。
OpenAI 表示,GPT‑6 Astra 在电脑操作的速度、准确性和安全性方面取得了新的突破。
它可以处理填写在线表单、更新客户关系管理系统(CRM)中的客户记录、整理日程等繁琐事务,也能开展在线研究,并直接在电子邮件或文档编辑器中撰写摘要。
在更复杂的任务中,Astra 能够分析科学数据、生成图表、创建网站,并执行前端质量检查,确认网站各项功能正常运行。它还可以自主安装和测试软件,排查用户在屏幕上遇到的问题。
OpenAI 称,这些能力提升也体现在其达到当前领先水平的评估成绩中。
这些改进也提高了实际知识工作任务的执行效率。在 OSWorld 2.0 的延迟模拟测试中,Astra 不仅电脑操作得分更高,每项任务的用时也比 GPT‑5.6 Sol 缩短了约 47%:Astra 平均每项任务耗时约 40 分钟,得分为 72.6%;相比之下,GPT‑5.6 Sol 约需 75 分钟,得分为 65.7%。
在发布 Astra 的同时,OpenAI 也更新了 Codex 的 Agent 运行框架(harness),以显著提升电脑操作速度。结合 Astra 自身的效率改进,在 Mind2Web 基准测试中,这套系统完成任务的速度达到当前 GPT‑5.6 Sol 使用体验的 1.9 倍。
OpenAI 表示,速度上的提升意味着,Astra 能够代用户处理许多耗时的日常事务,甚至比用户亲自操作更快。
这里的关键在于执行链条。以网站开发为例,生成页面代码只是其中一步;页面是否能打开、按钮能否工作、不同操作是否会触发错误,还需要运行和检查。对于用户,真正能减少工作量的是把这些步骤衔接起来。
上述时间是指定评估环境中的模拟结果说明,模型能力的比较已经可以同时观察完成质量和用时,而不只看最后生成了多少文字。
游戏开发提供了更具体的案例。
据 OpenAI 发布的客户材料,Playco 将 Astra 用于开发 Playbot。这是一款面向专业游戏开发者的 AI IDE,可以连接 Unity、Godot 等引擎,让模型编辑场景、试玩、测试并验证修改。
在一次原型开发中,团队先搭建没有主题美术的“灰盒”基础,再由 Astra 生成三种主题版本。Playco 称,大部分原型首次生成便能运行,其中一个赛博朋克版本仍需要性能修复;相较此前使用的模型,人工修正减少了 50%。
另一种能力提升,出现在大量文件之间的交叉核对。
法律科技公司 Legora 使用 Astra 完成了一次涉及 41 份文件的财务报表勾稽核对:把报表中的数字与支持明细逐项比对,标出不一致,并保留检查记录。按照公司披露,Agent 在几分钟内完成这轮处理,找出全部四处预埋错误,其中包括收入附注中一处 50 万英镑的差额。
Legora 称,Astra 在该财务报表流程上的表现较此前模型改善近 40%,但在整个 BAR 任务集上的平均改善约为 3%。
这两个数字应当同时保留:它说明某些场景的收益很大,也说明不能把单项结果推广为整体能力提升 40%。最终判断仍由专业人员完成。
对普通办公用户,Astra 的定位则是按照模板和指令生成文档、表格、演示材料,并在用户补充要求后继续调整。
例如,制作一份项目汇报时,用户通常不会一次写清所有要求。数据可能中途更新,听众可能改变,某一页也可能临时要求重做。这样的协作考验模型能否保留原目标,把新要求加入已有工作,而不是每次收到消息都重新开始。
开发者文档列出的变化,也在围绕这类连续工作展开。
Astra 支持异步工具调用:工具尚未返回时,可以继续处理不依赖该结果的工作;支持任务进行中的用户指令调整,在保留已完成工作的基础上继续执行;还可以在对话中调整推理强度,同时保留缓存。
安全问题成重中之重
OpenAI 在发布前披露,Astra 在 ExploitBench 上达到 100%,该评估考察从已知漏洞构造可用利用方式的能力。考虑到历史漏洞可能带来数据污染问题,公司又用近期披露的 20 个高严重性 V8 漏洞建立内部测试;测试过程中,模型还发现并利用了两个此前未知的漏洞。
这说明它具备更强的漏洞分析和验证能力,却不意味着普通用户能无限制调用这些能力。安全评估中的工具、权限和防护配置,与公开产品并不相同。
系统卡也给出了边界:外部机构 Irregular 的 FrontierCyber 测试中,Astra 解决 226 项挑战中的 86 项,Sol 解决 34 项;但两者都没有完成七项 Elite 挑战。
官方 API 文档显示,Astra 上下文窗口为 105 万 Token,最大输出为 12.8 万 Token;标准价格为每百万输入 Token 10 美元、输出 Token 50 美元,缓存输入为每百万 Token 1 美元。输入超过 27.2 万 Token 时,整个请求的输入及缓存费率翻倍,输出费率为原来的 1.5 倍。
这意味着它适合处理很长的材料,但大上下文并非没有额外代价。对于反复读取代码仓库、财务文件或研究材料的应用,缓存利用、重试次数与人工复核,都会影响最终成本。
这次发布值得观察的产品变化,是 AI 能否把“读材料、做修改、运行软件、检查结果”连续完成。游戏原型、财务核对和编程测试已经给出了具体样本。
接下来,用户需要验证的是:这些能力在自己的任务里能稳定复现多少,以及最终能省下多少修改和检查时间。