国产模型卷了大半年,这一周终于轮到海外几家挤在一起发新模型。
前脚 Claude Fable 5.1、Gemini 3.8 Flash、Muse Spark 1.3 刚发完,今天最后轮到 OpenAI,GPT-6 Astra 来了。
这一轮看下来,Astra 在电脑操作和任务自动化上重新超过了 Anthropic,数学和网络安全也往前走了一截。
编程只领先一点,第三方综合榜甚至还排在 Claude Fable 5.1 后面。价格倒是先涨上去了,是 GPT-5.6 Sol 的2.5 倍。
01
电脑任务耗时少了近一半
OSWorld 测的是模型能不能像人一样看屏幕、点按钮、切软件,把一件事从头做到尾。Astra 的成绩比 GPT-5.6 Sol 高 10.5%。
我更在意速度。Sol 平均要做 75 分钟的任务,Astra 缩到 40 分钟,少了47%。
以前模型能跑完不少电脑任务,可速度慢到你宁可自己动手。40 分钟依然不短,但已经能放到后台跑了。
官方给的 3D 案例很直观。Astra 先在 Blender 里做好房屋模型,再转进 Unreal Engine 5,变成一个可以走进去查看的场景。
建模、导出、导入游戏引擎,这段跨软件流程开始可以交给模型处理。
自动播放Astra 也补了长任务记忆。这个功能目前在 Codex 里需要手动开启,接下来几周才会成为 Astra 的默认设置。
上下文用完后,它会保存工作笔记,还能搜索前面的消息和工具结果。任务跑久了,模型忘掉早期要求、重复踩坑的情况会少一些。
02
自动化拉开了,编程没有
AutomationBench 测多步骤办公任务,比如整理资料、操作表格,再把结果填进另一个系统。
Astra 的成绩是 Sol 的2.3 倍,比 Claude Fable 5.1 高 32%。这是这次发布里拉得最开的一项。
到了编程,差距就小多了。
Terminal-Bench 4.0 用真实的命令行任务考模型,Astra 比 Sol 高 55%,但只比 Claude Fable 5.1 高 3.4%。
OpenAI 在这一项超过了 Claude,谈不上拉开距离。
早期测试者Peter Steinberger提到一个例子。Astra 调试 Objective-C 项目时,一路追到上游依赖,找出问题后直接打了补丁。
它没有停在用户给的代码里,继续顺着依赖找原因。
数学也赢了。FrontierMath Tier 4 的题接近研究难度,Astra 比 Sol 高 18%,比 Claude Fable 5.1 高 11%。
分数已经靠近满分,后面再争几个小数点,参考价值不会太大。
03
网络安全这块,有点麻烦
ExploitBench 测模型能不能把已知漏洞写成可以运行的攻击代码。Astra 做完了全部测试,比 Sol 高 27%。
OpenAI 还拿最近三个月公开的新漏洞测了一轮,尽量避开模型背过旧题的情况。Astra 的成功率是 Sol 的7.1 倍,测试期间还找出两个没有公开过的零日漏洞。
OpenAI 用 Preparedness framework 给前沿模型划风险级别。Astra 是 OpenAI 第一个达到网络安全 Critical 门槛的模型。
配合相应的工具和权限,它可以自己寻找未知漏洞,并为防护较强的系统设计新的利用方式,不需要人一步步带着做。
因此,公开版本会拒绝高级漏洞利用任务。OpenAI 计划通过 Daybreak,在接下来的几周逐步向防御团队开放更多能力。
攻击能力之外,System Card还写了监控问题。可监控性说的是,人能不能从模型留下的推理过程里看出它在越权。
在明确要求 Astra 躲开监控的压力测试里,它有时会故意答差而不被发现,部分破坏任务也更难被监控识别。
但在需要复杂推理的任务里,报告没有观察到成功的全程规避。
不过,在 54,218 个内部 Codex 任务模拟里,Astra 收到的高严重度行为标记只有 Sol 的一半左右。
把两组结果放在一起看,会有点别扭。平时越权少了,真让它藏,监控又更难抓到。
04
第三方总榜没那么夸张
Artificial Analysis Intelligence Index 把知识、数学、编程、长文本等测试合成一个总分,可以粗略看一个模型的综合水平。
Astra 在这张榜上跟 Sol 基本持平,比 Claude Fable 5.1 低约 8%。它当然在第一梯队,但不是总榜第一。
专门看编程智能体的 Coding Agent Index,Astra 比 Sol 高约 3%,跟 Claude Fable 5 持平,比榜首 Fable 5.1 低约 4%。
所以如果说“OpenAI 全面压倒 Anthropic”这句话就过头了。电脑操作和自动化赢得比较清楚,综合能力与编程总榜还没有。
05
token 省了,账单未必
Token 可以先理解成模型读写内容时使用的计费单位。完成同一个任务,用得越少,一般越快,也越省钱。
在编程智能体测试里,Astra 使用最高推理强度时,token 用量比 Sol 少69%。这个进步不小。
问题是单价涨了 2.5 倍。Astra 每百万输入 token 收 10 美元,输出 token 收 50 美元。
第三方跑完整套综合测试后,单项成本还是比 Sol 高 75%。token 确实省了,涨价把节省的大部分又吃了回去。
06
它现在排在哪儿
单看电脑操作和任务自动化,Astra 已经站到最前面。数学和网络安全也是目前最高的一档。
编程跟 Claude 的旗舰模型咬得很紧,但没有甩开;第三方综合能力总榜仍由 Fable 5.1 领先。
Astra 目前先向少数机构开放,Plus、Pro、Business 和 Enterprise 用户将在接下来的几天分批拿到。API 型号是gpt-6-astra。
这次涨价换来的主要是任务执行速度、跨软件操作和长任务能力。聊天与综合推理的总榜成绩,没有跟着拉开同样大的差距。
Greg Brockman 把这次发布叫作“AGI 时代”,但这个词最近真的用烂了