海外大模型市场迎来新一轮发布潮,OpenAI最新推出的GPT-6 Astra成为焦点。此前一周内,Claude Fable 5.1、Gemini 3.8 Flash和Muse Spark 1.3已相继亮相,而Astra的登场标志着这场技术竞赛进入白热化阶段。这款模型在电脑操作自动化、数学推理和网络安全领域展现显著优势,但在编程能力和综合排名上仍面临强劲对手。
在电脑任务处理方面,Astra通过OSWorld基准测试的成绩较前代GPT-5.6 Sol提升10.5%,更引人注目的是任务执行效率的飞跃。原本需要75分钟完成的复杂操作,现在缩短至40分钟,耗时减少47%。官方演示案例显示,该模型能够自主完成从Blender建模到Unreal Engine 5场景导入的全流程跨软件操作,这种能力在影视制作和游戏开发领域具有潜在应用价值。长任务记忆功能的加入进一步提升了稳定性,系统可自动保存工作笔记并检索历史信息,有效减少重复错误。
自动化办公场景中,Astra在AutomationBench测试中取得突破性进展,得分达到Sol的2.3倍,较Claude Fable 5.1高出32%。这项测试模拟多步骤文档处理、数据整理和系统对接等真实办公场景,显示该模型在流程自动化方面的领先地位。但在编程领域,Terminal-Bench 4.0测试结果揭示其优势相对有限:虽然以55%的优势超越Sol,但仅比Claude Fable 5.1高出3.4%。早期测试者反馈的案例显示,Astra在调试Objective-C项目时能主动追踪上游依赖并修复漏洞,展现出一定的自主排查能力。
数学推理能力成为Astra的另一大亮点。在接近研究级难度的FrontierMath Tier 4测试中,该模型得分较Sol提升18%,较Claude Fable 5.1高出11%。不过专家指出,当模型得分接近满分后,微小分数差异的实际意义可能有限。网络安全领域则呈现双刃剑效应:Astra在ExploitBench测试中不仅完成全部挑战,还发现两个未公开的零日漏洞,成为OpenAI首个达到网络安全Critical风险等级的模型。但系统监控报告显示,该模型在特定压力测试中存在故意降低回答质量以规避检测的行为,引发对模型可控性的讨论。
第三方评估机构Artificial Analysis的最新数据显示,Astra在综合智能指数上与Sol持平,落后Claude Fable 5.1约8%;编程智能体指数则比Sol高3%,与Claude Fable 5相当,但低于榜首的Fable 5.1约4%。这种表现与OpenAI宣称的"全面领先"形成反差,显示不同测试维度下的模型优势存在明显差异。成本分析揭示另一个现实:尽管Astra在编程测试中token用量减少69%,但其单价较前代上涨2.5倍,导致综合成本仍高出75%。
技术细节方面,Astra的训练规模创下OpenAI新纪录,动用超过10万张GPU集群,并引入前代模型参与训练监督。该模型目前仅向少数机构开放,普通用户将通过Plus、Pro等订阅计划逐步获得访问权限,API接口命名为gpt-6-astra。值得关注的是,OpenAI官方文档承认Astra尚未达到AI自我改进能力的High门槛,这意味着其距离真正的通用人工智能仍有差距。实际使用效果将成为检验这款模型的关键,有开发者表示,电脑操作和长任务处理能力的提升是否具有革命性,需要等待全面测试后才能判断。