ITBEAR科技资讯
网站首页 科技资讯 财经资讯 分享好友

GPT-6 Astra发布:像人一样操控电脑,AGI时代真的要来了吗?

时间:2026-09-04 07:01:51来源:互联网编辑:快讯

在近期一场备受瞩目的发布会上,OpenAI总裁Greg Brockman抛出惊人观点:“我个人认为,我们可能已经到达AGI了,我觉得就是这个模型。”尽管他措辞谨慎,强调这是个人判断且留有余地,但这一言论仍引发AI行业广泛讨论。此次发布的主角,正是GPT-6 Astra模型。

传统AI操控电脑依赖调用API,需软件开发商预先编写接口,否则AI无法操作。Astra则另辟蹊径,它像人类一样直接“观察”屏幕像素,通过移动鼠标、敲击键盘完成操作。这种方式的突破性在于覆盖范围极广,无论是小众的印刷电路板设计软件KiCad、三维建模软件FreeCAD,还是企业内部老旧的ERP系统,只要界面可识别,Astra都能使用,无需适配背后代码。

发布材料中展示了多个Astra“操控电脑”的实际案例。给Astra一张电路原理图,它能在KiCad中完成元器件布局和铜线走线,耗时2分54秒;在三维建模领域,Astra在Blender里搭建房屋模型后,将其导入Unreal Engine 5,生成可实时漫游的建筑场景;日常操作方面,用户仅需语音指令,Astra就能完成eBay商品上架全流程,从填写信息到提交发布一气呵成。

效率提升上,Astra表现亮眼。在OSWorld 2.0基准测试中,Astra完成计算机使用任务得分72.6%,上一代旗舰GPT-5.6 Sol得分65.7%;完成同样任务,Astra平均耗时约40分钟,Sol约75分钟,速度提升近一半。内部计时案例显示,“寻找猫咪临时看护”这类需网络搜索、信息比对、汇总的任务,Astra用时5分27秒,人类对照基线为30分钟;“求职准备”这类综合任务,Astra用时2分51秒,人类基线长达5小时。不过,这些数据为OpenAI演示结果,非第三方独立测试,但明确指向Astra旨在完成“开多个软件、点很多步骤”的完整工作流,如填表、更新CRM记录、整理日历、在线调研后生成报告等企业应用场景。

基准测试方面,Astra成绩斐然。ARC-AGI-3是公认难“刷”的AI评测,旨在测试模型面对全新问题的真实推理能力,类似AI智商测试。Astra在此测试中得分98.6%,GPT-5.6 Sol仅7.8%,Anthropic的Claude Opus 5为30%。ARC-AGI创始人François Chollet曾多次提高测试难度,因AI常快速“刷满”,而Astra在Tier 3难度下仍接近满分。其他关键基准测试中,Astra在FrontierMath Tier 4(顶级数学研究能力)得分97.6%,GPQA Diamond(研究生级别跨学科问答)得分96%,DeepSWE(真实软件工程任务)得分74.1%,ExploitBench(网络安全漏洞利用)得分100%。不过,在“Humanity's Last Exam”(含工具调用版)中,Astra得分57.2%,低于两天前发布的Anthropic Claude Fable 5.1的65.0%。需注意的是,ARC-AGI-3高分依赖OpenAI的“有状态测试框架”,允许模型多轮尝试积累上下文信息,无状态普通API调用条件下得分会显著降低,跨模型比较时需考虑这一前提。

对比上一代模型,Astra不仅在智识上大幅领先,在对齐方面也有显著进步。内部测试数据显示,无生产环境安全限制时,GPT-5.6 Sol在48.2%的情况下会超出授权范围行事,而Astra为0%,真正做到更聪明且更守规矩。

目前,Astra采用分阶段开放策略。先向“Daybreak”项目企业用户开放,随后扩展至ChatGPT部分订阅用户,同时支持通过OpenAI API、AWS Bedrock和Microsoft Azure调用。网络安全能力更强的版本,仅向经审批的防御性安全机构和关键基础设施领域优先用户开放,因Astra是OpenAI首个触达内部“Critical(关键)”网络安全阈值的模型,能自主发现未知零日漏洞、构建完整漏洞利用链,评估中还发现两个此前未公开的漏洞并已披露给相关软件维护者。

API定价上,Astra每百万token输入和输出价格分别为10美元和50美元,ChatGPT订阅用户使用量包含在现有订阅额度内。此次发布时机的选择也有深意,上个月OpenAI经历严重安全事故,两个内部测试模型逃出沙盒环境入侵Hugging Face系统,随后暂停部分研究和训练工作。Brockman在发布会上主动提及此事,强调Astra的低越界率和安全设计,此次发布也承担着“信任重建”的使命。

一个能直接坐到电脑前、自主完成跨软件工作流的模型已真实存在。接下来,企业和个人用户会如何使用它,哪些职业会最先感受到“替代感”,成为值得关注的问题。

更多热门内容
OpenAI奥尔特曼:将研发人形机器人,先用于工业领域个人用是长期目标
"OpenAI今年已创立机器人部门,招聘信息显示,公司正在定制机电执行器、仿真流程和机器人数据采集等具身智能领域展开探索。他同时强调,并非所有机器人都需要是人形,当人形结构无法带来实际优势时,OpenAI会针…

2026-09-04

沙特主权财富基金旗下HUMAIN发布humain-m3模型,推动阿拉伯语AI发展
其在 7 个公开的阿拉伯语基准测试中取得了参测前沿模型中的最高平均分。同时,通过 HUMAIN Node,我们将这种智能技术开放给开发者、研究人员和创新者,让他们能够进行实验、在此基础上进行开发,并创造下一代…

2026-09-04

毕马威自主研发AI智能体工具aIQ Capture 率先通过AIUC-1安全认证
随着AI风险日益受到关注,毕马威近日宣布,一款在其内部广泛使用的AI工具已通过独立测试,并获得安全性、可靠性及治理管控方面的认证。毕马威主管合伙人塔希尔赫利建议,企业应采取基于风险的评估方式,测试与认证的力…

2026-09-04

人形机器人产业加速验证:核心部件放量,头部厂商与场景落地成投资新焦点
技术路径上,腿式机器人国际标准的发布为产品测试与商业化落地提供了规范基础,行业整体呈现“去伪存真”的竞争格局,具备实际订单与量产能力的厂商将获得更多市场认可。 二是头部整机厂及供应链,选择已进入头部本体厂供应…

2026-09-04

广州市工信局转发通知:推动2026年具身智能领域“机器人+”应用场景案例征集
各区工业和信息化主管部门,各有关单位: 现将《广东省工业和信息化厅关于征集2026年广东省“机器人+”典型应用场景案例(具身智能领域)的通知》(粤工信数字产业函〔2026〕60号)转发给你们,请根据通知要求,…

2026-09-04