ITBEAR科技资讯
网站首页 科技资讯 财经资讯 分享好友

GPT-6 Astra初体验:从问答伙伴到自主数字员工,AI工作新篇章开启

时间:2026-09-04 18:35:54来源:快讯编辑:快讯

OpenAI 正式推出新一代旗舰模型 GPT-6 Astra,这款被定义为“全球最智能且对齐程度最高”的模型,标志着人工智能发展进入全新阶段。联合创始人格雷格・布罗克曼在发布会上宣称“欢迎来到 AGI 时代”,这一论断并非营销噱头——经过三天的实际使用,Astra 展现出的能力远超以往版本,它不再局限于被动回答问题,而是能够主动操作电脑、独立完成复杂工作流,真正成为具备自主执行能力的数字员工。

在计算机操作领域,Astra 的突破尤为显著。传统模型使用时,用户需将复杂任务拆解为多个步骤,逐一输入指令并确认执行结果;而 Astra 可直接接管电脑和浏览器,从打开软件、搜索资料、编辑文件到最终交付成果,全程无需人工干预。官方演示中,它完成了填写在线表单、更新客户关系管理系统数据、整理日程安排、开展网络研究并在邮件和文档中生成内容等任务,甚至具备分析科学数据、生成可视化图表、创建网站并自动运行前端质量测试的能力。

性能对比数据进一步印证了这一代际跃迁。在 OSWorld 2.0 计算机操作测试中,Astra 得分 72.6%,较 GPT-5.6 Sol 的 65.7% 提升明显;更关键的是效率指标——Astra 平均完成每项任务耗时约 40 分钟,而前代模型需 75 分钟,效率提升近 47%。在模拟真实工作场景的 Agents' Last Exam 测试中,Astra 以 59.3% 的得分超越 GPT-5.6 Sol(53.6%)和 Claude Opus 5(55.5%),该测试要求模型在真实电脑环境中同时操作软件、终端和文件,完成科研、工程、财务等领域的长流程任务,并以最终交付物质量评分。

软件工程领域是 Astra 展现优势的另一重要场景。OpenAI 将其称为“迄今最适合编程的模型”,这一结论得到多项测试支持:在 Terminal-Bench 4.0 终端操作测试中,Astra 得分 57.7%,显著高于 GPT-5.6 Sol 的 37.3% 和 Claude Fable 5.1 的 55.8%;在 DeepSWE v1.1 真实软件工程任务测试中,其得分超过 74%。这意味着程序员以往需反复调试的代码任务,现在可由 Astra 自主完成从需求理解、代码编写到运行测试的全流程。

针对编程助手的上下文管理痛点,Astra 引入了革命性改进。当上下文窗口容量达到上限时,传统模型会通过压缩总结历史内容,但这一过程会导致细节丢失;而 Astra 可保存完整上下文,允许用户跨窗口检索早期注释和累积信息,无需将其压缩为单一摘要。对于需要持续数天、涉及数万行代码的大型项目,这一功能极大提升了开发连续性和代码质量。

更令人惊讶的是 Astra 在抽象推理能力上的飞跃。在 ARC-AGI-3 测试中,其成绩从 GPT-5.6 Sol 的 7.8% 飙升至 99.9%,接近理论满分。该测试专门设计陌生环境下的抽象推理任务,被视为衡量模型“真智能”而非“记忆能力”的核心指标。在高阶数学领域,Astra 在 FrontierMath Tier 4 测试中取得 97.6% 的高分,展现出接近专业数学家的解题能力。

支撑这些突破的是前所未有的训练规模。Astra 在得州 Stargate 基地动用超过 10 万块 GPU 完成预训练,并首次采用前代模型深度参与监督训练的创新模式——用 GPT-5 指导 GPT-6 的训练过程,形成自我迭代的闭环。这种训练方式效率远超传统人工标注,成为 Astra 能在两个月内实现跨越式发展的关键因素。

随着能力提升,安全性成为关注焦点。OpenAI 强调 Astra 是“最对齐的模型”,并公布多项安全评估数据:在模拟越权操作的测试中,关闭生产环境保障措施后,GPT-5.6 Sol 有 48% 的测试出现越界行为,而 Astra 保持零越界;在故意关闭代码审查功能的测试中,Astra 生成不安全代码的概率也显著低于前代模型。

目前 Astra 尚未全面开放使用,OpenAI 正逐步向部分组织用户开放权限,更广泛的可用性计划在未来数日内启动。在 API 定价方面,Astra 输入成本为每百万 token 10 美元,输出成本为每百万 token 50 美元,是 GPT-5.6 Sol 的 2.5 倍。这一定价策略意味着普通个人用户短期内难以低成本大规模使用,但对企业和专业用户而言,效率提升带来的收益可能远超成本增加。

不同职业群体对 Astra 的价值感知存在显著差异:程序员可将其视为能独立完成模块开发的初级工程师;办公人员能获得自动制作 PPT、整理表格、处理邮件的行政助手;科研人员可借助其分析数据、运行模拟、生成图表;企业管理者则需重新规划人力结构,因为大量重复性知识工作将被自动化替代。但需注意的是,Astra 并非万能——其在网络安全领域的提升相对温和,复杂多步骤任务仍可能出错,最终交付物仍需人工审核。AI 的进化方向并非完全取代人类,而是承担更多基础性、重复性工作,让人类专注于创造力和判断力要求更高的领域。

从 GPT-3 到 GPT-4,人工智能展现了更强的对话能力;从 GPT-4 到 GPT-5,模型进化为更专业的助手;而 Astra 的出现,标志着 AI 从“回答问题”升级为“完成任务”。这种转变的本质在于交互模式的革新——用户无需再拆解任务步骤,只需设定目标,AI 即可自主规划实现路径。尽管现在断言 AGI 时代已经到来为时尚早,但 Astra 的问世无疑是一个重要信号:AI 正在从工具演变为能独立承担工作的数字劳动力,掌握与这类 AI 协作的能力,将成为知识工作者的核心竞争力。

更多热门内容
国产工控电控新机遇:运动控制与AI融合,机器人关节成第二曲线增长点
雷赛智能无框力矩电机订单破百万台、伺服收入增超五成,信捷具身智能收入翻一倍多,加上山东优宝特、青岛青成接连拿到融资——国产工控电控的增长逻辑,正在从"卖设备"转向"卖运动与控制能力"。 综上所述一句话总结:2…

2026-09-04

睿感机器人获全国首张最高等级气尘双防爆认证 推动特种机器人深入高危场景
通过该场景化解决方案,睿感机器人将防爆机器人从普通的“巡检设备”进一步升级为覆盖巡检、监测、诊断、识别的智能化安全生产工具。 对睿感机器人来说,防爆四足机器人是其切入特种危险场景的重要产品,而此次取得最高气…

2026-09-04

AI与机器人赋能无锡建筑工地:智能建造让施工更高效安全 房屋更牢靠
市住建部门组织华仁建设集团等本土龙头企业承接江苏省智能建造试点任务,搭建起以智能建造运管平台为牵引,AI智造+智能装备+BIM数字一体化三大板块协同发力的应用体系,推动工地从“凭经验干活”向“靠数据作业”转变…

2026-09-04

四川仪表工业学校“牵手”宇树科技 修订方案为机器人产业育一线技能人才
9月2日,四川仪表工业学校副校长陈觅一行走进宇树科技及其全资子公司重庆宇羿科技有限公司(宇树科技西部创新运营中心运营主体),在四足巡检机器人和新一代人形机器人的工业场景演示台前,与工程师逐条核对一项项实训教学…

2026-09-04

36氪牵头搭建产业大平台 助力具身智能产业链协同共进发展
机器人本体及整机企业具身大脑、VLA及世界模型企业核心零部件企业数据、训练及基础设施企业制造、物流、能源、医疗、商业服务等场景企业VC、CVC、产业基金及长期资本具备产业协同能力的相关机构Q13:初创企业可…

2026-09-04

黑芝麻智能携手遨博智能:首批产品交付,共推国产机器人具身智能新发展
根据战略合作协议,双方将围绕具身智能机器人"感知-决策-控制"关键链条开展协同研发,共同攻克高实时性、低功耗的边缘计算与场景自适应等共性技术难题,并在产品协同开发、市场生态建设、专业人才联合培养等维度展开深…

2026-09-04

东方晶源IDAS 2026展锋芒:AI赋能打造先进制程良率提升新引擎
作为国内集成电路良率管理领域的代表企业之一,东方晶源在EDA²主办的第四届设计自动化产业峰会IDAS2026上,系统分享了近年来在AI赋能计算光刻与良率管理方向的最新技术进展——从Total Mask层面的…

2026-09-04

英伟达IFA 2026发布多项升级:降低本地AI部署门槛,多模型性能显著提升
快科技9月4日消息,英伟达在IFA 2026上宣布多项本地AI重大升级。 与此同时,推理框架vLLM在RTX PRO 6000Blackwell上实现了20%的速度提升,双DGX Spark集群则达到1.4…

2026-09-04

华为 WATCH 6 系列 9 月 7 日登场,“高智小白瓷”引领智能手表美学与智慧新潮流
作为华为在材质与设计上的又一次大胆破局,从表壳到表带的全陶瓷的机身不仅进一步拓宽了智能手表的设计表达边界,也让产品在科技属性之外,呈现出更为鲜明的高端腕上配饰质感。与此同时,网上也陆续释出了代言人吴磊戴着 …

2026-09-04