ITBEAR科技资讯
网站首页 科技资讯 财经资讯 分享好友

中国“实在Agent”登顶OSWorld测试榜首 AI电脑操作能力迈入新阶段

时间:2026-07-31 12:55:45来源:互联网编辑:快讯

全球AI智能体领域迎来重大突破——中国团队研发的“实在Agent”在权威测试基准OSWorld中以90.2%的成功率登顶全球总榜,同时包揽Agentic framework分榜冠军。这一成绩不仅刷新了该测试自设立以来的最高纪录,更标志着AI在真实办公场景中的计算机操作能力迈入全新阶段。此前,该领域最高纪录由meta、OpenAI等国际科技企业保持,此次突破意味着中国AI技术实现从追赶到领跑的跨越。

OSWorld测试由香港大学、卡内基梅隆大学等机构联合设计,被业界视为衡量AI“数字员工”能力的核心标尺。与传统语言类测试不同,该测试要求智能体在真实操作系统中独立完成361项复杂任务,涵盖文件编辑、表格处理、跨应用协同等办公全流程,并由机器自动判定结果,彻底消除人为评分偏差。测试数据显示,2024年行业顶尖模型成功率仅12%,2025年底提升至72.6%,2026年5月进一步突破至83.6%,而“实在Agent”此次直接将纪录推高至90.2%,展现出显著的技术代差优势。

在细分任务中,该智能体在图像处理、跨应用协同和系统底层操作三大领域表现尤为突出。其中,系统级任务实现零失误,图像处理(GIMP)和跨软件联动等高难度任务得分远超行业平均水平。技术专家分析指出,跨应用协同考验智能体的长链路规划能力,图像处理反映其对非标准界面的深度理解,而系统级稳定性则体现工程架构的可靠性,这三项核心能力的叠加构成了其领先优势。值得注意的是,此次测试全程模拟真实办公环境,任务复杂度远超实验室场景,对AI的泛化能力和工程化水平提出极高要求。

研发团队透露,“实在Agent”的成功源于底层大模型与工程调度系统的深度协同。其采用的Harness架构相当于为AI装上“智能方向盘”,通过动态资源分配和实时纠错机制,确保复杂任务链的稳定执行。这种技术路线突破了传统大模型“重智力、轻工程”的局限,使智能体既能理解指令,又能精准操控各类软件工具。团队负责人形象比喻:“这就像给赛车装上顶级发动机的同时,还配备了最可靠的制动和转向系统。”

该成果的商业价值已得到市场验证。开发企业实在智能自2018年成立以来,已为6000余家企业提供数字化服务,客户涵盖世界500强、央企及行业龙头。在金融、制造、政务等领域,其智能体产品已实现大规模部署,可自主完成报表生成、数据核对、流程审批等重复性工作,帮助企业提升运营效率。团队表示,此次测试突破将推动AI从“辅助工具”向“数字员工”进化,未来计划将技术扩展至工业控制、科研计算等更复杂的场景。

行业观察人士指出,中国AI产业正从算法创新向工程化能力转型。此次登顶不仅证明国内团队在核心系统开发上的实力,更揭示出AI技术落地的关键路径——通过海量真实场景数据反哺模型优化,形成“应用-迭代-再应用”的闭环。随着“实在Agent”等产品的普及,AI有望深度融入实体经济,为产业升级提供新型基础设施。

更多热门内容