ITBEAR科技资讯
网站首页 科技资讯 财经资讯 分享好友

智源AREX智能体:以验证驱动自主研究,开启智能进化新路径

时间:2026-08-11 13:43:49来源:快讯编辑:快讯

在人工智能领域,当大模型逐步掌握对话、推理、编程和工具调用等能力后,自主研究被视为下一个重要突破口。这一发展方向的意义在于,AI将不再受限于人类知识边界,而是形成一种全新的智能生产模式——“投入多少能源,就转化多少智力”。衡量智能体自主研究能力的重要维度之一,正是其能否在复杂约束条件下持续接近正确答案。

与普通问答只需定位单一事实不同,自主研究需要处理一组相互关联、彼此制约的条件。智能体不仅要从海量信息中筛选候选答案,还需整合分散甚至冲突的证据,并确保最终答案满足所有关键约束。任何一项未验证的条件都会使答案失效。其核心挑战在于,智能体能否清晰判断当前答案的完整性、缺失部分,以及下一步的研究方向。

智源研究院发布的AREX模型正是针对这一难题提出的解决方案。它抓住了自主研究中的关键突破口——“发现—验证不对称性”:完整答案难以一次性生成,但通过逐项验证候选解的关键约束,可以快速定位不足并指导后续探索。验证不仅用于判断答案正确性,更重要的是帮助智能体理解“已知什么、缺失什么、下一步研究什么”,从而提升研究效率。

这一思路的前瞻性在Jeff Dean创立的Discovery Loop公司得到印证。该公司强调,未来AI不仅需要更强的推理能力,还需通过持续实验、反馈和修正形成自主发现能力。AREX通过“求解—验证”双循环框架,体现了这一趋势:内层循环负责研究,外层循环负责改进,二者协同推动智能体在复杂任务中持续进化。

AREX的目标是训练一种能长期运行、自我验证、持续修正的研究型智能体。与传统模型一次性给出答案不同,AREX通过“研究→验证→再研究”的循环,逐步接近完整解。面对复杂任务时,智能体会先给出阶段性答案,随后逐项检查约束条件,保留已验证证据,定位未解决主张,并发起更有针对性的后续研究。当新证据到来时,智能体会更新答案并重新验证,直至输出最终结论。

这一过程可递归执行多轮:研究→暂定答案→逐项验证→定位缺口→定向研究→更新答案。这里的“自我改进”并非指模型在线更新参数,而是指智能体对研究状态和当前答案的持续修正。AREX更像一个会反复检查进度、修正路径、沉淀有效证据的研究助手,而非简单的“搜索后回答”工具。

AREX的整体方法可概括为双循环递归求解框架:内层循环(Research Loop)负责完成一轮相对完整的研究,包括搜索信息、调用工具、收集证据、比较候选并构造暂定答案;外层循环(Self-Improvement Loop)则负责判断当前答案的进展,依据任务约束逐项审计,并形成置信判断。若所有条件均获支持,智能体结束研究;若仍有条件未解决,验证结果将转化为下一轮内层循环的研究目标。

自主上下文更新(ACU)是AREX的关键机制。它不是普通摘要,而是面向下一步行动的研究状态:保留已验证发现、已排除候选、未解决约束和下一步计划。实验显示,AREX在BrowseComp基准上达到82.5分,比关闭ACU和外层循环的版本高出22.9个百分点。这表明长程研究状态维护能显著提升性能。

在长程研究中,AREX通过主动调用上下文更新工具,将交互历史整理为“研究进度表”,帮助模型明确当前进展、已成立内容、已排除假设和下一步方向。这种机制避免了全盘保留冗余信息或简单截断丢失关键线索的问题,使智能体能够持续继承有效信息并形成更稳健的解。

为训练这种能力,AREX设计了一套可验证的自主研究任务生成方法:从确定答案出发,构造一组必须由真实证据支撑的约束条件,再改写为开放式问题。强教师模型在同样工具环境中执行任务,留下全过程的研究轨迹。只有从不确定候选逐步走向可验证答案的轨迹才会被保留,确保训练数据能真正教会模型如何发现线索、交叉验证、推翻错误候选并调整方向。

训练顺序同样关键。AREX采取分阶段策略:模型先学习多轮工具调用和证据获取的基本能力,再逐步进阶到长链推理、候选比较和困难问题求解。同时,强化学习阶段会重点优化关键步骤(如找到关键证据、否定错误候选、切换搜索方向)的研究策略,而非将所有步骤同等对待。

在六个基准测试中,AREX以10B激活参数达到自主研究前沿水平。在信息深度测试(BrowseComp、xbench-2510)中,AREX-Base分别取得82.5和接近MiroThinker-H1的成绩,表明其能稳定维护研究状态并逐级深入挖掘。在信息广度测试(WideSearch-en)中,AREX-Base以82.0 Item-F1领先所有对比模型,证明其能管理大范围搜索任务并持续跟踪已覆盖范围和剩余空白。

在深度与广度结合测试(DeepSearchQA)中,AREX-Base取得89.9 F1分,超过GPT-5.4等模型,说明其学到了一套可迁移的研究方法论:检索、比较、验证、修正、聚合。在端到端能力测试(GAIA、HLE with tools)中,AREX-Base分别取得85.4、71.0和52.4分,表明其能将搜索与规划、推理、工具调用结合,完成完整智能体工作流。

与同量级模型相比,AREX-Base的总参数量为122B,但每次推理仅激活10B参数。相比Qwen3.5-122B,AREX-Base在所有报告指标上均领先;相比Qwen3.5-397B,AREX-Base在六项完整可比基准上全部领先。与专门面向搜索和研究任务训练的智能体模型相比,AREX也体现出较高的参数效率。例如,AREX-Turbo仅4B参数,但在多项指标上超过Qwen3.5-35B等模型。

基于AREX LLMs,智源研究院进一步推出AREX Research Platform,将自主研究能力封装为面向科研与产业用户的日常工具。该平台针对资讯、论文、播客三种信息形态提供独立入口,均由AREX智能体驱动。用户可指定关注方向(如Coding Agent、芯片行业进展),生成持续运行的专属资讯智能体,按设定频率完成检索、筛选与汇总。

每条资讯、论文或播客旁均提供自主研究入口,可一键调用AREX智能体。智能体已感知当前阅读内容与上下文,无需重复交代背景,即可针对具体问题(如“该方向是否有后续讨论”“所选benchmark是否权威”)启动检索、对比、分析与综合,输出完整的知识脉络。这一设计将内容发现与自主研究直接衔接,降低了信息获取成本。

当前版本的AREX Research Platform覆盖科研工作流中的“信息获取”与“认知构建”阶段。后续,智源研究院计划将能力延伸至研究执行阶段,由提供参考信息发展为支持方案产出,最终实现用户定义研究问题、AREX自主完成探索与优化并交付可验证结果的目标。该平台已开放BETA版测试,用户可访问arex-research.com体验。

更多热门内容
2026服贸会:首钢园将迎服务机器人,智慧场景与消费体验双升级
北京市石景山区副区长胡浩8月10日在2026年中国国际服务贸易交易会倒计时一个月新闻发布会上介绍,本届服贸会将发挥科技创新优势,在首钢园重点区域部署服务机器人,打造智慧化场景与沉浸式交互体验。 此外,在打造特…

2026-08-11

雄安新区智慧城市科创中心揭牌 绘就未来城市数智化发展新蓝图
其中,“创新之城”以红色通信初心为主线,串联起1G至6G的通信技术发展历程;“魅力之城”集中呈现了中国移动在智算、低空经济、智慧城市等领域的全栈创新成果,可远程演示雄安低空应用公共服务平台,一键调度无人机起飞…

2026-08-11

北京石景山:人形机器人“学艺”正忙 十大场景练就全栈服务本领
8月10日,位于北京市石景山区的人形机器人数据训练中心内,上百台机器人正在训练师的带领下学习人类的生产生活技能。中新社记者 贾天勇摄中新社记者 贾天勇 摄图为一组机器人正在练习家庭康养应用场景技能。中新社…

2026-08-11

第二届世界人形机器人运动会将启,灵巧手专项赛机器人“精细活”练得如何?
我们参加了灵巧手专项的积木搭建的比赛,要在一个限定的时间和场地之内搭积木,一共要搭5层,按照比赛规则,最后能够立住5秒就有效。”这项比赛考核的是机器人和灵巧手的配合,包括它的精细操作的能力,对于以后走进家庭去…

2026-08-11

从网络热梗到硬科技落地:中国飞行机器人正突破天际,开启低空新未来
市场端也在同步响应,随着低空开放的步伐加快,植保、巡检、救援、物流等多个领域对具备自主作业能力的智能飞行设备的需求正在快速爆发,单纯依靠人工遥控的传统无人机已经难以满足复杂场景下的高效作业需求,这也让区分清…

2026-08-11

展厅讲解机器人进化论:从标准化服务到“千馆千面”智慧中枢的破局之路
猎户星空提供了超过370个API接口,覆盖了导航、感知、交互、系统状态等各个方面,开发者可以在Android Studio环境中使用Java/Kotlin语言进行深度定制,打造符合自身品牌调性的UI界面和交互…

2026-08-11

模量科技获数千万元Pre-A轮融资,以“视触觉+压阻”方案赋能机器人触觉感知
模量科技成立于2024年底,是一家致力于构建触觉基础设施的公司,具备触觉感知模组、触觉数据采集和触觉模型全链路研发能力,聚焦人形机器人/灵巧手、工业智能制造两大赛道。 在实际应用中,不同区域的机器人手部结构对…

2026-08-11

2026数博会倒计时!25台“贵阳造”无人接驳车带你驶向科幻未来
2026中国国际大数据产业博览会开幕在即,作为贵州本土硬核自动驾驶代表企业,贵州翰凯斯智能技术有限公司将在本届盛会上带来规模空前、体验感拉满的无人驾驶接驳车矩阵:25台无方向盘、无踏板的全自动驾驶接驳车组成…

2026-08-11

橡木果机器人发布全球首个触觉感知具身本能模型 获招商局创投等天使轮投资
姜峣进一步介绍,橡木果此次发布的模型不依赖任何数据预训练,是行业首个以触觉感知为核心、复刻人类操作机理的通用操作基座模型,其能够实现零样本泛化与毫秒级的自适应操作,从根本上解决了当前行业面临的“数据稀缺、场…

2026-08-11

智源AREX:让AI智能体告别“搜索即答案” 开启自主研究新范式
AREX的目标,不是让模型在单轮回答中写出一个「看起来更完整」的答案,而是训练一种能长期运行、持续验证、递归修正的自主研究智能体——不是一次性给出答案,而是在「研究→验证→再研究」的循环中不断接近完整解,让…

2026-08-11