随着人工智能技术的快速发展,大模型在对话、推理、编程等领域展现出强大能力。如今,自主研究被视为人工智能领域的下一个重要突破方向,其意义在于突破人类知识边界的限制,形成一种全新的智能生产扩展规律——能源投入与智力产出直接挂钩,自主研究能力成为衡量智能体水平的关键指标。
与普通问答只需定位单一事实不同,自主研究需要处理一组相互关联且相互制约的条件。智能体不仅要从海量信息中筛选候选答案,还要整合分散甚至矛盾的证据,并确保最终答案满足所有关键约束条件。只要有一项未验证,答案即为无效。其核心挑战在于让智能体清楚当前答案的完成度、缺失部分以及下一步研究方向,从而在复杂约束中逐步逼近正确答案。
针对这一核心问题,智源研究院推出了AREX模型。该模型抓住了自主研究中的关键突破口——“发现—验证不对称性”:完整答案难以一次性生成,但候选解一旦形成,便可通过逐项验证关键约束,快速定位不足并指导后续探索。验证过程不仅判断答案正确性,更重要的是帮助智能体理解已知信息、缺失部分及下一步研究方向,使每一轮研究更精准、更有方向性。
这一理念的前瞻性在Jeff Dean创立的Discovery Loop公司得到印证。该公司强调,未来人工智能不仅需要更强的推理能力,还需通过持续实验、反馈和修正形成自主发现能力。AREX通过“求解—验证”双循环框架,实现了智能的持续进化,成为人工智能发展的重要趋势。
AREX的目标是训练一种能长期运行、自我验证、持续修正的研究型智能体。它不是一次性给出答案,而是在“研究→验证→再研究”的循环中不断接近完整解。面对复杂任务,智能体先给出阶段性答案,然后逐项检查约束条件,保留已验证证据,定位未解决主张,再发起更有针对性的后续研究。当新证据到来时,智能体会更新答案、重新验证,并决定是否继续深入或结束研究并输出最终结论。这一过程可递归执行多轮,使智能体具备持续改进当前解的能力。
AREX的整体方法可概括为一套双循环递归求解框架。内层循环负责完成一轮相对完整的研究,包括搜索信息、调用工具、收集证据、比较候选并构造暂定答案。其目标不是一次性得到终局解,而是形成一个结构完整、证据可追踪、后续可审计的当前解。外层循环则负责判断当前答案的完成度,依据任务约束对暂定答案进行逐项审计,形成约束级别的置信判断。如果所有必要条件都得到足够支持,智能体结束研究并输出答案;如果仍有条件未解决,验证结果将转化为下一轮内层循环的研究目标。
自主上下文更新(ACU)是AREX推理机制的关键。它不是普通摘要,而是面向下一步行动的研究状态,保留已验证发现、已排除候选、未解决约束和下一步计划。受控实验显示,AREX完整系统在BrowseComp上达到82.5分,比关闭ACU和外层循环的版本高出22.9个百分点。训练消融表明,渐进式多轮能力训练、关键步骤聚焦监督和步骤感知强化学习分别贡献于工具交互、关键决策和长程策略优化。
长程研究中的核心挑战在于模型能否在持续延展的研究过程中稳定记住当前进展。AREX通过让模型主动调用上下文更新工具,将不断增长的交互历史整理成一个可以继续推进的研究状态。这种更新不是普通摘要,而是一份“研究进度表”,帮助模型明确当前研究阶段、已成立内容、已排除内容及下一步研究方向。通过这种方式,模型能够持续继承有效信息、压缩冗余内容,并在当前阶段形成更稳健的最优解。
为了训练模型的自我改进能力,AREX设计了一套可验证的自主研究任务生成方法。先从一个确定的实体答案出发,围绕它构造一组必须被真实证据支撑的约束条件,再将这些约束改写为无法通过关键词直接命中的开放式问题。强教师模型在同样工具环境中完整执行这些任务,留下全过程的研究轨迹。最终保留下来的,是从不确定候选逐步走向可验证答案的研究轨迹。
在获得高质量训练数据后,AREX采取分阶段训练策略。模型首先学习多轮工具调用和证据获取的基本能力,再逐步进阶到长链推理、候选比较和困难问题求解。同时,AREX会巩固论文研究、高难知识推理等专项能力,避免不同任务之间的能力相互干扰。在训练过程中,关键步骤会被重点关注,并在强化学习阶段继续优化模型的研究策略。
为了验证AREX的自主研究能力,智源研究院在六个基准上进行了评测,包括BrowseComp、DeepSearchQA、WideSearch-en、GAIA、xbench-2510和HLE with tools。在信息深度方面,AREX-Base在BrowseComp上达到82.5分,接近GPT-5.4等模型,并超过GLM-5与Qwen3.5-397B;在xbench-2510上,它接近MiroThinker-H1,并优于Qwen3.5-397B与DeepSeek-V4-Flash。在信息广度方面,AREX-Base在WideSearch-en上取得了82.0 Item-F1,为论文对比范围内的最高结果,超越了Kimi-K2.6等模型。在深度与广度的结合方面,AREX-Base在DeepSearchQA上取得了89.9 F1,超过GPT-5.4等模型,并接近Claude Opus-4.6等模型。在端到端能力方面,AREX-Base在GAIA和HLE with tools上分别取得85.4、71.0和52.4分,超过多个对比模型。
与同量级基础模型与智能体模型相比,AREX-Base的总参数量为122B,每次推理仅激活10B参数。相比同总参数量的Qwen3.5-122B,AREX-Base在双方均报告的指标上全部提升;相比更大规模的Qwen3.5-397B,AREX-Base在六项完整可比基准上全部领先。AREX-Turbo只有4B参数,但在多项指标上超过Qwen3.5-35B等模型;AREX-Base则在DeepSearchQA和HLE文本子集上超过MiroThinker-H1,并在xbench-2510上与其接近。这说明自主研究能力并不只来自扩大参数规模,也来自对长程研究过程的专门训练。
基于AREX LLMs的研究成果,智源研究院推出了AREX Research Platform,将自主研究能力封装为面向科研与产业用户的日常研究工具。该平台针对资讯、论文、播客三种信息形态提供独立入口,均由AREX智能体驱动。用户可指定关注方向生成专属资讯智能体,按设定频率完成检索、筛选与汇总。每条资讯、论文或播客旁均提供自主研究入口,可一键调用AREX智能体。智能体已感知当前阅读内容与上下文,无需重复交代背景,即可针对具体问题启动检索、对比、分析与综合,输出完整的知识脉络。
当前版本的AREX Research Platform覆盖科研工作流中的“信息获取”与“认知构建”两个阶段。智源研究院后续将能力延伸至研究执行阶段,由提供参考信息进一步发展为支持方案产出。最终实现用户定义研究问题,由AREX自主完成探索、实验与优化,并交付可验证的研究结果。AREX当前已开放BETA版测试。