在人工智能领域,一种名为递归自我改进(Recursive Self-Improvement,RSI)的技术路线正引发广泛关注。该技术旨在让模型自主生成训练数据、优化提示词并修复代码,但现有RSI系统普遍存在结构单一的问题——它们通常依赖固定不变的改进程序,且往往仅从数据、模型或框架(Harness)中的单一维度切入,难以实现全面突破。
针对这一瓶颈,由多家海内外顶尖高校联合研发的metaRSI-v1架构正式亮相。这项成果首次将模型改进、数据优化与框架调整三大维度统一于同一元递归框架中,为RSI领域提供了全新的方法论。研究团队通过实验证明,该架构不仅能让小规模模型实现显著提升,还能为GPT-5.6、Claude Opus 5等前沿模型带来可观的性能增长。
metaRSI-v1的核心创新在于其提出的Loop Kernel范式。这一范式将自我改进过程抽象为闭环系统:模型通过消费反馈信号生成学习信号,进而在数据、框架或模型层面提出改进方案,经由验证器裁决后,将结果回流为新的反馈信号。这种设计使得三大改进维度首次共享统一的底层逻辑,各组件可根据任务需求灵活组合与调度。
在具体实现上,该架构通过三大算子协同工作:Data-RSI算子从模型运行轨迹中提取学习信号,生成合成数据以标定模型能力边界;Harness-RSI算子在框架的五个可插拔模块(包括系统提示、技能库、工具调用等)中生成改进方案;Model-RSI算子则直接优化模型参数与结构。三个算子通过横向编排轴与纵向优化轴实现动态协作——横向轴决定算子执行顺序,纵向轴则持续优化算子内部策略。
实验数据显示,基于metaRSI-v1架构的30亿激活参数小模型,在四项基准测试中平均提升10.9分,其中代码解决率接近翻倍。更引人注目的是,该架构对GPT-5.6等前沿模型同样有效,六款顶级模型在终端基准测试中平均提升7.3分。这表明,即便对于已接近性能极限的模型,仍存在可观的自我改进空间。
研究团队进一步提炼出五条关键定律,为RSI技术发展提供理论支撑。其中第一条定律强调验证机制的重要性——只有存在可靠验证器的领域才能形成自改进闭环;第二条定律指出,模型对自身能力的认知会随改进过程失效,需持续重新发现能力边界;第三条定律揭示了能力与成本的辩证关系,例如将能力从框架迁移至模型可显著降低推理成本。这些定律不仅解释了实验现象,更为后续研究指明了方向。
值得关注的是,metaRSI-v1架构采用分层设计,由四个智能体协同运作:metaRSI² Agent负责优化整体策略,RSI² Agent决定横向或纵向优化方向,RSI² Sub-Agent执行算子策略改写,Transition Agent则确保各组件间数据流畅通。这种设计使得人类专家可局部介入系统运行,形成人机协作的改进闭环。
目前,研究团队已开源RSI-Harness工具包,该工具包具备自我学习与迭代能力,可为不同领域沉淀可移植的改进框架。更令人期待的是,团队正探索将该架构应用于物理世界,通过可编程仪器与自动化实验室构建闭环验证系统。这种设计将仿真实验、台架测试与真实操作分级推进,有望在材料科学、生物医药等领域催生新的突破。