ITBEAR科技资讯
网站首页 科技资讯 财经资讯 分享好友

国产AI新突破:U2-Flash以“轻”量级挑战万亿模型,RSI实践初显锋芒

时间:2026-09-15 13:37:21来源:互联网编辑:快讯

近期,人工智能领域掀起了一场关于递归自我改进(RSI)的热烈讨论。OpenAI和Anthropic等科技巨头纷纷表态,将研究重心转向这一前沿方向,引发了行业内的广泛关注。OpenAI首席科学家Jakub Pachocki在长文中指出,随着能力提升,人工智能将越来越多地参与到自身研发过程中,形成自我迭代的良性循环。

在这场技术变革中,国内企业云知声推出了基于RSI机制的U2-Flash模型,为行业提供了一个值得研究的实践样本。该模型通过自迭代优化后训练流程,能够自主发现薄弱环节,生成针对性数据进行强化训练,形成持续改进的闭环。这种创新方法使模型能力得到显著提升,在多个专业领域展现出强劲实力。

在编程能力测试中,U2-Flash取得了令人瞩目的成绩。在SWE-Bench Pro评测中,该模型获得61.6分,较前代提升10.5分;在DeepSWE v1.1测试中,得分达到64.6分,实现成绩翻倍并超越多个万亿参数级模型。更值得注意的是,在TerminalBench 3.0终端环境执行测试中,U2-Flash以24.3分的成绩领先,展现出强大的实际应用能力。

该模型在办公场景中的表现同样出色。在WorkBuddy-Bench Office评测中,U2-Flash以81分的成绩超越多个主流模型。面对复杂任务时,模型能够同时处理内容组织和视觉呈现,例如根据宽泛需求自动生成结构完整、设计精美的旅游攻略PPT,展现出卓越的多任务处理能力。

在数学推理领域,U2-Flash也展现出专业水准。在GPQA Diamond、IMOAnswerBench和HMMT Feb. 2026等权威评测中,分别取得92.4分、90.3分和97.1分的优异成绩。这些数据表明,该模型在逻辑推理和问题解决方面已达到行业领先水平。

技术实现方面,U2-Flash采用创新的稀疏混合专家架构,总参数约2660亿,但单次推理仅激活约100亿参数,激活比例不足4%。这种设计使模型在保持高效运行的同时,显著降低了计算资源消耗。通过隐式思考机制,模型能够在高维隐藏状态空间中探索多种解法路径,根据问题难度灵活调整推理强度。

在训练方法上,云知声构建了自主闭环演进系统。该系统通过模型自我评估发现薄弱环节,自动生成针对性训练数据,形成持续优化的循环。为解决传统题库固定难度导致的学习信号衰减问题,研发团队引入动态难度调整机制,确保训练任务始终与模型能力边界相匹配。

针对Agent任务训练中的效率瓶颈,团队开发了异步强化学习框架。通过多个并行工作单元独立采集训练轨迹,配合GRPO策略优化方法,使单位时间产出的有效训练数据量提升约60%。这种创新训练方式显著提高了模型的学习效率。

为解决多领域能力协同发展问题,研发团队采用多教师在线策略蒸馏技术。通过数学、编程、Agent和指令跟随四个专项教师模型的协同指导,使学生模型能够融合不同领域的专业知识。这种训练方式使模型在保持专项能力的同时,显著提升了跨领域任务处理能力。

在实际应用中,U2-Flash已展现出强大的工作替代能力。在云知声内部测试中,该模型被应用于代码仓库分析、前端页面开发、周报生成、会议纪要整理等多个工作场景。研发团队反馈,模型输出的准确性和稳定性显著提升,已成为日常工作中值得信赖的智能助手。

为满足企业级应用需求,U2-Flash进行了全面的国产化适配优化。在国产计算平台上,模型的吞吐量、时延和并发处理能力持续改进,部分场景性能已接近国际主流方案。这种适配性为注重数据安全的企业客户提供了新的选择。

目前,云知声正在探索RSI机制的更深层次应用。U2-Flash已开始参与训练数据生成、执行轨迹修正和训练环境维护等研发环节,形成有限边界的自我改进闭环。这种探索为人工智能的可持续发展提供了新的技术路径。

更多热门内容