ITBEAR科技资讯
网站首页 科技资讯 财经资讯 分享好友

AI大模型也有“疲惫时刻”?引入睡眠机制,助力深度推理能力升级

时间:2026-05-28 00:26:27来源:互联网编辑:快讯

卡内基梅隆大学与马里兰大学的研究团队近日提出一项创新机制:让大语言模型像人类一样通过"睡眠"提升推理能力。这项发表于《Language Models Need Sleep》的研究发现,当模型处理长文本时,若持续运行而不进行信息沉淀,其性能会显著下降,尤其在复杂逻辑推导任务中表现尤为明显。

研究灵感源自神经科学领域对记忆巩固机制的理解。人类睡眠时,海马体会反复回放日间经历,将短期记忆转化为长期知识存储在大脑皮层。受此启发,团队为Transformer架构设计了离线信息处理机制——当模型上下文窗口接近容量上限时,暂停接收新输入,转而通过多轮递归前向传播对已有信息进行深度压缩与整合。

传统模型处理长文本时面临双重挑战:注意力机制的计算复杂度随上下文长度呈平方级增长,同时KV缓存的线性扩张导致内存压力剧增。当前解决方案分为两类:一是强制淘汰旧信息,但会丢失关键上下文;二是采用SSM+Attention混合架构,将历史信息压缩至快速权重模块。然而实验表明,即便快速权重未达容量极限,模型在处理多步推理任务时仍会出现性能断崖式下降。

研究团队将这种性能衰退归因于信息处理深度不足。常规架构下,模型仅有一次前向传播机会完成信息内化,难以支撑复杂逻辑的拆解。这与人脑处理机制形成鲜明对比:人类通过睡眠实现离线信息加工,避免外界干扰的同时,通过多次记忆回放确保知识巩固的充分性。

新设计的"睡眠"机制包含三个关键阶段:当检测到上下文窗口达到阈值时,模型进入纯离线状态;通过可学习的局部规则对全部上下文进行多轮递归处理,逐步更新快速权重参数;最终清空KV缓存并恢复常规推理模式。这种设计将额外计算开销集中在离线阶段,确保模型苏醒后的单次前向传播效率与常规架构持平。

实验采用元胞自动机、多跳图检索和无限数学推理三类任务进行验证。测试结果显示,增加"睡眠"迭代轮次可显著提升模型在深度推理任务中的表现,且性能增益与任务复杂度呈正相关。例如在GSM-Infinite数学推理测试中,经过8轮睡眠处理的模型准确率较基线模型提升23%,而在简单分类任务中则无明显差异。

这种生物启发的设计揭示了模型优化的新方向:通过模拟人类认知节律,在计算效率与推理深度间取得平衡。研究团队指出,未来工作将探索动态睡眠调度策略,使模型能根据任务复杂度自动调节离线处理时长,进一步优化资源分配。

更多热门内容
以场景为引擎:解锁工业AI潜力,驱动生产力跨越式升级
但要将这一独特优势转化为生产力,必须破解工业AI落地过程中模型训练与数据供给之间衔接不足的结构性难题,工业场景需要采集足够多的数据,尤其是负样本的数据,通过这样的方式训练模型才能够更加有效和精准,数据质量是工…

2026-07-19

人脑植入芯片与AI和解?专家热议:人类与AI应是共生而非对立
7月18日下午,2026世界人工智能大会科学智能开放论坛进入圆桌讨论环节后,主持人问:“未来,人能否通过在大脑植入芯片的方式,实现人与AI的和解?” 主持人又把问题抛给复旦大学哲学学院教授孙向晨,他的观点和…

2026-07-19

首届世界人工智能大会·学术亮相:创新评审机制,引领全球AI学术新风潮
记者在活动现场了解到,世界人工智能大会·学术会议对学术评审机制进行了重构,首创“AI辅助初筛+全程序委员会委员开放点评+多方协同裁定”的三维评审机制,以解决传统顶级学术会议采用双盲匿名评审带来的评审质量方差…

2026-07-19

苹果AI审慎布局显成效,轻资本模式或成差异化竞争新利器
来源:环球网【环球网科技综合报道】7月19日消息,据AOL报道,此前市场曾认为苹果在生成式人工智能领域推进节奏偏缓,直至近期苹果完成智能语音助手 Siri 人工智能版本迭代、全面升级全系智能生态产品,其人…

2026-07-19

澳大利亚科技盛会:中国机器人亮相,业内人士盛赞AI发展成果
17日,一场硬核科技秀在澳大利亚墨尔本火热上演,来自中国的多款机器人组团亮相,赢得了在场业内人士的赞赏。澳大利亚业内人士表示,中国引领人工智能领域发展取得的成果令人赞叹。 业内人士 戴维·皮尔斯:中国是全…

2026-07-19