ITBEAR科技资讯
网站首页 科技资讯 财经资讯 分享好友

大模型也需要睡觉!让AI打个盹,醒来更聪明

时间:2026-05-28 05:31:36来源:量子位编辑:快讯

7×24,AI也吃不消。

卡内基梅隆大学和马里兰大学发了篇论文,《Language Models Need Sleep》——

大模型处理长上下文的时候,硬撑着不休息,真的会累傻。

这项研究的灵感源自人脑运作机制。

人睡觉的时候海马体会把白天的短期记忆一遍遍回放,巩固进皮层突触,变成长期知识。

研究团队认为模型也可以这样,设计了一个睡眠机制,让大模型上下文窗口快满的时候别硬撑了,打个盹把最近的上下文反复咀嚼几遍,压缩进长期权重,清空缓存,醒了再接着干。

测试发现,合理增加“睡眠”迭代轮次,能明显提升模型在深度推理类任务上的表现。

尤其是那些需要一步接一步推导的难题,越复杂,模型越需要多睡一会儿。

咋回事?

大模型到底怎么了,非要睡觉

Transformer的核心是注意力机制,但注意力有一个天生的短板就是,上下文越长,算力平方级往上蹿,KV缓存也线性往上涨。

同样是推理任务,8K上下文窗口和128K上下文窗口的算力成本差距极大,多出的算力基本都消耗在了历史信息的关联计算上。

所以现在的做法两种:

要么就硬扛,扛不住了就把老信息踢出缓存,但踢出去的东西,模型就当没发生过;

另一类就是两年流行的SSM+Attention混合架构,比如Samba、Qwen3.5。

混合架构是想了个折中方案,把老信息压缩进快速权重fast weight,不占缓存,同时保留信息的可调用能力。

这确实缓解了一部分内存压力,但团队发现即便快速权重还有充足容量,当推理步骤变多、逻辑链条变长时,模型依旧会出现性能失效的问题。

也就是说当下的瓶颈并非信息存储能力不足,而是深度推理能力跟不上。

历史信息被移出KV缓存前,模型仅有一次前向传播的机会完成信息内化,单次处理根本不足以支撑复杂逻辑的拆解与推导。

这一点和人脑比较像,你白天经历了一大堆事情,不是当场全消化掉的,而是大脑等你睡着了再处理。

海马体在睡眠期间一遍遍回放白天的重要片段,把短期记忆巩固进皮层突触,变成长期知识。

但这个过程必须离线,也就是你得先睡着,把外部刺激暂时关掉,大脑才能集中算力干消化这件事。

而且它不是回放一遍就完,得多放几遍。

模型的睡眠长什么样

团队把人脑这一整套逻辑搬到了模型上。

他们的设计是当模型上下文窗口快满的时候,不硬撑了,直接让大模型睡觉。

这里的睡觉是指暂停接收新token,进入纯离线状态,针对已积累的全部上下文,执行多轮递归前向传播。

依靠可学习的局部规则,反复对信息进行提炼整合,逐步更新SSM模块内的快速权重,完成信息的深度压缩与消化。

消化完了就清空KV缓存,带着更新后的权重醒来,接着干活。

从算力分配来看,额外的计算开销全部集中在“睡眠”阶段,型苏醒后的正常推理流程和常规模型保持一致,只需要一次前向传播。

这里的“睡眠时长”,本质上就是信息迭代处理的轮次,轮次越多,代表模型对上下文内容的梳理、打磨次数越充分。

团队选用元胞自动机、多跳图检索、GSM-Infinite无限数学推理三类任务开展测试,因为这几类任务可以精准控制推理深度与记忆负载两大变量。

测试结果清晰印证提升睡眠迭代轮次,模型整体性能稳步提升,而且性能提升主要体现在高难度深度推理任务上。

也就是说简单的题醒着就能秒了,难的题需要睡一觉,得经过多轮梳理,才能理清思路。

只能说,摸鱼休息确实是提升效率的妙招,有时候停下来才能好好思考(doge)。

更多热门内容
AI助力宇宙探索:迁移学习加速新物理发现,也面临负迁移挑战
迁移学习允许人工智能系统将从一项任务中获得的知识应用到另一项任务中,以帮助其更高效地学习。这个初始训练过程被称为预训练,为人工智能打下了基础,之后再让它接触包含可能的新物理的更复杂宇宙学模型。 正如作者在论…

2026-06-28

吉林建科携手华为举办产教融合论坛 共探AI时代人才培养新路径
央广网长春6月27日消息(记者张学龙)26日,由华为技术有限公司主办、吉林建筑科技学院承办的“数智赋能·人才兴吉——2026产教融合创新发展论坛暨华为院校人才培养论坛”在吉林建筑科技学院国际会议交流中心举行。…

2026-06-28

清华等多校联手:打破AI“自我确认陷阱”,让智能体真正学会“吃一堑长一智”
提炼经验的AI没有参与任务执行,它不会因为某条行动记录是自己产生的而对它有偏袒,也不会因为自己在某个地方失败了就不愿意承认那是错误。研究团队在论文中坦诚指出了几个值得关注的潜在问题:如果多个不同的AI恰好都存…

2026-06-28

2026企业级智能体开发平台怎么选?四大主流平台深度对比助决策
依据这一评价模型,本文选取市面上4款具备代表性的企业级智能体开发框架,围绕“产品定位-核心优势-适配场景-技术特征”的规范化范式进行深度剖析,以保证对比视角的同一性与逻辑对等。只有将底层算力、模型能力与具体…

2026-06-28

吉翼智能8个月完成技术攻坚:具身机器人进厂,开启智能质检新篇章
发布会首次亮出吉翼双机器人矩阵与自研Z—1具身大模型——后者在Robocasa开源评测中以80.0%的平均得分位列榜首。 从全球汽车零部件供应链的深度参与者,到具身智能赛道的实战派,吉翼智能正以“真实产品、真…

2026-06-28

览邦Watch Ultra深度评测:多场景适配的智能手表新标杆
在智能穿戴设备市场蓬勃发展的当下,智能手表已不再仅仅是看时间的工具,它承载着独立通信、健康监测、娱乐等诸多功能。 综上所述,览邦Watch Ultra在外观设计、核心功能、性能配置、续航能力等方面都有着出色的…

2026-06-28