这个研究用“睡觉”这种生物启发机制解决了长上下文推理的显存和速度瓶颈,做长序列AI应用的开发者可以直接参考开源方案,比堆显存更聪明。
CMU和UMD的研究团队发现,Transformer大模型在处理超长任务时注意力机制会因上下文长度二次方爆炸而性能下降。他们提出“sleep-like consolidation”机制,让模型在“睡眠”期间将最近上下文转化为持久fast weights并清空KV cache,从而将短期记忆转为长期记忆。实验表明,增加睡眠深度或时长能显著提升睡眠后的推理能力。该方案完全开源,颠覆了传统靠堆显存扩展上下文的做法。
别被骗了! 大模型也特么需要“睡觉”? 一个来自CMU和UMD的研究团队发现:Transforme…
别被骗了! 大模型也特么需要“睡觉”?
一个来自CMU和UMD的研究团队发现:Transformer大模型在处理超长任务时注意力机制彻底拉胯
他们没有继续堆上下文长度而是直接给模型安排了“睡眠”
模型在睡眠期间把最近的上下文全部转化成持久的fast weights然后清空KV cache
这个机制叫“sleep-like consolidation”大模型也需要睡觉
故事就藏在2026年5月25日刚出的arXiv 2605.26099里
标题直白到离谱:《Language Models Need Sleep》
作者Sangyun Lee、Sean McLeish、Tom Goldstein、Giulia Fanti
传统Transformer在长时序任务上越跑越累因为attention对上下文长度是二次方爆炸。
KV cache占显存越来越多推理速度越来越慢。
他们提出的方案超级生物启发:
模型每隔一段时间进入“睡眠模式”
先把最近积累的上下文做N次离线循环遍历
然后通过一个学会的局部规则把这些信息固化到state-space model块里的fast weights里
固化完直接清空KV cache
醒来后模型继续工作但记忆已经从“短期易失”变成了“长期持久”
实验结果直接证明:增加睡眠深度或者睡眠时长能显著提升睡眠后的推理能力
这不是又一个参数技巧而是彻底改变了模型处理长上下文的范式。
Big Tech还在疯狂卷把上下文拉到百万级靠暴力堆显存。
这个小团队却用“睡觉”这个最简单的人类机制把问题从根上解决了。
整个框架100%开源论文代码思路全在arXiv上。
Big Tech的闭源长上下文订阅模式靠的就是你不知道模型其实可以“睡觉”来省资源。