10:30官方账号arXiv cs.LG@Reza Bayat, Ali Behrouz, Vahab Mirrokni, Aaron CourvilleProteus提出增量记忆激活机制,随上下文增长逐步扩展记忆容量。该方法可嵌入SWLA、Comba、Titans、Hope-Attention等模型,无需额外成本。在长上下文检索和理解任务上持续提升,且优势随长度增加而扩大。AI模型ProteusSWLATitans推荐理由:Proteus给长上下文模型加了个记忆开关,逐步解锁容量,让SWLA、Titans这些模型在长文本上表现更好,越长的上下文提升越明显。原文稍后读已读值得跟进有用关注 Proteus
12:37Gary Marcus@GaryMarcus78°谷歌Titans团队提出记忆缓存方法,将RNN与Transformer统一为同一框架下的两种设置。该方法通过保存记忆检查点,使RNN的有效记忆随输入长度增长,计算复杂度为O(NL),介于RNN的O(L)和Transformer的O(L²)之间。在16k针堆测试中,Titans模型的召回得分从21提升至32。该方法可后训练接入,让模型处理超出训练长度的上下文。纯Transformer在原始召回精度上仍占优,但记忆缓存在极低算力下大幅缩小了这一差距。论文TitansTransformerRNN推荐理由:谷歌Titans团队的新方法用记忆缓存把RNN长上下文召回从21提到32,算力还远低于Transformer。原文稍后读已读值得跟进有用关注 Titans
13:13官方账号arXiv cs.AI@Reza Bayat, Ali Behrouz, Aaron Courville当前语言模型在深度上均匀分配参数,但研究表明各层贡献不同。该论文在固定预算下实验发现,将更多参数分配给前层、减少后层可以改进困惑度。提出Tapered Language Models(TLMs),通过余弦调度平滑锥形化MLP宽度。在Transformer、Gated Attention、Hope-attention和Titans四种架构上,三个模型尺度均一致提升困惑度和下游基准性能,且不增加参数或计算量。论文Tapered Language ModelsTransformerTitans推荐理由:这篇论文发现了一个简单技巧:同等算力下,把更多参数分给前几层、少给后几层,模型效果就能更好,试了多种架构都管用。原文稍后读已读值得跟进有用关注 Tapered Language Models