10:06官方账号arXiv cs.LG@Zeyun Zhong, Joya Chen, Manuel Martin, Frederik Diederichs, Juergen Gall, Juergen Beyerer精选测试时训练(TTT)通过推理过程中的连续权重更新实现长上下文处理,但现有方法难以平衡每token更新动态的表达性与分块近似硬件效率。我们提出E$^2$-TTT(表达性和高效TTT)以弥合这一差距。在标准分块近似梯度取自块起始权重的情况下,我们推导出封闭形式的态转换,精确地重现了每token递归的块末快速权重和动量状态。这使块级训练可以完全并行化,同时保留了先前块方法丢弃的更新规则的时间结构。通过从头训练高达1.3B参数的模型验证E$^2$-TTT。它在语言建模方面与先前TTT和混合注意力基线表现相当,但在上下文检索方面表现更优。其优势在长度外推方面最为明显:在标准的“针插麦堆”passkey测试中,它在8倍训练上下文长度下保留了超过90%的准确率。同时,E$^2$-TTT可以匹配高效分块方法的训练吞吐量,表明它有效地协调了表达性和效率。代码可在https://github.com/zeyun-zhong/E2-TTT获取。论文测试时训练表达性效率推荐理由:E$^2$-TTT模型在语言建模和上下文检索方面表现优异,且在长度外推方面具有明显优势,值得一看。原文稍后读已读值得跟进有用关注 测试时训练
10:57官方账号arXiv cs.LG@Yuting Ge, Pengju Yang, Mingkai NieRelation模型通过将成对证据组织成显式的Self和Exchange关系,然后推导信息流,实现更高效的注意力机制。Full Relation在10M、30M和100M参数的匹配解码器模型中,最终验证NLL低于MHA。FlashRelation在固定上下文基准测试中比Full Relation快3.60-4.41倍。Hybrid Relation使用75%的Linear Relation层,达到强大的语言建模质量。论文Relation模型注意力机制信息流推荐理由:Relation模型通过关系组织提供更高效的注意力机制,比MHA表现更优,值得一看。原文稍后读已读值得跟进有用关注 Relation模型
11:04官方账号arXiv cs.AI@Giovanni Monea, Nathan Godey, Kianté Brantley, Yoav Artzi该论文提出状态-预测分离假设,认为Transformer中预测下一个token与存储有用状态可被分离。作者设计双流Transformer变体,将两个功能分配到不同计算流。在多个规模下的预训练实验中,该方法在数据和计算效率上持续优于标准Transformer,验证损失更低,下游任务平均提升2-3个百分点。额外实证分析排除了潜在混淆因素,揭示了设计带来的梯度差异。论文Transformer状态-预测分离语言建模推荐理由:这篇论文把Transformer的预测和记忆分开了,实验证明效果更好,下游任务平均提了2-3个点,搞LLM架构的值得细看。原文稍后读已读值得跟进有用关注 Transformer
19:10官方账号arXiv cs.AI@Keya Hu, Linlu Qiu, Yiyang Lu, Hanhong Zhao, Tianhong Li, Yoon Kim, Jacob Andreas, Kaiming He研究者提出ELF(Embedded Language Flows)模型,将连续流匹配应用于语言建模。与现有主要在离散词元上操作的扩散语言模型不同,ELF在连续嵌入空间中运行,仅在最后一步通过共享权重网络映射为离散词元。该方法可简单适配图像扩散领域的成熟技术(如无分类器引导)。实验显示,ELF在生成质量和采样步数上均显著优于当前领先的离散和连续扩散语言模型,为高效连续语言模型提供了新方向。论文流匹配扩散模型语言建模推荐理由:ELF展示了连续扩散模型在语言建模中的有效性,简化了技术迁移路径,可能降低语言生成模型的设计复杂度。其较少的采样步数有利于实际应用效率,值得关注。原文稍后读已读值得跟进有用关注 流匹配