AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

长度泛化

共 3 条相关 AI 资讯
7月9日
09:55
09:55官方账号arXiv cs.LG@Xinyi Wu, Siyuan Liu, Ali Jadbabaie
精选
论文提出频率匹配原理,认为RoPE最优频率与数据依赖宽度W成反比(1/W),并通过合成数据和文本数据验证。发现语言模型中低频带源于自然语言的多尺度依赖结构。将频率选择与位置插值长度泛化关联:低频缩放扩展有效场但降低分辨率。实验表明自然语言具有近似自相似性,支持测试时频率缩放实现长上下文泛化。
论文RoPE位置编码长度泛化

推荐理由:这篇论文解释了为什么RoPE在训练中某些频率更常用,还教你用频率缩放来扛更长上下文,很实用。
原文
6月1日
10:15
10:15官方账号arXiv cs.LG@Felipe Urrutia, Juan José Alegría, Cinthia Sanchez Macias, Jorge Salas, Cristian B. Calderon, Cristobal Rojas
这篇论文通过训练GPT-J在两种结构等价的多跳推理任务(数字任务需位置推理,字母任务需符号推理)上,研究了注意力头的学习动态。作者引入新指标将注意力头分类为位置型或符号型,发现成功学习与纯头(即只表现一种类型)的出现相关。尽管任务结构等价,但数字任务需要位置和符号两种头,而字母任务只需符号头。论文进一步揭示了这些头的计算角色,并给出基于RoPE的几何可解释构造。关键发现是符号机制在长序列上泛化更可靠,而位置机制有更明显的局限性,并通过理论和实验验证了这种分离。
论文注意力机制RoPE长度泛化

推荐理由:这篇论文用严谨的实验和理论揭示了位置与符号注意力在长度泛化上的本质差异,做Transformer机制研究或长上下文优化的开发者值得细读,看完会对RoPE的几何解释有更深理解。
原文
5月26日
12:25
12:25官方账号arXiv cs.LG@Charles Pert, Dalal Alrajeh, Alessandra Russo
精选
长度泛化是神经网络长期面临的挑战:循环模型存在位置偏差,而Transformer受限于固定计算深度。研究人员提出MLP-LDRU(对数深度循环单元),通过并行归约近似循环计算,捕获结合性偏置算子。在21个正则语言任务中,MLP-LDRU在18个任务上实现100%的分布外准确率,其余3个任务至少达到99.9%,显著优于同类循环和注意力模型。在ListOps和NLP分类基准测试中,MLP-LDRU也表现出竞争力。
论文长度泛化循环单元正则语言

推荐理由:长度泛化是AI模型的硬骨头,MLP-LDRU用对数深度设计解决了循环模型和Transformer的各自短板,做序列建模和语言理解的团队值得关注这个新架构。
原文
精选全部日报登录