AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

RNN

共 4 条相关 AI 资讯
8月11日
10:59
10:59官方账号arXiv cs.LG@Vagan Terziyan, Artur Terziian, Oleksandra Vitko
本文提出有序结构依赖假说(OSDH),认为同一观测的多个可接受排序能揭示单一序列无法捕捉的互补结构依赖。为验证该假说,作者提出独立结构专家原则(ISEP),独立训练各投影专属序列模型,再通过融合模型整合表征。具体实现为结构演化RNN(SE-RNN),保持底层循环计算不变,仅增加投影多样性。在三个不同复杂度合成数据集上的实验表明,SE-RNN在存在隐藏结构依赖时持续受益于多投影,在简单数据集上仍具竞争力。该方法独立于底层序列模型,可扩展至其他架构。
论文SE-RNNRNNOSDH

推荐理由:想给RNN换个思路?这篇论文提出用多个顺序投影挖掘结构依赖,实验显示在复杂数据上更稳,简单数据也不掉链子。
原文
8月4日
12:37
12:37Gary Marcus@GaryMarcus
78°
谷歌Titans团队提出记忆缓存方法,将RNN与Transformer统一为同一框架下的两种设置。该方法通过保存记忆检查点,使RNN的有效记忆随输入长度增长,计算复杂度为O(NL),介于RNN的O(L)和Transformer的O(L²)之间。在16k针堆测试中,Titans模型的召回得分从21提升至32。该方法可后训练接入,让模型处理超出训练长度的上下文。纯Transformer在原始召回精度上仍占优,但记忆缓存在极低算力下大幅缩小了这一差距。
论文TitansTransformerRNN

推荐理由:谷歌Titans团队的新方法用记忆缓存把RNN长上下文召回从21提到32,算力还远低于Transformer。
原文
6月19日
09:47
09:47官方账号arXiv cs.LG@Valentin Abadie, Clemens Hutter, Helmut Bölcskei
本文证明:对于 [-1,1] 上的任意连续函数,存在一个固定的 ReLU RNN(隐层维度固定、权重固定),通过延长运行时间即可实现一致逼近。核心创新在于引入中间模型 TMNU(Turing machine with neural units),它保留了实现多项式逼近方案的算法自由度,同时能被隐维度和权重大小有明确上界的 RNN 模拟。得到的收敛速率与底层多项式逼近率对应。本文还给出了极小极大下界,证明运行时间是该固定网络逼近范式中不可避免的资源。
论文RNNRecurrent Neural Networks逼近定理

推荐理由:这篇论文很硬核:用一个固定 RNN 就能逼近任意连续函数,运行越长越准,像图灵机一样。
原文
6月5日
12:14
12:14官方账号arXiv cs.AI@Akarsh Kumar, Phillip Isola
精选
论文提出Supervised Memory Training (SMT),一种训练非线性RNN的新方法。SMT通过将RNN训练转化为一步记忆转换标签的监督学习,完全绕过了传统的循环信用分配。它利用基于Transformer的编码器从预测状态目标中获取记忆标签,只保留预测未来所需的过去信息。SMT实现了时间并行训练,任意两个token之间的梯度路径长度稳定为O(1),无需展开RNN。实验表明,SMT在语言建模和像素序列建模等任务上优于BPTT,能更好地捕捉长程依赖关系。
论文RNN预训练长程依赖

推荐理由:SMT解决了RNN训练中并行性差和长程依赖难学的问题,做序列建模或时间序列分析的开发者可以直接用这个方法替代BPTT,训练效率会大幅提升。
原文
精选全部日报登录