10:52官方账号arXiv cs.LG@Cédric Gerbelot, Jean-Christophe Mourrat本文研究无限宽两层神经网络联合优化学习错误指定的单指标模型,通过摄动参数调节第一层和第二层的相对训练速度。作者证明常数和线性分量在预测的时间尺度内以精确显式阈值恢复。进一步分析二次分量的学习起始,并表明早期学习的分量持续影响后续动态。证明基于奇异摄动流的定量近似,现象上权重测度在达到二次分量时出现奇异行为。论文两层神经网络奇异摄动分层学习推荐理由:这篇论文严格验证了Berthier等人的分层学习时间尺度猜想,对理解深度网络训练动态很有帮助。原文稍后读已读值得跟进有用关注 两层神经网络
09:29官方账号arXiv cs.LG@Jakob Galley, Vahid Shahverdi, Axel Flinth精选该研究探讨了训练数据的对称性是否会在神经网络的梯度流训练中产生守恒量。作者证明,在损失函数为解析且非多项式的一般情况下,数据对称性通常不会引入额外的运动积分。但对于均方误差(MSE)损失,数据增强有时会产生额外的守恒量。研究通过引入“可张量化网络”框架来描述这一现象,这类架构包括线性网络、多项式网络以及Lightning Attention。论文神经网络对称性守恒律推荐理由:这项研究澄清了数据对称性与神经网络训练动力学之间的深层关系,对理解数据增强的理论基础有重要意义。做理论研究的机器学习学者值得关注,它可能影响你对数据增强策略的设计思路。原文稍后读已读值得跟进有用关注 神经网络