论文11:56论文证明DGM和PINN算法在非线性PDE求解中的全局收敛性这篇论文给DGM和PINN的用户吃了定心丸:对于一类半线性PDE,梯度下降训练真的能收敛到正确解,不是只找到局部最优。#DGM#PINN#PDE#神经网络aarXiv cs.LG@Justin Sirignano 等 3 人原文稍后读已读值得跟进有用关注 DGM
论文09:24令牌预算饱和与思维链推理非收敛的早期机制检测这篇论文发现DeepSeek-R1推理非收敛在早期就能从内部表征检测到,未来可做自适应计算分配,研究推理效率的朋友可以看看。#DeepSeek-R1-Distill-Qwen-7B#推理模型#早期检测#令牌预算aarXiv: DeepSeek@Renuka Oladri 等 3 人原文稍后读已读值得跟进有用关注 DeepSeek-R1-Distill-Qwen-7B
论文15:10同质深度网络中持续学习的收敛性研究这篇论文从理论上搞清楚了持续学习中同质深度网络的收敛性质,比之前只分析线性模型或单任务模型的结果更通用。#Continual Learning#Homogeneous Deep Networks#Deep Networks#理论分析aarXiv cs.LG@Matan Schliserman 等 4 人原文稍后读已读值得跟进有用关注 Continual Learning
模型11:07自适应表示的泛函梯度下降新算法这篇论文提出了首个可实现的泛函梯度下降算法,能自适应调整梯度表示,理论上有收敛保证,实验上比传统FGD和神经网络更快更准。#FGD#自适应表示#优化算法#收敛性aarXiv cs.LG@Daniel Csillag 等 6 人原文稍后读已读值得跟进有用关注 FGD