12:25官方账号arXiv cs.LG@Iosif Lytras, Nikolaos Makras, Sotirios Sabanis精选研究者提出次梯度驯化非调整朗之万算法(SG-TULA),用于处理势函数非光滑、超线性梯度增长且非凸的采样问题。该算法直接操作次梯度,无需计算昂贵的平滑步骤,并采用驯化技术保证显式格式稳定。在Wasserstein-2距离下推导了非渐近收敛界,所有常数随维度和逆温度显式给出,优于现有次梯度类朗之万算法。作者在GPT-2系列LLM的正则化预训练势上验证了假设,并展示SG-TULA的坐标提升变体在预训练中可与微调后的AdamW和Muon竞争。AI模型SG-TULALangevin算法GPT-2推荐理由:新采样算法SG-TULA能处理非光滑非凸问题,在GPT-2预训练上干赢了AdamW和Muon,还带理论保证。原文稍后读已读值得跟进有用关注 SG-TULA
11:10官方账号arXiv cs.LG@Yunbum KookKannan 和 Narayanan 于 2009 年提出 Dikin walk 用于对多面体均匀采样。Chen 等人在 2017 年使用 Lewis-weight 势垒将混合时间改进至 $d^{2.5}$ 并猜想最优界为 $d^{2}$。本论文将 Dikin walk 的混合时间从 $d^{2.5}$ 改进至 $d^{2.25}$,基于缩放后的 Lee–Sidford 度量,从热启动出发达到指数精度。主要技术是改进的 Lee–Sidford 度量平均自和谐性,结合高阶展开、移动正交标架计算及 Wiener 混沌分解。论文Dikin walkpolytopes采样推荐理由:这篇理论论文把 Dikin walk 采样的混合时间从 $d^{2.5}$ 降到了 $d^{2.25}$,离理论下界 $d^{2}$ 更近了,搞采样理论的同学可以关注。原文稍后读已读值得跟进有用关注 Dikin walk
09:57官方账号arXiv cs.LG@Eitan Levin, Venkat Chandrasekaran该论文提出使用随机采样映射(如替换采样、随机分箱、物种采样)来比较不同大小的输入(如点云点数量不同、序列token长度不同、图节点数不同)。通过分析领域内问题实例的对称性,确定了每种采样类型的适用场景。框架给出了函数类连续性的显式泛化率和草图化率,涵盖序列、图和张量上的函数族。具体例子包括矩多项式、同态密度、置换不变Transformer和图神经网络。论文采样泛化图神经网络推荐理由:这篇论文提出了一个统一的采样框架,帮你理解模型在不同大小输入上的泛化能力,还能把大输入压缩成小输入来节省计算,例子涵盖Transformer和图神经网络。原文稍后读已读值得跟进有用关注 采样