AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

采样

共 3 条相关 AI 资讯
8月7日
12:25
12:25官方账号arXiv cs.LG@Iosif Lytras, Nikolaos Makras, Sotirios Sabanis
精选
研究者提出次梯度驯化非调整朗之万算法(SG-TULA),用于处理势函数非光滑、超线性梯度增长且非凸的采样问题。该算法直接操作次梯度,无需计算昂贵的平滑步骤,并采用驯化技术保证显式格式稳定。在Wasserstein-2距离下推导了非渐近收敛界,所有常数随维度和逆温度显式给出,优于现有次梯度类朗之万算法。作者在GPT-2系列LLM的正则化预训练势上验证了假设,并展示SG-TULA的坐标提升变体在预训练中可与微调后的AdamW和Muon竞争。
AI模型SG-TULALangevin算法GPT-2

推荐理由:新采样算法SG-TULA能处理非光滑非凸问题,在GPT-2预训练上干赢了AdamW和Muon,还带理论保证。
原文
7月16日
11:10
11:10官方账号arXiv cs.LG@Yunbum Kook
Kannan 和 Narayanan 于 2009 年提出 Dikin walk 用于对多面体均匀采样。Chen 等人在 2017 年使用 Lewis-weight 势垒将混合时间改进至 $d^{2.5}$ 并猜想最优界为 $d^{2}$。本论文将 Dikin walk 的混合时间从 $d^{2.5}$ 改进至 $d^{2.25}$,基于缩放后的 Lee–Sidford 度量,从热启动出发达到指数精度。主要技术是改进的 Lee–Sidford 度量平均自和谐性,结合高阶展开、移动正交标架计算及 Wiener 混沌分解。
论文Dikin walkpolytopes采样

推荐理由:这篇理论论文把 Dikin walk 采样的混合时间从 $d^{2.5}$ 降到了 $d^{2.25}$,离理论下界 $d^{2}$ 更近了,搞采样理论的同学可以关注。
原文
7月9日
09:57
09:57官方账号arXiv cs.LG@Eitan Levin, Venkat Chandrasekaran
该论文提出使用随机采样映射(如替换采样、随机分箱、物种采样)来比较不同大小的输入(如点云点数量不同、序列token长度不同、图节点数不同)。通过分析领域内问题实例的对称性,确定了每种采样类型的适用场景。框架给出了函数类连续性的显式泛化率和草图化率,涵盖序列、图和张量上的函数族。具体例子包括矩多项式、同态密度、置换不变Transformer和图神经网络。
论文采样泛化图神经网络

推荐理由:这篇论文提出了一个统一的采样框架,帮你理解模型在不同大小输入上的泛化能力,还能把大输入压缩成小输入来节省计算,例子涵盖Transformer和图神经网络。
原文
精选全部日报登录