7月21日
09:52
09:52官方账号arXiv cs.LG@Joseph Lazzaro, Alessio Russo, Aldo Pacchiano
本文研究在线表格强化学习中的最佳策略识别问题,提出首个非渐近样本复杂度保证。算法Navigate and Stop (NaS)的样本复杂度依赖于特征时间、MDP的连通性、最优特征时间的曲率等实例相关量。研究填补了NaS算法在非渐近分析上的空白,明确了各因素对样本复杂度的贡献。
推荐理由:这篇论文给NaS算法提供了非渐近保证,解释了样本复杂度受哪些因素影响,做强化学习理论的朋友可以看看。
7月14日
12:00
12:00官方账号arXiv cs.LG@Michael Rizvi-Martel, Satwik Bhattamishra, Guillaume Rabusseau, Michael Hahn
这篇论文聚焦Transformer的理论理解,指出已有研究大多分析其表达性,但很少涉及可学习性。受损失景观分析启发,作者初步提出了学习C-RASP构造的样本复杂度边界。该工作为理解Transformer在有限样本下的学习能力提供了理论基础。
推荐理由:这篇论文讲了Transformer的理论短板——表达性研究够了,但学不学得会还不知道。他们用C-RASP给出了样本复杂度的初步界限,对想深挖模型理论的人很有用。
6月26日
6月19日
11:46
11:46官方账号arXiv cs.LG@Georgy Noarov, Aaron Roth
这篇论文提出了一种确定性多校准算法,达到最小最大最优的样本复杂度率 O~(ε⁻³),解决了此前只有随机算法能达到该复杂度而确定性算法样本复杂度更差的开放问题。算法进一步推广到结果不可区分性(OI)和全预测器,给出了针对有限或有限覆盖测试集合的最优确定性预测器。这解决了CLNR26和OKK25等先前工作中明确提出的开放问题。
推荐理由:这篇论文解决了机器学习里一个悬而未决的问题:确定性多校准算法终于能像随机算法一样高效了。如果你关心公平性、可信预测的样本效率,可以看看他们怎么做到的。