论文10:24论文提出鲁棒老虎机首个多项式时间学习器搞 bandit 或理论机器学习的可以看看:这论文给 robust bandits 找到了第一个多项式时间算法,遗憾 Õ(√T),还划清了 NP-hard 边界。#robust bandits#遗憾界#NP-hard#学习理论aarXiv cs.LG@Vanessa Kosoy, Vinayak Pathak原文稍后读已读值得跟进有用关注 robust bandits
论文11:11带子线性噪声探测的在线凸优化探测可降低在线学习遗憾#OCO#Pairwise Probes#噪声探测#遗憾界aarXiv cs.LG@Simone Di Gregorio 等 4 人原文稍后读已读值得跟进有用关注 OCO
论文精选10:16MNL混合MDPs的极小化最优方差感知遗憾界这篇论文首次给出了MNL混合MDPs的极小化最优遗憾界,对研究强化学习理论或设计高效算法的研究者来说,是理解问题复杂度的重要参考。#强化学习#MDP#多项逻辑模型#遗憾界aarXiv cs.AI@Pierre Boudart 等 3 人原文稍后读已读值得跟进有用关注 强化学习