11:40官方账号arXiv cs.LG@Christophe D. Hounwanou, John Emeka Eze, Yaé U. Gaba该研究结合大型语言模型与强化学习,将LLM规划器和RL控制器架构形式化为目标增强马尔可夫决策过程。研究表明,当LLM的状态进展分数作为有界势函数时,即使LLM评分不准确,形成的奖励塑造项也能保持最优策略集。研究者在小型MDP上验证了结果,包括四种势能配置,其中一种对抗性配置放大到基础奖励幅度的20倍。论文LLMRLMDP推荐理由:这篇论文提出了LLM反馈的奖励塑造方法,即使在LLM评分不准确时也能保持最优策略,比传统方法更可靠。原文稍后读已读值得跟进有用关注 LLM
11:11官方账号arXiv cs.AI@Tereza Kinská, Jan Křetínský, Tobias Meggendorfer, Sabine Rieder, Maximilian WeiningerdtControl2+ε扩展了dtControl2工具,针对马尔可夫决策过程(MDP)中的控制器表示问题。通过引入允许的精度损失参数ε≥0,该工具能生成更小的决策树,同时保证ε-最优性。相比现有最优方法,生成的决策树规模可减少数个数量级,从而提升人机理解释性。方法在保持核心控制逻辑的前提下,可控地省略细节。论文dtControl2决策树MDP推荐理由:想搞懂马尔可夫决策过程控制器可解释性的可以看看这个。dtControl2+ε用ε容忍度换更小更易懂的决策树,比原先的压缩效果好很多。原文稍后读已读值得跟进有用关注 dtControl2
09:41官方账号arXiv cs.LG@Ziheng Wei, Annie Qu, Rui Miao离线强化学习中,即时奖励常因记录稀疏或审查而缺失,导致评估偏差。本文聚焦奖励缺失非随机(MNAR)场景,在有限时域MDP下研究离线策略评估(OPE)。作者利用未来状态作为影子变量,结合奖励依赖倾向模型辨识全数据条件均值奖励。进一步引入桥函数并通过min-max估计避免双重采样,提出Fitted-Q-Evaluation风格估计器。在模拟数据和MIMIC-III Sepsis数据上,该方法在误差和一致性上优于现有基线。论文OPEMNARMDP推荐理由:想处理真实场景奖励缺失的强化学习玩家可以看这篇,用影子变量和桥函数解决偏差问题,实验比传统方法稳。原文稍后读已读值得跟进有用关注 OPE
10:16官方账号arXiv cs.AI@Pierre Boudart, Pierre Gaillard, Alessandro Rudi精选该论文研究了基于多项逻辑(MNL)模型的马尔可夫决策过程(MDPs)的强化学习问题。现有算法对MNL混合MDPs的遗憾界为Õ(dH²√T),其中d是特征维度,H是回合长度,T是回合数。作者引入了一个问题依赖常数σ̄_T(≤1/2),衡量最优下游值函数沿学习轨迹的归一化平均方差,并提出了一个遗憾界为Õ(dH²σ̄_T√T)的算法。该算法在最坏情况下恢复现有界,在结构化MDPs(如KL约束鲁棒MDPs)中可将H依赖因子降低H倍。此外,论文证明了匹配的下界Ω(dH²σ̄_T√T),首次完全刻画了MNL混合MDPs的遗憾复杂度(达到对数因子内的极小化最优)。论文强化学习MDP多项逻辑模型推荐理由:这篇论文首次给出了MNL混合MDPs的极小化最优遗憾界,对研究强化学习理论或设计高效算法的研究者来说,是理解问题复杂度的重要参考。原文稍后读已读值得跟进有用关注 强化学习
19:11官方账号arXiv cs.AI@Linus Heck, Filip Macák, Roman Andriushchenko, Milan Češka, Sebastian Junges该论文提出将经典Shields模型扩展到概率安全场景的新框架。传统Shields确保绝对安全,但概率安全(允许以一定概率发生不良事件)更复杂。论文证明了强安全和最大允许性无法同时保证,提出了两种弱化保证的自然Shields,以及一种保持强安全保证的离线/在线构造方法。实验表明这些新Shields在计算可行性和实用性上具有优势,为自主智能体安全提供新工具。论文AI安全ShieldsMDP推荐理由:该研究为安全关键型AI系统(如自动驾驶、机器人)的概率安全验证提供了理论框架和实用工具,弥补了现有Shields方法在概率场景中的不足。原文稍后读已读值得跟进有用关注 AI安全