10:14官方账号arXiv cs.AI@Manith Adikari, Bei Peng, Samuele Vinanzi, Angelo CangelosiLEMUR是一个新框架,让智能体从多个人的偏好反馈中学习多目标策略,无需预先定义奖励函数。它同时学习策略和多个目标专属的奖励模型,在训练中平衡竞争目标。在多种多目标任务基准上,LEMUR的表现优于现有基线方法。这项研究为无预设奖励的多目标决策任务提供了新方向。论文LEMUR多目标强化学习偏好反馈推荐理由:这是篇新论文,LEMUR能直接从多人偏好学多目标策略,不用设奖励函数,基准上比现有方法强。原文稍后读已读值得跟进有用关注 LEMUR
10:47官方账号arXiv cs.AI@Cláudio Lúcio do Val Lopes, Lucca Machado da Silva金融异常检测面临极端类别不平衡,传统单目标算法常出现“欺诈崩溃”。研究者提出 Semantic Pareto-DQN,一个基于多目标强化学习的框架。它利用大语言模型将异构交易特征编码为自然语言状态表示,并优化包含金融效能、操作摩擦和语义发现的向量奖励。在电子商务欺诈和UCI Credit数据集上,该框架成功打破零召回陷阱,相比标量化基线提升了少数类召回率。AI模型Semantic Pareto-DQN多目标强化学习金融异常检测推荐理由:金融欺诈检测的老大难问题有了解法:Semantic Pareto-DQN 不用重采样,直接多目标优化,既能抓到欺诈又少误拦正常交易。原文稍后读已读值得跟进有用关注 Semantic Pareto-DQN
10:36官方账号arXiv cs.LG@Arnaud Lequen, Clément Legrand-Lixon, Léo SaulièresPQLRM算法将Pareto Q-Learning与奖励机器(Reward Machines)结合,维护向量化Q估计来逼近Pareto前沿。实验表明,相比朴素PQL基线,PQLRM在奖励机器编码的非马尔可夫任务中收敛更快。它还能合成QRM无法获得的Pareto最优策略,提升了多目标强化学习的样本效率。论文PQLRMReward MachinesPareto Q-Learning推荐理由:这篇论文提出了PQLRM,把Pareto Q-Learning和奖励机器结合起来,在多目标任务里比基线收敛更快,还能找到普通方法找不到的最优策略。原文稍后读已读值得跟进有用关注 PQLRM
12:00官方账号arXiv cs.LG@Umer Siddique, Peilang Li, Yongcan Cao该论文研究多目标强化学习(MORL)中的公平性优化问题。传统单策略方法使用广义基尼福利函数(GGF)只能处理固定用户偏好,缺乏策略多样性。作者证明对于凹分段线性福利函数(如GGF),公平策略仍属于凸覆盖集(CCS)。提出三种新算法:集成GGF的多策略多目标Q学习(MOQL)、状态增强多策略MOQL及随机策略扩展。在多个领域实验表明,该方法能学习一组适应不同用户偏好的公平帕累托最优策略。论文MORLGGF多目标强化学习推荐理由:这篇论文提出了在MORL中兼顾最优和公平的新方法,用GGF和三种算法生成多样化的公平策略,比传统单策略方法更灵活。原文稍后读已读值得跟进有用关注 MORL