09:49官方账号arXiv cs.LG@Ezgi Oztekin, Figen Oztoprak, S. Ilker BirbilDynamic Constraint Learning (DCL) 提出一种数据驱动框架,用于在约束函数未知且无法查询时进行约束优化。该框架在每个迭代中从附近数据学习局部代理,并在数据支持的信任区域内求解子问题。与离线全局约束学习相比,DCL使用局部代理,适应优化过程中的数据分布。在合成测试问题和一个文献案例研究中,DCL实现了与全局模型相当的解决方案质量,同时使用更简单的局部模型和更小的优化子问题。论文Dynamic Constraint Learning约束优化数据驱动推荐理由:这篇论文提出DCL方法,在约束函数未知时用局部代理高效优化,解决了实际难题,值得关注。原文稍后读已读值得跟进有用关注 Dynamic Constraint Learning
09:15官方账号arXiv cs.LG@Haricharan Balasundaram, Karthick Krishna Mahendran, Rahul Vaze本文针对约束在线凸优化(COCO)问题中的OGD+Projection算法,首次证明其累积约束违反(CCV)的下界为Ω(T^{(d-1)/(2d)}),其中d为维度。已有研究表明该算法在d=2时可达O(T^{1/3})的CCV,对任意d可达O(√T)的CCV。本文的下界结果填补了理论空白,揭示了算法在高维场景下的性能极限。该结论基于Sarkar和Sinha(2026)及Balasundaram等人(2026)的前序工作。论文OGD+ProjectionCOCO在线凸优化推荐理由:这篇理论论文首次给出了OGD+Projection算法在高维约束优化中违反约束的下界,搞在线凸优化的人可以看看。原文稍后读已读值得跟进有用关注 OGD+Projection
09:42官方账号arXiv cs.LG@Federica Filippini许多计算与网络系统的决策问题可转化为带性能约束的成本最小化问题。传统强化学习(RL)通过加权惩罚将成本和约束违规合并为标量奖励,但权重需手动调整。本文提出MAMO(多智能体多目标约束优化系统),利用多智能体RL将奖励权重选择作为学习问题。MAMO将任务执行与目标设计解耦,为动态环境中约束优化问题的自主RL方案迈出第一步。论文MAMO多智能体强化学习推荐理由:这篇论文提出MAMO,用多智能体RL自动调权重,解决约束优化中手动调参难题。原文稍后读已读值得跟进有用关注 MAMO
12:40官方账号arXiv cs.LG@Udvas Das, Waris Radji, Debabrota Basu, Odalric-Ambrym Maillard精选本文提出了一种名为 Dri-MED 的算法,用于解决线性上下文随机多臂赌博机问题,其中学习者需为具有个性化偏好的用户群体提供推荐,且上下文分布随时间漂移。在实用假设下,该问题被简化为具有异方差非平稳噪声的平稳均值线性赌博机。算法还确保每次决策的平均奖励不低于基线策略,实现了与约束感知次优间隙相关的实例相关遗憾界,并具有理论保证的约束违反次数。数值实验表明,Dri-MED 显著优于忽略漂移和偏好结构的保守基线方法。论文在线学习上下文赌博机非平稳环境推荐理由:在线推荐系统常面临用户偏好漂移和基线约束的挑战,Dri-MED 为这类问题提供了理论扎实且效果显著的解决方案,做推荐系统或在线学习的团队值得关注其算法设计。原文稍后读已读值得跟进有用关注 在线学习
10:22官方账号arXiv cs.LG@Dhruv Sarkar, Abhishek Sinha精选本文针对对抗性约束下的在线凸优化(COCO)问题,提出了一种基于投影的简单算法。对于强凸损失,该算法同时实现了 O(log T) 的遗憾和 O(log T) 的累积约束违反(CCV),相比此前最优的 O(√T log T) CCV 实现了指数级改进。对于凸损失,算法将 CCV 从 O(√T log T) 降至 O(√T),同时保持最优 O(√T) 遗憾。关键创新在于利用自收缩曲线的几何结果,该技术可能具有独立研究价值。论文在线凸优化约束优化自收缩性推荐理由:约束在线优化是机器学习中的核心问题,这篇论文用简洁的投影算法大幅降低了累积约束违反,做在线学习或凸优化理论的研究者值得关注,其自收缩性技巧可能启发更多改进。原文稍后读已读值得跟进有用关注 在线凸优化