11:01官方账号arXiv cs.LG@Moïse Blanchard, Dmitrii Ostrovskii, Aadirupa Saha精选该论文研究在线PCA的bandit反馈版本(Bandit PCA),每一轮t=1,...,T中,对手选择秩至多为r的d×d对称增益矩阵G_t,学习者选择单位向量w_t并接收奖励w_t^T G_t w_t。Kotlowski和Neu(2019)给出遗憾上界O(d√(rT log T))和下界Ω(r√(T/log T))。本文将上界改进至O(r√(dT))(忽略d和T的对数因子),下界提升至Ω(r√(dT)),从而确定了该问题的极小极大最优遗憾。上界算法结合了在密度矩阵谱面上的在线镜像下降与多尺度探索方案。AI模型Bandit PCA在线PCA遗憾分析推荐理由:这篇论文把Bandit PCA的遗憾上界从O(d√(rT log T))降到O(r√(dT)),下界也提到Ω(r√(dT)),彻底解决了这个优化问题的理论最优性。原文稍后读已读值得跟进有用关注 Bandit PCA
09:22官方账号arXiv cs.AI@Alexandre Belloni, Yan Chen, Yehua Wei该论文提出了一种在线上下文潘多拉魔盒模型,用于自适应查询和选择LLM API。决策者在每个周期观察请求上下文,面临两阶段决策:查询阶段顺序调用API并产生输出相关成本,选择阶段从生成的输出中选一个部署并观察下游奖励。与经典模型不同,该模型输出反馈结构不直接揭示奖励。研究者直接建模保留索引,结合广义矩估计和UCB置信界,实现了维度相关的√T累积遗憾。论文LLM API自适应查询潘多拉魔盒模型推荐理由:LLM API调用成本高、选择困难,这篇论文为开发者提供了理论驱动的自适应查询策略,做模型编排或API调度的团队可以直接参考其方法优化成本与效果。原文稍后读已读值得跟进有用关注 LLM API
10:22官方账号arXiv cs.LG@Dhruv Sarkar, Abhishek Sinha精选本文针对对抗性约束下的在线凸优化(COCO)问题,提出了一种基于投影的简单算法。对于强凸损失,该算法同时实现了 O(log T) 的遗憾和 O(log T) 的累积约束违反(CCV),相比此前最优的 O(√T log T) CCV 实现了指数级改进。对于凸损失,算法将 CCV 从 O(√T log T) 降至 O(√T),同时保持最优 O(√T) 遗憾。关键创新在于利用自收缩曲线的几何结果,该技术可能具有独立研究价值。论文在线凸优化约束优化自收缩性推荐理由:约束在线优化是机器学习中的核心问题,这篇论文用简洁的投影算法大幅降低了累积约束违反,做在线学习或凸优化理论的研究者值得关注,其自收缩性技巧可能启发更多改进。原文稍后读已读值得跟进有用关注 在线凸优化