18:12官方账号arXiv cs.LG@Nikita Sevriukov, Anna Barabanova, Uliana Gagarina, Karina Ivanova, Sofiia Kasaeva, Ilya Levin, Marina Sheshukova逆强化学习(IRL)旨在从专家演示中恢复奖励函数,通常被建模为双层优化问题,内层为策略优化,外层衡量策略与专家数据的差异。然而,外层更新需要计算涉及内层目标逆Hessian向量积的超梯度,计算成本高昂。本文证明在内层最优处,内层目标的Hessian与策略的Fisher信息矩阵成正比,从而提出基于Fisher的超梯度,与自然超梯度下降紧密相关。为应对大规模Fisher矩阵的瓶颈,作者使用流式谱草图近似逆Fisher向量积,避免显式构造Fisher矩阵。在离散和连续控制环境中,该方法相比一阶随机双层基线,实现了有竞争力的策略性能和奖励排序质量,同时降低了曲率存储复杂度并提升了计算效率。论文逆强化学习超梯度Fisher信息矩阵推荐理由:这篇论文给IRL的超梯度计算找了个巧妙的捷径,用Fisher矩阵和谱草图省下大量算力,做强化学习的朋友可以看看。原文稍后读已读值得跟进有用关注 逆强化学习
10:51官方账号arXiv cs.LG@Ruochen Jin, Zhanliang Wang, Zongyu Dai, Jiancong Xiao, Bojian Hou精选论文提出用双层优化改进LLM校准,主目标最大化预测分布熵以抑制过度自信。该方法借鉴温度缩放,在低层用参数化损失训练模型,在高层选择损失超参数。为适配大模型规模,采用一阶近似避免二阶计算。在多项选择和开放生成式问答实验中,该方法在分布外泛化上表现尤其突出。论文LLM校准温度缩放双层优化推荐理由:这篇arxiv论文提出用双层优化做LLM校准,不靠事后温度缩放,在开放问答上分布外泛化更稳。原文稍后读已读值得跟进有用关注 LLM校准
10:56官方账号arXiv cs.AI@Kezhao Lai, Yutao Lai, Hai-Lin LiuSpecAHD提出了一种耦合双层优化框架,用于在单个问题实例内部实现启发式规则的区域特化。上层搜索学习暴露有界修复区域的位置,下层进化互补的可执行启发式程序池。在四个大规模路由问题(CVRP、VRPTW、PDP等)上,SpecAHD相比最强AHD基线将目标成本降低了最高57.7%,并且在大多数公开实例上超越了每实例基线包络线。该框架具有子模性,提供了(1-1/e)的贪婪选择近似保证。论文SpecAHD自动启发式设计路由问题推荐理由:这篇论文用双层优化让LLM自动写出针对不同区域的启发式规则,在多个大规模路由问题上比现有方法好57%,还有理论保证,值得一看。原文稍后读已读值得跟进有用关注 SpecAHD
10:51官方账号arXiv cs.LG@Mathieu Dagréou, Aurélien Bellet精选该论文研究了机器学习模型隐私审计中的金丝雀(canary)生成问题,旨在通过单次训练运行高效评估隐私泄露。作者提出一种结合影响函数贪婪初始化与双层优化的方法,生成既高可检测又低干扰的金丝雀,通过促进嵌入空间多样性减少金丝雀间干扰。实验表明,该方法在更低计算成本下获得比现有方法更强的隐私泄露估计,为差分隐私审计提供了实用改进。论文隐私审计差分隐私金丝雀生成推荐理由:做隐私审计或差分隐私研究的团队,这篇论文直接解决了单次运行审计中金丝雀干扰的痛点,提出的方法计算效率高且效果更好,值得点开看具体实现。原文稍后读已读值得跟进有用关注 隐私审计
11:35官方账号arXiv cs.LG@Javad Parsa, Enis Simsar, Amir Joudaki, Thomas Hofmann, André M. H. Teixeira精选SeqLoRA 是一种针对文本到图像扩散模型的高效微调方法,解决了多概念组合生成中的表示干扰问题。现有模块化方法要么依赖昂贵的后处理融合,要么冻结适配子空间,限制了表达力和概念保真度。SeqLoRA 通过双层优化联合优化两个 LoRA 因子,并建立强收敛保证,从理论上证明学习 LoRA 基比固定基方法更有效减少干扰。实验显示,SeqLoRA 在多达 101 个概念上提升了身份保持和可扩展性,无需昂贵融合,减少了属性干扰。论文LoRA多概念生成扩散模型推荐理由:做多概念图像生成的团队终于有了一个兼顾保真度和可扩展性的方案——SeqLoRA 用双层优化解决了 LoRA 的干扰问题,支持上百个概念组合,做个性化扩散模型的开发者值得一试。原文稍后读已读值得跟进有用关注 LoRA
11:44官方账号arXiv cs.LG(学术论文)本文研究一类上下层均为极小极大结构的双层优化问题,提出了基于罚函数的一阶方法,无需下层问题满足强凸性假设。在确定性环境下,该方法以Õ(ε⁻⁴)的复杂度找到ε-KKT点;对于凸约束下层最小化问题(通过拉格朗日对偶转化),复杂度从现有Õ(ε⁻⁷)提升至Õ(ε⁻⁴)。在随机梯度场景下,方法以Õ(ε⁻⁹)的复杂度找到近似ε-KKT点。这一工作填补了双层优化与极小极大优化交叉领域的空白,为对抗训练、元学习等应用提供更高效的理论工具。论文双层优化极小极大罚函数方法推荐理由:该工作从理论上攻克了下层为极小极大结构这一长期难点,提出的罚函数框架简洁优雅,且对凸约束问题实现了复杂度数量级改进,将推动智能体对抗训练、多任务学习等领域的实际算法设计。原文稍后读已读值得跟进有用关注 双层优化