09:52官方账号arXiv cs.AI@Osei Brempong, Mohammed Ayman Habib, Vivan Poddar, Morteza FayaziORACLE是一个基于强化学习的开源模拟电路设计优化框架,将标量奖励替换为向量化学习与偏好条件控制。它用偏好向量指定多个目标的相对权重,单个模型无需重训即可覆盖不同权衡场景。论文提出归一化权重与余弦对齐两种偏好引导策略,并加入大语言模型动作筛选。在多种电路拓扑的2000个测试用例上,ORACLE相比最先进方法运行时间降低20.4倍到104.4倍,满足99.9%的目标规格,输出品质因数提升5.1倍到318.6倍。论文ORACLE模拟电路设计强化学习推荐理由:ORACLE开源了:一个模型按偏好向量调模拟电路,不用重训;2000个用例上比现有方法快20-104倍。原文稍后读已读值得跟进有用关注 ORACLE
09:31官方账号arXiv cs.LG@Jakob Schubert, Maximilian Kasper, Maximilian Linke, Benedict Herzog, Mark Deutel, Axel Plinge, Dominik Seuss, Christopher Mutschler该研究提出一种为微控制器单元(MCU)设计深度神经网络(DNN)的方法,适用于太阳能供电等能量可能中断的间歇性设备。方法结合硬件感知能量预测模型与多目标优化(MOO),在离线设计阶段完成DNN优化,无需在目标MCU上反复部署测试。能量预测器基于DNN的算力和存储特征,估算推理、训练及间歇检查点开销的逐层能耗。在Cortex-M4 MCU上用自编码器进行异常检测验证,预测器的加权绝对百分比误差为16.6%,足以在中断约束下可靠选择架构。论文Cortex-M4MCU间歇学习推荐理由:这篇论文教你怎么在能耗不稳定的MCU上做持续学习,不用反复上机测试,Cortex-M4上误差只有16.6%。原文稍后读已读值得跟进有用关注 Cortex-M4
09:37官方账号arXiv cs.LG@Boxiao Wang, Runxiang Wang, Kai Li, Chongming Li, Zhiwei Chen, Yifan Zhang, Jian ChengMOT-SR是一种面向符号回归的多目标工具增强框架,利用外部分析工具提取结构先验,并通过动态Pareto前沿同时优化精度、复杂度和泛化性。在40个标准任务上,MOT-SR在准确率、泛化性和效率上优于现有符号回归方法。在极端质量比旋进轨道建模中,该方法发现的可解释修正项在留出配置上取得了最低的轨迹级积分误差。论文MOT-SR符号回归多目标优化推荐理由:MOT-SR把工具和大模型结合起来找方程,40个任务上又快又准,还能处理引力波轨道建模,挺实用。原文稍后读已读值得跟进有用关注 MOT-SR
10:27官方账号arXiv cs.AI@Danial Ramezani, Mostafa Abouei Ardakan本文提出增强策略用于多目标进化算法(MOEA),解决基数约束下的NP-hard大规模投资组合优化问题。新方法包括独特解表示、新算子及修复机制,设定资产数量的上下限。在标准市场指数基准上测试,定制算法相比传统MOEA不仅提供更优近似解,且收敛更快,随资产数量增加性能不降。论文投资组合优化进化算法基数约束推荐理由:这篇论文给投资组合优化问题搞了一套新的进化算法方案,收敛快结果好,做量化研究的可以看看。原文稍后读已读值得跟进有用关注 投资组合优化
11:12官方账号arXiv cs.AI@Pengxin Wang, Lihao Guo, Yi Xie, Bo Liu, Siyang Cao, Jingdi Chen本研究提出了偏好协调多智能体策略优化(PCMA),用于解决合作多目标多智能体强化学习中的冲突问题。PCMA为每个智能体学习协调的个性化偏好,使智能体在多个目标(如效率与公平)之间形成互补性权衡。理论证明,在一定条件下,偏好多样性可通过一阶改进分解推动团队整体提升。在多个合作多目标环境及实际交通控制场景中,PCMA同时提升了任务性能和权衡协调能力。论文PCMA多智能体强化学习多目标优化推荐理由:让多智能体学会互相配合完成多目标任务原文稍后读已读值得跟进有用关注 PCMA
11:07官方账号arXiv cs.AI@Duc-Cuong Dang, Andre Opris, Dirk Sudholt本文首次对 SPEA2 算法中处理支配解的部分进行了运行时分析,发现其在 OneTrapZeroTrap 基准上无法像 NSGA-II 等算法一样高效覆盖帕累托前沿。问题根源在于使用 k 近邻距离进行适应度分配,导致对支配个体的多样性维持不足。为此,作者提出改进版本 SPEA2$^+$,采用所有成对距离进行密度估计,在复杂问题上达到与其他主流算法相同的性能保证,同时在简单问题上保持原算法表现。实验验证了理论分析的正确性。论文多目标优化进化算法SPEA2推荐理由:多目标优化研究者终于有了 SPEA2 的理论短板分析——原版在支配解处理上存在盲区,SPEA2$^+$ 的改进思路(全距离密度估计)简单有效,做进化算法理论或应用的团队值得关注。原文稍后读已读值得跟进有用关注 多目标优化
11:36官方账号arXiv cs.LG@Grégoire Dhimoïla, Victor Boutin, Agustin Martin Picard, Thomas Fel, Thomas Serre精选本文提出一个统一框架,将概念对齐分解为“对齐什么”(表征 vs 概念)和“对齐层级”(实例级 vs 分布级)两个维度,从而定义四种属性。作者发现现有方法常混淆这些属性,优化一个目标并不能可靠恢复其他目标。他们引入 InterVenchA 基准来独立测量提取质量、翻译质量和概念一致性。最后提出 CoSAE(耦合稀疏自编码器),联合强制执行互补的对齐目标,仅需 0.1% 配对数据即可在分布目标锚定下恢复实例级对齐。这项工作表明概念对齐本质上是多目标优化问题,需要明确定义、测量和优化。论文表征对齐概念分解稀疏自编码器推荐理由:做表征对齐、多模态学习或可解释性研究的团队,这篇论文把概念对齐的混乱局面理清了——CoSAE 用极少量配对数据就能实现强对齐,值得直接复现试试。原文稍后读已读值得跟进有用关注 表征对齐
11:48官方账号arXiv cs.AI@Parth Darshan, Abhishek Divekar精选该论文研究了在多评估标准下同时优化LLM裁判提示时出现的失败模式。由于文本梯度方法产生自然语言评论而非数值向量,多任务学习中的冲突解决工具(如PCGrad、MGDA)无法直接应用。实验测试了五种文本梯度优化器的分解模式,发现在10种配置中有6种优化效果未超过初始提示。当梯度LLM联合处理多个标准时,梯度特异性下降59%(从9.0降至3.7)。此外,简单合并各任务指令会导致斯皮尔曼相关系数下降5.3%。研究识别出两种可分离的失败模式:优化时的梯度稀释和推理时的指令干扰,这限制了多目标裁判定制的设计空间。论文LLM裁判多目标优化文本梯度推荐理由:做LLM评估或裁判定制的团队,这篇论文点出了多目标优化时容易踩的坑——梯度稀释和指令干扰,看完能帮你避开无效的提示优化策略。原文稍后读已读值得跟进有用关注 LLM裁判
22:16AK@_akhaliqMARBLE(Multi-Aspect Reward Balance for Diffusion RL)提出了一种新方法,旨在解决扩散模型强化学习中多个奖励信号之间的平衡问题。通过动态调整不同奖励方面的权重,该方法能在图像生成等任务中同时优化多个目标,如质量和多样性。论文展示了在多个基准测试上的改进效果,表明该方法能有效提升生成质量并减少模式崩溃。这对扩散模型的微调和可控生成具有实际意义。论文扩散模型强化学习多目标优化推荐理由:该方法直接回应了扩散模型RL中多目标优化的核心挑战,为提升生成质量和多样性提供了一种实用平衡策略。原文稍后读已读值得跟进有用关注 扩散模型