10:14官方账号arXiv cs.AI@Manith Adikari, Bei Peng, Samuele Vinanzi, Angelo CangelosiLEMUR是一个新框架,让智能体从多个人的偏好反馈中学习多目标策略,无需预先定义奖励函数。它同时学习策略和多个目标专属的奖励模型,在训练中平衡竞争目标。在多种多目标任务基准上,LEMUR的表现优于现有基线方法。这项研究为无预设奖励的多目标决策任务提供了新方向。论文LEMUR多目标强化学习偏好反馈推荐理由:这是篇新论文,LEMUR能直接从多人偏好学多目标策略,不用设奖励函数,基准上比现有方法强。原文稍后读已读值得跟进有用关注 LEMUR
23:56Milvus@milvusioLEMUR 是一种将多向量压缩为单向量的策略,声称无需调参、数据驱动。但研究发现,在文档长度差异大的语料(如 LoTTE,长度范围 400 倍)上,LEMUR 会学习到“长文档得分更高”的偏差,导致按长度而非相关性排序。在 LoTTE 上,LEMUR 的 nDCG@10 仅 0.109,召回率 30.5%,而 Exact MaxSim 方法达 0.722 和 98%。问题根源在于 LEMUR 的训练标签(MaxSim 分数)天然偏向长文档,MLP 学到了长度信号。建议用户检查语料的长度分布(P90/P10 比)和模型的可分离性(MaxSim 标准差),若长度差异大或可分离性高,应改用 TokenANN 或 MUVERA。已使用 LEMUR 的团队可通过长度分层采样缓解偏差。论文向量检索多向量压缩长度偏差推荐理由:做向量检索的团队注意了——LEMUR 在长尾语料上会悄悄按文档长度排序而非相关性,LoTTE 上召回率从 98% 掉到 30.5%。如果你的语料长度差异大(P90/P10 > 20),建议先跑文中的两个检查再决定是否用 LEMUR。原文稍后读已读值得跟进有用关注 向量检索