论文10:14LEMUR:用偏好反馈实现多目标强化学习对齐这是篇新论文,LEMUR能直接从多人偏好学多目标策略,不用设奖励函数,基准上比现有方法强。#LEMUR#多目标强化学习#偏好反馈#强化学习aarXiv cs.AI@Manith Adikari 等 4 人原文稍后读已读值得跟进有用关注 LEMUR
论文23:56LEMUR 多向量压缩策略在长尾语料上存在长度偏差问题做向量检索的团队注意了——LEMUR 在长尾语料上会悄悄按文档长度排序而非相关性,LoTTE 上召回率从 98% 掉到 30.5%。如果你的语料长度差异大(P90/P10 > 20),建议先跑文中的两个检查再决定是否用 LEMUR。#向量检索#多向量压缩#长度偏差#LEMURMilvus@milvusio原文稍后读已读值得跟进有用关注 向量检索