7月3日
6月19日
10:16
10:16官方账号arXiv cs.AI@Yuhan Liu, Pei Fu, Hang Li, Yukun Qi, Chao Jiang, Jingwen Fu, Zhen Liu, Bin Qin, Zhenbo Luo, Jian Luan, Jingmin Xin
ELVA提出一种基于规则强化学习(RLVR)的框架,解决对比学习在多模态检索中的“粒度盲视”问题——模型忽略查询中的粒度信息。该方法不依赖奖励模型,通过规则奖励联合优化负样本排序并扩大正负样本相似度差距。为精准评估,作者引入新基准MRBench,专用于多粒度查询场景。ELVA在标准检索基准上达到最先进结果,并在MRBench上实现13.1%的提升。
推荐理由:这篇论文提出了ELVA,用强化学习思路改多模态检索,解决了对比学习忽略粒度的问题,还在新基准MRBench上提了13.1%,值得做检索方向的人看看。
6月2日
10:21
10:21Qdrant@qdrant_engine
Twelve Labs 的 James Le 将在 Vector Space Day 上展示如何正确构建多模态检索,从体育和音频的语义搜索到处理目标跟踪和高光生成的智能体工作流。视频是信息密度最高的模态,但大多数检索管道仍将其视为带图片的文本。该演讲将展示向量搜索的前沿方向,适合对多模态检索和智能体工作流感兴趣的开发者。

推荐理由:多模态检索是当前向量搜索的关键突破点,做视频理解、智能体或搜索系统的团队值得关注这场演讲,看看 Twelve Labs 如何将视频从“带图片的文本”变成真正的语义搜索对象。