7月21日
12:09
12:09官方账号arXiv cs.LG@Sheng-Yu Wang, Yotam Nitzan, Aaron Hertzmann, Jun-Yan Zhu, Eli Shechtman, Alexei A. Efros, Richard Zhang
本文提出TPIPS,一种基于文本提示的图像感知相似度度量,能根据文本条件区分形状、颜色等不同视觉相似性维度。研究基于大规模三元组数据集,包含多种自由形式语义相似性标注。在多个前沿视觉语言模型(VLM)基准测试中,模型与人类一致性差距显著。通过微调VLM,TPIPS在文本引导检索、组合搜索和生成模型细粒度评估中表现更优,且泛化良好。
推荐理由:这篇论文搞了个新度量TPIPS,能按文字指令判断两张图在哪个方面像,比现有单标量打分更细。数据集和模型都开源了。