11:29官方账号arXiv cs.AI@Wen Ye, Yuxiao Qu, Aviral Kumar, Xuezhe Ma论文发现视觉语言模型在几何推理中,对文本、图像和图文组合三种视图的推理结果不一致。为此构建了ODA-Data多视图几何数据集,并提出了MIRROR强化学习方法。MIRROR通过评估模型在各视图下的表现,选择最佳视图作为教师,用反向KL散度训练其他视图。在多个几何推理基准上,MIRROR比标准RL提高了准确性和模态间一致性。论文MIRRORVLM多模态推理推荐理由:这篇论文提出了MIRROR方法,让视觉语言模型通过不同视角互相学习,在几何推理中表现更稳定、更准确。原文稍后读已读值得跟进有用关注 MIRROR