7月28日
11:00
11:00官方账号arXiv cs.AI@Wendi Deng, Hang Du, Guoshun Nan, Haokun Tian, Jiaqi Yu, Xinlei Cao, Jaile Li, Jingfeng Chen, Ling Deng, Ting Li, Hao Yang, Jun Liu, Xudong Jiang, Sicong Leng
多模态大语言模型在推理任务中常出现中间步骤有缺陷但最终答案正确的问题,影响可解释性。论文提出O^2-CritiCuRL框架,在离线阶段通过多轮次分析步骤标注轨迹估计步骤重要性,提取关键推理步骤;在线阶段采用逐步强化学习策略,用截断链引导模型推理缺失步骤。在多个多模态推理基准上达到SOTA,同时训练和推理效率更高。代码已开源。
推荐理由:这篇论文提出了一种新方法,能解决多模态模型推理时中间步骤乱但结果对的问题,效果SOTA还更高效,做推理增强的可以看看。