8月31日
09:08
09:08官方账号arXiv cs.LG@Federico Spurio, Olga Zatsarynna, Lars Doorenbos, Emad Bahrami, Gianpiero Francesca, Juergen Gall
精选73°
研究人员提出MD-VQA协议和基准,用于检测视频中执行步骤的错误。该方法使用定制奖励函数,鼓励模型识别指令与视频之间的差异。在EP-VQA基准上,该方法比最佳基线模型提升11.6%,特别适用于未见过的程序。
推荐理由:FedeSpu团队发布了首个视频语言模型后训练技术,能检测视频中的执行错误,对未见任务效果提升11.6%。