8月31日
09:08
09:08官方账号arXiv cs.LG@Federico Spurio, Olga Zatsarynna, Lars Doorenbos, Emad Bahrami, Gianpiero Francesca, Juergen Gall
精选73°
研究人员提出MD-VQA协议和基准,用于检测视频中执行步骤的错误。该方法使用定制奖励函数,鼓励模型识别指令与视频之间的差异。在EP-VQA基准上,该方法比最佳基线模型提升11.6%,特别适用于未见过的程序。
推荐理由:FedeSpu团队发布了首个视频语言模型后训练技术,能检测视频中的执行错误,对未见任务效果提升11.6%。
8月7日
12:09
12:09官方账号arXiv cs.AI@Sarvesh Baskar, Zikui Cai, Shayan Shabihi, Anirudh Satheesh, Muhammad R. Islam, Udari Madhushani Sehwag, Tom Goldstein, Furong Huang
新论文提出trace-grounded参数化测试方法,在2,190个视频上审计事件计数能力。Gemini 3.6 Flash在80%可靠性阈值下最多可靠计数12个持续状态转换事件(0.5和1.0 Hz),对瞬时闪烁事件则无可靠计数区间。高计数高频率场景下仅0.2%的最终计数正确,模型只能恢复18.1%的真实事件。提高采样率将Bounce Ball准确率从19.6%提升至29.3%,但报告序列与真值一致率仅3.7%。
事件专题

推荐理由:用可执行真值逐帧审计视频模型计数,发现Gemini 3.6 Flash处理瞬时事件几乎失效,加帧只虚涨分数,值得看。