09:08官方账号arXiv cs.LG@Federico Spurio, Olga Zatsarynna, Lars Doorenbos, Emad Bahrami, Gianpiero Francesca, Juergen Gall精选73°研究人员提出MD-VQA协议和基准,用于检测视频中执行步骤的错误。该方法使用定制奖励函数,鼓励模型识别指令与视频之间的差异。在EP-VQA基准上,该方法比最佳基线模型提升11.6%,特别适用于未见过的程序。论文MD-VQA视频语言模型错误检测推荐理由:FedeSpu团队发布了首个视频语言模型后训练技术,能检测视频中的执行错误,对未见任务效果提升11.6%。原文稍后读已读值得跟进有用关注 MD-VQA
12:09官方账号arXiv cs.AI@Sarvesh Baskar, Zikui Cai, Shayan Shabihi, Anirudh Satheesh, Muhammad R. Islam, Udari Madhushani Sehwag, Tom Goldstein, Furong Huang新论文提出trace-grounded参数化测试方法,在2,190个视频上审计事件计数能力。Gemini 3.6 Flash在80%可靠性阈值下最多可靠计数12个持续状态转换事件(0.5和1.0 Hz),对瞬时闪烁事件则无可靠计数区间。高计数高频率场景下仅0.2%的最终计数正确,模型只能恢复18.1%的真实事件。提高采样率将Bounce Ball准确率从19.6%提升至29.3%,但报告序列与真值一致率仅3.7%。论文Gemini 3.6 Flash视频语言模型事件计数1 个信源在谈事件专题推荐理由:用可执行真值逐帧审计视频模型计数,发现Gemini 3.6 Flash处理瞬时事件几乎失效,加帧只虚涨分数,值得看。原文稍后读已读值得跟进有用关注 Gemini 3.6 Flash
12:17官方账号arXiv cs.AI@Seung Hyun Hahm, Minh T. Dinh, SouYoung JinStoryTeller 是一种无需训练的框架,用于长格式音频描述(AD),可保留角色、事件和故事上下文。它维护经过验证的叙事记忆,跨场景传递故事相关信息,无需字幕、脚本或微调。在标准 AD 基准和多种长视频上,StoryTeller 在自动评估、QA 评估和人工评估中一致提升了叙事连贯性和事实准确性。作者还引入了 StoryAD-QA 基准来测试生成描述的故事理解能力。论文StoryTeller长格式音频描述叙事接地推荐理由:这个框架不用训练就能让AI给长视频生成连贯的旁白,特别适合帮助视障观众理解剧情。原文稍后读已读值得跟进有用关注 StoryTeller