10:40官方账号arXiv cs.AI@Wenqi Pei, Henry Hengyuan Zhao, Yilai Liu, Jiahao Meng, Han Chen, Ziyu Wang, Hongyang Du研究团队推出TempCloze基准测试,包含1521个视频片段,评估Video-LLMs的时间推理能力。测试要求模型从四个选项中识别出视频中间缺失的部分。研究发现Alignment维度是主要瓶颈,模型能识别语义内容和事件进展,但难以把握时间对齐。研究团队对10个专有和21个开源Video-LLMs进行了评估。论文Video-LLMsTempCloze时间推理推荐理由:新基准测试揭示视频大模型在时间对齐上的短板,比语义理解更弱。原文稍后读已读值得跟进有用关注 Video-LLMs