11:45官方账号arXiv cs.AI@Diandian Zhang, Tingyu Song, Lin Fu, Zheyuan Yang, Yilun ZhaoSci-VBench 是一个评估科学领域视频生成的新基准,包含 1,253 个专家标注示例,覆盖 60 个主题和四个学科。该基准要求模型生成具有科学推理和知识基础的视频,而非仅表面视觉合理性。研究显示,非专家评估者和 MLLM-as-Judge 系统与专家判断有较高一致性。对 16 个模型的测试发现,自动感知质量分数相近,但提示接地和科学因果正确性差异显著,且专有模型与开源模型差距明显。这表明视觉真实性的进步尚未转化为对科学和因果动态的可靠建模。论文Sci-VBench视频生成科学推理推荐理由:想知道视频生成模型在科学推理上有多靠谱?这个新基准测了 16 个模型,发现视觉好看不等于科学正确,专有和开源差距不小。原文稍后读已读值得跟进有用关注 Sci-VBench