10:22官方账号arXiv cs.LG@Jonathan Sadeghi, Jenny Seidenschwarz, Jesse Allardice, Sirish Srinivasan, Benjamin Graham, Jeffrey HawkeCaliBench 提出用物理可解释的离散空间(如骰子点数、纸牌花色、轮盘颜色)来评估视频世界模型,而不是像 FID 那样的学习特征空间。该基准覆盖九种场景和六个模型(WAN-2.7、SeeDance-2.0、HappyHorse-1.0、Veo 3.1、Runway Gen-4.5、Cosmos3-Super),每个模型生成32次。测试发现模型普遍把概率质量集中在少数结果上,而非复现参考分布;多数场景-模型组合显著失准,Veo 3.1 在骰子场景甚至坍缩到单一结果。在轮盘场景中,生成视频常让球位置含糊不清,导致多个模型的可评分性(scorability)很低。研究者将协议和指标 mnTV(平均归一化总变差)开源,供新模型对比。论文CaliBenchVeo 3.1视频生成推荐理由:CaliBench 新基准专测视频模型的物理随机效果靠不靠谱,六个模型里 Veo 3.1 在骰子上翻车。想对比可以参考。原文稍后读已读值得跟进有用关注 CaliBench