AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

CaliBench

共 1 条相关 AI 资讯
8月18日
10:22
10:22官方账号arXiv cs.LG@Jonathan Sadeghi, Jenny Seidenschwarz, Jesse Allardice, Sirish Srinivasan, Benjamin Graham, Jeffrey Hawke
CaliBench 提出用物理可解释的离散空间(如骰子点数、纸牌花色、轮盘颜色)来评估视频世界模型,而不是像 FID 那样的学习特征空间。该基准覆盖九种场景和六个模型(WAN-2.7、SeeDance-2.0、HappyHorse-1.0、Veo 3.1、Runway Gen-4.5、Cosmos3-Super),每个模型生成32次。测试发现模型普遍把概率质量集中在少数结果上,而非复现参考分布;多数场景-模型组合显著失准,Veo 3.1 在骰子场景甚至坍缩到单一结果。在轮盘场景中,生成视频常让球位置含糊不清,导致多个模型的可评分性(scorability)很低。研究者将协议和指标 mnTV(平均归一化总变差)开源,供新模型对比。
论文CaliBenchVeo 3.1视频生成

推荐理由:CaliBench 新基准专测视频模型的物理随机效果靠不靠谱,六个模型里 Veo 3.1 在骰子上翻车。想对比可以参考。
原文
精选全部日报登录