8月28日
17:22
17:22官方账号arXiv cs.AI@Yuandong Pu, Le Zhuo, Sayak Paul, Gabriel Jorge Menezes, Avram Đorđević, Shiyang Li, Yifan Zhou, Bin Fu, Wenlong Zhang, Junjun He, Yu Qiao, Yihao Liu, Jingbo Xing, Xi Chen
精选73°
PAWBench基准测试评估了11个当前视频生成系统在50个场景下的表现。研究发现,没有模型能够同时匹配参考概率并恢复有效行为范围。该研究引入了概率对齐概念,将世界模型定义为可能行为的分布采样器。PAWEval协议将重复视频展开转换为可能物理行为的经验分布。
推荐理由:PAWBench首次系统评估视频生成模型作为世界模型的概率对齐能力,揭示了当前模型与理想状态间的差距。