09:23官方账号arXiv cs.LG@Taiye Chen, Qi Zhang, Yisen Wang视频扩散世界模型在自动驾驶、机器人等任务中生成长视频时,滑动窗口自回归推理会导致误差累积,使帧质量随时间下降。研究发现,复合误差与隐藏表示的维度塌缩紧密相关,有效秩在生成漂移开始时急剧下降。单纯扩大训练数据无法提升模型抗误差漂移能力。提出视频表示正则化,通过轻量训练约束稳定潜在表示,抑制迭代误差累积。相比Diffusion Forcing方法,在VBench的美学质量指标上从38.65提升至55.56,成像质量从44.37提升至72.08。论文Video World ModelsDiffusion ForcingVBench推荐理由:这篇论文揭示了视频世界模型长视频生成不稳定的根本原因——表示维度塌缩,并提出了一个简单有效的正则化方法,在VBench上大幅超过Diffusion Forcing。原文稍后读已读值得跟进有用关注 Video World Models