10:49官方账号arXiv cs.LG@Xindi Wu, Sven Elflein, James Lucas, Olga Russakovsky, Laura Leal-Taixé, Despoina Paschalidou, Jonathan Lorraine, Aljoša Ošep交互式视频世界模型依赖键值缓存作为视觉记忆,但生成超过训练长度后,时间旋转位置编码偏移超出训练范围,模型无法通过注意力可靠寻址已存储内容。论文提出WorldTrace,一种无需训练的长期视觉持久化记忆框架,通过为每个摘要槽分配分布内的虚拟位置保持可寻址性。WorldTrace-Field压缩历史以提升时序一致性,WorldTrace-Landmark在场景转换处存储逐字轨迹用于情节回忆。在LoopBench基准上,WorldTrace-Field将时序一致性提升15.5%,WorldTrace-Landmark将情节回忆提升19.5%。论文WorldTraceLoopBench世界模型推荐理由:看这个,论文解决了视频生成模型长视频记忆丢失的问题,不重新训练就能把一致性拉高15个点,做视频生成的人应该关心。原文稍后读已读值得跟进有用关注 WorldTrace