11:44官方账号arXiv cs.AI@Yafei Zhang, Nan Wu73°AcrossVAM1.0是一个轻量级文本辅助视频动作模型,将未来预测分解为物体中心运动和密集外观。该模型使用0.28M参数的时空Transformer,通过冻结的OpenCLIP指令嵌入进行调制。在VRS基准测试上,粒子动力学将轨迹误差降低21.0%,未来帧PSNR/SSIM从19.97/0.796提升至20.573/0.8004,运动区域PSNR从11.89提升至13.23。论文AcrossVAM1.0机器人视频预测粒子动力学推荐理由:AcrossVAM1.0通过粒子动力学显著提升机器人视频预测精度,但语言引导和外观传递仍是主要挑战。原文稍后读已读值得跟进有用关注 AcrossVAM1.0