Prism 开源:动态稀疏注意力实现 2K 音视频同步生成
精选理由
复旦、腾讯混元和浙大联合开源了 Prism,能生成 2K 分辨率且声音和画面同步对齐的视频,训练速度还快了 2.5 倍,做视频生成的可以去看看。
复旦大学、腾讯混元和浙江大学的研究团队发布了开源视频生成模型 Prism。该模型采用动态稀疏注意力方案,先识别发声区域和画面变化快的区域,把算力集中在声画强相关部分。这一方法把训练速度提升约 2.5 倍,同时支持 2K 分辨率下声音与画面对齐生成,画质细节也更清晰。
原文 · Gorden Sun
Prism:开源AI视频模型,高画质音视频同步生成
现在的 AI 生成视频如果想达到 2K 这种超高清分辨率,并且让声音和画面完全对齐,计算量会极其庞大,普通训练方式容易让显卡吃不消,细节也容易变模糊。
针对这个问题,复旦大学、腾讯混元和浙江大学的研究团队提出了一套名为动态稀疏注意力的技术方案。它的原理可以简单理解为抓重点。AI 不会把整个高清画面的每一处像素都平均分配算力,会先判断哪些区域在发声、哪些画面的变化更快,然后重点把算力集中在声画强相关的区域。这样既能保证声音和动作紧密契合,又能把训练速度提升约 2.5 倍,同时生成画质更好。
模型:https://t.co/51BzOuzAVa
- rohanpaul_ai10-08 03:09原文