15:05IT之家(博客/媒体)79°谷歌 DeepMind 发布 GenCeption,基于阿里巴巴开源视频模型 Wan2.1 训练。该模型将预训练视频生成器逆向改造,可同时完成深度估计、图像分割、3D 姿态估计等任务。与传统扩散模型需多步去噪不同,GenCeption 一次前向传播完成预测,小模型处理81帧视频约需6秒,14B大模型约需10秒。训练仅用7500段合成视频,但可泛化到真实多人视频及动物、类人机器人。输出细节可保留猫胡须和单根发丝边缘,部分结果甚至优于训练数据渲染质量。AI模型GenCeptionWan2.1DeepMind推荐理由:谷歌 DeepMind 用阿里 Wan2.1 搞了个逆天改造,一个模型能同时搞深度估计、分割、姿态估计,速度还快,搞 CV 和生成模型的值得一看。原文稍后读已读值得跟进有用关注 GenCeption