李飞飞团队推出Atlas,能精确控制镜头生成视频和3D重建,比开源模型更强。
World Labs发布了全球首个多模态世界模型Atlas,支持像素级精确的相机控制。Atlas能从一张或多张输入图像生成最长1分钟的1440p视频,并重建真实场景。该模型在空间重建任务上优于顶级开源重建模型,支持文本生成图像和360度全景。
全球首个多模态世界模型:李飞飞创办的 World Labs 发布 Atlas,支持以像素级精度控制镜头
IT之家 9 月 2 日消息,“AI 教母”李飞飞的创企 World Labs 今日发布了“ 全球首个多模态世界模型 ”—— Atlas,宣称该模型能够以像素级精确的相机控制生成图像和视频帧,并将其在 3D 中重建。 World Labs 官方介绍,其从头开始对 Atlas 进行预训练,使其能够接受多模态输入,包括相机移动,并将其转化为 3D 视图。 通过在模型的空间上下文中定位多个输入视图,Atlas 允许用户生成具有精确控制的图像和视频帧。 Atlas 还能从一张到多张输入图像输出明确的 3D 模型,超越了顶级开源重建模型。 Atlas 会根据你指定的任意摄像机位置和角度生成一个或多个参考图像 。生成的视图与输入图像的内容和几何形状相匹配,能够平滑地扩展图像,自主想象输入中看不到的场景部分。 具体来看,Atlas 能够执行涵盖世界生成、重建和模拟的广泛任务: 相机控制生成:Atlas 通过像素精确的相机控制从一张或多张图像生成图像和视频, 输出最长 1 分钟的 1440p 视频 。 空间重建:Atlas 能够重建从一张到数十张输入图像的真实场景。它既能从新颖视角生成图像帧,也能生成显式三维输出,优于专门用于三维重建的先进模型。 时空模拟:Atlas 通过输入视频建模空间和时间,重新构图视频以增强戏剧性视觉效果,并支持机器人的真实到模拟工作流程。 图像生成:Atlas 支持从文本生成图像和 360 度全景,它可以跟随复杂的提示,渲染文本,并生成各种视觉风格。 World Labs 官方表示,部分合作伙伴已获得 Atlas 抢先体验资格,将在未来几周内开放早期访问。 IT之家附 Atlas 官方演示地址: https://www.worldlabs.ai/blog/atlas