精选理由
Black Forest Labs的FLUX 3把图像、视频、音频和机器人动作预测塞进一个模型,已经跟真实机器人合作跑起来了。
Black Forest Labs推出FLUX 3,这是一个统一的多模态backbone,同时支持图像生成、视频、原生音频和机器人动作预测。目前视频功能已开放early access,未来将开放模型权重。该模型已与mimic、Audi合作,在真实机器人上运行测试。团队提出物理世界智能与内容创作可共享同一套视觉基础模型。
原文 · berryxia
好久没有看到Flux家更新模型了啊~ FLUX 3把图像、视频、音频和机器人动作预测塞进了同一个模…
好久没有看到Flux家更新模型了啊~
FLUX 3把图像、视频、音频和机器人动作预测塞进了同一个模型。
Black Forest Labs这次直接上统一架构,一个多模态backbone同时处理图像生成、视频、原生音频,甚至能扩展到机器人动作预测。
目前视频已经开放early access,后续还会开放权重,并已经和mimic、Audi合作在真实机器人上跑起来了。
这不是简单的“多加几个模态”,是他们明确提出:物理世界的智能和内容创作,本质上可以跑在同一套视觉基础模型上。
生成一段真实的视频,和预测机器人该怎么动手,共享的是同一套对世界的理解。 https://t.co/W9HMNIMvLV