12:15shao__meng@shao__meng72°Black Forest Labs 发布 FLUX 3,定位为真实世界模型,统一处理图像、视频、音频三种模态。模型最长生成约20秒带原生音频的视频,支持续写、关键帧、多语言对白。图像合成与编辑功能将在数周后推出,强化复杂 prompt 和文字渲染。动作预测已通过 FLUX-mimic 用于 mimic robotics 和 Audi 场景。AI模型FLUX 3Black Forest Labs多模态7 个信源在谈事件专题推荐理由:FLUX 3 把图像、视频、音频放一起训,还能预测动作。已经能生成20秒带声音的视频,图像也快上了。原文稍后读已读值得跟进有用关注 FLUX 3