FLUX 3 发布:Black Forest Labs 推出真实世界模型

FLUX 3 发布了! Black Forest Labs 对它的定位,不再是又一个「文生视频模型」或「文生图模型」,是「真实世界模型」! 团队把 图像 / 视频 / 音频 放进同一套 multi...

精选理由

FLUX 3 把图像、视频、音频放一起训,还能预测动作。已经能生成20秒带声音的视频,图像也快上了。

AI 摘要

Black Forest Labs 发布 FLUX 3,定位为真实世界模型,统一处理图像、视频、音频三种模态。模型最长生成约20秒带原生音频的视频,支持续写、关键帧、多语言对白。图像合成与编辑功能将在数周后推出,强化复杂 prompt 和文字渲染。动作预测已通过 FLUX-mimic 用于 mimic robotics 和 Audi 场景。

图片来源 · shao__meng
原文 · shao__meng

FLUX 3 发布了! Black Forest Labs 对它的定位,不再是又一个「文生视频模型」或「文生图模型」,是「真实世界模型」! 团队把 图像 / 视频 / 音频 放进同一套 multi...

FLUX 3 发布了! Black Forest Labs 对它的定位,不再是又一个「文生视频模型」或「文生图模型」,是「真实世界模型」! 团队把 图像 / 视频 / 音频 放进同一套 multimodal flow 架构里,试图学「世界如何运作」,再把同一底座同时接到 内容生成 和 具身/动作预测。 为什么要「多模态一起学」? · 图像:提供某一时刻的空间结构与关系 · 视频:提供时间、动力学、物理规律 · 音频:提供机械现象与声学之间的因果线索 · 语言:提供目标、抽象、指令 各模态都是同一现实的「投影」,单独训只能拟合投影;一起训时,模态之间的互约束(声音必须对得上撞击、运动必须符合质量、未来必须接续过去)才更接近「世界表征」。 能力拆解:同一模型,三条产品线 1. Video(已 Early Access):最长约 20 秒、原生音频;文/图/视频参考、续写、关键帧、多语言对白;可链式拼更长片。 2. Image(随后数周):合成 + 编辑;复杂 prompt、多语文字、风格与分辨率更强(仍在 midtraining 迭代)。 3. Action(伙伴通道):原生动作预测,或把视频骨干当动力学底座微调;已有 FLUX-mimic(mimic robotics / Audi 场景)。 Your browser does not support the video tag. 🔗 View on Twitter 💬 0 🔄 0 ❤️ 0 👀 122 ⚡

FLUX 3 发布:Black Forest Labs 推出真实世界模型 · AI 热点