事件专题 · 多源确认

Black Forest Labs发布Flux 3:生成最长20秒带原生音频视频

Black Forest Labs发布Flux 3多模态基础模型,可同时学习图像、视频和音频。该模型能生成最长20秒带原生音频的视频,为该公司首次实现语音与画面同步输出。BFL内部测试显示Flux 3在多项指标上略领先Seedance 2.0,但独立评测尚未公开。公司最终目标构建世界模型,已在机器人任务上测试Flux 3。

当前结论

Black Forest Labs的Flux 3能生成带声音的视频,最长20秒,性能还略超Seedance 2.0,他们想搞世界模型,值得关注。

9 个信源73° AI 热度最后更新 2026/7/23 18:03:01

证据链

相关来源 1Latent Space (swyx)
查看原文
相关来源 3歸藏(guizang.ai)
查看原文

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。

查看资讯详情