主要来源Decoder
查看原文事件专题 · 多源确认
Black Forest Labs发布Flux 3:生成最长20秒带原生音频视频
Black Forest Labs发布Flux 3多模态基础模型,可同时学习图像、视频和音频。该模型能生成最长20秒带原生音频的视频,为该公司首次实现语音与画面同步输出。BFL内部测试显示Flux 3在多项指标上略领先Seedance 2.0,但独立评测尚未公开。公司最终目标构建世界模型,已在机器人任务上测试Flux 3。
当前结论
Black Forest Labs的Flux 3能生成带声音的视频,最长20秒,性能还略超Seedance 2.0,他们想搞世界模型,值得关注。
9 个信源73° AI 热度最后更新 2026/7/23 18:03:01
证据链
相关来源 1Latent Space (swyx)
查看原文相关来源 2IT之家
查看原文相关来源 3歸藏(guizang.ai)
查看原文相关来源 4Justine Moore
查看原文相关来源 5berryxia
查看原文相关来源 6shao__meng
查看原文相关来源 7岚叔
查看原文相关来源 8@koltregaskes
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。