字节新模型一次能生成30秒连贯视频,还能多轮延长,做短片不用一段段拼了,影视剪辑党可以试试。
字节跳动7月31日发布Seedance 2.5视频生成模型,单次生成时长从15秒提升到30秒,并支持多轮延长。模型延续Seedance 2.0统一的多模态音视频联合生成架构,可一次输入最多30张图片、10段视频、10段音频作为参考。官方示例展示了30秒音乐会片段,能同时还原多个人物形象与声音。Seedance 2.5将陆续上线即梦AI与豆包专业版,API服务近期接入火山方舟。模型面向影视、广告、教育、具身智能和自动驾驶等场景。
字节跳动推出 Seedance 2.5 模型:AI 单次可生成 30 秒高质量视频片段
IT之家 7 月 31 日消息,字节跳动今天(7 月 31 日)发布公告,宣布推出 Seedance 2.5 视频生成模型, 可单次生成 30 秒高质量视频片段 ,陆续上线即梦 AI 与豆包专业版,API 服务也将于近期接入火山方舟。 官方称,Seedance 2.5 延续 Seedance 2.0 统一的多模态音视频联合生成架构,重点提升长叙事、多模态参考和编辑能力。 该模型面向影视、广告、教育、工业制造、具身智能和自动驾驶等场景,目标是让视频生成从“生成一个片段”转向“完成一段创作”。 在生成方面,Seedance 2.5 将单次视频生成时长从 15 秒提升至 30 秒,并支持多轮延长。官方称,模型可在 30 秒内组织多个具备逻辑关联的镜头,让故事可以按照铺垫、推进、转折、收尾展开。 在官方示例中,一段歌手一镜到底登台演出片段展示了完整叙事:镜头从红色厚重幕布缝隙推进,进入暖色后台化妆间;年轻女歌手整理耳机,工作人员提醒其登台;歌手穿过后台通道,与舞伴互动并接过麦克风;随后登上舞台,镜头最终拉远至体育馆全景,呈现观众、灯牌、荧光棒和欢呼声。 多轮延长方面,官方示例要求模型在已有视频基础上继续生成 30 秒,并保持人物主体、场景、画面风格、声音和音效一致。示例剧情包括小男孩抱着足球沿车厢跑、地铁停稳后冲出车门、男主追赶并最终抓住小男孩等连续动作。 Seedance 2.5 支持用户单次输入最多 30 张图片、10 段视频、10 段音频作为参考素材。官方称,模型可综合理解不同素材中的画面构图、场景、风格、人物、道具等元素,并按指令用于视频生成。 在多人同框和群像叙事场景中,Seedance 2.5 可同时还原多个人物形象与声音,并保持主体特征稳定。官方展示的 30 秒音乐会片段采用 16:9 横屏、电影感写实风格,参考素材覆盖场景图、钢琴家、大提琴、小提琴、主唱、管弦乐队、合唱团和观众席。 IT之家附上参考地址 Seedance 2.5 项目主页