视频生成新突破:Seedance 2.5 单次30秒,长叙事创作更高效
该模型面向影视、广告、教育、工业制造、具身智能和自动驾驶等场景,目标是让视频生成从“生成一个片段”转向“完成一段创作”。秒内组织多个具备逻辑关联的镜头,让故事可以按照铺垫、推进、转折、收尾展开。秒,并保持人物主体、场景、画面风格、声音和音效一致。
三十秒能讲什么故事
以往的视频生成模型, 一回仅能产出时长为15秒的片段, 才刚将镜头对准主角便就此结束了。而在7月31日发布的豆包2.5视频生成模型, 把单次生成的时长加了一倍, 变为30秒, 而且还支持多轮进行延长。这就意味着, 用户能够连续产出多个时长为30秒的片段, 将其拼接成完整叙事。在官方所展示的歌手登台示例当中, 镜头先是从幕布的缝隙处往前推进, 到达化妆间位置, 接着又跟随歌手穿越通道登上舞台, 最后拉得更远到体育馆的全景, 整个流程上逻辑连贯, 并非再是零散画面的胡乱堆砌。
多模态参考素材怎么用
这次更新当中, 最为实用的变化之处是, 参考素材的容量得到了大幅度的提升, 用户在单次上传的时候, 能够上传30张图片, 以及10段视频, 还有10段音频, 模型会对这些素材之中的构图信息、场景信息、风格信息、人物信息以及道具信息进行综合且深入的理解, 好比你提供一张场景方面的图片, 还有几张关于人物的照片, 与此同时提供一段背景音乐示例, 模型从而能够依据这些已然提供的参考内容, 去生成风格保持统一的视频, 对于广告行业以及影视行业来讲, 这所代表的意义是前期的分镜以及概念图能够直接当作生成的依据, 而并不需要借助反复用文字对画面细节进行描述这种方式。
多人同框不再面目模糊

曾经在进行多人场景生成之际, 时常浮现人物形象相互混淆或者声音出现错乱之类的问题。2.5模型于多人同框以及群像叙事的时候展开了专门的优化, 能够就多个人的形象以及声音同时加以还原, 并且使得主体特征保持稳定状态。官方所展示的30秒音乐会片段选用16:9横屏电影感写实风格, 参考素材涵盖钢琴家、大提琴手、主唱、管弦乐队、合唱团以及观众席, 所生成的结果里每一个人物都维持了各自的特征, 并未出现串脸或者变声这类状况。

多轮延长保持一致性
视频生成最为忌惮的便是续写之际风格发生突变, 2.5的多轮延长功能有着这样的要求, 这种要求是让模型在已有的视频基础之上继续去生成30秒, 与此同时还要一直保持人物、场景、画面风格、声音再加上音效完全一致, 在官方给出的示例当中, 小男孩抱着足球在地铁车厢里面奔跑, 到达站点之后冲出门外, 男主展开追赶并且抓住了他, 整个连贯的动作跨越了多个镜头, 人物的外观以及场景的光线都不存在明显的跳变, 此功能对于那些需要长叙事的内容创作者而言是相当实用的。
哪些行业能直接用
官方清晰地罗列出影视、广告、教育、工业制造、具身智能以及自动驾驶这六个目标场景,影视行业能够借助它进行预演以及分镜验证, 广告团队能够迅速生成多个创意版本用来比稿。教育机构能够制作历史场景还原或者科学原理演示视频, 具身智能和自动驾驶领域能够运用模型生成训练所需的模拟视频数据, 以此降低真实数据采集成本。
怎么上手体验
现阶段, 模型已然连续上线了即梦AI以及豆包专业版, API服务在最近期间也将会接入火山方舟平台。平常的用户能够直接于即梦AI内输入文字说明来生成视频, 专业的用户能够经由API调用进而集成至自身业务流程里面。要是你之前往昔使用过豆包的视频生成功能, 此次的更新之后能够当即体验30秒的长片段并且拥有多素材参照, 无需另外去申请权限。

你准备首先运用这个模型生成哪一种类型的视频, 欢迎于评论区谈论你的创作规划, 倘若觉得这篇文章具备价值的话记得点赞并且分享给身旁从事内容方面的朋友。