德国AI新模型Flux3发布,20秒音视频生成,碾压Luma和Runway
Labs)正式发布多模态基础模型Flux3,标志着生成式视频技术迎来重大突破。Robotics开发了适用于机器人领域的视频动作模型Flux-mimic,目前已在奥迪工厂开展生产任务测试。
颠覆视频生成格局
七月末的时候, 黑森林实验室开展了一项规模较大的行动, 推出了一个多模态基础模型, 它被称作Flux3 , 这并非是那种平常的小改动修修补补, 此次是生成式视频技术方面一项意义重大能有新进展的突破, 它运用了一种全新的Self – Flow架构, 将之前存在的那种单一模态处理时所具有的局限性全然改变了。
该模型配备了专门用于图像的编解码器, 该模型配备了专门用于视频的编解码器, 该模型配备了专门用于音频的编缉么区, 该模型配备了专门用于动作的代码解么去。有着这般统一理解而后生成的能力, 故而可以让AI同时去处理处于物理环境的信息, 也可以让AI同时去处理处于数字环境的信息。这等情况所意味的是, 将来所生成的视频, 不会仅仅止于画面, 而是会是兼具声音、动作以及逻辑的完整体验。
原生音频生成突破
成为首款支持原生音频生成的模型, 是Flux3最引人注目的亮点, 以往视频生成常常存在后期配音情况或者音画不同步状况, 然而Flux3能够一次性输出时长达到20秒的音视频同步片段, 这种同步性有力地提升了内容的真实感与沉浸感。

其功能覆盖范围, 除了长视频生成之外, 还包含文本转视频、图像转视频等多种。既能够让用户直接输入文字, 也能够输入图片, 如此一来, AI便可以生成与之对应的动态视频。基于关键帧的转场功能, 也致使视频制作变得更为灵活起来, 并让创作者能够精准把控场景切换的节奏以及效果。
性能数据全面领先
在早期测试里, 其分辨率为720p, 片段时长是10秒, 此时Flux3的表现, 令人留下深刻印象。就与Luma Ray3.2进行对标而言, Flux3取得了胜率为93%的成绩, 这属于一种压倒性的优势。相较于其他竞品, Flux3在画面流畅度以及在细节还原方面, 均表现得更为稳定。
Flux3 於跟 Gen – 4.5 的较量里头, 同样是以七成七的胜率取得胜利。就算是在直面.0 及其 Omni Flash 等顶级模型之际, Flux3 依旧维持着细微但持续不间断的优势。这些数据显示了, Flux3 在当下的视频生成范畴已然处在领衔位置, 拥有极为强大的竞争力。
机器人领域应用落地
黑森林实验室对消费级应用予以关注, 并且还与Mimic共同开发了视频动作模型Flux – mimic, 该模型适用于机器人领域, 专门针对机器人的感知以及行动能力做出了优化, 目的在于使机器人于复杂环境里更出色地进行理解任务以及执行任务相关的各项操作。
当下, Flux – mimic于奥迪工厂展开了生产任务方面的测试, 工业场景对于精度以及稳定性有着极高的要求, 其可以在奥迪工厂开展测试, 这说明了该模型技术成熟度已然抵达了很高的水准。这会加快AI从虚拟世界朝着物理世界的延伸过程。
分阶段发布策略
先上线了部分功能, BFL采取的是分阶段推出这种做法, 随后会陆续发布开源权重版本, 既保证了产品拥有稳定性之态势, 又让开发者和研究者存在深入探索模型潜能的机遇, 开源权重版本开展发布这一行为会进一步促使社区创新得以推进、应用拓展得以展开。
推动AI朝着具备感知以及行动能力的“世界模型”演进, Flux3借助打破单一模态的信息局限来加速实现, 这种演进并非只是技术层面的升级, 还是AI应用范式的转变, 在未来, AI不会只是内容的生成者, 更是环境的理解者, 以及行动的执行者。
行业影响与展望
被标记为Flux3发布的事件, 意味着生成式AI步入了一个全新阶段 , 具备音视频同步以及多模态统一处理能力, 如此一来, AI所生成的内容愈发真实且可信, 而在影视制作、游戏开发、教育培训等多个行业方面均会对此造成深远影响。
顺着技术持续成熟以及应用场景拓展的态势, 我们存有相信的缘由, 断定 AI 会于更多领域发挥关键作用, 自内容创作至实体制造, 自虚拟交互至物理操作, AI 正一步步渗入我们生活的各个方面, 你对 Flux3 给你工作带来何种改变怀有期待?