Black Forest Labs推出FLUX3多模态基础模型,性能超棒创作模式多
多模态基础模型,采用统一架构联合学习图像、视频和音频。系列基础上进一步扩展至多模态生成与理解任务。可完成图像生成与编辑,覆盖多种风格、宽高比和分辨率。用作机器人行为预测模型,将多模态AI能力从内容生成延伸到实体机器人领域。不仅是一个创作工具,更有望成为连接数字世界与物理世界的通用多模态引擎。
统一架构打破界限
有一个名称为Black Labs的主体,最近开展了一项规模较大的行动, 推出了一款名为FLUX3的多模态基础模型, 该模型采用的是Early方式进行上线, 其主要强调的是一种贯穿整体的统一架构, 它具备将图像以及视频和音频集中起来进行联合学习的能力, 这样的设计赋予了模型一种情况, 即不再如同以往那样各自行使其自身的管理方式和功用, 而是达成实现了一种真正深入的多模态维度的融合状态。
该模型是经由Self – Flow框架扩展而来的, 先前的FLUX1以及FLUX2主要着重于单一模态, 如今的FLUX3对视频、图像以及音频进行同步训练, 这表明它于理解复杂场景之际更为精准, 这般技术路线的升级, 为后续的多模态生成任务筑牢了稳固基础。

原生音频同步输出
在FLUX3之中, 最具亮眼特性的是其具备可径直输出带有声音的视频的能力, 其对于视频生成所支持时长的最大值能够达到20秒, 并且其所呈现的音频属于原生性质, 并非是经由后期强行拼凑上去的, 不管是从文字生成视频的情形, 还是从图片生成视频的状况下, 它均能够同时成功处理画面以及声音方面的任务, 用户并不需要再度单独去寻觅配音或者音效, 通过这一方式能够达到一步到位的效果, 这种情况显得非常省事。
它同样支持视频续写操作, 以及关键帧转视频功能, 你能够输入一段视频并且一并输入一段音频, 继而让它顺着已有的继续往下编排。这般具备多语言对话以及多镜头串联特质的能力, 使得整个创作流程变得极为灵活多变。对于从事短视频制作或者广告工作的那些人而言, 这简直就是一款效率方面的神器, 把大量后期剪辑配乐所带来的麻烦给省去了。
性能全面领先对手
于带有声音的10秒720p视频评测当中, FLUX3的表现当真颇为炸裂。经人工评测得以显示, 其战胜Grok Video的概率高达69%。而这个数字所意味的是, 它于画质、音画同步以及逻辑连贯性部分均具备显著优势。将其与Omni Flash以及2.0版本相对比, 胜率同样达到了52%, 从而显示出全面领先的态势。
这样的数据方面的压倒性优势, 表明在对多模态任务予以处理期间, FLUX3显得更为稳固。它不但能够产出美观的画面, 而且还能够确保声音跟画面达成绝佳的契合。针对那些追求高品质内容的创作者而言, 这种具有高获胜几率的模型能够显著削减尝试错误所需付出的成本。毕竟, 没有谁愿意耗费半天时间所生成的视频, 最终由于声音与画面不协调而功亏一篑。
图像编辑覆盖广泛
撇开视频不说, FLUX3在有关图像的范畴里的呈现也是不可轻视的。官方声称它是能够支持多种风格、宽高比以及分辨率的图像进行生成与编辑的。不管你所期望的是写实照片, 又或者是卡通插画, 它都是能够胜任的。这样一种具备广泛覆盖能力的特性, 使得它变成设计师以及插画师的得力帮手。
它具备的图像处理该项能力, 并非仅仅被限定于生成这一方面, 而且还涵盖着编辑这一范畴。用户能针对已然存在的图片予以调整, 去改变其风格或者对细节予之优化。这样的一种灵活性, 使得它在日常的创作过程当中具备相当高的实用性。不管是用作社交媒体的配图, 亦或是用于商业宣传的海报, FLUX3都能够迅速地提供质量上乘的视觉素材。
进军机器人领域
FLUX3有着超出内容创作范畴的野心, Black Labs正在和Mimic展开合作, 钻研把其用作机器人行为的预测模型, 这表明多模态AI可从数字环境延展至实体机器人范畴, 机器人要借助剖析图像、视频以及音频, 从而更佳地察觉周边环境并予以回应。
这般布局极具前瞻性, 若成功, FLUX3会成为连接数字与物理世界的通用引擎,机器人不再是仅有执行预设程序能力而是含有多模态理解素养的智能体, 这对于自动驾驶以及家庭服务机器人此类行业而言, 可能造成颠覆性状况。
未来应用前景广阔
FLUX3的现身, 意味着多模态AI步入了一个全新阶段, 它不但提高了内容创作的效率以及质量, 还为机器人技术创造了新的可能性, 伴随技术的持续更新, 我们或许会目睹更多基于此模型的创新应用问世。
就普通用户来讲, 这代表着更便利的内容创作器具。对企业而言, 这没准是一项技术革新的起始。你有没有准备好去迎接这个多模态时期呢? 欢迎于评论区去分享你的见解, 点赞并且转发给更多有需求的友人。