AI资讯

MiniMax开源H3视频模型,支持2K画质与多模态生成

智能摘要

作为一款全模态生成系统,该模型打破了传统单任务的界限,能够深度融合并理解由文本、图像、视频以及音频交织而成的多模态上下文,展现出极强的任务泛化能力。像素的常规模式进行基础创作。张图像,能够自由灵活地应对文生视频、首帧生视频、尾帧生视频以及首尾帧协同生成的不同任务。Face获取完整的开源代码与资源。

8月3日,人工智能企业正式宣告开源新一代通用视频模型H3, 这个全模态生成系统使得多模态视频创作门槛极大幅度降低。

模型核心能力介绍

H3突破了传统单任务生成的边界, 这一突破使得它可以深度融合文本、图像、视频以及音频的多模态上下文,如此这般的设计让该模型理解复杂创作需求的能力得以增强, 使其不会再被局限于单一输入形式。

如下为改写后的内容: 模型展示出了超强的任务蔓延性, 无论是从文字生发出视频这样的情况, 还是从图片生发出视频的情形, 又或是音频与视频同步生产制造上。这种情形下它都可以稳定地输出极高质量的最终产物, 对于创作者讲这意味着能够以变少的提示语收获更为精确精准的内容。

生成规格与分辨率

关于时长, 输出是4到15秒这样一种状况的视频, 帧率相应地达到24帧率每秒, 音频采样率呈现的是32千赫兹且是以立体声的形式存在。用户能够依据项目的需求, 从中进行选择, 选择的结果是21比9、16比9、 4比3、1比1等多种为类别划分的宽高比。

在常规模式当中, 模型会把较短的边设定为768像素来开展基础创作, 这是默认的情况。当使用H3至2K方案之后, 画面的分辨率能够提升到2K级别, 视觉方面的效果会变得更加令人惊艳。

灵活版本与输入规格

H3 – Base – FL2VA运用首尾帧模式, 它支持输入0至2张图像, 它可以灵活应对文生视频这种任务类型, 它还能灵活应对首帧生视频这种任务类型, 它也能灵活应对尾帧生视频这种任务类型, 它同样能灵活应对首尾帧协同生成这种任务类型。

全模态那种参考模式, 却是可以对最多9张图像予以支持, 还有3段视频, 其总时长是不能超过15秒的, 再者还有3段音频一块儿进行混合输入, 并且文件总数的最高上限能够达到12个, 以此为专业创作者给予精细控制。

多语言交互支持

H3在多语言交互这一范畴展现出稳定特性, 这个功能可以去支持多达11种主流语言, 其中包括阿拉伯语, 还有中文, 可以也支持流利的日常交流用语英语, 以及法式语言, 还有德语, 意大利的语言风格它也支持能清晰表述含义使用, 日语以及韩语, 西班牙语和葡萄牙语, 俄语此语言它亦是轻松支持。

此种多语言支持, 使得全球范围内的创作者, 皆能够运用H3来开展视频生成工作, 它减小了跨语言创作所存在的障碍, 同时还为国际化的内容生产, 赋予了便利的条件。

底层架构设计

三个核心模块构成了H3的完整系统 , H3–IR承担着把繁复的多元指令进行深度剖析的任务 , 它会将其转变成模型能够容易理解的结构 , 这是确保高品质输出的最为关键的环节。

H3 – Base模块承担着生成768p基础音视频内容任务, 然而, H3 – 2K模块借助把初始结果跟原始上下文进行回传这一方式,达成2K超分重构, 它不但保留了生动细节, 而且还提高了视觉保真度。

获取方式与应用前景

当下, H3已然正式予以发布, 那些相关的开发者以及技术爱好者能够经由Face平台去获取完整的开源代码以及资源文件, 开源策略促使更多团队能够基于H3开展二次开发以及定制。

业界广泛觉得此次开源会进一步削减多模态视频生成的运用界限, 促使影视编排、视觉规划以及AI交互朝着新层级迈进, 面对这般的开源工具, 你计划用它去创作何种内容呢?

相关文章