AI资讯

MiniMax H3视频模型8月3日开源,支持2K15秒多模态输出

智能摘要

点正式开源。分辨率。1/2。

开源时间与获取方式

稀宇科技于7月31日透出消息, 全新H3通用多模态视频模型 gonna 在8月3日0点于魔搭社区正式开源, 这表明自周六凌晨起, 开发者可直接下载模型代码以及权重文件了, 无需排队申请内测资格。

此番开源, 对于个人开发者以及中小团队而言尤为友好, 大家能够于魔搭社区页面寻觅到完整的模型卡, 还有使用文档以及示例代码。官方另外提供了部署指南, 其支持主流显卡以及云服务器环境, 进而降低了上手门槛。

多模态理解能力

MiniMax H3视频模型8月3日开源,支持2K15秒多模态输出

H3具备的最大特点在于, 能够同时对文本、图像、视频以及声音这四种模态的输入进行处理。举例而言, 一旦你给到它一段视频, 并且附加一句文字描述 , 它便可做到理解视频内容, 进而依据指令生成全新的视频 , 像这种统一理解能力在当下已开源的模型当中是不多见的。

在实际运用当中, 你能够呈上一段毫无声响的街拍视频, 再配合文字要求是“增添雨声以及车流声”这款H3, 就会缔造出带有环境声音的全新视频, 它还具备依据图片加之文字描述而来生成动态视频的能力, 就好像一张产品照片再加上“旋转展示”这样的指令那般。

原生双声道输出

H3具备输出原生双声道音视频的能力, 这是诸多视频模型所无法达成的, 它能够营造出左右声道各异的声音效果, 像是左边呈现人物对话, 右边播放背景音乐, 进而使视频的沉浸感得以更强。

就做短视频的创作者而言, 此功能颇具实用性, 就做广告片的创作者而言, 这般功能相当实用, 就做游戏CG的创作者来讲, 该功能极为好用, 无需再另行寻觅音频软件去合成声音, 仅凭借H3进行生成便具备立体声效应, 能够省下诸多后期制作的时间。

分辨率与时长表现

H3默认给予2K分辨率, 其最高可支撑15秒的视频生成, 与当下市面上多数仅能生成1080P或者720P的模型相比较, 画质有着显著的提高。于768P分辨率的情况下, 产生速度更为快速, 适宜批量进行素材制作。

据官方数据呈现, H3处于2K分辨率时, 每秒价格低于主流模型的三分之一, 身处768P分辨率下, 是主流720P价格的二分之一。那便是说, 去生成一个时长为15秒的2K视频, 成本或许仅有几块钱, 这对于预算受限的创作者而言颇具吸引力。

性价比优势分析

H3的定价方针显著对准了中小企业以及个人创作者, 他们最为在意的便是以较少花费达成较大事情。官方所提及的Omni、H3-VAE、H3-Omni、In-等多项技术, 其主要用意在于削减计算资源消耗, 将成本压低下来。

对照同类产品, 像是Runway或者Pika的付费方案, H3在同样画质状况下价格更为低廉, 并且经开源之后还能够自行进行部署, 连带API费用都节省下来了。对于那些有着大量视频素材生成需求的团队而言, 一个月能够省下相当多的钱。

适用场景与展望

短视频制作、广告创意、教育培训、游戏开发等好些领域都适合用H3, 像对于电商卖家而言, 能够借助它去生成产品展示视频, 老师呢, 可用其制作教学动画, 游戏开发者能够借它生成过场动画。

开源于8月3日后, 社区里或许会出现各类二次开发用到的工具及组件, 进而将H3有着的应用范畴予以更进一步的拓展。要是你正探寻一款性价比优良的视频生成模型, 那么不妨于周六的凌晨时分蹲守着去下载尝试一番。

你认为H3开源之后, 最有极大倾向性在哪个行业首先展开大范围的应用呢? 欢迎于评论区域留下话语进行探讨议论, 要是这一篇文章给你带来助力, 记得送出表示赞赏的的“点赞”并给予分给有需要友人。

相关文章