AI资讯

中国AI震撼全球!MoE架构突破视频生成,MAGI-2开源

智能摘要

3年前,全球顶尖AI几乎集体转向这一架构。这是全球首个开源的千亿级MoE统一音视频生成模型,但价格可以做到主流模型的1/10。在外界看来,sand.ai每一代模型都在押一个「非共识」。35年后,它变成了一个拥有114B参数、每次只激活约6B,并且完全开源的视频生成模型。

MoE架构的三十年轮回

35年前, 那位被称作AI教父者, 与他与之合作之人就已然提创了MoE架构的初步形态。直到如今, 这个概念才终于在大模型时代切实落地扎根了。MAGI – 2恰恰是这一架构的最新实践成果, 它将传统密致模型的思路进行了完全的颠覆。

想让过去时的视频模型变得厉害起来, 就只能把Dense模型做的越来越大。然而视频Token密度达到了极为高的程度, 一张图像会被拆分成数量众多的空间Token, 再加上时间这个维度, 序列就只会变得更长。每当模型增加一层的时候, 每个Token都必须穿过更多的参数, 成本也就跟着急剧上涨。

成本断崖式下降的秘密

有着114B模型容量被做到的 MAGI-2, 不过每次推理之时却唯有将近6B参数被激活, 这究竟意味着什么呢? 一个开源模型就这样跻身到了闭源模型的榜单前列之处。它的Elo得分是1106, 于图生视频含音频这一榜单里处在第六的排名位置上。

以按照8卡H100的月租金来进行折算的情况, 去生成时长为10秒的视频, 不过仅仅只需要大概0.5元, 这可是当下行业主流模型中价格的达成为十分第一比例的数据体现, 从原本的几块钱下降到了几毛钱这样的程度, 对于视频产品团队而言, 其中所涉及的商业模式确实已然是呈现出完全不一样的状况了。

音视频统一生成的突破

行业当中存在着数量不少的音画同步方案, 实际上是将两套模型串联起来运行, 先是产出视频, 接着配置声音, 到后期再把它们缝合在一起。MAGI – 2把文本、视频以及音频放置到同一个上下文当中, 于每一层去直接地交换信息。

被共同建模的有口型, 有动作重音, 有表情, 还有镜头节奏, 其从生成的第一步便开始了。画面与声音是一同生长出来的, 并非进行后期拼接。口型能够跟台词相匹配, 动作重音和声音踩在同一节拍上。

通信瓶颈的巧妙化解

专家拆解得越是精细, 通信方面的问题就变得越发棘手, MAGI – 2其将3072维的巨大表现拆解成为12个256维的独立子信息空间, 每个单独的head在256个专家之中单独挑选出其中的6个,经由此类设计把挑选专家这一环节转变成为更为细致的组合类问题。

在路由尚没有发生以前, 模型依据头将具备固定形状的表示分配至各个设备。每一个设备在拿到自身所负责的头以后, 于本地开展路由以及专家计算。如此一来, 跨设备传输的数据量变成固定的, 不会再随着输入而产生剧烈的波动。

数据决定专家分工

最令细粒度多专家混合模型害怕之处在于有名目上几千个专家之数, 然而最终众人所学到的却近乎相同。真正对专家分工起到决定作用的并非数值, 而是数据。MAGI – 2的数据处理流程从单纯的过滤转变为具备广泛覆盖以及细粒度标注的状态。

有3072个专家单元所提供的是容量, 数据决定了这些容量能否变成真正不同的能力。基础模型预训练覆盖得越发完整, 后训练就越不用忙于修补运动细节, 而是能够更多地用于偏好对齐以及产品适配。

开源带来的系统级革新

MAGI – 2所开源的并非仅仅是一个114B的模型, 反而是一条系统性路线,模型结构、通信机制、算子以及优化器一同被推进到千亿级规模:其中三者职责分工确定明确, 模型决定调用哪位专家, Head负责通信还有计算, 另外一个负责大规模参数更新。

历经35年之后, MoE架构最终从理论转化成了现实。一个有着114B参数且每次仅仅激活大约6B、完全处于开源状态的视频生成模型已然来临。你认为这个开源模型会怎么样去改变视频创作行业? 请在评论区分享你的看法。

相关文章