AI资讯

14B视频生成遇难题,速度与显存成两大拦路虎

智能摘要

14B视频生成的两道硬门槛问题集中在两点:一是生成慢,二是显存装不下。14B模型权重、长视频Token、注意力缓冲区和中间激活同时占用显存,峰值容易超过约30GB消费级GPU的容量,程序会直接出现OOM。两类任务的5秒视频生成时间均短于播放时间。8卡I2V在720p下达到4.5秒,跨过实时生成线。

大模型视频生成为何这么难

这几年, 视频生成模型发展得极为迅速, 其呈现出一幅渐趋清晰的画面, 且动作也变得愈发自然。然而, 与之相随出现的问题也日益繁多, 普通用户根本无法将其运用自如。

存在这样一个视频模型, 其参数为14B , 生成时长为5秒、分辨率是720p的视频, 可能需要等待几十分钟。更为关键之处在于, 此种模型根本无法在消费级显卡上运行, 即便拥有40GB显存, 也未必能够满足需求, 程序会直接报错并退出。

生成慢的根源在哪

视频生成得反复去噪 , Wan2.2生成一段完整视频平常要40步。每一步都得去跑一回完整的DiT前向计算 , 时间就这样累积起来了。

分辨程度越高, 视频的Token序列就会愈发长。当序列的长度抵达120K的时候, 自注意力的计算会占据整个延迟的80%还要多。这种呈现平方级增长的开销, 是性能瓶颈的关键核心所在。

减少步数还能保持质量

DMD方法将去噪过程划分成不一样的阶段, 使得不一样的专家分担不一样的噪声区间。在训练的时候仅仅留存一个采样步的梯度, 如此一来既节省显存还防止质量下落。

与SGMD训练策略相配合, 最终塑造出“两步高噪声再加上两步低噪声”这样四步的推理流程环境。相较于传统来说的四十一二十四十步相较少的步数, 速度增强了十倍的提升级别层级状态程度。与此同时, 做到了将视频当中的运动方面详细节段内容以及多样性予以留存保持。

量化与稀疏注意力双管齐下

NVFP4量化技术, 采用4比特来存储权重, 借由块级缩放以保留动态范围。量化感知训练是这样: 让模型提前去适应精度损失还作协调配合专用内核而达成更低的显存流量。

仅计算大约10%的关键块的是稀疏注意力 , 其余块被直接跳过。Q/K采用INT8 , V采用FP8 , 这种方式大幅削减了矩阵乘以及注意力计算所产生的开销。

单卡运行成为现实

经过前面所阐述的那样的优化, 14B模型最终得以在单单一张消费级显卡上面运行, I2V 480p的速度提高了3.5倍, 720p的速度提高了2.4倍, 并且峰值显存被控制在30GB以内。

Block级卸载技术, 将权重按块实施搬运, 使得计算与数据传输能够异步且重叠进行, 进而把显存峰值进一步予以降低, 普通用户最终不用去购买专业卡也能够体验大模型视频生成。

多卡并行实现实时生成

实时而生成之标准乃, 5秒视频之生成时间不超5秒。借由风格序列并行之法, 将长视频Token予以切分至8张GPU之上, 每张卡仅计算部分注意力。

叠加FP8通信技术, 叠加QKV融合技术, 叠加Head级流水线等技术, 720p的对于8卡而言的面向T2V的延迟降低到了有3.8秒, 在这种情况下对于 I2V呈现为4.5秒, 在这两种情况之下双双成功跨越了实时这一界限级别, 最高加速度达成至于达705之倍数。

你认为视频生成模型还得于哪些层面持续优化, 方可使得更多普通用户能够用上? 欢迎在评论区把你的看法分享出来!

docker pull lightx2v/lightx2v:26052801-cu130-5090

相关文章