AI资讯

小红书开源大模型280B参数,适配昇腾AI硬件,加速推理部署

智能摘要

开源大模型。开源推理引擎提供完整的部署与推理能力。推理部署适配与性能优化,在完整保留模型文本、视觉、语音一体化全模态理解能力的前提下,实现了稳定运行与生成效率提升,为长程复杂任务场景智能落地提供算力支撑。昇腾此次关键适配及优化点如下:投机推理原生支持,攻坚增量解码时延瓶颈

小红书首款大模型来了

8月14日, 小红书正式对外发布了dots3-note开源大模型, 此乃dots3系列的首个版本, 而这也标志着, 那家拥有数亿用户的社交平台正式迈入大模型赛道。

小红书开源大模型280B参数,适配昇腾AI硬件,加速推理部署

按照官方所给出的介绍来看, 此模型运用的是有着280B总参数、16B激活参数的架构设计方式, 并且它同时拥有文本、视觉、语音这三种模态的理解以及生成能力, 在多项评测当中达到了主流大尺寸模型的竞争水准。

280B参数背后的技术路线

dots3-note运用了混合专家(MoE)架构, 总参数量为280B, 然而每次进行推理时, 仅会激活其中16B的参数, 这样的设计, 在保障模型知识储备的情形下, 极大程度地削减了计算成本。

激活参数数量越少, 推理的速度就会越快, 显存的占用同样也会越低。这所要表明的是, 企业能够在相对较为廉价的硬件之上, 去部署如此这般的大规模模型, 进而降低了应用门槛。

昇腾0天完成全量适配

小红书开源大模型280B参数,适配昇腾AI硬件,加速推理部署

需予以关注的是, 在dots3-note发布当日的那个时候, 昇腾便宣告成就了从硬件驱动一直到推理框架的全部数量适配工作, 达成了在实际意义层面上的0 Day部署。

昇腾Atlas 800 A3完成了适配, Atlas 900 A3超节点也完成了适配, 它们基于vLLM开源推理引擎, 具备完整的部署能力, 还具备完整的推理能力, 这从而证明了国产AI芯片具备兼容性, 也证明了国产AI芯片具备灵活性。

全模态理解能力实测

该模型不但对文本对话予以支持。而且还能够理解图片以及语音。在实际的测试当中。针对包含文字的图片内容识别。多轮对话里的情感理解等场景。dots3-note均展现出了不错的能力。

有这样一种情况, 在短视频平台那里, 对于处理图文以及音频信息而言, 这两者能够同时进行, 这就等同于意味着, 该平台能够更加精准地去理解用户所提供的内容, 进而提升推荐算法的准确程度, 并且还能为内容创作工具奠定下技术方向的基础。

MTP投机推理大幅提升效率

于这次适配期间, 昇腾的团队着重对MTP投机推理技术实施了优化, 该技术能够极为明显地削减增量解码之际所产生的延迟。

传统的大模型, 生成每一个新的token时, 均要重新针对全部的上下文展开计算, 然而投机推理借助引入小型的草稿模型, 使得大模型能够并行地去验证多个候选token, 进而极大程度地削减推理所需的时间。

开源生态的价值与挑战

是dots3-note选择了开源发布, 这就表明了任谁是开发者, 都能够凭借这个去开展二次开发以及部署这种行为。这一件事情对于中国大模型生态来讲, 属于是一种补充, 并且还为中小企业给予了获取AI能力的、成本更低的途径。

然而, 尽管开源意味着竞争会更为清晰透明, 可是怎样于开源的根基之上构筑具备差异化的优势, 这乃是小红书以及所有进入该领域者都务必去思索的问题。你认为小红书开展AI业务, 其最大的优势究竟是什么呢?

相关文章