AI资讯

阿里开源新模型Qwen3.8-Flash-Next:1250亿参数仅激活60亿,性能越级

智能摘要

架构的早期预览版本,该模型在保持极低计算开销的同时展现出了越级的性能表现。级别的直接支持,开发者可以通过开源渠道获取模型权重并在本地或集群环境中高效部署。这一系列底层架构的创新与突破,不仅为全球开源社区提供了前沿的技术探索样本,也进一步推动了高性能AI大模型向低成本、高效率的规模化落地演进。

性能碾压但成本极低

近期, 阿里通义千问团队开源了一款多模态MoE模型, 它叫Qwen3.8-Flash-Next, 此乃Qwen4架构的早期预览版本。这款模型, 最引人注目的地方是, 它凭借极低的计算开销, 达成了越级的性能表现, 打破了以往高性能就必定高成本的常规认知。

根据官方所给出的数据能够看出, 在代码编写以及办公场景这类核心任务方面, 这款模型的表现相较于之前大幅度提升了。让人感到十分惊叹的是, 仅仅依靠规模为60亿激活参数, 它在多项评测当中成功战胜了Opus 4.6 Max等顶尖旗舰模型, 实实在在达成了利用更少的资源去做更多事情的目标。

架构设计巧妙平衡

就核心架构而言, Qwen3.8 – Flash – Next运用了高度稀疏的混合专家设计。整个模型的总参数量达到了1250亿, 当中512个专家经由top – 10路由分配, 进而形成了48层的网络结构, 这样的设计在容量与效率之间寻得了巧妙的平衡。

更具巧妙性的情况是, 模型额外配备了有着510亿参数的N – gram嵌入表, 以及具备40亿参数的多token预测模块。这些额外的参数, 几乎不会增添计算所需承担的负担, 然而却能够极大程度地提升模型的容量, 进而为后续的性能优化奠定下坚实牢固的基础。

技术创新多点开花

处于技术创新的那个层面里, 此模型引进了GDN跟QSA混合起来的注意力机制, 一方面兼顾了长文本处理这块儿的运行效率, 另一方面还保证了信息检索的精度。原本是256K的上下文窗口借助YaRN技术被扩展到了1M, 使得模型在处理超长的文档之际更加能够应对自如。

那模型采用了门控残差连接的设计方式, 它还采用了微块粒度选择上下文那稀疏注意力这样的方案。这些创新既是提升了模型的全部性能的, 也是为后续同类研究提供了可贵的技术参考这一路径。

N-gram嵌入降低成本

这款模型的亮点之一, 是有着510亿参数的N – gram嵌入表。引入这一模块后, 在几乎不增加额外计算成本的情况下, 模型大幅扩展了容量。更关键的是, 它支持通过异步预取, 使其驻留于系统低速DRAM内存中, 进一步降低了部署门槛。

这表明, 开发者能够于普通服务器上面, 高效地运行这一模型, 而无须去购买那种价格昂贵的专用硬件。对那些预算有限的中小团队以及个人开发者来讲, 这毫无疑问是一项重大利好, 能使得高性能AI应用变得越发触手可及。

训练成本大幅下降

这款模型, 在实际性能跟成本表现方面, 交出了令人瞩目的答卷。它得益于极为极致的稀疏化设计, 其训练成本仅仅是上一代Qwen3.7 – Plus的九分之一, 此一数字直观地呈现出架构优化所具备的巨大价值。

发生了性能实现了跃升, 并且成本出现了下降的情况, 表明了阿里于模型优化的领域当中已然处于行业的前列方位。这对于追寻性价比的AI应用企业来讲意义颇为重大, 意味着能够在同等的预算条件下取得更强的模型能力。

开源生态快速响应

关于生态部署这一情况, 阿里在模型发布的首日, 就给出了Day – 0级别的直接支持。开发者能够经由开源渠道, 去获取模型权重, 并且能在本地环境或者集群环境里, 进行高效部署, 这样的快速响应, 充分展现出了开源社区的协作效率。

此一系列底层架构方面的创新以及突破, 不光给全球开源社区予以了前沿的技术探索样板, 还进一步促使高性能AI大模型朝着低成本、高效率的规模化落地发展演进。你觉得这种低成本样式的开源大模型将会怎样去改变AI行业的竞争布局呢?

相关文章