阿里千问Qwen3.8-Flash发布:125B参数、1元/百万token,办公新功能上线
在成本上优势显著,训练开销仅为前代Qwen3.7-Plus的九分之一,API定价每百万Tokens输入1元、输出3元,目前已上线千问AI平台,同步推出“千问办公”功能。
近期, 阿里千问团队发布了一款重量级模型Qwen3.8 – Flash, 同时开源了下一代架构, 该模型凭借最少的激活参数跑出超出预期的高效表现, 又将成本降至前代的九分之一, 直接刷新了开源大模型的性价比标杆。
成本优势直击痛点
Qwen3.8—Flash有着仅为前代Qwen3.7—Plus九分之一的训练开销来着, 在API定价这儿, 每百万输入字符仅需1元, 然而输出字符为3元, 这样的价格针对中小企业和个人开发者而言是极度友好的, 值得一提的是千问AI平台已然上线该模型, 而且同步推出来了能够降低实际应用门槛的千问办公功能。
曾几何时, 大模型训练所需费用往往高达数千万美元之巨, 寻常普通的机构根本就没有能力去承担这笔数目不菲的开支。而在此次情况之下, 阿里成功地将训练成本压低到了极低的水平, 这就预示着有更多的团队能够尝试依照开源模型来进行二次开发, 而不会再被那高昂的算力费用无情地阻拦在门外了。
架构设计实现突破
注意力模块采用的是GDN加QSA的混合架构, GDN它负责压缩历史信息, QSA它负责筛选关键上下文, 与此同时, 在前一种在面向百万token量级场景里面实现了7.6倍数目的那种加速效果, 后一种在同样场景下实现了4.9倍数目的加速效果, 另外Gated机制把残差流拓展成为4条同时并行存在的分支, 通过动态门来进行跨层传播信息路径传导的优化, 这样有效地提升了训练的稳定性。

构架设计兼顾效率还有质量, 保留了长文本理解能力, 大幅降低计算资源的消耗, 团队事先就开放构架权重, 凭借社区力量验证创新方案, 体现稳步推进Qwen4系列研发的方式、方法、谋略, 思路。
N-gram技术扩充容量
这个模型额外搭载了51B N – gram参数 , 其总参数量达到了125B。这些新增加的参数 , 几乎不会给计算增添负担 , 然而却能够凭借局部上下文查表的方式 , 从而有效地扩充模型容量。每token仅激活数量为6B的参数这种设计 , 致使该模型的推理速度远远超越了同类模型。
此设计思路, 突破了那个传统大模型堆参数的惯常做法, 是以更为聪慧的方式去提升模型能力。N – gram部分, 身为附加组件, 于不影响核心性能这个情况下, 给模型创造出了更强的语言建模基础。
基准测试成绩亮眼
多项基准测试有显示, 仅仅依靠6B激活参数, 基础模型于14项评测当中斩获8项最优成绩, 微调版本在代码、智能体、多模态任务方面表现得尤为突出, SWE-bench Pro达到62.5分, 在相关智能体榜单之上大幅领先同类模型。
这表明, 激活参数数量, 并非是用以衡量模型能力的唯一标准, 架构设计以及训练策略, 同样是十分关键的。阿里借助精细化设计, 在资源受到限制的情形下, 达成了性能的最大化, 给行业提供了全新的思路。
长上下文场景实用
模型原本就支持二十六万token上下文, 通过借助YaRN技术能够扩展到一百万token, 这种能力使长文档处理场景变得更具可行性, 也让长对话记忆类型的场景变得更为可行。此外, 百万token场景下所呈现出的加速效果还证实了架构设计具备合理性。 标点略多, 但没办法表述清楚, 只能如此了。
对于那有着需要去处理长文本情况的企业用户来讲, 这属于是一重相当重要的优势了。长上下文所具备的能力会直接对模型于实际工作之中所处的应用范围造成影响 , 像是合同审查活动、报告生成行为、代码库分析这类场景均能够从其中获取益处的。
开源生态助力迭代
Qwen3.8 – Flash – Next的权重在Hugging Face被开源了, 完整的技术报告一同公开了。千问团队期望借助社区的力量去验证创新的方案, 持续不断地迭代技术, 稳定地推进Qwen4系列模型的研发。开源的策略会吸引更多的开发者参与到优化以及改进当中。
采用这种开放来合作的模式, 会对加速技术进步有帮助, 并且这还能令开源社区借助阿里框架开展二次创新。于把目光聚焦在AI发展上面的从业者以及研究者来说, 这样一套东西属于一个值得去跟进的重要项目。
针对Qwen3.8 – Flash所具备的成本方面的优势以及架构上的创新, 你持有怎样的看法? 欢迎于评论区域来分享你自身持有看法之情状, 要是你认为这一篇文章具备价值意义的话, 那就请点赞并且分享给更多的从事相同行业的朋友!