AI资讯

Kimi K3原生多模态 推理思考缩放 架构效率提升2.5倍

智能摘要

架构三大革新:扩展效率提升2.5倍KDA(线性注意力):负责高效的长序列混合,将冗长的上下文压缩成固定大小的循环状态,彻底打破了上下文长度的内存诅咒。K3交叉训练了通用、智能体、代码三大领域的专家模型,并在低、高、极限三个「思考努力」级别上进行强化学习。

原生多模态与慢思考能力

Kimi K3最为关键的突破之处在于, 从预训练开始的第一天起, 它就把视觉与文本进行深度融合, 并非如同其他别的模型那般, 于后期实施拼接对齐操作。正是这样一种原生的、多模态的架构, 使得该模型在天然状态上, 就能够明白图文相互之间所存在的内在联系, 并不需要进行额外的磨合处理。

在推理的时期阶段, K3具备支持从Low起直至Max的三种不同思考级别, 当面临复杂任务之际, 它会如同人类那样进行反复地推敲琢磨, 这种展现出“三思而后行”特质的能力, 使得它在处理数学推理以及代码生成等这类硬核问题之时, 准确率得到大幅度的提升。

2.8万亿参数背后的训练革命

进行一个具备2.8万亿参数的模型训练, 可不是简单地进行GPU堆叠, Kimi团队在扩展效率方面达成了大概2.5倍的提升。他们引入了不存在浪费情况的专家并行技术, 借助在线整数线性规划以及零拷贝通信, 达成了全然动态且绝对平衡的算力配置。

于MoE训练之时, 算力不均衡原本就是常态, 然而K3的这一套系统使得896个专家处于这样一种状态, 即“不闲着且并未累坏”, 每个专家都能够被充分加以利用, 由此训练效率获得了大幅度的提升, 这同样是K3能够在有限的算力情形下达成如此规模的要点所在。

百万级上下文的内存破解

百万级上下文被传统注意力机制处理之际, KV Cache的内存占用会瞬间让显存被撑爆。K3采用了混合架构, 其中KDA线性注意力负责高效长序列混合, 它会把冗长上下文压缩成固定大小的循环状态, 从而彻底打破内存诅咒。

与此同时, Gated MLA全局注意力以周期性的方式, 保留着达到极致程度的全局信息检索能力。这样一种双轨制的模式, 使得K3在处理超长文本时, 不会丢失关键信息, 切实达成了1M上下文的实用化效果。

稀疏训练与跨层连接的稳定秘诀

秉持着在极度稀疏的激活模式当中维持训练稳定这一目的需求, K3团队拿出了两个极具效力的手段。SiTU-GLU激活函数成功地化解了传统激活函数于极端规模情形下有容易引起激活值爆炸的这个问题呈现, 致使训练过程走向更加平稳的状态。

分位数负载均衡抛弃了传统辅助损失函数, 运用动态调整偏差的法子, 这使得896个专家于训练里各尽其责, 既不会闲置又不会过度劳累, 达成了近乎完美的负载均衡情形。

百万级Agent的强化学习训练

K3的强化学习专门是为百万Token超长视距的智能体去量身定制的, 训练环境并非简单问答那样, 而是真实的模拟器, 在这儿K3要历经成百上千个步骤, 这些步骤包括写代码, 包括截图, 包括查Bug, 还包括自我修正。

它甚至于在经过模拟的Slack、Gmail环境里充当人类员工, 去处理那种贯穿虚拟数天的超长待机所产生的任务, 这样的一种训练方式致使K3学会了在复杂环境当中自行做出决策、持续迭代的能力。

开源生态与极致性价比

K3全方位地凌驾于Opus 4.8、GLM – 5.2以及GPT – 5.5之上, 朝着Fable 5和GPT – 5.6 Sol趋近。于网络安全评估里, 不仅仅是它能够去编写已知漏洞利用程序, 而且还独自发觉了Linux内核当中的多个未知零日漏洞。

靠着量化感知训练以及投机解码等方面的优化, K3的性价比极为惊人。于第三方平台计数里, 单次任务成本仅是GPT – 5.6 Sol的一半, 比某些种类的模型便宜掉一个数量层级。随着权重彻底放开, 社区之中得以优化的版本以及本地进行部署的方案将会大量涌现。

你认为, Kimi K3的开源, 会给全球大模型竞争格局带来怎样的影响呢, 欢迎在评论区, 分享你的看法, 点赞并转发, 让更多人看到中国AI的力量。

相关文章