AI资讯

字节跳动训练5万亿参数大模型,规模超阿里月之暗面

智能摘要

万亿,是目前国内已知参数规模最大的模型。的人士给出的理由很直白:与其在现有尺寸上继续追赶其他大模型,不如把参数规模一次推到同行的数倍,争取领先位置。他表示在大语言模型上字节会继续坚持自研、做好基本功,接受短期落后,坚持优化长期。

参数规模突破5万亿

字节跳动正处在探讨训练一个参数规模超出5万亿的大模型的进程之中, 此数字已然碾压了阿里通义千问Qwen 3.8 – Max的2.4万亿, 还超过了月之暗面K3的2.8万亿, 进而成为当下国内已知参数规模最为庞大的模型计划。

和Seed团队关系近乎的人讲, 这个规划还处于早前探讨时期, 模型最后不见得会发布。不过内部的逻辑挺简洁: 跟在现有的水准上持续追赶相比之下, 倒不如把参数的量一次提高到同领域若干倍, 努力夺取优先地位。

高层表态坚持长期主义

创始人张一鸣, 于近日的内部分会上, 进行了罕见的公开表态, 着重强调做模型这条路, 得始终秉持长期主义, 还要拥有延迟满足之感, 千万不能利用别人产出的成果, 去换取那一时的榜单排名。他清晰地指明说, 字节甘愿为了长期设定的目标, 将一部分短期内能获取的收益予以舍弃。

梁汝波这位CEO, 在8月6日举行的2026年中全员大会之上, 再次着重强调了这一逻辑, 他表明字节就大语言模型方面, 会持续坚持自行研发, 把基本功给做好, 甘愿接受短期内处于落后状态, 持续坚持, 以优化长期价值, 他特地作出澄清, 外界针对外部压力所展开的猜测, 不过纯粹属于胡乱猜测罢了。

严禁蒸馏开源模型

有关字节对于开源模型所抱持的态度, 正呈现出收紧的态势。张一鸣明确地作出了禁止, 禁止内部针对开源模型展开蒸馏行为, 甚至还借助通过API检测等一系列方式, 以此来强化限制举措。他觉得蒸馏这一行为会对真正具有实质意义的长期技术突破形成干扰, 并且这种立场在这个相关业内人士圈里, 是显示得相当强硬的。

有一种技术手段叫蒸馏, 它用来借助小模型知识去提升大模型性能, 能迅速见到成效, 不过有可能对底层能力的深度构建造成阻碍。字节决定舍弃这条便捷途径, 而是深入专心研究自身技术, 踏上一条更具挑战性但更为坚实稳固的道路。

组织调整重新分工

为了给这一满怀壮志的计划提供支撑, Seed团队正着手开展组织架构的调整, 负责人项亮跟大语言模型预训练数据负责人沈科密切协作, 重新去梳理团队的职责, 进行资源的分配, 这般调整展现出字节对于5万亿参数模型的重视程度。

此前Seed团队已然推出了Seed系列模型, 这在行业里具备一定影响力。进而此次组织架构调整, 蕴含着字节正为更大范围规模之模型训练开展准备工作。从起始的数据收集直至模型训练, 各个方面环节均需再度进行构思预案以及优化完善。

与竞品对比分析

相较于国内主要大模型那些竞品的参数规模, 字节此次的布局显得格外激进, 阿里通义千问Qwen 3.8 – Max拥有2.4万亿参数, 这已然是行业领先水平, 月之暗面K3的2.8万亿参数也紧随其后, 字节要是达成5万亿参数的目标, 那将会是目前已知国内规模最大的模型。

针对这种参数规模方面的竞争情形, 后面暗藏着对于AI技术路线的异样理解阐释。存在一部分人觉得参数越大表明模型能力越强劲, 然而却也有其他人觉得质量还有效率同样具备重要意义。字节最终所做出的选择明显是属于那种主张参数越大越好的观点, 它期望凭借规模层面的显著优势去打造技术方面的防护壁垒。

战略意义与未来展望

字节跳动于此次宣告5万亿参数模型计划, 这并非单纯属于一次技术层面的竞赛, 更是一种战略性质的宣言。其目的在于对内实现研发思路的统一, 同时对外传达出这样的信号, 即字节跳动不会有意去跟着他人的技术路线陷入那种过度竞争的困局, 而是有意谋划走出一条完全归属于自身的成长路径。

假使这一项计划最终达成落地的状态, 那么将会对于国内的AI这个行业来说的格局产生极为深刻的影响。参数规模出现的突破情形有可能去带来模型能力上的质的变化, 也存在着可能引发新一轮的技术方面的竞争。字节能不能够实现这一个目标, 这还有等待时间去进行检验。

难道你会觉得参数规模就是用以判定AI模型能力的独一无二的因素吗? 诚挚欢迎于评论区域去分享一下你的见解呀的, 赶紧点赞并且转发从而以便让更多的人能够看到!

相关文章