大模型训练太贵?上海AI实验室推NCP预训练,Token减半效率翻倍
他们提出全新预训练任务下一个概念预测(NCP),并顺势推出全球首个8.9B规模的离散隐空间基座模型NCP-ArchPreview,把训练效率的账本重新算了一遍。对于想要在模型微调和推理加速上找新突破口的研究者来说,这套隐空间思路无疑是一份刚出炉的路线图。
逐词预测统治大模型训练好几年了,上海AI实验室联合上交大LUMIA Lab直接说: 换个概念维度来预测, 半箱算力就够。
半箱油追平全箱的算力账本
针对NCP项目我们依托了5.73T的Dolma多语料进行预训练操作, 该举措在仅仅消耗51.3%的Token预算的情况之下, 成功追平了OLMo-3-7B模型在最后Loss指标上的表现水平, 这一结果等效于将整体的收敛速度提升了1.95倍之多。
别人要烧光所有的算力, 才能够到那个位置, 它只用了不到一半的预算就到了, 计算帕累托效率实现了系统性的提升, 提高到了1.74倍, 这笔账算下来让人觉得相当刺眼。
三段式隐空间流水线
这个模型的结构框架是使用乘积量化技术来构建一个超大规模的离散概念空间的, 然后连接一个可以微分的下一个概念预测头以及防止因果信息泄漏的反馈模块, 最后采用分层残差路由的方式进行处理。
所谓的三段串起来进行整合的意思, 就是把未来那个概念给明确地建模表示出来, 这不再是依靠逐个词汇进行死板的猜测, 而是先把下一个概念具体呈现出什么样的状况给想明白、搞清楚之后, 再去进行输出内容的处理。
从逐词跳到逐概念
传统的研究范式始终盯着下一个token的概率分布不放, 而NCP技术则是把预测的粒度直接提高到了概念层面, 这样一来, 在隐空间里只通过一次路由操作, 就能够跳过多层的token处理步骤。
它的下游综合表现是领先的, 具体分数高出了2.45分。在GSM8K数学推理这个方面, 得分一下子涨了近6分。概念级预测在推理任务上的优势显得特别明显。
十七兆参数微调就超LoRA
团队发现, 要是只微调隐空间参数里面的那个数量是十七百万的参数项目的话, 其实际表现效果就能够超越采用LoRA技术所达到的水平状况, 并且完全没有出现灾难性遗忘这种以往一直存在的老旧缺点问题, 不仅如此训练时的吞吐量数值得到了显著提升上升的同时所使用的计算机显存容量需求反而出现了降低下降的现象。
对于手里资源不太充裕的团队而言, 这个微调过程所需要的花费在整体来看几乎就是可以忽略不计的状态, 与此同时它所带来的效果稳定性却是要比现在那些普遍采用的主流方法还要更稳固得多。
推测解码加速也搭上了
将概念表征的方法注入到草稿模型里面去之后进行推测解码, 结果发现平均接受的长度提升了有百分之四点一七%, 其中代码任务的提升幅度上涨到了百分之七点五九%。
推理加速这个事儿, 一直以来都是部署环节里的一个大瓶颈。隐空间这个概念提出来之后, 它就给推测解码这种方法打开了一条全新的路子。因为它的接受率上去了, 所以延迟自然就下来了不少。
全套资产开源加踩坑笔记
在技术报告里面, 团队把那些用于筛选千亿级代理指标的机制, 还有那个全过程中包含各个阶段性评测的框架, 全部都进行了开源处理, 并且连自己在实践中遇到的坑, 以及针对这些问题的解决方案, 也都全部写到了里面。
这张路线图刚刚出炉, 对于那些想要尝试进行模型微调以及推理加速研究的各位朋友来说, 你们是完全可以直接拿去用来运行的, 这意味着大家根本就不用再从零开始经历那些可能会让人头疼的踩坑过程了。
大家认为概念级别的预测如果不断地深入发展, 会不会把以token为粒度的方法彻底废掉呢? 可以在评论区里探讨一下。如果觉得内容有用, 不妨点赞并分享。