LFM2.5模型推理提速3倍,端侧AI从此不卡顿
通过引入全新的投机解码路径,该技术在完全不改变模型输出质量的前提下,大幅提升了推理吞吐量。端,整体吞吐量最高可提升3.18倍;在端侧设备上,最高提升幅度也能达到2.87倍。平台上开源,为开发者在从云端大规模加速器到端侧边缘设备的广泛部署提供了强有力的支持。
性能数字到底有多猛
日前, AI和Face一同发布了LFM2.5系列的三款草稿模型检查点, 数据一下子就达到满分状态。在GPU端, 吞吐量能够达到最高提升3.18倍的程度, 这并非只是在实验室里作理论上的探讨, 而是实实在在具有加速成效了。
在端侧设备方面, 其表现同样非常突出, 提升幅度最高可达2.87倍。对于普通用户来讲, 这表明原本要付费才能用到的云端模型功能, 现而今在本地就能够进行运行, 并且运行速度还更快。
端侧智能体跑得更快
在端侧Agent进行推理的场景之中, 为LFM 2.5至2.6B , 函数调用的延迟平均而言出现了降低情况, 降低幅度达到了57%。对于从事本地智能体应用相关工作的用户来讲, 这个特定的数据极为关键, 它所意味着的是响应变得会更跟手同时交互也会更流畅。

在将M4Max Pro当作测试平台的情况下, LFM2.5 – 2.6B的输出速度, 其最高能够到达每秒139个token。这样的成绩, 甚至是超过了部分专有云模型, 在本地的体验方面, 并不比云端要差。
投机解码怎么提速
传统大语言模型在推理阶段, 主要是受内存带宽的限制, 众多延迟大多源于把模型权重从DRAM以流化形式加载至SRAM的进程, 此瓶颈多年来一直困扰着该行业。
投机解码是专门为解决此痛点而产生的, 它借助轻量级草稿模型迅速生成候选token, 接着由目标模型在单次前向传播里统一进行验证, 把加载权重的成本高效分摊至多次token上。
草稿模型怎么训练的
这次发布里, AI深度融合了投机解码技术, 该技术包含三个核心组件。在训练数据这块, 草稿模型采用了大规模多样化数据混合, 其中包括SFT、聊天、代码以及函数调用。
历经严格的消融实验后, 最终所确定的初始版本是仅注意力架构, 它含有5层以及9个块, 整体参与数量把控在大概3亿前后, 于保障性能之际力求做到尽量瘦身。

输出质量有保证吗
投机解码机制存在着这样一个特点, 在贪心解码的情形之下, 草稿token唯有在与目标模型分布全然一致的时候才会被予以接受。一旦遭受拒绝, 随即就会被目标模型自身的token给替代掉。
这表明所生成的输出序列, 于结构方面跟基线贪心解码达成了全然一致的状态。在每一项基准测试当中, 准确率并没有出现哪怕丝毫的下降情况, 质量对齐所做的工作十分稳健踏实。
开发生态支持如何
生态支持这块儿进展速度极快, AI在发布首日之际就达成了对主流推理框架的兼容。开发者无需去做额外折腾环境这类事情, 拿到之后就能够直接使用。
现阶段与之相关的GGUF以及GGUF格式的检查点, 都已经于Face平台进行开源, 不管你所使用的是云端那种大规模的加速器, 或者是运行在端侧边缘设备之上, 均能够寻觅到与之相对应的部署方案。
这件提高了3倍AI推理速度的事, 是云端加速更让你心动, 还是端侧部署更让你心动呢? 欢迎至评论区谈论你的看法, 表述自己的见解。