MarkTechPost新闻
Liquid AI 发布 LFM2.5-DSpark 草稿模型,解码速度提升高达 3.18 倍且输出不变
Liquid AI 发布了 LFM2.5 系列三个模型的 DSpark 草稿检查点,通过投机解码实现最高 3.18 倍(H100)和 2.87 倍(M4 Max)的解码加速,且贪心输出与原始模型完全一致。草稿模型约 300M 参数,支持 llama.cpp 和 SGLang,权重以 Safetensors 和 GGUF 格式提供,但需自托管。
Liquid AI 发布了其 LFM2.5 系列中三个模型的 DSpark 草稿模型检查点:LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B。每个草稿模型都为现有目标模型增加了一条推测解码路径。一个约 3 亿参数的草稿模型会提出一个包含九个候选 token 的块,目标模型在单次前向传播中验证整个块。这种权衡是以少量内存增加换取大幅解码加速:在 H100 上最高可达 3.18 倍,在 M4 Max MacBook Pro 上最高可达 2.87 倍。输出不会改变。在贪心解码下,生成的序列与目标模型单独运行时的结果完全相同,因此基准测试准确率保持不变。llama.cpp 和 SGLang 均提供首发支持。
可以部署吗?
可以,前提是你自行托管。权重以 Safetensors 和 GGUF 格式提供,且目前 Hugging Face 上没有任何托管推理提供商提供草稿模型检查点的服务。运行它们需要使用支持 LFM2 目标 DSpark 的 SGLang 或 llama.cpp 构建版本。
- 公司层面:LFM 开放许可证 v1.0 仅在你的实体年收入低于 1000 万美元时允许免费商业使用。独立开发者、初创公司和中型企业均涵盖在内;大型企业必须首先联系 Liquid AI 获取商业许可证。
- 行业:开发者工具、本地运行的消费类应用、机器人和嵌入式系统,以及将数据保留在本地或设备上的医疗保健、金融和国防工作负载。
- 应用:本地编码助手、在每次工具调用前进行推理的设备端代理、批大小为 1 的单用户聊天,以及在笔记本电脑级硬件上运行的离线副驾驶。
什么是草稿模型?
推测解码使用一个小模型来提出 token,再由一个更大的模型进行验证。每个 LFM2.5 草稿模型约有 3 亿参数:针对 1.2B-Instruct 目标的是 2.957 亿,针对 2.6B 和 8B-A1B 目标的是 3.277 亿。其主干是 5 个全注意力层,hidden_size=2048,intermediate_size=6144,GQA 采用 32 个查询头对应 8 个 KV 头,块大小为 9。草稿模型不附带词表权重;嵌入层和 LM 头在加载时从目标模型绑定。2.6B 草稿模型仓库在 BF16 格式下大小为 655 MB,这是你实际增加的内存成本。
DSpark 结合了三个部分。一个 DFlash 风格的并行主干,以目标模型的上下文特征为条件,在单次前向传播中为所有草稿 token 生成隐藏状态。一个轻量级顺序头,在秩为 256 的相邻 token 之间建模为马尔可夫链,恢复 token 间的依赖关系并提高后续块位置的接受率。一个置信度调度的验证器,预测每个 token 的存活概率,并在验证成本高于节省成本时剪除低置信度的后缀。
实测结果
Liquid AI 报告了在 1xH100 上通过 SGLang 使用 BF16 的吞吐量,以及在 M4 Max MacBook Pro 上通过 llama.cpp 使用 Metal 和 FP16 GGUF 权重的吞吐量。两者均使用块大小 9、批大小 1 和温度 0,涵盖 MATH500、HumanEval、MBPP、GSM8K 和 MT-Bench。
加速比与接受率相关,而接受率又与输出的可预测性相关。LFM2.5-8B-A1B 在 MATH500 上每步接受 10 个 token 中的 8.27 个,而在 GSM8K 上仅接受 4.02 个,因此同一模型在同一 GPU 上的加速比从 3.18 倍波动到 1.29 倍。在 1.2B 模型上,MT-Bench 的接受率降至 3.90,H100 上的增益降至 1.66 倍。
MoE 模型在 Apple 芯片上的结果是最明显的警示:LFM2.5-8B-A1B 在 M4 Max 上平均仅获得 1.18 倍的加速。Liquid AI 将此归因于 llama.cpp 的 Metal 后端中当前的 MoE 实现,以及验证 k 个 token 会比单次解码步骤激活更多专家,从而产生更多权重流量的事实。
智能体场景
增益集中在用户在每次工具调用前等待推理的场景。在多工具函数调用场景中,Liquid AI 报告 DSpark 为 LFM2.5-2.6B 平均降低了 57% 的延迟。用你自己的轨迹进行测试:一个会规划、调用和重新规划的智能体,在每个用户轮次中会多次承担解码成本。
python -m sglang.launch_server \
--model-path LiquidAI/LFM2.5-2.6B \
--speculative-algorithm DSPARK \
--speculative-draft-model-path LiquidAI/LFM2.5-2.6B-DSpark \
--speculative-draft-attention-backend flashinfer \
--disable-radix-cache --mem-fraction-static 0.75 --port 30000块大小从草稿模型的 config.json 中读取,基线是去掉三个 --speculative-* 标志的相同命令。
关键要点
- DSpark草稿模型新增约3亿参数,在H100上解码速度最高提升3.18倍。
- 贪婪解码输出与基线完全一致,因此基准测试准确率不受影响。
- 加速效果取决于接受率,并随工作负载变化,范围从1.04倍到3.18倍不等。
- 端侧MoE是短板:LFM2.5-8B-A1B在M4 Max上仅获得1.18倍加速。
- 多工具函数调用获得最大的实际收益:LFM2.5-2.6B延迟降低57%。
请查看8B-A1B的模型卡片及完整技术报告。本研究的所有功劳归于该项目的研究人员。
需要与我们合作推广您的GitHub仓库、Hugging Face页面、产品发布或网络研讨会等?请联系我们。
Asif Razzaq是Marktechpost Media Inc.的首席执行官。作为一位具有远见卓识的企业家和工程师,Asif致力于利用人工智能的潜力促进社会公益。他最新的举措是推出人工智能媒体平台Marktechpost,该平台以对机器学习和深度学习新闻的深度报道而著称,内容既具有技术深度又易于广大读者理解。该平台月浏览量超过200万,足见其广受欢迎。