2026-08-21 · AI 资讯
Liquid AI发布DSpark草稿模型:推理加速最高超3倍

Liquid AI与Hugging Face近日联合发布了LFM2.5系列模型的DSpark草稿模型检查点。通过引入投机解码技术,该方案能够在保持模型原输出质量的前提下,实现推理速度的飞跃式提升。测试数据显示,GPU端吞吐量最高可提升3.18倍,端侧设备提升幅度亦达到2.87倍。

DSpark的核心架构包括并行主干网络、马尔可夫链驱动的顺序头以及置信度调度验证器。其工作机制通过轻量级草稿模型预生成序列,再由目标模型统一验证,从而分摊了内存带宽受限导致的推理延迟。在端侧智能体场景中,函数调用延迟显著降低,极大提升了本地运行复杂应用的流畅度。
该方案已兼容SGLang及llama.cpp等主流推理框架,并开源了Safetensors和GGUF格式权重。DSpark的发布不仅为开发者提供了从云端到端侧的全面加速能力,也为边缘计算场景下部署高性能AI模型提供了新的技术范式。
