2026-08-11 · AI 资讯
英伟达实现KV缓存跨模型迁移,推理速度飙升25倍
英伟达研究团队近日取得一项重大技术突破:他们成功研发出一种让KV缓存(键值缓存)在不同模型间进行迁移的方法。这一创新使得目标模型在接收上下文时,可以跳过繁琐的预填充阶段,直接复用已有的计算结果。
众所周知,大语言模型在生成第一个词前,必须处理完整输入并将其存储为KV缓存,这往往是推理中最耗时的环节。长期以来,KV缓存仅限“一次一模型”使用,模型升级或切换时,之前的计算成果便会作废。英伟达的新方案通过转换机制,实现了缓存的通用化。
根据测试数据,该技术可将转换速度提升2.7倍至25倍,具体取决于上下文复杂度和模型架构。这一发现有望从根本上降低长文本AI服务的推理成本,并大幅提升模型切换与升级时的流畅度,为未来AI推理基础设施的优化提供了新方向。
97AI 视角:该技术突破若应用于相关模型,将显著优化长文本处理和多模型调度效率。
