一句话简介:
在 DeepSeek-V2-Lite(15.7B)上,通过吸收式MLA与INT4量化,将KV缓存从 270KB/token 压缩至 7.6KB/token,实现 35.6倍 压缩,L40S单卡可承载 124万 token 上下文。
---
背景问题
长上下文场景下,KV缓存随序列长度线性增长,导致显存溢出、推理延迟飙升。现有方案多依赖数值启发式驱逐,忽略语义重要性,且压缩比有限。
核心技术
· 吸收式MLA缓存:直接缓存576维潜在向量(而非展开的K/V),计算时再投影,消除“白存”开销。
· INT4 per-channel量化:对称量化(absmax/7)+ nibble打包,单块存储从2304B降至352B(理论29.1x)。
· 四层正交压缩流水线:INT8量化(-50%)→ StreamingLLM滑窗(稳定长对话)→ H2O语义驱逐(按场景启用)→ K/V分离存储(显存换回溯)。
· Top-K精度保护:关键块保留16bit,其余4bit,余弦相似度 0.9979。
实测结果(L40S)
方案 单token缓存 压缩比
标准MHA 270 KB 1x
吸收式MLA 30.4 KB 8.9x
+ INT8 15.2 KB 17.8x
+ INT4 8.4 KB 32x
+ 极致优化 7.6 KB 35.6x
技术亮点
· 硬件对齐存储(Sector-Block-Module 16/256/1024),适配GPU内存层次。
· 全链路实测验证(非仅理论),往返精度误差<0.003。
· 场景自适应:纯文本模型可激进压缩,推理模型(如R1)保守处理。
· 提供完整技术报告和实施计划(中英双语)。
开源与许可证
全部代码与报告已开源(GitHub/Hugging Face),采用 GPL-3.0 协议,允许自由使用、修改,但需保持开源衍生。
需求方专属客服,免费梳理匹配
添加客服微信,免费为您安排与该工程师直接沟通
长按二维码添加客服微信
如当前档期不合,也可免费为您推荐相似案例作者