一句话简介: 在 DeepSeek-V2-Lite(15.7B)上,通过吸收式MLA与INT4量化,将KV缓存从 270KB/token 压缩至 7.6KB/token,实现 35.6倍 压缩,L40S单卡可承载 124万 token 上下文。 --- 背景问题 长上下文场景下,KV缓存随序列长度线性增长,导致显存溢出、推理延迟飙升。现有方案多依赖数值启发式驱逐,忽略语义重要性,且压缩比有限。 核心技术 · 吸收式MLA缓存:直接缓存576维潜在向量(而非展开的K/V),计算时再投影,消除“白存”开销。 · INT4 per-channel量化:对称量化(absm
一句话简介: 脑 = DeepSeek · 手 = 工具执行 · 记忆 = 四层上下文保持 AgentFrame 是一个专为 AI Agent 设计的上下文保持框架。通过四层流水线架构(认知→路由→存储→物理),解决大模型在长对话、多轮任务中的记忆丢失、显存爆炸和上下文断裂问题。 技术栈: Python · DeepSeek API · INT4量化 · 向量检索 · REST API 核心能力与量化结果 架构亮点: · 四层流水线:L1 MetaCog(任务分解/信息缺口/遗忘曲线)→ L2 LandmarkRouter(地标检索/分层Softmax)
一句话简介: 在 DeepSeek-V2-Lite(15.7B)上,通过吸收式MLA与INT4量化,将KV缓存从 270KB/token 压缩至 7.6KB/token,实现 35.6倍 压缩,L40S单卡可承载 124万 token 上下文。 --- 背景问题 长上下文场景下,KV缓存随序列长度线性增长,导致显存溢出、推理延迟飙升。现有方案多依赖数值启发式驱逐,忽略语义重要性,且压缩比有限。 核心技术 · 吸收式MLA缓存:直接缓存576维潜在向量(而非展开的K/V),计算时再投影,消除“白存”开销。 · INT4 per-channel量化:对称量化(absm...
一句话简介: 脑 = DeepSeek · 手 = 工具执行 · 记忆 = 四层上下文保持 AgentFrame 是一个专为 AI Agent 设计的上下文保持框架。通过四层流水线架构(认知→路由→存储→物理),解决大模型在长对话、多轮任务中的记忆丢失、显存爆炸和上下文断裂问题。 技术栈: Python · DeepSeek API · INT4量化 · 向量检索 · REST API 核心能力与量化结果 架构亮点: · 四层流水线:L1 MetaCog(任务分解/信息缺口/遗忘曲线)→ L2 LandmarkRouter(地标检索/分层Softmax)...
添加客服微信,免费为您安排与该工程师直接沟通
长按二维码添加客服微信
如该工程师当前档期不合,也可免费为您推荐相似候选人