垃圾实验室的案例列表

作者:垃圾实验室 · 共 2 个案例

KV-Model-caching

一句话简介: 在 DeepSeek-V2-Lite(15.7B)上,通过吸收式MLA与INT4量化,将KV缓存从 270KB/token 压缩至 7.6KB/token,实现 35.6倍 压缩,L40S单卡可承载 124万 token 上下文。 --- 背景问题 长上下文场景下,KV缓存随序列长度线性增长,导致显存溢出、推理延迟飙升。现有方案多依赖数值启发式驱逐,忽略语义重要性,且压缩比有限。 核心技术 · 吸收式MLA缓存:直接缓存576维潜在向量(而非展开的K/V),计算时再投影,消除“白存”开销。 · INT4 per-channel量化:对称量化(absm

AgentFrame-vv4.1.0 ​

一句话简介: 脑 = DeepSeek · 手 = 工具执行 · 记忆 = 四层上下文保持 AgentFrame 是一个专为 AI Agent 设计的上下文保持框架。通过四层流水线架构(认知→路由→存储→物理),解决大模型在长对话、多轮任务中的记忆丢失、显存爆炸和上下文断裂问题。 技术栈: Python · DeepSeek API · INT4量化 · 向量检索 · REST API 核心能力与量化结果 架构亮点: · 四层流水线:L1 MetaCog(任务分解/信息缺口/遗忘曲线)→ L2 LandmarkRouter(地标检索/分层Softmax)

案例判断参考

程序员兼职平台怎么选 程序员平台对比怎么看 企业找程序员外包避坑

垃圾实验室的案例列表

KV-Model-caching

一句话简介: 在 DeepSeek-V2-Lite(15.7B)上,通过吸收式MLA与INT4量化,将KV缓存从 270KB/token 压缩至 7.6KB/token,实现 35.6倍 压缩,L40S单卡可承载 124万 token 上下文。 --- 背景问题 长上下文场景下,KV缓存随序列长度线性增长,导致显存溢出、推理延迟飙升。现有方案多依赖数值启发式驱逐,忽略语义重要性,且压缩比有限。 核心技术 · 吸收式MLA缓存:直接缓存576维潜在向量(而非展开的K/V),计算时再投影,消除“白存”开销。 · INT4 per-channel量化:对称量化(absm...

AgentFrame-vv4.1.0 ​

一句话简介: 脑 = DeepSeek · 手 = 工具执行 · 记忆 = 四层上下文保持 AgentFrame 是一个专为 AI Agent 设计的上下文保持框架。通过四层流水线架构(认知→路由→存储→物理),解决大模型在长对话、多轮任务中的记忆丢失、显存爆炸和上下文断裂问题。 技术栈: Python · DeepSeek API · INT4量化 · 向量检索 · REST API 核心能力与量化结果 架构亮点: · 四层流水线:L1 MetaCog(任务分解/信息缺口/遗忘曲线)→ L2 LandmarkRouter(地标检索/分层Softmax)...

案例判断参考

程序员兼职平台怎么选 程序员平台对比怎么看 企业找程序员外包避坑
查看简历
微信沟通 客服 看中这位工程师了?客服帮你 1 小时对接沟通 → ×