编程 KVMem:把百万 token 的 agent 工作区虚拟化到消费级 GPU 上

2026-09-07 18:12:29

KVMem:把百万 token 的 agent 工作区虚拟化到消费级 GPU 上

现代 LLM agent 运行在持久工作区里,累积的历史会超过 GPU KV 容量和模型原生上下文窗口。现有系统通常把旧上下文压成摘要或以后检索成文本——要么丢失细粒度执行证据,要么重复预填充模型已处理过的内容。KVMem 提出 KV-context 虚拟化:把溢出的工作区历史作为分页的 KV 状态保存在 GPU 显存、主机内存和磁盘之间,让 agent 无需重放整个历史就能继续执行。

思路

核心是把"上下文"从"必须一次性塞进窗口的 token 序列"变成"可换页的 KV 状态":工作区历史以 KV cache 形式持久化,跨 GPU 显存(热页)、主机内存(温页)、磁盘(冷页)分页。当 agent 需要回到早期某段执行证据,KVMem 换入对应页,而不是重新预填充那段文本——省掉反复处理相同 token 的计算与延迟。模型推断发生在当前窗口内,工作区虚拟化为任意长的历史提供"换页即用"的访问。

为什么重要

现有路径的代价被低估:摘要丢失细节(错误信息、中间状态、具体输出)会直接传导到 agent 决策错误;检索式方案把旧文本重新塞回上下文,预填充成本随历史线性增长。KVMem 让"百万 token 级工作区"在消费级 GPU 上可用——面向资源有限的本地/个人 agent 部署,而不是必须依赖集群。

工程要点

  • 分页层级:显存/内存/磁盘三级的换页策略决定延迟曲线——热页毫秒级、冷页回源慢,冷热分离要以访问模式为依据。
  • KV 一致性:分页缓存与模型推理之间必须保证 KV 状态精确对应,页失效与换入不能静默错位,否则静默产生幻觉级别错误。
  • 适用场景:长会话 agent、代码仓库级 agent 工作区、多轮工具调用轨迹复盘;对一次性短任务收益有限。
  • 同类对比:与"摘要压缩"和"检索增强"不同,KVMem 走的是保留原始 KV 证据的虚拟化路线——代价是存储与换页管理复杂度,换来的是执行证据不丢失。

来源:KVMem: Virtualizing Million-Token Agent Workspaces on a Consumer GPU - arXiv

复制全文 生成海报 AI 大模型 KV cache agent

推荐文章

程序员茄子在线接单