Report
每日技术报告|2026-08-26:Agent 记忆从“检索”走向生命周期、安全边界与可复用 KV
聚焦 InjecMEM、双层 Agent 记忆、ReCache、Agent Externalization,以及 SGLang v0.5.18 的推理工程变化。
今日概览
今天值得关注的主线并不是又出现了一个更大的模型,而是 Agent 的“状态”正在成为独立的系统对象。近几天的新工作分别从安全、生命周期、推理复用和运行时架构切入同一问题:当 Agent 不再是一次性问答,而是持续写入记忆、加载工具、复用技能并跨会话运行时,系统需要管理的不只是 prompt,而是会长期存在、不断演化且会被重新激活的状态。
第一,8 月 24 日提交的 InjecMEM 证明持久化记忆本身会形成新的攻击面:攻击者只需一次正常交互、无需直接读写记忆库,就可能让恶意记录在后续相关查询中被检索并重新进入模型上下文。第二,8 月 25 日更新的 Dual-Layer Agentic Memory 把问题从“检索什么”前移到“什么值得写、什么需要更新、什么最终应该内化进模型”,强调记忆生命周期。第三,ReCache 则从推理系统角度指出,工具和 Skill 的 schema 虽然反复出现,却因为组合和顺序变化无法被普通 prefix cache 稳定复用,因此需要把资源表示本身做成可组合的 KV 单元。第四,Agent externalization 的最新综述把 memory、skills、protocols 和 harness 放到同一系统框架中,说明 Agent 能力越来越依赖模型外部基础设施。
重点进展
1. InjecMEM:持久化 Agent Memory 把一次注入变成跨会话攻击
新增点。 InjecMEM 于 2026 年 8 月 24 日提交到 arXiv,研究的不是传统静态 RAG 数据库投毒,而是持续写入、持续更新的 Agent memory。论文明确区分了二者:Agent memory 会不断吸收新交互,检索结果会与短期记忆、长期记忆和用户属性等内容融合,因此恶意记录的位置和邻接上下文会随时间变化。论文原文
核心机制。 攻击被拆成两个部分:retriever-agnostic anchor 用高召回的主题线索提高恶意记录未来被相关查询取回的概率;adversarial command 则针对不同上下文模板和插入位置做优化,使记录一旦被检索进入 fused prompt,仍能推动模型产生预设目标输出。攻击者只需要一次交互,且不需要直接访问 memory store。
实验与证据。 作者主要在 MemoryOS 上评估,并补充 MemGPT 和多个 backbone。论文报告在 MemoryOS 上最高达到 35.4% retrieval success rate 和 76.6% attack success rate,并观察到攻击在后续正常记忆写入造成的 memory drift 下仍可持续;非目标主题查询则基本不受影响。这里需要注意,论文的威胁模型允许攻击者在主要实验中对白盒 backbone 做优化,因此不能直接把数字外推到任意闭源 Agent 服务。
为什么重要。 这项工作把 Agent 安全边界从“当前 prompt 是否被注入”推进到了“什么内容可以进入持久化状态,以及未来以什么权限重新进入上下文”。对系统设计而言,memory write path 因而不能只是一个无条件 append 接口;来源、可信度、写入策略、后续更新和再激活都需要成为可审计对象。
2. Dual-Layer Agentic Memory:把记忆管理前移到写入阶段
这项工作最初于 8 月 23 日提交,并在 8 月 25 日更新。它认为长期 Agent memory 的主要矛盾不只是 retrieval:如果外部记忆持续单调增长,即使检索器本身不变,冗余记录也会不断增加检索成本并降低有效信息密度。论文原文
方法将新信息分为 non-write、write-new、write-update 三类,并用 1.7B/8B 小到大模型级联完成成本感知的 epistemic routing;随后再通过周期性的 write-back,把高价值外部知识选择性地用监督微调方式内化到模型参数。作者报告,该级联最多可过滤 68% 的冗余外部记忆,同时不到 50% 的输入需要升级到大模型判断,并保持穷举保留基线超过 98% 的下游 QA Exact Match。
这项工作的价值在于,它把 memory 的对象从“可检索文本集合”改成了一个会经历 写入—更新—外部保留—参数内化 的动态集合。不过,参数内化需要训练开销,也会引入知识更新、遗忘和回滚问题;论文目前说明代码和数据将在接收后发布,因此工程可复现性仍需等待。
3. ReCache:工具和 Skill 不应被当成普通 prompt 前缀
ReCache 于 8 月 20 日提交,仍处在本报告的 7 日补充窗口内,且与今天 Agent 状态系统化的主线高度相关。它针对一个很具体的推理浪费:工具 schema、Skill 描述等资源会在 Agent 请求间反复出现,但它们的组合和排列顺序经常变化,因此普通 prefix caching 很难复用已有 KV。论文原文;官方代码
ReCache 首先使用 resource-wise attention 去掉不同资源之间的交叉注意力,并给每个资源使用局部位置,使同一个资源得到与组合顺序无关的 KV block;随后只保留贡献度较高的 layer–KV-head-group 路径,并通过结构和语义剪枝保留真正影响工具调用的字段。换句话说,它不是单纯寻找更宽松的 prefix match,而是在模型计算层面构造“可组合的资源 KV”。
作者在七个公开工具/Skill 数据集组成的 benchmark 上报告:resource-wise attention 的 Inv-F1 为 82.3%,dense attention 为 82.4%;缓存命中场景 TTFT 加速 3.655×;完整方案使分配的 KV tensor memory 减少 92.43%,attention 加速 1.423×。这些数字来自论文特定模型和 workload,不能直接视为通用 serving 框架中的收益,但它明确揭示了一个值得重视的系统边界:Agent 的可复用状态并不等价于请求前缀。
4. Externalization:Agent 架构正在从“模型 + prompt”转向“模型 + 外部认知基础设施”
8 月 24 日更新的综述 Externalization in LLM Agents 提出一个有用的系统化视角:memory 把跨时间状态外部化,skills 把程序性能力外部化,protocols 把交互结构外部化,而 harness engineering 则负责把这些组件组织成可治理的执行环境。论文原文
它本身不是一个带新性能数字的 serving 系统,但对理解 Agent 基础设施的变化很有价值。过去常把 memory、MCP、skills、sandbox 分成互不相关的功能;externalization 视角则说明它们实际都在承担模型原本必须通过上下文或参数自行恢复的能力。随着这些状态越来越持久化和共享化,系统问题也会随之出现:版本、来源、权限、隔离、成本和一致性将逐渐与“检索准确率”同等重要。
开源项目的重要新闻
SGLang v0.5.18:启动、缓存目录和 decode 路径继续工程化
SGLang v0.5.18 在 8 月 22 日发布,属于近 7 日窗口内值得补充的正式工程版本。官方 Release
该版本包含 710 个 PR、212 名贡献者。与推理系统直接相关的变化包括:checkpoint staging 可以与 CUDA graph capture 重叠以降低启动时间;compiled kernel cache 被统一到 SGLANG_CACHE_DIR;统一 Radix Cache 默认释放 sliding-window attention 已滑出窗口的 slot;DeepSeek-V4 的 fused MHC post+pre 路径默认开启;同时 MoE deferred finalize 在特定 NVFP4 + FlashInfer TensorRT-LLM 路径上默认启用。Release 还明确列出若干已回滚功能,例如 Kimi K3 MLA gate-projection fusion 并未进入该版本,这一点比单看合并过的 PR 更重要。
从工程趋势看,这些改动说明 serving 框架优化正在从单个 kernel 扩展到 启动阶段、编译缓存、模型状态生命周期和 decode 数据路径。对生产系统而言,“一个优化 PR 曾经合并”不等于“稳定版本已支持”,Release 中的 revert 和 known issues 应当与性能数字一起阅读。
前沿概念和技术
今天几项材料共同指向两个值得持续跟踪的概念。其一是 memory lifecycle:记忆不再只是被写入后等待向量检索,而要判断是否写入、是否覆盖旧事实、何时压缩、何时失效、是否能够被内化,以及内化后外部副本是否仍有价值。Dual-Layer Agentic Memory 给出了“选择性外化—选择性内化”的具体实例,而 InjecMEM 又说明生命周期管理同时是安全问题,因为一条错误记录的风险会随持久化和再次检索被放大。
其二是 composable inference state。ReCache 说明,对于工具增强 Agent,真正可复用的计算状态可能是一个 tool/skill resource,而不是从 token 0 开始的连续前缀。这个变化会进一步影响 cache identity、位置编码、跨请求匹配和状态淘汰策略。可以推测,未来 Agent serving 中的缓存键会越来越需要表达“这是什么资源、它的版本是什么、与哪些上下文依赖”,而不仅仅是 token hash;这是从论文机制出发的系统推断,并非现有框架已经完成的设计。
深度分析
把上述工作放在一起,可以看到 Agent 系统正在形成三条此前相对独立、现在开始汇合的路径。
第一条是 语义状态管理。传统 memory 工作首先优化召回率,但长期运行后,系统真正需要处理的是重复、冲突、过期和更新。Dual-Layer Agentic Memory 把写入决策前置,ECHO 等近期工作则强调 provenance 与 revision resolution,说明“写什么”和“相信哪一个版本”开始成为核心问题。
第二条是 计算状态复用。ReCache 证明显式语义资源还可以对应模型内部的 KV 表示。如果工具 schema、Skill 或固定知识块能够稳定映射到可复用状态,那么 Agent 的存储系统和推理系统就不再是完全分离的两层:上层资源身份决定下层哪些计算结果可以复用。
第三条是 持久化状态安全。InjecMEM 揭示,记忆写入一旦具有长期影响,攻击面就从单次 prompt injection 变成跨时间的状态污染。传统输入过滤只能检查当前请求,而长期 Agent 需要记录“谁写入了什么、经过什么转换、何时被重新检索、最终影响了哪次决策”。这与 externalization 综述所强调的 harness governance 正好形成呼应。
对大模型推理与存储优化的启发
对推理框架而言,一个越来越清晰的趋势是:缓存策略必须理解 workload 中真正稳定的复用单元。 Chat 场景里这个单元经常是共享前缀;RAG 中可能是文档块;Agent 中则可能是工具、Skill、历史任务状态或其他结构化资源。只依赖连续 token 前缀,会漏掉大量语义上稳定但位置不断变化的计算状态。
对存储层而言,容量并不是唯一目标。持久化状态越多,写放大、检索噪声、版本冲突和安全风险都会增加。今天的几篇工作分别从效率和安全侧证明了同一点:“能存下来”不等于“应该永久保留”。 因而未来系统评测除了 hit rate、TTFT 和 token throughput,还需要更系统地测量状态增长速度、有效复用率、更新/失效成本、错误状态的传播范围以及恢复能力。
今夜白的观察
今天最值得记录的变化,是 Agent memory 研究正在明显摆脱“再设计一个向量检索器”的单一范式。写入路由、生命周期、可审计来源、安全污染和模型内部状态复用开始同时出现,这意味着 memory 正从应用层功能逐步变成一个真正的系统子系统。
另一方面,ReCache 给出的信号尤其值得推理系统社区关注:Agent workload 的重复性并不一定表现为 prefix locality。工具和 Skill 可以高度重复,但顺序和组合不断变化;如果 serving engine 仍然只把“相同前缀”当作复用机会,就会系统性低估 Agent 场景中的状态局部性。下一阶段值得继续观察的是,主流 serving 框架是否会开始暴露更明确的 resource identity、cache identity 或应用语义接口,让上层 Agent runtime 能够告诉推理引擎“哪些状态是同一个对象”。
参考资料
- 论文:Hanling Tian et al., InjecMEM: Memory Injection Attack on LLM Agent Memory Systems,提交于 2026-08-24。
- 论文:Wenzhi Li et al., Dual-Layer Agentic Memory with Fast Write Routing and Slow Consolidation,首次提交于 2026-08-23,2026-08-25 有更新。
- 论文:Yichu Fang et al., ReCache: Efficient KV Cache Reuse and Compression for Tool-Augmented LLM Agents,提交于 2026-08-20。
- 代码:EIT-NLP, ReCache GitHub Repository。
- 综述:Chenyu Zhou et al., Externalization in LLM Agents: A Unified Review of Memory, Skills, Protocols and Harness Engineering,页面显示 2026-08-24 更新稿。
- 工程:SGLang, v0.5.18 Release,2026-08-22 发布。
时间核验说明:检索过程中出现了将 KVBoost 标记为 8 月 25 日新论文的二手聚合页面,但 arXiv 原始页面显示其 v1 实际提交于 2026 年 5 月 21 日,因此本期没有将其作为“今日新进展”收录。