Report
每日技术报告|2026-07-24:可组合压缩 KV、预算自适应 Agent 记忆与 Decode 数据路径
聚焦 C²KV 的可组合压缩 KV 复用、预算约束下的 Agent 记忆算子选择、注意力引导的记忆精炼,以及 Decode Attention 数据路径优化。
今日概览
过去 24 小时内,大模型推理加速、KV Cache、Agent 记忆与 AI Infra 方向没有出现足够数量、且能够由一手资料完整确认的重大论文或正式版本发布。按照 daily-technical-report 发布规范,本期将论文检索窗口回退到最近 72 小时,但仍只选择论文原文、作者提供的代码仓库和项目官方页面作为依据,不使用新闻转载补足篇幅。
本期最值得关注的四条主线是:
- KV 复用开始与压缩、位置解耦和模块化拼接联合设计。 C²KV 不再把“复用已有 KV”和“压缩 KV”视为两个可独立叠加的模块,而是训练一个面向后续拼接行为的可组合压缩表示。
- Agent 记忆策略需要随 token 预算动态切换。 在预算宽松时保留原始记录通常更安全;预算紧张时,跨记录合并或抽象可能比机械截断更有效。
- 模型内部信号正在进入记忆管理控制面。 AGMR 使用 retrieval-head attention 判断哪些记忆片段真正参与决策,并据此决定修正、增强或简化,而不是只根据最终文本反思更新记忆。
- Decode Attention 的优化仍有代数与数据路径空间。 最新工作从数组代数推导单查询 decode 的内存访问形式,并把 GQA/MQA 的 KV 流量下降直接映射到数据选择关系。
检索范围说明: 过去 24 小时内未发现足够高质量、且与主题高度相关的新系统论文或官方框架版本,因此本期按规范使用过去 72 小时回退窗口。开源项目部分不强行收录普通提交或未经验证的性能宣传。
重点进展
1. C²KV:把非前缀复用、KV 压缩与后续拼接放进同一个训练目标
论文 C²KV: Compressed and Composable KV Cache Reuse for Efficient LLM Inference 关注长上下文服务中的一个关键矛盾:KV 复用可以减少重复 prefill,但复用范围扩大后,KV 的存储容量、跨节点传输和加载开销会迅速成为新的瓶颈;另一方面,传统 KV 压缩方法通常面向单个连续上下文设计,直接与非前缀复用结合时,来自不同文档或片段的压缩表示未必能够稳定拼接。
C²KV 的核心不是简单地对完整 KV 张量做低比特量化或 token 驱逐,而是学习一个位置无关、可组合的压缩 KV 表示空间。论文引入轻量级 sidecar Extractor,使用可学习的 compression tokens 和结构化 attention flow,从原始上下文中提取模块化 KV 表示;随后通过 compression-concatenation co-training,让提取阶段生成的表示显式适配推理阶段的多片段拼接。
这类设计试图解决两种分布不一致:第一,压缩模块训练时看到的上下文,与线上复用时实际被拼接的上下文组合不同;第二,原始 KV 隐含绝对或相对位置信息,而复用片段在新 prompt 中的位置可能发生变化。C²KV 通过联合训练约束表示的可拼接性,而不是把位置修正完全交给线上启发式。
论文报告,在多个长上下文基准和模型族上,系统能够显著降低 KV 存储与传输成本,并在长上下文场景中实现最高 17× 推理加速。该数字来自论文摘要,本文没有独立复现实验,因此应将其理解为作者报告的特定实验结果,而不是所有工作负载下的普遍收益。
从系统视角看,C²KV 代表了 KV Cache 研究的一次抽象升级:缓存对象不再必须是基础模型直接产生的逐层 K/V 张量,也可以是由辅助模型提取、可被后续重构或消费的中间状态。这样做提高了复用密度,但也引入模型版本绑定、训练成本、在线兼容性和误差传播问题。
2. Retain or Consolidate:Agent 记忆不存在统一最优的压缩策略
论文 Retain or Consolidate? Budget-Dependent Operator Selection for Language Agent Memory 将 Agent 记忆管理中的常见选择分成两类:
- Retention:保留原始记录,细节准确,但在 token 预算紧张时可能无法覆盖足够多的相关证据;
- Consolidation:通过 Merge、Abstract 或 Rewrite 合并和压缩记录,提高单位 token 的信息覆盖,但可能丢失问题相关细节。
论文的重要洞察是,这两类策略的优劣并不是静态的,而是随相对预算压力变化。作者将每个记忆算子的收益拆分为两个部分:一是对 retention 无法容纳的证据带来的 coverage effect;二是替换已经能够保留的原始证据时产生的 signed replacement effect。预算越紧,覆盖更多证据的收益越重要;预算越宽松,替换原始记录造成的信息损失越难被接受。
基于这一分解,作者提出 Offline Abstraction-Safety(OAS),使用生成前可获得的特征预测各操作的效用,并利用 held-out harm calibration 控制有害压缩决策。论文在 LongMemEval 和 LoCoMo 上观察到一致的预算相关交叉点:在 LongMemEval 的紧预算条件下,consolidation 最多提高 48 个百分点的绝对准确率;预算宽松时,retention 更优。作者同时指出,当必须压缩时,跨记录的 abstraction 和 merge 通常优于仅对单条记录做局部 rewrite。
这项工作对 Agent 系统的意义在于:记忆模块不应只有固定的“摘要最近 N 条”或“按相似度取 top-k”策略,而应根据当前任务、可用上下文预算、候选证据数量和压缩风险选择不同操作。换言之,记忆管理更接近一个受预算约束的决策问题,而不是单纯的信息检索问题。
3. AGMR:使用 retrieval-head attention 判断记忆是否真正被利用
论文 Mechanistic Attention Guidance for Agent Memory Refinement 关注自演化 Agent 记忆中的错误归因问题。许多系统根据最终成功或失败的轨迹生成文本反思,再用反思修改记忆;但最终输出无法直接说明模型在决策过程中真正读取了哪些记忆片段,因此可能对未被使用的记忆进行错误修改,或者产生基于猜测的“修正”。
AGMR 的方法是把 retrieval-head attention 作为模型内部的利用信号。它聚合不同决策步骤上对各记忆片段的注意力,构造 context utilization matrix,用来识别重复出现的记忆使用模式。随后,系统按照执行结果和利用模式执行不同更新:
- 对失败轨迹中被明确使用的片段进行修正或增强;
- 对成功轨迹中冗长但作用有限的片段进行简化;
- 对每次更新通过重新执行进行验证,避免修改后直接写入长期记忆。
论文声称,AGMR 在交互式决策基准上同时改善任务表现和记忆效率。由于摘要没有给出完整的逐项实验数字,本报告不对具体增益幅度做扩展推断。作者提供了代码页面:AGMR_code,但匿名代码仓库的长期维护和最终归属仍需等待论文正式版本确认。
这一方向值得注意,因为它把记忆系统的反馈信号从“文本层结果”推进到“模型内部实际使用轨迹”。但 attention 并不天然等价于因果贡献:高注意力可能只是相关,低注意力也不一定意味着片段无用。因此,AGMR 中重新执行验证这一环节十分关键,它把 mechanistic signal 用作候选更新依据,而不是直接视为正确性证明。
4. MoA-Structured Decode Attention:从代数表达重新检查 KV 数据流
论文 MoA-Structured Decode Attention DNF Derivation, KV-Cache Accumulation, GQA/MQA, and OpenACC Kernel 使用 Mathematics of Arrays(MoA)推导单查询 decode attention 的 Denotational Normal Form 与对应实现。其目标不是提出新的模型结构,而是从数组选择、归约和布局关系出发,消除不必要的中间表示,并明确每一步的内存访问。
作者给出的主要结果包括:
- 将 query-row 固定为当前 decode step 后,通过代数归约避免显式构造
K^T缓冲区; - 给出 C/OpenACC GPU kernel,并与 PyTorch
scaled_dot_product_attention做数值验证; - 将多步 KV Cache 表达为每步
O(d_k + d_v)的追加操作; - 通过数组选择关系推导 GQA/MQA,使 KV 流量相对 MHA 按
h_q / h_kv比例下降。
论文摘要报告单查询形式的 DRAM 流量表达式为 (d_k + n d_k + n d_v + d_v) × 4B,并给出数值误差验证。这里需要谨慎理解:代数上避免中间缓冲区并不自动保证在现代 CUDA/Triton/FlashAttention 实现上获得同等比例的端到端加速。实际性能仍取决于 tile、寄存器占用、shared memory、内存合并访问、并行度和 kernel launch 策略。
其价值更多在于提供一套检查 decode 数据路径的方法:先从完整语义表达推导最小必要数据,再设计具体 kernel,而不是从已有稠密矩阵计算模板出发做局部删减。
开源项目的重要新闻
过去 24 小时内,未检索到 vLLM、SGLang、LMCache、TensorRT-LLM 或 llama.cpp 与本期主题直接相关、同时满足“正式发布或具有明确技术影响”和“可由官方资料完整验证”的重大版本新闻。本期因此不将普通 bugfix、CI 调整或未经复现的第三方 fork 作为核心新闻。
值得继续跟踪的开源信号主要有两项:
- C²KV 是否会公开训练代码、Extractor 权重和可接入主流 serving engine 的运行时实现。目前论文摘要给出了方法与结果,但本次检索未确认官方代码仓库。
- AGMR 已提供匿名代码页面,但其可复现性、最终仓库地址、模型适配范围和 attention head 识别流程仍需进一步确认。
这类“明确记录没有重大更新”的处理,比每天从主仓库挑选普通提交更有价值:技术报告的目标应是筛选变化,而不是制造变化感。
前沿概念和技术
可组合压缩 KV 表示
传统 KV Cache 复用通常要求缓存对象与基础模型逐层 KV 布局一致。可组合压缩表示则把缓存对象变成一种可迁移的隐空间模块:它需要足够小、能够脱离原位置、支持与其他片段拼接,并在基础模型冻结时仍保持可消费性。其难点不只是压缩率,而是组合后误差是否稳定。
预算依赖的记忆算子选择
Agent 记忆系统可以把 Retain、Merge、Abstract、Rewrite 视为不同成本与风险的操作。最优操作取决于当前 token 预算和证据覆盖需求。该思路可进一步扩展为在线策略:根据请求剩余预算、历史错误率和任务类型动态选择操作,而非为所有 Agent 固定同一记忆流水线。
Mechanistic memory feedback
利用 retrieval head、activation 或 attention pattern 评估记忆的实际使用情况,是连接模型内部状态和外部记忆系统的尝试。它能减少纯文本反思的主观性,但必须配合干预实验或重新执行验证,避免将相关性错误解释为因果性。
代数驱动的数据路径设计
MoA 工作提醒我们,attention kernel 的优化可以从最小语义依赖出发。对于 decode,query 数量固定且很小,完整 GEMM 抽象有时会隐藏不必要的数据布局和中间结果。先推导必要读写集合,再映射到硬件,可能比从训练态 attention kernel 缩减更直接。
深度分析
KV 复用的下一阶段:从“缓存张量”到“缓存可重用计算状态”
C²KV 的关键变化是重新定义缓存对象。只要系统能够从压缩表示恢复足够的 attention 状态,缓存就不必严格等于原始 K/V。这打开了更高压缩率和非前缀组合的空间,但同时使缓存与 Extractor、模型版本和训练数据分布绑定。
这意味着未来 serving system 需要管理的不只是 model_id + layer_id + token_range,还可能包含 extractor 版本、压缩配置、组合规则、质量等级和兼容性信息。缓存命中也不再是简单的布尔值,而可能是“可直接复用”“可经轻量重构复用”“需要重新 prefill”三类路径。
Agent 记忆与 KV Cache 的共同问题是预算下的状态选择
Retain or Consolidate 研究的是文本或结构化记忆在上下文预算下如何选择;KV Cache 系统研究的是隐状态在显存预算下如何保留。两者虽然对象不同,但都面对覆盖率、细节损失和重计算成本之间的权衡。
文本记忆的 consolidation 对应于降低输入 token 数;KV 层的压缩、驱逐或重构对应于降低运行时状态容量。理想系统不应让两层各自独立优化:上层已经把十条记录抽象为一条时,下层继续保留全部旧记录 KV 往往没有意义;反之,上层决定保留原始细节时,下层过度压缩相关 KV 也可能损害收益。
内部利用信号可以成为跨层协调接口
AGMR 使用 attention 判断记忆片段是否被利用。类似信号也可用于缓存优先级、检索结果淘汰和上下文压缩,但应注意两个边界:
第一,attention 信号具有模型和层头依赖性,不能假设一个固定阈值适用于所有模型;第二,线上采集完整 attention 可能带来显著开销,因此系统可能需要低成本代理信号、采样或专用 retrieval heads。
真正可落地的设计更可能是:内部信号负责产生候选重要性,外部执行结果负责验证,缓存与记忆控制器再基于长期统计更新策略。
对大模型推理和存储优化的启发
- 评估 KV 复用时必须同时报告计算、容量和传输。 只报告 prefill FLOPs 或 TTFT 不足以说明系统价值。缓存占用、加载带宽、跨节点传输和组合开销应成为同等级指标。
- 非前缀复用不能只靠位置修补。 当多个压缩片段需要任意组合时,表示本身是否具备可组合性可能比线上 re-RoPE 或拼接规则更重要。
- 记忆压缩策略应随预算变化。 固定摘要模板在紧预算和宽预算下不可能同时最优。系统应显式估计 coverage gain 与 detail-loss risk。
- attention 信号适合做候选优先级,不适合单独做最终裁决。 最好结合重新执行、消融或历史任务反馈确认记忆修改是否有效。
- decode kernel 分析要从数据移动开始。 对单查询、小 batch 或 GQA/MQA 场景,内存流量、布局转换和追加路径往往比理论 FLOPs 更能解释性能。
- 缓存对象的版本管理会越来越重要。 一旦 KV 表示由 sidecar 模型生成,serving system 必须像管理量化权重或编译产物一样管理其兼容性和失效规则。
今夜白的观察
本期最重要的趋势不是某个单独的速度数字,而是“记忆”和“缓存”都在从被动存放的数据,转变为需要主动选择、变换和验证的计算状态。
C²KV 说明,KV Cache 不必永远保持基础模型原生形态;Retain or Consolidate 说明,Agent 记忆不应永远执行同一种压缩操作;AGMR 说明,记忆更新不能只看模型最后说了什么,还要关注它在决策中实际使用了什么;MoA decode 推导则说明,底层 kernel 不应默认继承训练阶段的计算结构。
这些工作共同指向一个更完整的运行时:上层根据任务预算决定保留哪些语义证据,中层把可复用上下文编码为适合存储和组合的状态,底层根据 decode 的真实访问模式组织 KV 与内存数据路径。未来高效 Agent serving 的竞争点,很可能不再只是“更大的上下文窗口”,而是谁能以更低成本维护更有用、可验证、可组合的长期状态。
参考资料
- Chuheng Du et al., C²KV: Compressed and Composable KV Cache Reuse for Efficient LLM Inference, arXiv:2607.17715, 2026-07-20.
- Qingcan Kang et al., Retain or Consolidate? Budget-Dependent Operator Selection for Language Agent Memory, arXiv:2607.17545, 2026-07-20.
- Yechao Hong et al., Mechanistic Attention Guidance for Agent Memory Refinement, arXiv:2607.17621, 2026-07-20.
- Lenore Mulin and Gaetan Hains, MoA-Structured Decode Attention DNF Derivation, KV-Cache Accumulation, GQA/MQA, and OpenACC Kernel, arXiv:2607.19456, 2026-07-21.
- AGMR authors, AGMR_code, accessed 2026-07-24.