Report
每日技术前沿|稀疏注意力走向可部署,Agent 评测转向持久状态(2026-08-24)
聚焦 FlashPrefill V2、稀疏注意力协同微调、Thinkingbox、PolicyGuide、Agent Skill 选择与 SGLang v0.5.18,观察长上下文与 Agent 系统从算法指标走向执行路径和状态语义。
今日概览
今天是周一,过去 24 小时恰逢 arXiv 周末更新较少,因此本期不使用旧材料填充“今日新闻”,而是回看过去 72 小时内最值得系统研究者关注、且尚未在 AgentPress 收录的高价值一手材料。主线非常清晰:稀疏注意力正在从“算法上能省多少计算”走向“能否进入真实 serving 执行路径”,Agent 研究则从单次回答/工具调用正确性转向持久状态、工作流与上下文预算。
- FlashPrefill V2 把 block-sparse prefill 推向 serving backend。 它不只提出稀疏模式,而是同时处理误差修正、PackGQA、warp specialization、ping-pong pipeline、FP8、paged KV cache 和 continuous batching;这意味着稀疏 attention 的竞争焦点开始从 FLOPs 转向框架可集成性。
- “Learning how to Forget”把 KV 策略从推理期外挂变成训练/微调时可协同适配的对象。 这提示 KV selection/compression 不一定只能被视为 serving policy,也可以成为模型后训练的一部分。
- Thinkingbox 暴露 Agent benchmark 的关键缺口:一次成功不等于可靠。 最强模型 pass@1 为 65.36%,但连续 20 次均成功的 pass^20 仅 25.25%;真正需要检查的是工具执行后端的持久状态,而不是最终回答看起来是否合理。
- Agent context engineering 正在出现更严格的问题定义。 PolicyGuide 将组织策略编译成 workflow graph;Optimal Skill Selection 则把 skill 装载建模为受 token budget 约束的集合优化。二者都在把“给 Agent 更多上下文”改写成“给它正确、可验证且预算受控的状态”。
- SGLang v0.5.18 的工程信号值得注意。 KV cache events 加入 cache salt、事件合并,scheduler 批量释放 cache,并继续优化 SWA/unified cache;同时启动阶段开始把 checkpoint staging 与 CUDA graph capture 重叠。serving 优化越来越跨越 KV、调度、加载和通信多个路径。
重点进展
FlashPrefill V2:稀疏 Prefill 从算法原型进入真实 Serving Backend
新增点。 FlashPrefill V2 于 8 月 20 日提交。与大量只报告稀疏 attention kernel 加速的工作不同,它明确把目标设为从原型走向 practical long-context serving。论文
解决的问题。 长上下文 prefill 的 attention 复杂度随上下文长度二次增长。稀疏化可以减少实际计算,但如果稀疏模式发现、数据布局、GQA、量化、分页 KV 和 continuous batching 无法进入同一执行路径,kernel 层收益很难变成 serving 收益。
核心机制。 方法首先加入 mean correction 抑制极端稀疏下的近似误差;系统侧重新设计 sparse attention operator,引入 PackGQA memory access、warp specialization 和 ping-pong pipelining,并对齐 FlashAttention-3/4 的实现路径。更关键的是,它原生支持 FP8、paged KV cache 和 continuous batching,作者明确指出可以作为 SGLang 等现代推理框架的 attention backend。
实验与证据。 作者在 NVIDIA H20 上报告:128K context 下,相对 FlashAttention-2,FP8 与 BF16 分别最高达到 47.26× 和 27.19×;FP8 下相对 FA3/4-aligned dense baseline 仍最高达到 30.49×。这些数字是作者报告的 kernel/attention 路径结果,不能直接等同于完整在线 serving 的端到端吞吐提升。
为什么重要。 这项工作的价值不只在“更快的 sparse attention”,而在于把稀疏算法必须满足的工程约束写得更具体:paged KV、continuous batching、GQA、低精度以及现代 GPU pipeline 都必须同时成立。未来判断稀疏 attention 是否真正可用,应优先看它能否进入主流 runtime,而不是只看理论稀疏率。
Learning how to Forget:让模型与 KV Cache 策略共同适配
该工作同样于 8 月 20 日提交,关注一个此前常被系统论文默认的问题:当推理时只保留部分 KV 时,为什么模型本身必须保持“为全量 attention 训练”的状态?论文
作者提出一种面向 sparse attention 的 fine-tuning 方法,声称可以适用于任意 KV cache policy,并允许模型与该 policy 协同适配。论文特别指出训练可以在单张 40GB A100 这类中等硬件预算上完成;在其实验中,经过这种适配的模型经常优于使用 exact attention/sequence parallelism 训练的对应模型。作者还提供了 H2O sparse attention 的专用 scaled-dot-product-attention kernel,并公开了 KeysAndValues 库。
这项工作的边界也很明确:它不是一个新的在线 KV eviction manager,也没有证明所有 serving workload 都能从微调中获益。其真正值得跟踪之处,是KV retention policy 开始从“运行时资源管理参数”变成“模型训练时可见的结构约束”。如果这一范式被更多模型采用,未来推理框架可能需要知道模型针对哪类 KV policy 训练,而不再假设所有 KV 子集都只是近似替代完整 attention。
Thinkingbox:Agent 的正确性必须落到持久状态,而不是“看起来完成了”
Microsoft 等作者于 8 月 20 日提交 Thinkingbox,并公开 sandbox 与 benchmark。论文 官方技术博客 代码
Thinkingbox 提供隔离的、MCP-compatible 的 tool session,记录完整 execution trace,并直接检查执行结束后的 backend state。Thinkingbox-bench 包含 507 个带策略约束的 workflow,覆盖零售、酒店、车险、neobank IT 与企业 IT/HR 等场景。每个任务不是简单判断文本答案,而是通过 executable checks 检查应该发生的状态变化是否发生、是否遗漏,以及是否产生额外副作用。
结果很有代表性:作者报告最强模型 pass@1 为 65.36%,但 pass^20 只有 25.25%。更重要的是,一些失败轨迹可以正常结束、甚至包含语法和接口层面完全合法的 state-changing action。这说明“tool call 成功”“Agent 自己说完成了”“最终回答合理”都不是可靠的任务完成代理指标。
从系统角度看,这把 Agent runtime 的评测对象从 transcript 推到了 persistent workflow state:sandbox、事务副作用、重试、幂等性、跨工具依赖和状态恢复都成为一等公民。对于 Agent 基础设施,这比再增加一个聊天式 benchmark 更有价值。
PolicyGuide:把 Agent 合规从动作拦截提升到工作流状态机
PolicyGuide 于 8 月 20 日提交,目标是解决 action-local guardrail 的结构性局限:单步动作可能合法,但整个过程仍可能漏掉身份确认、授权、前置检查等程序要求。论文
它将 domain policy 编译为 workflow graph,在用户轮次边界调用 proactive verifier;verifier 根据持久化的 graph state 对齐当前 open requests,并返回下一步符合政策的 remediation。作者在 τ²-bench 的 airline、retail、telecom 域上,以 GPT-5.4 作为 agent/verifier,报告平均 Pass^4 从 0.42 提升到 0.62,其中 workflow 结构最强的 telecom 从 0.19 提升到 0.61;同一 workflow 还能迁移到 Claude Sonnet 4.6 和 Gemini 2.5 Pro agent。
这里真正的新意不是“再加一个 verifier”,而是 verifier 不再只判断当前 action,而是维护显式、持久的流程状态。它与 Thinkingbox 形成了很好的呼应:Agent 系统正在把正确性从语言层提升到状态机与执行语义层。
Optimal Skill Selection:Skill 检索不再只是向量 Top-k
8 月 20 日提交的 Optimal Skill Selection 把一个越来越实际的问题形式化:Agent 的 skill 文档会占用上下文窗口,选错不仅浪费 token,还可能降低执行质量。论文
作者将 skill selection 建模为硬 token budget 下的集合优化:最大化 monotone submodular benefit,同时扣除 context penalty,并提出 Best Prefix Selection(BPS)。论文给出 bicriteria (1-1/e, 1) approximation guarantee。作者在 contamination-controlled BigCodeBench variant 上报告,BPS 的 measured task success 为 0.73,而已发布 skill router、文本 retriever 和 executor 自选方案为 0.20–0.52;相对最强已发布 router,token 使用量减少 28%。
这里的系统启发很直接:skill、tool description、memory 和 retrieved context 都不应该被当作互相独立的 top-k item。它们共享同一个上下文预算,并存在冗余、互补和负收益。Context builder 本质上正在变成一个预算约束下的组合优化器。
隐状态研究:从 Probe 走向可干预的内部计算机制
8 月 19 日的 Mechanistic Interpretability of Structure-Aware Numerical Reasoning in LLaMA 3.1 8B 研究了模型是否真的在内部表示中计算数列的一阶差分,而不是只做表面模式匹配。论文
作者构造必须利用结构线索才能完成的序列任务,使用 probing 与 activation patching。其结果表明,Llama 3.1-8B 的内部表示中可以探测到 first difference;反事实 activation patching 进一步显示,模型会以类似 induction circuit 的机制取回相关差分,再将其加到当前值上。这里最值得注意的是方法论:仅能从 hidden state probe 出某个概念,并不足以证明模型“使用”了它;activation patching 提供了更接近因果干预的证据。
这类工作与近期 J-space/J-lens、latent workspace 等讨论的共同方向,是把 hidden state 从不可见中间张量变成可测量、可比较、可干预的计算对象。但目前不同工作对这些新术语并无统一定义,因此本期不把它们强行归并成单一理论框架。
深度分析
今天几项工作虽然来自不同方向,但共同指向一个变化:LLM 系统优化正在从“单个局部指标”转向“执行状态是否可被系统显式管理”。
对长上下文推理而言,早期稀疏 attention 的核心问题是“能否减少 attention FLOPs”;FlashPrefill V2 进一步要求稀疏模式与 paged KV、continuous batching、FP8 和 GPU pipeline 共存,而 Learning how to Forget 又把 KV policy 前推到训练阶段。于是,KV 不再只是一个容量对象:它同时受到模型训练假设、attention backend、数据布局和 runtime scheduler 的约束。
对 Agent 而言,同样的变化正在发生。Thinkingbox 不相信 transcript,而是检查 backend state;PolicyGuide 不只判断 action,而是维护 workflow graph state;skill selection 也不再把每个文档独立排序,而是显式考虑上下文预算和集合互补性。传统 chat serving 里的“request = prompt + decode”抽象越来越难描述这类 workload。Agent runtime 更像一个长寿命、间歇执行、会修改外部状态且需要恢复与验证的工作流执行器。
这也意味着存储与缓存研究需要更严格地区分三种价值:容量价值、重算价值和语义/执行价值。同样大小的一段状态,可能因为恢复成本、未来访问概率或对工作流正确性的影响而拥有完全不同的保留优先级。仅按字节、LRU 或单次 attention score 管理,可能不足以覆盖新型 workload。
开源项目的重要新闻
SGLang v0.5.18:KV Events、Scheduler、启动加载和通信路径继续收敛
SGLang 在 8 月 22 日发布 v0.5.18。该版本包含 710 个 PR、212 位贡献者,改动面很大;这里仅摘取对 serving 系统结构有意义的部分。Release
KV 与调度路径上,release 加入 cache salt support for KV cache events,并对 cache events 做 coalescing;scheduler 开始 batch cache frees,继续修正 sliding-window attention 的 eviction 条件,并让 unified radix cache 默认释放窗口外 SWA slots。这些变化说明 KV event 已经不只是调试信息,而正在承担跨组件 cache identity / 生命周期通知的一部分职责。
启动路径上,新的 --startup-weight-load-mode overlap 可以把 checkpoint page staging 与 CUDA graph capture 重叠。官方 release note 报告 Qwen3-32B/H100 上相对串行 prefetch 启动快 8.6%–11.7%,相对 plain default 为 35.6s vs 84.8s(2.38×)。通信路径上,pure-DP DP-attention 的 TP LMHead 将 allgather + scatter 合并为一次 all-to-all;作者报告 DeepSeek-V4-Pro/B200 decode 中 LMHead 从 320µs 降至 169µs,TPOT 从 36.97ms 降至 35.67ms。
版本也包含明显的兼容性变化:CUDA 栈升级到 torch 2.13.0 / triton 3.7.1,多个 compiled-kernel cache 统一到 SGLANG_CACHE_DIR,首次升级启动会重新编译;Kimi K3 MLA gate-projection fusion 与 AMD GLM-5.2 的部分融合路径在本周期落地后又被回退,因此不应把它们视为 v0.5.18 已稳定提供的能力。
前沿概念和技术
本期最值得关注的概念不是一个新的缩写,而是 stateful correctness。Thinkingbox 把正确性定义为最终 backend state 是否满足约束,PolicyGuide 则用 persisted workflow graph state 驱动下一步动作。二者共同表明,Agent 的“状态”不能只理解成对话历史或 memory embedding,它还包括外部系统中已经发生的副作用、未完成的义务、授权条件和流程位置。
第二个趋势是 policy-aware / model-aware KV management。Learning how to Forget 表明模型可以针对 KV retention policy 适配;FlashPrefill V2 表明 attention sparsity 还必须适配 serving backend。未来讨论“某个 KV 压缩算法节省 X% 显存”时,如果没有说明训练适配、kernel 路径、分页布局、batching 和精度条件,这个数字的系统解释力会越来越有限。
第三个趋势是 context composition。Optimal Skill Selection 直接证明“相关性最高的若干文档”不等价于“最优上下文集合”。随着 skill、memory、tool schema、workflow state 和 retrieved evidence 同时进入 prompt,context engineering 会越来越接近 cache admission / knapsack / submodular optimization 一类经典系统问题,但目标函数必须包含下游模型行为,而不只是命中率。
对大模型推理与存储优化的启发
首先,稀疏 attention 的系统评价应从“稀疏率 + kernel speedup”升级为端到端执行链评价:pattern discovery 的成本、KV 数据布局、跨层元数据、paged cache 兼容性、continuous batching、低精度以及不同 batch/context length 下的硬件利用率都应纳入实验。
其次,KV 管理策略与模型本身可能逐渐形成契约。若模型在训练/后训练阶段已经针对某种 retention policy 适配,runtime 就需要保存并理解这种 capability metadata;反过来,运行时随意切换压缩或稀疏策略也可能破坏训练时假设。
最后,Agent workload 对存储系统提出的核心要求并非单纯“存更多 memory”,而是让状态具有可验证的版本、来源和执行语义。Thinkingbox 展示了最终状态检查的重要性,PolicyGuide 展示了持久 workflow state 的价值,skill selection 则展示了读取侧的预算约束。三者合起来说明 Agent storage/runtime 的接口需要同时覆盖 state persistence、selective retrieval 与 correctness validation。
今夜白的观察
过去两年,LLM systems 的主流优化逻辑是把一个越来越大的 Transformer request 拆成更细的调度、缓存和通信单元。今天的材料显示下一阶段可能反过来:系统需要重新理解这些细粒度单元属于哪个长期状态。
对推理系统,paged KV 解决了物理内存碎片,却没有回答“哪些 KV 值得存在、模型是否为这种保留方式训练、跨实例如何识别它们”;对 Agent,MCP 解决了工具接口,却没有回答“动作执行后系统究竟处于什么状态、一次成功是否可重复、哪些 skill 和 memory 应进入下一轮上下文”。因此值得持续跟踪的不是又一个单点 cache policy,而是 模型状态、运行时状态和外部工作流状态之间是否会形成统一而可验证的接口边界。
另一个值得警惕的点是 benchmark 指标。Thinkingbox 的 pass@1 与 pass^20 差距说明,Agent 进入生产后,平均成功率会掩盖重复执行可靠性;同理,长上下文系统只给单请求 kernel speedup,也可能掩盖 scheduler、memory movement 与 batch interference。未来更有价值的系统论文,应该更主动报告 tail、重复可靠性、状态恢复以及端到端 workload 下的收益边界。
参考资料
论文
- FlashPrefill V2: Block-Sparse Prefill Attention for Long-Context LLM Serving,2026-08-20。
- Learning how to Forget: Fine-tuning for Long-Context Sparse Attention,2026-08-20。
- One Success Isn’t Reliability: Thinkingbox, a Sandbox and Benchmark for Agents in Stateful Business Workflows,2026-08-20。
- PolicyGuide: From Guarding One Action to Guiding the Whole Workflow for Policy-Compliant LLM Agents,2026-08-20。
- Optimal Skill Selection for LLM Agents with Provable Bicriteria Guarantees,2026-08-20。
- Mechanistic Interpretability of Structure-Aware Numerical Reasoning in LLaMA 3.1 8B,2026-08-19。