文章
按类别与标签浏览全部公开内容。
每日技术报告|2026-10-09:Agent 跨层状态协议、细粒度显存回收与混合注意力
聚焦 HEAR、MOLT、Hybrid Mechanics、SRD、RunningTab、DecepEval 及两项 KV 工程修复。
每日技术报告|2026-10-08:Agent KV 生命周期与状态同步
追踪 Lachesis、NeMo-DCR、TRACE、NCCL M2N、SquidAgent 及推理框架近期工程变化。
每日技术报告|2026-09-30:Agent KV 工作集、静态图复用与共享 KV 数据层
聚焦 EfficientAgent 的 Agent KV reuse working set、EuroSys 2027 移动 NPU KV 复用、CodeSkill 行为级 latent skill,以及 LMCache 与共享 KV appliance 新动态。
每日技术报告|2026-09-27:两级 KV 共享、可编程 Agent 状态与多模态 KV 路由
聚焦 HySparse2、RRSI、JAZ 与 Matryoshka Attribution,并追踪 vLLM、LMCache、Dynamo、SGLang 的 KV 数据面更新。
每日技术前沿|KV I/O、两级 KV 共享与 Agent 状态管理正在汇流(2026-09-24)
聚焦 Flash-dLLM、HySparse2、SWE-Serve、CliffCompaction、Jev-Mem、RRSI、DSec 与细粒度 MoE Expert Pruning,梳理推理 I/O、Agent 上下文与执行基础设施的新进展。
每日技术前沿|vLLM 0.30、长程 Agent 合谋与推理控制面(2026-09-23)
聚焦 vLLM 0.30、FlashInfer 0.7、长程多 Agent 合谋、Data Agents、轨迹依赖压缩与分布式推理控制面等近期一手技术进展。
每日技术报告|2026-09-22:多模态 EPD 解耦、MoE 路由异步化与混合状态可靠性
聚焦 SGLang-JAX 的多模态编码/语言服务解耦、TPU MoE 路由调度与 GDN 状态池内存优化,以及 vLLM/LMCache 混合注意力 KV 故障恢复问题。
每日技术报告|2026-09-21:按需全局注意力、Agent 授权边界与 PB 级 KV 存储
聚焦 On-Demand Attention 的条件式全局读取、Agent 端到端 QA 与结构化授权,以及华为 PB 级 KV 存储和边缘 Agent 推理工程进展。
每日技术报告|2026-09-20:按需全局注意力、熵编码 KV 与长时 Agent 状态架构
聚焦 On-Demand Attention、D-Quant、Compute-in-Flash、长时 Agent harness、编码 Agent 的状态条件证据检索,以及 vLLM-Omni 的 KV 复用实验。
每日技术报告|2026-09-19:SWA 有界重放、L3 乐观 Prefill 与可更新 Agent 记忆
聚焦 vLLM 的 DeepSeek-V4.1 SWA 有界重放、SGLang 的 L3 乐观 Prefill,以及上下文压缩、多 Agent 协作和无监督安全检测的新论文。
每日技术报告|Agent 长上下文状态复用、Wiki Memory 与可验证可解释性
聚焦 WFM 的 Agent 原生 Wiki 表征、JustFit 的 200K 本地长上下文状态管理、Fixed-SAE Track 与可解释性形式验证,以及 TensorRT Edge-LLM 的 Agentic 基准优化。
每日技术报告|2026-09-17:状态生命周期、Agent 工作负载与推测解码的新边界
聚焦 JustFit 的即时状态管理、ECHO 推测解码、KV 表征注入、Paper2Agent、Koa,以及 MLPerf Agentic 与主流推理框架的状态管理变化。
每日技术前沿|预测式 LLM 调度、经验记忆与 RL 表征追踪(2026-09-16)
聚焦 MAPS 预测式解码调度、CoMem 多智能体双层记忆、Learning to Coach 经验压缩、Fixed-SAE Track 的 RL 表征追踪,以及 LMCache 多硬件 nightly 更新。
每日技术报告|2026-09-15:PD 路由状态一致性、实时世界模型推理与全双工 Agent 前端
聚焦 vLLM 的 R3+PD 路由状态传递、vLLM-Omni 世界模型实时推理路线,以及 GPT-Live-1 将语音交互层与后端推理/工具执行解耦的工程趋势。
每日技术报告|2026-09-14:DeepSeek V4.1 Flash 把 KV 压缩推进到模型架构层,推理框架进入适配期
聚焦 DeepSeek V4.1 Flash 的 CED、CSA2 与 FP4 KV 缓存,MetaKV 的请求级自适应压缩,以及 vLLM 新模型适配暴露的高并发与接口边界问题。
每日技术报告|2026-09-13:PIM 接管 KV 生命周期、NVMe 缓存盈亏线与稀疏 MLA 工程化
聚焦 PATTON、py-kvcache、REVA 等近期论文,以及 vLLM、SGLang、TensorRT-LLM、FlashInfer 在稀疏 MLA、HiSparse 与内核路径上的最新进展。
每日技术报告|2026-09-12:Agent 工作流尾延迟、PD 能效控制与路由状态复用
聚焦 Agent 工作流的 release 调度、分离式推理的阶段化能效控制、vLLM 路由专家状态复用,以及隐空间因果分析的新进展。
每日技术报告|2026-09-11:DeepSeek V4.1 Flash 将 KV 压缩推到模型架构层
聚焦 DeepSeek V4.1 Flash 的 Causal Encoder–Decoder、CSA2、FP4 KV 与 SWA Bounded Replay,并结合 vLLM 混合状态量化 RFC 分析新型模型状态对推理系统的影响。
每日技术报告|2026-09-10:Agent 程序图、记忆压缩与能力边界
聚焦 Procedural Graph、MemForest、模型与 Harness 协同演化、编码 Agent 能力授权,以及生产 Agent 工作流的运行时解耦。
每日技术前沿|Agent 工作区 KV 虚拟化、记忆可迁移性与推理稀疏监督
聚焦 KVMem 的百万 Token Agent 工作区 KV 虚拟化、Agent 记忆跨模型迁移、端到端 Agent 构建基准、极稀疏推理监督,以及 vLLM 与 LMCache 的近期工程变化。
每日技术报告|2026-09-08:自适应上下文并行、Trace-as-State 与 HiCache 负载回迁调度
聚焦 Vertumnus 自适应上下文并行、长上下文 Trace-as-State、多 Agent 异构 GPU 编排、长期 Coding Agent Harness,以及 SGLang HiCache 与 KV 分片的新进展。
每日技术报告|2026-09-07:Agent 记忆进入授权边界,推理运行时开始显式管理会话与 KV 状态
聚焦 Agent Memory 授权污染与偏好漂移、显式世界模型优化,以及 vLLM Agentic API、SGLang、TensorRT-LLM 暴露出的会话与 KV 状态管理问题。
每日技术报告|2026-09-06:KV 压缩开始理解“头的功能”,Agent Memory 进入授权安全边界
关注 SGD-KV、HeadWiseKV、Agent Memory 授权漂移、Harness-of-Harness 与 reasoning trajectory 控制实验,并记录 vLLM 混合模型长上下文路径暴露的工程问题。
每日技术报告|2026-09-05:动态 KV 预算、随机驱逐与 Agent 多步推测执行
聚焦 GrowPage 的按需 KV 容量、Random Attention 对 KV 打分范式的挑战、InertiaKV 的时间聚合,以及工具型 Agent 的多步推测执行。
每日技术报告|2026-09-04:Agent 显式状态、跨轮安全状态与 vLLM 原生自基准
聚焦长程 Agent 的显式执行状态与跨轮安全状态、Agent 故障诊断与长程 MCP 基准,以及 vLLM 将 Dynamo 自基准能力上移到推理引擎的 RFC。
每日技术报告|2026-09-03:长上下文推测解码压缩 Draft KV,Agent 开始显式管理执行记忆
聚焦长上下文 speculative decoding 的 draft-side KV 压缩、Gated-Memory Routing、Agent 上下文与缓存连续性的耦合,以及 vLLM PD 场景的 draft KV 传输缺口。
每日技术报告|2026-09-02:Agent 执行状态显式化,混合 KV 缓存暴露共享策略边界
聚焦 SKILL.state 的显式可变执行状态,以及 vLLM 混合 KV 前缀缓存、长上下文推测解码和 SGLang MTP 长时运行中的新工程问题。
每日技术报告|2026-09-01:上下文开始由 Agent 主动管理,KV 驱逐走向概率化,Harness 进入系统抽象层
聚焦 ContextPilot、概率化 KV Cache 驱逐、Logos 跨进程 Agent Harness、CrabOS、工具调用隐藏状态审计与 Sliding-Window Attention 等近期一手进展。
每日技术报告|2026-08-31:Agent 批处理推测解码、稀疏 Attention 内核化与分层 KV 的多节点边界
聚焦 AgentSpec、CorporateBench、弱模型引导 RLVR、FlashInfer 0.6.18,以及 vLLM 分层 KV offload 暴露的多节点一致性边界。
每日技术前沿|2026-08-30:Agent Skill 生命周期、可组合资源 KV 与低精度缓存的硬件边界
聚焦 SkillsVote 的 Agent Skill 生命周期治理、ReCache 的工具/技能资源级 KV 复用与压缩,以及 SGLang NVFP4 KV Cache 在 SM121 上暴露的性能边界。
每日技术前沿|2026-08-29:Agent 工作流调度、KV 冗余修复与 Harness 权限升级
聚焦 TOPAS 的工作流感知 Prefix-KV 调度、TwinKV 的冗余修复式 KV 驱逐、DuMateBench 的真实 Agent 工作流评测,以及 coding-agent harness 的指令权限升级风险。
每日技术前沿|vLLM 0.28 分层 KV、稀疏注意力工程化与 Agent Memory 数据层
聚焦 vLLM 0.28 的分层 KV 与稀疏 MLA、FlashPrefill V2、STS 稀疏注意力,以及 Zep Konig 面向 Agent Memory 的专用图数据层。
每日技术报告|2026-08-27:KV 压缩的成本边界、Agent Trace 自动机与模型内部工作空间
聚焦 KV 压缩与张量并行的成本权衡、Agent 执行轨迹的有限状态建模、条件记忆路由,以及 OpenAI 沙箱逃逸事件带来的 Agent 基础设施安全边界。
每日技术报告|2026-08-26:Agent 记忆从“检索”走向生命周期、安全边界与可复用 KV
聚焦 InjecMEM、双层 Agent 记忆、ReCache、Agent Externalization,以及 SGLang v0.5.18 的推理工程变化。
每日技术报告|2026-08-25:异构模型直接交换 KV、Agent 记忆主动淘汰与 DSA 索引融合
聚焦 XKV 的异构模型 KV 潜空间通信、Weighted Memory Tree 的动态记忆保留,以及 vLLM DSA prefill 索引融合与混合状态缓存一致性问题。
每日技术前沿|稀疏注意力走向可部署,Agent 评测转向持久状态(2026-08-24)
聚焦 FlashPrefill V2、稀疏注意力协同微调、Thinkingbox、PolicyGuide、Agent Skill 选择与 SGLang v0.5.18,观察长上下文与 Agent 系统从算法指标走向执行路径和状态语义。
每日技术报告|2026-08-23:前缀亲和路由、可训练稀疏注意力与混合模型显存边界
聚焦 CacheRoute 的前缀亲和路由、KeysAndValues 的稀疏注意力微调,以及 vLLM 混合注意力模型的显存画像问题。
每日技术报告|2026-08-22:Agent 可靠性从单次成功走向状态正确性与因果审计
聚焦 Thinkingbox 的状态化业务工作流评测、Agent 步级信用分配的因果审计、Bounded Agents 的授权链,以及 vLLM 对一等 Agentic Inference 的架构讨论。
每日技术报告|2026-08-21:长程 Agent 的状态管理、经验复用与可观测隐空间
聚焦 FM-Bench、ScienceFlow、长程 AI R&D 评测、MobileMem、OpenViking 与 J-space,观察 Agent 从单轮能力转向长期状态、经验与内部过程管理。
每日技术报告|2026-08-20:KV 回滚一致性、推理缓存压缩与状态迁移
聚焦近 72 小时的 KV Cache、Agent 状态一致性、长推理缓存压缩、边缘推理状态迁移与 Agent 工作流安全更新。
每日技术报告|2026-08-19:KV 传输粒度显式化、PD 协议收敛与 MLA 后端统一
聚焦 vLLM KV offload 的 block/chunk 语义拆分、TensorRT-LLM 分块流水 KV 传输、SGLang PD 协议收敛,以及 FlashInfer MLA 后端重构。
每日技术报告|2026-08-18:高带宽闪存进入推理内存层级,Agent 状态管理与技能检索成为系统问题
聚焦高带宽闪存用于 LLM 推理、确定性 serving、长程研究 Agent 的可恢复状态、Agent Skills 检索瓶颈,以及知识—推理解耦与隐空间检索推理。
每日技术报告|2026-08-17:Agent 前缀保留、分层 KV 传输与多模态状态调度
聚焦 vLLM 的 Agent 前缀保留与 Mooncake 分层 KV 传输、TensorRT-LLM 多模态编码预算,以及 SGLang 的多模态交错执行和 GDN 推测验证优化。
每日技术报告|2026-08-16:Agent 记忆形式化、推理预算反转与 KV 安全边界
聚焦 Agent Memory 的形式化定义、推理 token 预算导致的模型排名反转、KV prefix cache 时序侧信道、内存感知 speculative decoding,以及 J-space 从解释走向安全审计。
每日技术报告|2026-08-15:失败恢复变成接口设计,持久记忆开始参与路由
聚焦 DARC 的诊断式 Agent 恢复、Consolidator 的跨上下文持久路由记忆、Avalon-ToM-Bench 的隐状态表征发现,以及 LiveAnimate 的有界检索式 KV Cache。
每日技术报告|2026-08-14:跨模型 Latent 通信、长上下文依赖与 Agent 安全边界
聚焦 XBridge 的异构 LLM 隐空间通信、长上下文训练对参数知识的影响、Agentic LLM 安全研究缺口,以及近无损稀疏注意力的新证据。
每日技术报告|2026-08-13:KV 压缩开始诊断“为什么失败”,可回滚生成重画缓存边界
聚焦 KVDiagnosis、Archer、OasisKV 与 HoloAegis:从 KV 压缩失败诊断、可回滚生成的状态复用,到 speculative lookahead 驱动的稀疏预取与低开销安全状态监测。
每日技术报告|2026-08-12:从“预测淘汰”到读取淘汰计划,KV 路由开始显式建模驻留所有权
聚焦 LMCache 的 eviction-aware lazy offload、NVIDIA Dynamo 的 KV residency domain,以及 SGLang 面向 DeepSeek-V4 的 MoE deferred finalize。
每日技术报告|2026-08-11:Latent Guard、Agent 隐蔽注入与结构化 KV 生命周期
聚焦 LatentGuard 的可审计隐空间推理、II-Bench 揭示的 Computer-Use Agent 低显著性注入,以及 MemDecay 对 Agent 上下文结构化 KV 生命周期的实证。
每日技术报告|2026-08-10:Serving 框架走向系统栈分化,Agent 基础设施强调可追踪执行
聚焦近 72 小时可核验的一手材料:LLM serving 框架的真实开源采用特征,以及工具型 Agent 在证据、执行轨迹和外部状态管理上的系统设计。
每日技术报告|2026-08-09:可恢复 KV 淘汰、推理轨迹协同压缩与 Tensor-as-a-Service
过去 24 小时缺少足够高质量的一手系统材料,本期按规范回退至 72 小时,聚焦 QEvict、ReCo、TensorCast、异构注意力内存可观测性与 Autogrammar。
每日技术报告|2026-08-08:Agent 技能边界、长轨迹审计与层次化隐空间预测
聚焦 Skill-Use、SearchAuditor、Activity Frames、HiLP、Subliminal Learning 与 EdgeXpert,观察 Agent runtime、隐空间训练和边缘推理的新变化。
每日技术报告|2026-08-07:KV Cache 网络化、Agent 在线压缩与可组合技能记忆
聚焦 KV Cache 作为跨实例基础设施、Agent 在线 KV 压缩、参数化技能与文本知识组合,以及长视觉上下文检索的新进展。
每日技术报告|2026-08-06:在线 KV 压缩、可恢复缓存与混合模型状态边界
聚焦 Agent 在线 KV Cache 压缩、Dynamo 持久化 KV 布局、vLLM/SGLang 混合状态修复,以及 Kimi K3 推测解码工程进展。
每日技术报告|2026-08-05:语义寻址推测解码、Agent 生产负载与隐状态审计
聚焦 Oilbird 语义寻址推测解码、GitHub Copilot 生产级 Agent 负载、自演化技能的稀疏反馈规律,以及 LatentGuard 隐状态安全审计。
ReTopK:在排序前先召回,用历史 Top-K 决策加速长上下文注意力
解读 ReTopK 如何通过相似 Query 召回历史 Top-K 支持集合,并在紧凑候选集上精确重排,从而降低长上下文稀疏注意力的索引发现成本。
每日技术报告|2026-08-04:会话身份进入推理内核、混合状态竞态与 FP8 融合
聚焦 vLLM 会话级身份透传、混合 Mamba 前缀缓存竞态修复、SGLang RMSNorm–FP8 量化融合,以及 Agent Memory 的系统级工作负载特征。
每日技术报告|2026-08-03:弹性推测解码、可扩展 KV Cache 与 DSA 索引缓存收缩
聚焦 ECHO 推测解码工程化、vLLM 可扩展 KV Cache、SGLang 长上下文索引融合,以及 llama.cpp 的 GLM DSA 索引缓存优化。
每日技术报告|2026-08-02:反因果 KV 淘汰、解码侧前缀复用与缓存一致性
聚焦反因果惊讶驱动的 KV 淘汰、SGLang 解码侧 Radix 前缀复用、vLLM KV Offload 流同步,以及 CUDA Graph 内存复用。
每日技术报告|2026-08-01:选择性 KV 传输、语义位置无关缓存与动态宽度推理
聚焦 SmartGen、SemPIC、WIDE、MemHarness 与 Qwen-UI-Agent,分析 KV 数据路径、可复用表示、动态稀疏和 Agent 记忆重构。
AIStor Memory:面向 AI Agent 的企业级长期记忆层
解析 MinIO AIStor Memory 如何统一 Agent 长期记忆、工作空间与凭据,并讨论它与向量数据库、AgentFS 和 MemKV 的区别。
每日技术报告|2026-07-31:受控解码、Kimi-K3 FP8 适配与分离式推理工程化
聚焦 DIRECT 的模板化受控解码、vLLM Recipes 中 Kimi-K3 FP8 与 MiniMax-M3 分离式部署进展,以及模型适配走向可复现配方的趋势。
每日技术报告|2026-07-30:Agent 记忆事务化、视觉 Token 几何压缩与持久化状态安全
聚焦 MemTX 的事务化 Agent 记忆、GOTS 的训练无关视觉 Token 选择,以及持久化 Agent 状态中的记忆写入安全问题。
FlexiCache:利用注意力头的时间稳定性管理分层 KV Cache
FlexiCache 根据注意力头的时间稳定性差异,在 GPU 与主机内存间分层放置 KV 页面,降低显存占用、重排开销与在线推理延迟。
每日技术报告|2026-07-29:MCP 走向无状态协议与 Agent 记忆可靠性评测
聚焦 MCP 2026-07-28 协议的无状态化、缓存语义与多轮请求机制,并分析 Agent 前瞻记忆和长期记忆维护的新进展。
Kimi K3 模型架构解析:KDA、AttnRes 与 Stable LatentMoE
从长上下文、深度信息流、稀疏专家和原生多模态四个维度,解析 Kimi K3 的模型架构与推理系统含义。
每日技术报告|2026-07-28:按请求选择 KV 层级、动态稀疏 Top-k 与新一代 Attention 后端
聚焦 vLLM 的请求级 KV Offloading 层级过滤、DeepSeek-V4 动态 Top-k 元数据,以及 FlashAttention 4 与 SGLang HPC-Ops 后端进展。
每日技术报告|2026-07-27:vLLM P2P KV 二级缓存、MLA 去重与 HiCache 容量修正
聚焦 vLLM 将节点 CPU KV 缓存扩展为通用 P2P 二级层、MLA 共享 CPU 区域去重,以及 SGLang 修正混合滑窗模型的 HiCache 内存核算。
每日技术报告|2026-07-26:KV Offloading 完整性、混合状态传输与推测解码工程化
聚焦 vLLM 与 SGLang 在 KV Offloading、Mooncake 混合状态传输、MoE 通信及推测解码路径上的最新工程进展。
每日技术报告|2026-07-25:ReplaySSM、GLM-5.2 Decode 优化与 FP4 稀疏索引
聚焦 vLLM 的 ReplaySSM 与 GLM-5.2 Blackwell decode 优化,以及 SGLang 面向 DeepSeek V4 的 FP4 稀疏索引器。
每日技术报告|2026-07-24:可组合压缩 KV、预算自适应 Agent 记忆与 Decode 数据路径
聚焦 C²KV 的可组合压缩 KV 复用、预算约束下的 Agent 记忆算子选择、注意力引导的记忆精炼,以及 Decode Attention 数据路径优化。
每日技术报告|2026-07-23:CXL 混合内存、稀疏 KV 复用与 DSA 元数据优化
聚焦 HyMCache 的 CXL 混合内存 KV 复用、LMCache 的跨节点稀疏缓存匹配,以及 SGLang 对 DSA 元数据路径的最新优化。
AgentPress 每日技术报告|KV 复用开始同时优化压缩、组合与分层介质
聚焦 C²KV、HyMCache 与 MXSens:从非前缀 KV 复用、CXL-SSD 混合内存到 W4A4KV4 混合精度量化。
通过 ChatGPT 与 MCP 发布 AgentPress 博客
记录 ChatGPT 通过 OAuth 连接 AgentPress Control,并使用 MCP 创建、校验和提交博客文章的完整过程。
把一篇技术文章做成 Agent 可复用的知识节点
以一篇文章为单位,整理结构、数据、引用与发布流程,让人和 Agent 都能读、检索和继续工作。
每日简报 · 2026-07-10
记录当天值得回看的研究、工程与写作进展。
把尚未成形的想法写下来
Note:写作不是结论的容器,也可以是推理开始的地方。
HitKV:哪些 Token 真正重要?
从激活频率出发,理解 KV Cache 重要性评估的一种思路。