2026 上半年 Agent Memory 研究全景:从分块拼接到可学习的记忆技能

· Agent Memory · 综述整理

过去一年,LLM Agent 的「记忆系统」从 RAG 风格的外挂检索,演化成一个有完整生命周期(存储 / 检索 / 更新 / 合并 / 丢弃)的数据管理系统。本文按「综述打地基 → 架构方法创新 → 评测补齐 → 治理与安全」四条主线,梳理 2025–2026 年这个方向最值得关注的一批工作。

一句话总览:方法侧已经从「分模块拼装」走向「端到端可学习的记忆技能」;评测侧刚刚补齐长程、巩固、遗忘三类基准;治理(语义漂移、隐私、可遗忘性)正在从边缘议题变成主线。

一、四篇综述:先把地图摊开

做任何具体研究前,先看这四份综述,能避免重复造轮子。

论文一句话定位时间
Memory in the Age of AI Agents 基础性大综述,约 200 篇论文(截至 2026.01),提出经典的 3×3×3 分类(内容 × 形式 × 操作) 2025.12
From Storage to Experience 从「存储」到「经验」的演化视角,弥合 OS 工程派与认知科学派的分裂 ACL 2026 Findings
Memory for Autonomous LLM Agents: Mechanisms, Evaluation, and Emerging Frontiers 围绕 store / retrieve / update / summarize / discard 五操作展开 2026.03
LLM Agent Memory: A Unified Representation–Management Perspective 用「表征—管理」统一框架把任务知识需求与记忆表征打通 2026.03

另外两份值得收藏的延伸材料:

二、架构与方法:前沿在做的事

1. Agentic Memory(AgeMem)— 统一长短期记忆,端到端可优化

ACL 2026 的 Agentic Memory: Learning Unified Long-Term and Short-Term Memory Management for LLM Agents。过去的方法把长期记忆(LTM)和短期记忆(STM)当成两个独立组件,靠启发式或外部控制器拼装。AgeMem 把二者统一管理,端到端可优化,不再有不可学习的胶水层。

趋势信号:从「分模块」走向「统一可学习」——记忆管理本身正在变成模型可以学的技能,而不是工程师手设的流水线。

2. GAM — 层级图结构的 Agentic Memory

ACL 2026 的 GAM: Hierarchical Graph-based Agentic Memory。统一流式记忆(stream-based)方便上下文更新,但容易被瞬时噪声干扰;离散结构化记忆稳定但难适应新知。GAM 用层级图同时拿到「塑性」和「稳定性」,缓解 classic stability–plasticity dilemma。

3. AutoMem — 把记忆当成可训练的「元记忆」技能

这是我个人认为对 coding agent 实践者最有启发的一条线。AutoMem: Automated Learning of Memory as a Cognitive Skill(arXiv 2607.01224)引入认知科学里的 metamemory(元记忆)概念:

Memory expertise is a learned skill: knowing what to encode, when to retrieve, how to organize knowledge.

它的关键设计是把文件系统操作升级为一等记忆动作(first-class memory actions),让模型自己决定怎么管理记忆——而不是只能调用一组固定的工具。记忆技能沿两条轴进步:支撑它的结构(提示、文件 schema、动作空间)和模型使用结构的能力。

4. SSGM — 记忆的稳定性与安全治理

Governing Evolving Memory in LLM Agents: Risks, Mechanisms, and the SSGM Framework(arXiv 2603.11768)。当记忆从静态检索库变成动态 agentic 机制后,语义漂移(semantic drift)、隐私漏洞、知识陈旧等问题集中爆发。SSGM(Stability & Safety Governed Memory)是这一新前沿的代表性框架——记忆治理正式从「事后补丁」走向「系统一等公民」。

三、评测:这一年重点补齐的方向

方法侧跑得快,评测侧 2025–2026 才追上来。下面四个基准覆盖了从短到长、从召回到遗忘的不同维度。

Benchmark评测重点来源
LongMemEval 五项长程能力:信息抽取、多会话推理、时序推理、知识更新、遗忘 ICLR 2025
Memora (From Recall to Forgetting) 跨数周到数月的长对话,强调记忆巩固频繁知识更新,而非单纯事实召回 ACL 2026 Findings
MemBench 多记忆层级 × 多交互场景的综合指标,弥补单场景评测 ACL 2025 Findings
Anatomy of Agentic Memory 经验性分析:benchmark 规模不够、指标与语义效用错配、跨 backbone 差异大、系统成本被忽视 2026.02

还有一份值得读的反思型工作 Are We Ready For an Agent-Native Memory System?(arXiv 2606.24775):它批评当前评测把记忆当黑盒、只看端到端 F1/BLEU,呼吁组件级评测——不要再把记忆系统当成不可分解的整体。

四、可观察的整体趋势

  1. 从「检索增强」到「数据管理系统」:记忆不再只是 RAG,而是带 lifecycle(存储 / 检索 / 更新 / 合并 / 丢弃)的一等系统。
  2. 从「分块拼接」到「端到端可学习」:AgeMem、AutoMem 都在把记忆管理变成模型自身的可训练能力。
  3. 评测正在追方法:方法侧跑得快,评测侧 2025–2026 才补齐 LongMemEval / Memora / MemBench,且业界开始反思「黑盒端到端指标」的局限。
  4. 治理与安全成为新前线:语义漂移、隐私、可遗忘性(the right to forget)从边缘议题变成主线。
  5. 认知科学回归:元记忆、可塑性—稳定性、巩固(consolidation)等术语在工程论文中频繁出现——工程派和认知派在重新对话。

参考资料

  1. Memory in the Age of AI Agents — arxiv.org/abs/2512.13564
  2. From Storage to Experience: A Survey on the Evolution of LLM Agent Memory — ACL 2026 Findings
  3. Memory for Autonomous LLM Agents: Mechanisms, Evaluation, and Emerging Frontiers — arxiv 2603.07670
  4. LLM Agent Memory: A Survey from a Unified Representation–Management Perspective — preprints.org 202603.0359
  5. Tobias Weiss, Agent Memory Research in 2026 (Extended Survey) — tobias-weiss.org
  6. Agentic Memory: Learning Unified LTM and STM Management — ACL 2026
  7. GAM: Hierarchical Graph-based Agentic Memory — ACL 2026
  8. AutoMem: Automated Learning of Memory as a Cognitive Skill — arxiv 2607.01224
  9. Governing Evolving Memory in LLM Agents (SSGM) — arxiv 2603.11768
  10. LongMemEval — ICLR 2025
  11. From Recall to Forgetting: Benchmarking Long-Term Memory (Memora) — ACL 2026 Findings
  12. MemBench: Towards More Comprehensive Evaluation — ACL 2025 Findings
  13. Anatomy of Agentic Memory — arxiv 2602.19320
  14. Are We Ready For an Agent-Native Memory System? — arxiv 2606.24775
  15. ICLR 2026 Workshop on Memory for LLM-Based Agentic Systems (MemAgents) — iclr.cc