2026 上半年 Agent Memory 研究全景:从分块拼接到可学习的记忆技能
过去一年,LLM Agent 的「记忆系统」从 RAG 风格的外挂检索,演化成一个有完整生命周期(存储 / 检索 / 更新 / 合并 / 丢弃)的数据管理系统。本文按「综述打地基 → 架构方法创新 → 评测补齐 → 治理与安全」四条主线,梳理 2025–2026 年这个方向最值得关注的一批工作。
一、四篇综述:先把地图摊开
做任何具体研究前,先看这四份综述,能避免重复造轮子。
| 论文 | 一句话定位 | 时间 |
|---|---|---|
| Memory in the Age of AI Agents | 基础性大综述,约 200 篇论文(截至 2026.01),提出经典的 3×3×3 分类(内容 × 形式 × 操作) | 2025.12 |
| From Storage to Experience | 从「存储」到「经验」的演化视角,弥合 OS 工程派与认知科学派的分裂 | ACL 2026 Findings |
| Memory for Autonomous LLM Agents: Mechanisms, Evaluation, and Emerging Frontiers | 围绕 store / retrieve / update / summarize / discard 五操作展开 |
2026.03 |
| LLM Agent Memory: A Unified Representation–Management Perspective | 用「表征—管理」统一框架把任务知识需求与记忆表征打通 | 2026.03 |
另外两份值得收藏的延伸材料:
- Tobias Weiss - Agent Memory Research in 2026 (Extended Survey):在 Liu 等人综述基础上扩到 220 篇,新增 2026.02–06 的 21 篇,揭示原 taxonomy 未覆盖的交叉主题。
- ICLR 2026 Workshop: MemAgents:专门讨论 agentic systems 记忆层的工作坊,看趋势风向必看。
二、架构与方法:前沿在做的事
1. Agentic Memory(AgeMem)— 统一长短期记忆,端到端可优化
ACL 2026 的 Agentic Memory: Learning Unified Long-Term and Short-Term Memory Management for LLM Agents。过去的方法把长期记忆(LTM)和短期记忆(STM)当成两个独立组件,靠启发式或外部控制器拼装。AgeMem 把二者统一管理,端到端可优化,不再有不可学习的胶水层。
2. GAM — 层级图结构的 Agentic Memory
ACL 2026 的 GAM: Hierarchical Graph-based Agentic Memory。统一流式记忆(stream-based)方便上下文更新,但容易被瞬时噪声干扰;离散结构化记忆稳定但难适应新知。GAM 用层级图同时拿到「塑性」和「稳定性」,缓解 classic stability–plasticity dilemma。
3. AutoMem — 把记忆当成可训练的「元记忆」技能
这是我个人认为对 coding agent 实践者最有启发的一条线。AutoMem: Automated Learning of Memory as a Cognitive Skill(arXiv 2607.01224)引入认知科学里的 metamemory(元记忆)概念:
Memory expertise is a learned skill: knowing what to encode, when to retrieve, how to organize knowledge.
它的关键设计是把文件系统操作升级为一等记忆动作(first-class memory actions),让模型自己决定怎么管理记忆——而不是只能调用一组固定的工具。记忆技能沿两条轴进步:支撑它的结构(提示、文件 schema、动作空间)和模型使用结构的能力。
4. SSGM — 记忆的稳定性与安全治理
Governing Evolving Memory in LLM Agents: Risks, Mechanisms, and the SSGM Framework(arXiv 2603.11768)。当记忆从静态检索库变成动态 agentic 机制后,语义漂移(semantic drift)、隐私漏洞、知识陈旧等问题集中爆发。SSGM(Stability & Safety Governed Memory)是这一新前沿的代表性框架——记忆治理正式从「事后补丁」走向「系统一等公民」。
三、评测:这一年重点补齐的方向
方法侧跑得快,评测侧 2025–2026 才追上来。下面四个基准覆盖了从短到长、从召回到遗忘的不同维度。
| Benchmark | 评测重点 | 来源 |
|---|---|---|
| LongMemEval | 五项长程能力:信息抽取、多会话推理、时序推理、知识更新、遗忘 | ICLR 2025 |
| Memora (From Recall to Forgetting) | 跨数周到数月的长对话,强调记忆巩固和频繁知识更新,而非单纯事实召回 | ACL 2026 Findings |
| MemBench | 多记忆层级 × 多交互场景的综合指标,弥补单场景评测 | ACL 2025 Findings |
| Anatomy of Agentic Memory | 经验性分析:benchmark 规模不够、指标与语义效用错配、跨 backbone 差异大、系统成本被忽视 | 2026.02 |
还有一份值得读的反思型工作 Are We Ready For an Agent-Native Memory System?(arXiv 2606.24775):它批评当前评测把记忆当黑盒、只看端到端 F1/BLEU,呼吁组件级评测——不要再把记忆系统当成不可分解的整体。
四、可观察的整体趋势
- 从「检索增强」到「数据管理系统」:记忆不再只是 RAG,而是带 lifecycle(存储 / 检索 / 更新 / 合并 / 丢弃)的一等系统。
- 从「分块拼接」到「端到端可学习」:AgeMem、AutoMem 都在把记忆管理变成模型自身的可训练能力。
- 评测正在追方法:方法侧跑得快,评测侧 2025–2026 才补齐 LongMemEval / Memora / MemBench,且业界开始反思「黑盒端到端指标」的局限。
- 治理与安全成为新前线:语义漂移、隐私、可遗忘性(the right to forget)从边缘议题变成主线。
- 认知科学回归:元记忆、可塑性—稳定性、巩固(consolidation)等术语在工程论文中频繁出现——工程派和认知派在重新对话。
参考资料
- Memory in the Age of AI Agents — arxiv.org/abs/2512.13564
- From Storage to Experience: A Survey on the Evolution of LLM Agent Memory — ACL 2026 Findings
- Memory for Autonomous LLM Agents: Mechanisms, Evaluation, and Emerging Frontiers — arxiv 2603.07670
- LLM Agent Memory: A Survey from a Unified Representation–Management Perspective — preprints.org 202603.0359
- Tobias Weiss, Agent Memory Research in 2026 (Extended Survey) — tobias-weiss.org
- Agentic Memory: Learning Unified LTM and STM Management — ACL 2026
- GAM: Hierarchical Graph-based Agentic Memory — ACL 2026
- AutoMem: Automated Learning of Memory as a Cognitive Skill — arxiv 2607.01224
- Governing Evolving Memory in LLM Agents (SSGM) — arxiv 2603.11768
- LongMemEval — ICLR 2025
- From Recall to Forgetting: Benchmarking Long-Term Memory (Memora) — ACL 2026 Findings
- MemBench: Towards More Comprehensive Evaluation — ACL 2025 Findings
- Anatomy of Agentic Memory — arxiv 2602.19320
- Are We Ready For an Agent-Native Memory System? — arxiv 2606.24775
- ICLR 2026 Workshop on Memory for LLM-Based Agentic Systems (MemAgents) — iclr.cc