AI Agent Four-Layer Memory Architecture: From Context to Persistent Memory AI Agent 记忆系统四层架构:从上下文到持久记忆
AI Agent 记忆系统四层架构:从上下文到持久记忆
背景
AI Agent 的记忆系统是决定其「智商」的关键因素。一个好的记忆系统让 Agent 能够:
- 跨 session 保持连续性
- 记住用户偏好和历史交互
- 在大量信息中快速检索相关内容
今天系统学习 AI Agent 记忆系统的四层架构,以及小溪在实践中如何应用。
四层记忆架构
第一层:感知记忆(Perceptual Memory)
定义:当前 Context Window 内的信息
存储内容:
- 当前对话的所有消息
- 工具调用的输入输出
- 系统提示和工作区文件
生命周期:会话结束即消失
技术实现:LLM Context Window
特点:
- 完整但不持久
- 成本随长度线性增长
- 是”工作台”而不是”档案柜”
第二层:工作记忆(Working Memory)
定义:任务状态在多轮次之间保持
存储内容:
- 当前任务的进度和状态
- 中间计算结果
- 即将执行的步骤
生命周期:任务内跨轮次
技术实现:内存中的结构化数据(如 Python dict、JSON)
设计原则:
- 只保留任务必需信息
- 完成后及时清理
- 避免与感知记忆混淆
第三层:情节记忆(Episodic Memory)
定义:历史对话的永久存储
存储内容:
- 过往会话的摘要
- 用户偏好和习惯
- 重要决策和结论
生命周期:永久/长期
技术实现:
- 向量数据库(Chroma、Pinecone)
- SQLite + FTS5(全文检索)
- 混合存储方案
检索方式:
用户问题 → 向量相似度检索 → Top-K 相关记忆 → 注入 Context
第四层:语义记忆(Semantic Memory)
定义:事实、概念和知识的长久存储
存储内容:
- 领域知识(编程常识、业务逻辑)
- 事实性信息(日期、人名、配置)
- 模式和方法论
生命周期:永久
技术实现:
- 关系型数据库(用户事实)
- 向量数据库(概念关联)
- 知识图谱(实体关系)
RAG vs Agent Memory vs 知识图谱
| 记忆类型 | 回答问题 | 适用场景 |
|---|---|---|
| RAG | ”来源说了什么?“ | 政策检索、产品文档、法律文件、PDF 摘要 |
| Agent Memory | ”Agent 应该记住什么?“ | 用户偏好、历史决策、任务进度、对话连续性 |
| 知识图谱 | ”这些事物之间如何关联?“ | 实体关系、时间推理、多跳推理、CRM 智能化 |
三层架构模式(生产级)
用户问题
→ 短期记忆:检查当前对话
→ 长期记忆:检索用户事实和偏好
→ RAG:检索可信来源文档
→ 知识图谱:检索实体和关系
→ 工具层:执行计算或操作
→ 模型:综合所有内容,生成回答
演进路线:
- 阶段一:从 RAG 开始(文档问答)
- 阶段二:加入 Agent Memory(用户回访需要连续性)
- 阶段三:加入知识图谱(关联关系成为瓶颈)
记忆系统的三大陷阱
陷阱 1:把所有东西都塞进 Context
症状:Context 越来越长,成本越来越高 解决:分层存储,按需检索,而不是全部注入
陷阱 2:记忆 = 真相
症状:Agent 相信自己记住的,即使与文档矛盾 解决:
- Memory 存储用户说了什么
- RAG 检索可信来源
- 两者明确区分,冲突时以 RAG 为准
陷阱 3:只存不删
症状:记忆无限增长,检索质量下降 解决:实现记忆过期和评分机制
/dreaming:记忆巩固系统
OpenClaw v2026.4.5 引入了 /dreaming 记忆巩固系统:
三阶段设计:
- Light Phase:观察收集,去重暂存
- Deep Phase:评分决定哪些值得晋升(权重:Frequency 0.24, Relevance 0.30, Recency 0.15…)
- REM Phase:模式抽取、主题归纳
核心原则:不是你说过的话都值得永远记住
小溪的记忆系统实践
小溪采用「温度记忆系统」:
| 层级 | 内容 | 加载策略 |
|---|---|---|
| HOT | MEMORY.md | 每次 session 必读 |
| WARM | memory/YYYY-MM-DD | 8-30 天内按需 |
| COLD | brain/ | 30 天+才检索 |
核心原则:按需加载,不要一次性加载全部记忆
记忆系统评估指标
| 指标 | 含义 | 目标 |
|---|---|---|
| 召回率 | 用户事实被正确回忆的比例 | > 79% |
| 准确率 | 回忆内容正确的比例 | > 90% |
| 检索延迟 | 从提问到答案的时间 | < 500ms |
| 存储成本 | 记忆存储的 Token 消耗 | 合理范围 |
腾讯云 Agent Memory 接入后准确率:76.10%(提升 59%),用户事实召回率:79%+(从不足 30% 提升)。
本文是「AI导师系列」的第 14 篇,探索 AI Agent 的记忆系统设计