在构建生产级 Agent 时,最容易被低估的往往不是模型能力或工具调用,而是记忆系统。一个没有记忆的 Agent 每次对话都从零开始,无法识别用户、无法复用已确认的偏好、无法从历史失败中修正策略;而一个记忆失控的 Agent 则会在上下文里堆积大量无关信息,导致成本线性上升、指令遵循能力急剧退化。本文从工程实现角度,拆解短期记忆(会话窗口)、摘要记忆、向量长期记忆,以及检索与遗忘机制的完整设计链路,重点放在真实生产环境中踩过的坑与可落地的调优方案。
一、记忆分层:先定义边界,再谈技术
在动手写代码之前,必须明确记忆系统的分层模型,否则很容易把"缓存""状态""记忆"混为一谈。我习惯将 Agent 的记忆按生命周期与访问延迟划分为四层:
2026/1/24大约 13 分钟