AI代理应该记住、遗忘、重新计算还是再次检索什么?

长时间运行的代理不应记住所有内容。本文提供了一个实用的生命周期模型,用于决定哪些内容应属于持久记忆、哪些内容应重新检索、哪些内容重新计算更安全,以及哪些内容应过期或被取代。
已发布:
Aleksandar Stajić
Updated: 2026年9月25日 22:20
AI代理应该记住、遗忘、重新计算还是再次检索什么?

长时间运行的AI代理会积累远超其应永久记住的信息量。对话、工具输出、中间计算、用户偏好、项目决策、搜索结果、系统状态、错误以及成功流程,在当下都可能看起来有用。将它们全部视为持久记忆会引发第二个问题:代理之后必须判断哪些已存储的信息仍然可信、最新、相关且可安全复用。

真正的记忆问题不是存储——而是生命周期控制

现代代理系统几乎可以存储任何内容:完整记录、摘要、嵌入、文件、数据库记录、工具轨迹、结构化事实、技能以及外部工件。因此,存储容量并非难点。难点在于决定什么值得保留、应保留多久,以及当现实发生变化时必须发生什么。

OpenAI的会话记忆指南明确警告,将过多历史向前携带会造成分心、低效、上下文污染以及错误累积。Anthropic同样将上下文视为必须精心管理而非累积的有限资源。微软研究院也朝着同一方向前进:PlugMem将原始交互历史转换为可复用的结构化知识,而不是将完整历史视为同等有价值的记忆。

其架构后果很简单:记忆需要准入策略、维护策略和退役策略。仅靠检索器无法提供这些语义。

对任何代理信息可采取的四种可能行动

行动使用时机典型示例主要风险
记住该信息在未来任务中仍然有用,且可靠重建成本高昂或不可能稳定的用户偏好、已接受的项目决策、可复用技能、已验证的长期约束持久化错误、过时或过于宽泛的内容
重读/检索该信息具有可能变化的权威来源权限、库存、策略版本、订单状态、产品价格、当前API文档使用旧副本而非当前权威来源
重算该信息是派生的,且重新计算成本足够低基于当前源数据的总计、分数、排名、摘要,确定性转换持久化过时的派生输出
遗忘/过期/取代未来复用价值很小,或会带来隐私、过时、冲突或污染风险临时工具输出、失败假设、被取代的决策、临时令牌、过时环境状态丢失后来证明必要的信息

记忆准入测试

在信息成为持久代理记忆之前,用六个属性对其进行测试。这些属性比模糊的重要性评分更有用,因为它们能预测信息随时间变化的行为。

决定信息是否属于记忆的六个属性

属性问题决策压力
易变性
权威性
复用价值
重建成本
敏感性
修订行为

1. 记住:能改善未来决策的持久知识

良好的持久记忆能减少重复工作,而不会把昨天的状态变成今天的真相。典型候选包括明确的用户偏好、持久的项目约束、决策及其理由、可复用流程、反复出现的失败模式,以及预计不会频繁变化的已验证事实。

最强的记忆未必是原始记录。PlugMem在2026年的工作主张将交互历史转换为紧凑事实和可复用技能。微软的BREW同样将过去轨迹提炼为可检索的程序性知识,描述该做什么、何时适用以及需要注意什么。两者都指向一个有用的设计原则:存储可复用知识,而不仅仅是历史文本。

被记住的条目还应保留来源。未来的代理应能区分“用户明确要求这一点”、“系统观察到这一点”、“某个来源陈述了这一点”以及“某个模型推断了这一点”。没有这种区分,记忆会逐渐将证据、解释和推测混为一个无差别的池子。

2. 重新读取或检索:具有外部真实来源的易变事实

有些信息之所以有价值,恰恰是因为它会变化。当前权限、订单状态、库存、账户状态、服务健康状况、软件文档、价格、日程、法规和 API 行为,在用于重要决策之前,通常应从拥有这些信息的系统中重新读取。

智能体可以记住某个来源存在、如何访问它,或哪些字段重要。但它不应假设过去检索到的值仍然具有权威性。这将关于从何处以及如何获取真相的记忆,与真相的缓存副本区分开来。

3. 重新计算:计算比信任成本更低的派生信息

派生信息应与源事实区别对待。如果一个值可以从当前输入确定性地重新计算,那么持久化结果可能会造成不必要的陈旧。总计、百分比、排名、资格标志、生成的摘要以及其他派生输出,在使用时通常应重新计算。

关键的权衡是成本。如果重新计算成本高昂,系统可以将结果与确切的输入版本、时间戳、推导方法和失效条件一起缓存。如果重新计算成本低廉,新鲜度通常胜出。

4. 遗忘、过期或取代:删除是一种能力

遗忘不一定是一种缺陷。它是一种控制机制。临时的工具输出、一次性的搜索结果、失败的假设、临时环境状态、中间推理产物、过时的用户偏好、过期的凭证以及被取代的决策,如果无限期地保持活跃,都可能成为负担。

近期的记忆研究越来越认识到,无限制的积累会降低性能。微软 2026 年受人类启发的记忆架构明确包含了基于干扰的遗忘和巩固,而 PlugMem 报告称,原始历史记录可能会用低价值上下文压垮智能体。工程上的教训并不需要复制生物记忆:保留应该是有选择性的。

在许多系统中,取代比立即删除更安全。旧决策仍然可审计,但检索默认使用新决策。这对于项目、政策、合规以及任何变更历史本身就是证据的工作流程都很重要。

决策方法

决定信息项的生命周期

1
1. 对信息进行分类
它是权威状态、用户偏好、外部证据、派生输出、程序、观察还是模型推断?
2
2. 确定真实来源
确定是否有其他系统或来源比记忆本身更具权威性。
3
3. 估计易变性
询问该项在下一次有意义的重用之前发生变化的可能性有多大。
4
4. 估计重用和重建成本
将未来价值与获取或重新创建信息的成本和可靠性进行比较。
5
5. 检查敏感性和范围
定义谁可以访问该信息、它可以在哪里持久化,以及持久化是否合理。
6
6. 定义失效
指定过期、取代、冲突解决,或强制进行全新权威读取的条件。
7
7. 选择操作
记住、重新读取/检索、重新计算,或遗忘/过期/取代。
8
8. 保留来源
存储足够的元数据,以区分源事实、用户陈述、观察、推导和模型推断。

示例:同一个智能体应使用不同的生命周期操作

信息推荐操作原因
“用户偏好简洁的技术性回答。”记住稳定的偏好,具有高重用价值
“部署当前已暂停。”重新读取当前操作状态可能发生变化
“预计总成本为 48,620 欧元。”根据当前输入重新计算派生值应跟随源变化
昨天一个 20,000 token 的原始工具响应遗忘或外部归档直接重用价值低;上下文成本高
针对反复出现的构建失败的已确认解决方法作为可重用程序记住未来重用价值高,重新发现成本高
模型对服务器故障原因的猜测不要提升为持久事实推断不是经过验证的证据
一个旧的项目决策后来被新决策取代取代,保留审计历史最新决策应胜出,同时不抹除来源
当前产品价格再次检索高易变性和外部权威
法律或政策解释仅在有来源/版本元数据时记住先前的分析;行动前重新检查权威性适用性可能随时间和司法管辖区而变化

记忆应存储条件,而不仅仅是结论

当持久记忆只存储结论而丢失了结论有效时的条件时,它就会变得危险。“使用每租户数据库”比“当监管隔离和租户特定生命周期要求超过运营开销时,使用每租户数据库”更弱。第二种形式保留了决策边界。

这对于智能体学习到的程序更为重要。一个成功的工作流程不仅应捕获步骤,还应捕获前提条件、环境、工具版本、可观察的成功标准以及已知的失败模式。否则,在错误环境中检索到的记忆可能会自信地重现一个过时的解决方案。

记忆写入应比记忆读取更昂贵

读取弱记忆可能损害一个答案。写入弱记忆可能损害许多未来的答案。这种不对称性表明写入路径应比读取路径更严格:对候选记忆进行分类、检查来源、检测矛盾、应用敏感性规则、定义作用域,并决定是否需要人工确认或外部验证。

当智能体从自身生成的输出中写入记忆时,这一点尤为重要。生成的摘要可能包含压缩错误。工具故障可能被误解。一个看似合理的假设可能被存储为事实。如果这些输出在没有证据状态的情况下成为未来上下文,智能体可能创建自我强化的错误循环。

记忆质量至少包含五个维度

维度问题
保留质量系统是否保留了应当留存的信息?
检索质量系统能否在需要时恢复正确的记忆?
新鲜度质量系统是否知道存储的信息何时不再是最新的?
来源质量系统能否区分来源、用户陈述、观察、推导和推断?
退役质量当信息不应再影响决策时,系统能否使其过期、取代、限制或删除?

基准测试正开始区分这些关注点。微软的 MemGym 明确评估长时程智能体场景中的记忆,并报告记忆隔离分数,旨在减少推理、检索和工具使用能力的混杂影响。这一方向很重要,因为仅凭最终任务分数无法判断记忆本身是有帮助、有害还是无关。

默认情况下不应放入持久记忆的内容

  • 原始思维链或隐藏推理产物。
  • 临时认证令牌、机密或凭据。
  • 未经核实的模型生成假设。
  • 存在实时权威系统的易变状态。
  • 缺少源输入且可低成本重新计算的派生值。
  • 仅因存储可用而保存的大型工具输出。
  • 已由更好的真相来源管理的信息的重复副本。
  • 没有明确持久化目的、访问范围和生命周期的敏感个人数据。
  • 没有明确版本或退役语义的已被取代的结论。
  • 仅对当前运行有用且没有可复用诊断价值的错误消息或故障状态。

记忆是任务特定的——不存在通用的最优存储

编码智能体受益于可复用流程、仓库约定、成功修复模式和项目决策。个人助理可能需要偏好、承诺和关系上下文。商务智能体更需要当前产品和交易状态,而非价格或库存的历史副本。研究智能体受益于来源出处、未解决的假设和明确的证据状态。

微软研究院的 M-star 工作直接指出了这一点:为某一目的优化的记忆系统可能难以迁移到另一目的,而任务特定的记忆机制可能优于固定的通用设计。因此,记忆模式应遵循智能体必须做出的决策,而不是强加给每个智能体的通用模板。

什么会改变这个答案?

当检索缓慢或昂贵、权威系统间歇性不可用、重新计算成本高昂、审计规则要求历史快照,或智能体必须离线运行时,这种平衡会发生变化。在这些情况下,可能需要缓存或持久化更多信息——但需附带版本、来源、时间戳和失效元数据。

对于主要价值在于个性化的智能体,这种平衡也会发生变化。稳定的偏好可能值得记住,即使技术上可以再次询问。相反,在高风险领域,将观察或解释转化为持久记忆的门槛应高得多。

未来的托管记忆平台可能会自动化整合、检索、遗忘和上下文构建。这可以减少实现工作,但并不能消除治理问题:哪些信息被允许影响未来决策,在什么条件下,以及系统何时必须回到当前的真相来源?

局限性

在当前框架和研究中,“智能体记忆”没有统一定义。一些系统用该术语指代对话历史,另一些则指外部持久存储、结构化知识、学习到的流程、检查点或模型适配。本文中的决策模型侧重于操作生命周期语义,而非强制统一术语。

四个生命周期操作也可能重叠。一个系统可以在同一工作流中记住稳定的摘要、保留指向来源的指针、重新读取易变字段并重新计算派生结果。该模型的目的不是为每个事实强制使用一种存储原语,而是使持久化的原因变得明确。

结论

一个有用的智能体不是靠记住最多信息取胜,而是靠保留正确的信息、在现实可能变化时回到权威来源、重新计算那些再次推导更安全的内容,并淘汰不应再影响未来决策的信息。

因此,对于每一条候选记忆,实际的问题不是“我们能存储这个吗?”,而是:如果这条信息保留下来,未来的决策会更可靠吗?如果答案取决于时效性、权威性、成本、敏感性或修订情况,就把这些条件编码进记忆生命周期,而不是只依赖检索。

常见问题

AI智能体记忆生命周期

AI智能体应该长期记住哪些信息?

优先选择那些持久、可复用、保留来源,并且重建成本高或不可靠的信息,例如稳定的用户偏好、已接受的项目决策、可复用的流程,以及经过验证的长期约束。

AI智能体应该重新检索而不是记住哪些信息?

具有权威外部来源的易变信息,通常应在用于重要决策前重新检索。例如权限、库存、当前价格、账户状态、策略版本、服务状态和当前文档。

AI智能体应该在什么时候重新计算信息?

当计算成本低而过期结果代价高时,应重新计算派生值。当重新计算成本高,并且缓存包含来源版本和失效条件时,持久化派生值才更有意义。

AI智能体应该遗忘信息吗?

应该。对于短暂、过时、敏感、低价值或具有误导性的信息,遗忘、过期和取代是有用的控制手段。无限制保留会产生噪声,并让过时或错误的信息持续影响未来决策。

存储整个对话历史是一种好的记忆策略吗?

仅靠它本身并不是。原始历史可以保留证据,但长期运行的智能体通常需要整理、结构化、摘要、可复用的事实或流程、检索以及生命周期规则,以避免低价值历史主导未来上下文。

术语表

关键记忆生命周期术语

记忆准入
决定信息是否被允许成为持久智能体记忆的决策过程。
取代
将较旧的记忆或决策标记为已被较新信息替换,同时在需要时保留历史记录。
失效
使已存储或缓存的值在不刷新、不重新计算或不审查的情况下不安全复用的规则或事件。
来源
描述信息来自何处、何时被观察到、由谁或什么断言,以及如何被转换的元数据。
易变性
信息在存储时间与复用时间之间发生变化的可能性。
重建成本
为恢复或重新生成信息而不是存储信息所需的时间、金钱、计算、工具使用或不确定性。

主要来源与延伸阅读

OpenAI — 上下文工程:使用会话进行短期记忆管理

关于裁剪、摘要、长期运行上下文,以及过时细节和上下文污染等风险的指导。

Anthropic — 面向AI智能体的有效上下文工程

关于整理、压缩、结构化笔记记录,以及在长期范围内维护有用智能体上下文的工程指导。

Anthropic — 面向长期运行智能体的有效框架

关于在长期运行的智能体任务中跨上下文窗口保留进度和产物的实践工作。

Microsoft Research — PlugMem

关于将原始智能体交互转化为结构化、可复用的事实和技能,而不是累积未区分历史的研究。

Microsoft Research — M★:每个任务都值得拥有自己的记忆框架

研究表明,任务特定的记忆机制可以优于固定的通用记忆设计。

Microsoft Research — MemGym

一个用于在长期智能体环境中隔离和评估记忆性能的基准。

Microsoft Research — 面向LLM智能体的类人记忆架构

探索持久智能体记忆中的巩固、基于干扰的遗忘、再巩固和检索的研究。

Related Articles

答案有效性边界:相关性到可靠AI答案之间缺失的层级

答案有效性边界:相关性到可靠AI答案之间缺失的层级

一个来源可能相关、权威,但对于所提出的问题仍然是错误的。缺失的层次是适用性:答案成立的条件,以及迫使其被重新考虑的变化。本文介绍了“答案有效性边界”这一面向人类、AI搜索和RAG系统的来源设计模式。

MCP vs A2A vs UCP vs AP2 vs A2UI:智能体协议栈详解

MCP vs A2A vs UCP vs AP2 vs A2UI:智能体协议栈详解

MCP、A2A、UCP、AP2 和 A2UI 常被描述为相互竞争的智能体标准。它们大多解决的是不同的互操作性问题。本指南将每个协议映射到其实际标准化的边界,并展示它们如何在同一个生产系统中协同工作。

什么是RAG?对其工作原理的最简单解释

什么是RAG?对其工作原理的最简单解释

RAG听起来很复杂,但想法很简单:在AI回答之前,它先从知识源查找有用的信息,并将该信息提供给语言模型。本指南使用一个简单的思维模型来解释RAG、LLM、状态、记忆和工具。

AI代理记忆不是RAG:如何区分记忆、检索、状态和上下文

AI代理记忆不是RAG:如何区分记忆、检索、状态和上下文

代理记忆、RAG、状态和上下文经常被当作可以互换的概念来使用。它们并不是。这个实用的架构模型将这四个层次区分开来,展示了每一层各自应处的位置,并解释了当系统将它们合并为一层时会出现什么问题。

GPU 不是产品:面向未来的私有 AI 架构

GPU 不是产品:面向未来的私有 AI 架构

私有 AI 基础设施不应围绕单一 GPU 或单一模型来设计。更具韧性的做法是将快速推理 GPU、内存充裕的 AI 系统、物理 AI 节点以及可选的前沿云模型,统一置于一个具备能力感知的路由层之后。

如何判断一个AI智能体是否真正使用了正确的证据

如何判断一个AI智能体是否真正使用了正确的证据

AI代理可以引用来源,却仍然使用错误的证据。本文介绍一种实用方法,用于核查主张支持、来源权威性、适用性、出处,以及证据是否实际影响了答案。