精选Hugging Face Blog论文
你的智能体到底需要多少记忆?
该研究探讨了智能体记忆的最佳剂量问题,发现不同能力的模型对记忆量的需求不同。强模型适合完整指南集,弱模型适合精选检索,饱和模型则无提升。实验表明,精选检索在准确性和成本上均优,如gpt-oss-120b在任务完成率上提升16.1个百分点,而token开销仅增加5%。
- +42
为智能体配备智能体记忆听起来很简单:从它过去的工作中提炼经验教训,将其放回上下文中,经验越多就应该意味着性能越好。但事情并不总是这样。当我们将评估扩展到八个模型——从30B稠密模型到前沿专有系统——时,一个发现尤为突出:
智能体记忆不是一项你可以直接开启的功能,而是一剂需要根据模型来校准的剂量。
TL;DR
- ALTK-Evolve 让智能体从自身过去的轨迹中学习:提炼可复用的指导原则,并在推理时将其注入回上下文,无需更新权重,也无需人工标注。
- 合适的剂量因模型层级而异:有余量的强模型需要完整的指导原则集,较弱的模型在紧凑核心加按任务检索的方案下表现最佳,而已经饱和的模型则没有可测量的提升。
- 精选检索既可以是最准确的,也可以是最经济的方案:gpt-oss-120b 仅以+5%的token开销就获得了+16.1个百分点的任务完成率提升——而提示缓存甚至能让完整的指导原则集在生产环境中保持低成本。
核心洞察:剂量取决于能力
并非每个模型都能从相同量的记忆中受益。在跨越能力谱系的八个模型中,我们观察到了三种反复出现的模式:
- 有余量的强模型需要完整的指导原则集——每一条指导原则,包括罕见的边缘案例经验。它们有能力吸收并应用全部内容。DeepSeek-V3.2(671B MoE)在获得其完整的自挖掘指导原则集后,任务完成率提升了+9.5个百分点。
- 较小或较弱的模型会被庞大的指导原则集淹没。对于这些模型,一个紧凑的高置信度核心加上每个任务检索到的少量任务相关指导原则效果最佳。gpt-oss-120b(117B MoE)通过这种选择性方案获得了+16.1个百分点的提升——而完整的指导原则集提升更少,且token开销高出约50%。
- 已经饱和的模型没有可测量的提升。我们称之为饱和模式——这个标签描述的是我们观察到的现象,而非已证实的成因。该模型可能在这些任务上已经接近其上限,指导原则可能没有针对其剩余的失败点,或者模型可能没有有效地应用这些指导。在我们的运行中,GLM-5(745B MoE)就处于这种状态。
决定一个模型落入哪种模式的因素并不仅仅是参数量。基准测试的余量、上下文窗口大小、架构、指导原则质量和任务分布似乎都会影响模型的落点,而分离这些因素是正在进行的工作。无论哪种情况,实际结论都成立:记忆的合适剂量取决于模型本身,而我们可以对其进行校准。
学习发生在模型周围,而非模型内部
这里的“记忆”并不意味着回放过去的记录。它指的是一套指导原则——有效的策略、需要避免的错误和边缘案例——从智能体自身先前的轨迹中提炼而来。循环过程很直接:
- 智能体尝试任务并产生轨迹。
- ALTK-Evolve 从其成功和失败的运行中提取行为指导原则。
- 它将这些指导原则整合为一套可复用的集合。
- 在推理时,智能体接收完整的指导原则集或其中与任务相关的选择。
模型权重不会被更新。学习循环改变的是可供智能体使用的指导,而非底层模型本身——这正是它采用成本低且在我们测试的八个模型中可移植的原因。
跨谱系的结果
我们在 AppWorld 上进行了评估——涵盖9个模拟应用(日历、消息、支付等)的585个多步任务(168个test_normal + 417个test_challenge)。任务按两种方式评分:智能体是否完全完成每个任务(TGC——任务目标完成率),以及场景的每个变体是否都通过(SGC——场景目标完成率,一个更严格的全有或全无标准)。完整定义见附录。
我们比较的三种配置
由于任何记忆研究中容易混淆的部分是上下文中实际包含的内容,我们预先定义这些配置。
两种记忆配置都来自同一套指导原则集,该集合仅通过上述循环从 AppWorld 的训练集挖掘一次。它们之间的区别仅在于这一套集合的传递方式——完整指导原则集在每一步注入全部内容,而精选检索则提供选定的子集——指导原则的产生方式从不改变,构建过程中也从不使用测试集数据。
| 配置 | 智能体上下文中的内容 |
|---|---|
| 基线 | 无记忆——模型出厂状态。 |
| 完整指导原则集 | 每条挖掘出的指导原则,在每个 ReAct 步骤中注入。 |
| 精选检索 | 同一套指导原则中固定的高置信度核心,加上每个任务检索到的少量任务相关指导原则(固定部分+可变部分)。 |
模型挖掘出的指导原则数量取决于其自身能力,因此我们按策略来报告配置——“完整指导原则集”对比“精选检索”——而非按原始数量,因为后者在不同模型之间不可比。
三种模式,一图概览
八模型扫描中的代表性模型,以 test_normal 上的任务完成率(TGC)衡量:

图 1. 三种观察到的模式中的代表性模型。柱状图显示 AppWorld test_normal 上基线配置与最佳记忆配置的 TGC 对比;x 轴从 40% 开始以使差异可见。仅看 TGC 会低估更大的 SGC 增益——参见下表中的 SGC 列。
图中绘制 TGC 以保持可读性;表格补充了更严格的 SGC 指标,该指标下的增益通常更大:
| 模型 | 模式 | 基线 TGC / SGC | 最佳记忆 TGC / SGC | 最佳配置 | Δ TGC | Δ SGC |
|---|---|---|---|---|---|---|
| gpt-oss-120b (117B MoE) | 弱 / 选择性 | 39.9 / 21.4 | 56.0 / 37.5 | 精选检索 | +16.1 | +16.1 |
| DeepSeek-V3.2 (671B MoE) | 强,有余量 | 79.8 / 64.3 | 89.3 / 80.4 | 完整指南集 | +9.5 | +16.1 |
| Claude Opus 4.6 | 强,有余量 | 90.5 / 87.5 | 94.6 / 94.6 | 完整指南集 | +4.1 | +7.1 |
| GPT-5.5 | 强(接近上限) | 92.3 / 82.1 | 95.2 / 89.3 | 完整指南集 | +2.9 | +7.2 |
| GLM-5 (745B MoE) | 饱和 | 87.5 / 80.4 | 87.5 / 80.4 | 完整指南集 | 0.0 | 0.0 |
观察 SGC 列可以发现,更严格的指标通常比 TGC 变动更大——DeepSeek 的 SGC 提升了 +16.1 个百分点,而 TGC 仅提升 +9.5 个百分点——因为好的指南尤其能帮助智能体通过某个场景的所有变体,而不仅仅是平均情况。而且这种效应在能力顶端也不会消失:GPT-5.5 和 Opus 在 TGC 上均已接近上限,但 SGC 仍分别获得 +7.2 和 +7.1 个百分点的提升。只要模型还有剩余的失败模式可以针对,记忆就会持续带来回报。
最廉价的记忆策略也可能是最好的策略
一个实际顾虑:注入完整指南集会膨胀每个 ReAct 步骤的输入,因为指南每轮都会重新发送。以下是我们观察到的结果:
| 模型 | 配置 | 每任务 token 数(基线) | 每任务 token 数(+记忆) | 开销 |
|---|---|---|---|---|
| DeepSeek-V3.2 | 完整指南集 | 148K | 263K | +78% |
| gpt-oss-120b | 完整指南集 | 110K | 166K | +51% |
| gpt-oss-120b | 精选检索 | 110K | 116K | +5% |
表 1. 每任务平均 token 使用量,跨智能体步骤累计,与无记忆基线对比。
- 精选检索使成本接近基线水平。对于较弱的模型,当选择性方案在准确性上胜出时,它在成本上也同样胜出——两全其美(gpt-oss-120b 仅增加 +5% token 就获得 +16.1 个百分点的 TGC 提升)。更好的性能在这里并不需要更高的推理成本。
- 记忆不会使推理循环膨胀。DeepSeek 在有记忆和无记忆的情况下运行的 ReAct 步数大致相同(平均约 18–19 步),因此增加的成本来自输入 token 膨胀,而非更长的轨迹。
生产中真正的效率杠杆是提示缓存:指南集中的静态部分在各步骤间完全相同,可以被缓存,从而大幅降低有效成本。面向缓存感知的提示设计——保持共享指南集前缀稳定以便其始终可缓存——值得投入工程精力。我们还推测上下文窗口大小也起作用:窗口更大的模型可能更有效地吸收完整指南集,而上下文较小的模型则更受益于保持注入内容紧凑的检索方式。我们尚未运行隔离该因素的受控实验。
记忆应当校准,而非单纯累积
经验教训不是把智能体学到的一切都塞给它,而是给它恰好能实际利用的经验量。
- 对于弱模型,这意味着一个紧凑的核心加上少量任务特定的经验——巧合的是,这也是最经济的选择。
- 对于有余量的强模型,这意味着保留完整指南集,并通过提示缓存在生产中保持可负担。
- 对于饱和模型,这意味着在更好地理解其剩余失败模式之前,不额外消耗上下文。
增益在各类模型上都是真实存在的——自动获取、无泄漏、无需人工标注——但前提是剂量匹配模型。
下一步
这是起点,不是终点:
- 学习型选择器。我们当前的检索按余弦相似度对指南排序,已证明这并不能完美预测哪些指南对给定任务有帮助。基于结果信号训练的选择器是自然的下一步。
- 针对极弱模型的记忆。低于最低能力基线时,自蒸馏缺乏信号。针对极弱模型的教师蒸馏记忆是我们正在探索的另一个问题。
- 超越 AppWorld。这些结果在 AppWorld 上得到验证——这是一个严谨的多步骤基准,但只是单一基准。更广泛的智能体基准和真实部署正在进行中。
- 隔离上下文窗口。如上所述,我们希望进行受控实验,将上下文窗口大小与原始能力分离开来。
试试 ALTK-Evolve 库——其中包含本文使用的提取、整合和检索流水线——或阅读完整技术报告,了解完整方法和消融实验。
附录:理解各项指标
AppWorld 任务通过两项指标评分,均以百分比表示(越高越好):
- TGC — 任务目标完成度。智能体完整且正确完成的单个任务所占比例。这是“任务是否完成”的核心数字。
- SGC — 场景目标完成度。一项更严格的“全有或全无”指标。每个场景包含同一任务的多个变体(相同请求,但数据、措辞或边界条件不同)。SGC 仅在智能体成功完成所有变体时才将该场景计为通过。它衡量的是可靠性——一个智能体若大多数时候能解决任务,但在某个变体上失败,则 TGC 得分,SGC 不得分。