根据Beat Oracle 的监测,伊利诺伊大学计算机科学博士生 Dylan Zhang 进行了一项 Agent 记忆实验,结果指向一个反常的结论:让模型反复总结经验,可能会导致其记忆能力下降。
最引人注目的结果之一来自 ARC-AGI:研究人员选择了 19 道 GPT-5.4 在无记忆状态下全部正确回答的问题,然后将这些问题的真实解法馈送给模型,让其在观察的同时进行「经验总结」。理论上,这相当于开卷复习;然而经过多轮记忆压缩后,同一模型的准确率从 100% 下降到了 54%。原始路径是正确的,真正出问题的是模型将正确路径改写为通用经验的那一步。
更糟糕的是,这种记忆退化并非个例。在 WebShop 网购任务中,AWM 记忆方法在吸收 8 条专家路径时获得的分数为 0.64,路径增加到 128 条后下降至 0.20,恰好回到无记忆基准线。换句话说,随着记忆的积累,收益反而被抵消。
问题不在于「经验不足」,而在于「总结过于频繁」。大型模型记录的经验并非客观日志,每次总结都是一次重新生成。最终,具体的前提条件会被删除,不同任务的规则会被混为一谈,本来可以指导操作的细节会变成「优先采取最直接行动」、「使用正确工具」等看似正确但实际无益的废话。原文展示了一个极端示例,其中 50 条结构化记忆被一次合并为 1 条,多个任务之间的差异被压缩为同一通用流程,下一轮评估中直接丢弃了 6 到 13 个成功样本。
作者提供的建议非常谨慎:不要着急让 Agent 在每轮都写「错题本」。更加稳妥的做法是保留经过筛选的原始操作路径,只在确实需要时进行抽象总结。在实验中,仅保留原始 episode 并关闭抽象总结的方案,使多个 Agent 在基准测试中达到或超过了经过测试的压缩式记忆方法。对开发人员来说,这个结论非常清晰:让模型看见真实操作过的内容,通常比让其背诵一堆抽象规则更为有效。
