分享好友 健康资讯首页 健康资讯分类 切换频道

上海AI Lab团队推出MemHarness:让Agent记忆像人类一样被重构

2026-08-03 17:1614036kr

检索过往经验,已成为增强LLMAgent 决策能力的常见方法。在面对新任务时,Agent 往往会直接调用过去的经验,借助记忆辅助判断。

但问题在于,历史经验只有在适配当前上下文时,才具有实用价值。多数现有记忆增强 Agent 会把检索到的经验当作静态记录,直接注入上下文,很少判断这些经验是否适合当前上下文。如果“旧”经验与当前状态不匹配,反而可能干扰决策、导致负面效果(负迁移)。

与人工智能(AI)系统不同,人类调用记忆则更加灵活:通常会结合当前上下文,重新判断以往经验该如何使用,从而更好地服务于当前决策。

受到这一启发,上海 AI Lab 团队及其合作者提出了“LLM Agent 经验重构”框架 MemHarness,通过在检索与动作之间插入显式的记忆重构环节来主动 harness 检索到的经验,并通过 GRPO 端到端地学习这一能力,且无需任何额外的人工标注。

结果显示,MemHarness 的性能显著优于纯强化学习(RL)和静态记忆增强基线方法,且在分布外(OOD)场景中展现出很强的鲁棒性。同时,重构目标不仅减少了负迁移,也在记忆重构过程中进一步训练了 Agent 的推理能力。

论文链接:https://arxiv.org/abs/2607.28272

像人类一样“检索、评估和重构”

MemHarness 的设计思路是通过在“检索”与“动作”之间显式插入“批判”与“重构”这两个新的环节,主动地 harness 所检索到的经验,从而将记忆从静态的提示片段转变为具有上下文敏感性的指导信息。

其中,历史记忆只保留可迁移的部分,供模型在新状态下继续使用。具体流程如下:

检索:根据最近几步的观测和动作,判断是否需要调用历史经验。需要时,模型会查询经验记忆库,获取相关经验。

重构:负责将检索到的经验改写成当前可用的指导。模型会结合任务描述、当前上下文、检索到的记忆和来源状态,比较过去与现在的差异,再决定保留、改写还是丢弃。如果没有合适的记忆,就跳过这一步,直接让模型继续推理。

动作生成:模型结合当前历史信息和重构后的指导生成动作。重构模块不单独提供标注,整个流程主要依赖任务奖励,并通过 GRPO 端到端优化。

图|MemHarness 框架概览。

整个训练阶段,MemHarness 采用 GRPO 进行端到端优化,优化信号来自任务奖励和格式约束。GRPO 会比较同一任务下多条轨迹的表现,思考、重构和动作生成可以同时训练,不需要单独训练价值网络。

持续优于纯RL基线

研究团队在两个具有挑战性的 agent 决策基准 ALFWorld 和 WebShop 上评估了MemHarness。

结果显示,MemHarness 持续优于纯 RL 基线以及 SOTA 静态记忆增强方法。消融实验进一步表明,去除重构阶段会使模型性能退化到与朴素记忆重放相当的水平,这证实了自适应重构(而非单纯的检索)才是实验中所观察到的性能提升的主要驱动因素。

详细实验结果如下:

1.优于纯 RL 和静态记忆

结果显示,相比直接叠加外部记忆的做法,MemHarness 通过记忆重构取得了更好的整体表现;即便模型规模只有 7B,其表现也超过了更大规模的 Gemini-2.5-Pro 等闭源模型。

图|ALFWorld 和 WebShop 上的主要结果。

2. 直接复用记忆会引入噪声

消融结果显示,当去掉记忆重构后,Agent 在 ALFWorld 上的表现会下降。直接将检索到的经验放入上下文,并不一定能辅助决策。

图|MemHarness 各组件的消融实验。

在 OOD 评测中,测试环境换成了训练时没见过的布局和物品位置。当 Agent 直接套用旧经验时,更容易做出错误决策;MemHarness 则会先判断记忆是否适用,并改写或舍弃不匹配的内容,在OOD场景中具有强大的鲁棒性。

图|ALFWorld 在 OOD 场景中的表现。

3.重构需要端到端训练

训练过程中,Agent 会把交互轨迹中的经验逐步存进记忆库,每次只取最相关的三条作为参考。由于没有现成标注告诉模型记忆该怎么改写,整套“检索-重构-行动”流程只能靠 GRPO 结合任务奖励端到端训练。

图|RL 训练过程中记忆使用行为的演化。

4.当前状态决定重构是否有效

结果显示,策略模型是否采纳重构内容,取决于来源状态和当前状态是否匹配。如果将来源状态替换为明显不匹配的随机状态,模型的拒绝率会上升;如果直接删去原始状态信息,拒绝率变化不大,任务成功率会下降。

图|按记忆决策条件划分的成功率训练动态。“SR when Accepted/Rejected”表示包含至少一次被接受或被拒绝的记忆重构的轨迹对应的成功率。

当然,目前的方法也存在一些不足。

例如,MemHarness 目前主要只在 ALFWorld 和 WebShop 两个交互式基准上进行了验证,尚未覆盖更开放、更多样的真实环境。未来,研究团队仍需在更大规模的模型和更开放的环境中进一步验证该方法。

此外,目前冷启动模型本身的任务表现有限,真正的重建和决策能力仍需要要依赖后续的任务级强化学习。

本文来自微信公众号 “学术头条”(ID:SciTouTiao),作者:夏千斯,36氪经授权发布。

举报
收藏 0
打赏 0
评论 0
上海土拍揽金90.6亿 一家不锈钢企业青山实业成最大赢家
上海第七批次土拍终于落槌。如果只看实时拍地数据,这似乎是波澜不惊的一天:上架5宗地块全部拍出,总揽金90.6亿元,没有所谓的地王地块,也没有超高溢价率的房企争夺战。但如果将视角拉远,会发现这场土拍背后,筛选出了上海楼市中两种截然不同的资本面孔。第一类,是常年参与上海土拍的各大房企们:从绿城、招商,再到华润、联发,几家企业已沉浸这片楼市多年;第二类,则是那些选择“跨界”入局的实业企业们,而本场土拍中

0评论2026-08-0567

早期项目 | 从智能喂养切入,一家创业公司想搭建母婴AI生态
作者 | 张子怡编辑 | 袁斯来母婴市场在全球拥有万亿级规模。中国的母婴消费市场规模已突破5万亿元,年均增速保持12%的稳健水平;全球母婴市场总量更是达到约2万亿美元。庞大的母婴市场背后,其智能化渗透率较低,尚不足1%。全球母婴家庭普遍面临养育压力大、成本高、信息繁杂等核心痛点,而传统母婴产品仍停留在基础功能阶段,智能化程度不足、生态割裂,无法满足新一代家庭需求。以喂奶为例,不少家庭依然采用着极为

0评论2026-08-0569

壹酒店“失败”启示录……
近日,三亚海棠湾阳光壹酒店正式撤牌,原址将引入希尔顿旗下康莱德品牌。这意味着新喜达屋在中国内地的唯一酒店黯然离场,也宣告康莱德阔别四年后重回海棠湾。为何是小众先锋的壹酒店退出,而老派奢华的康莱德归来?在存量竞争白热化的当下,业主为何要么自持、要么纷纷转向国际酒店巨头?壹酒店换牌康莱德,新喜达屋退出中国市场?近日,三亚海棠湾康莱德酒店项目悄然落地了。令人意外的是,该项目曾一度传出要换牌凯悦旗下的奢华

0评论2026-08-0572