跳到主要内容

MemHarness – 上海 AI Lab 等推出的智能体记忆重构框架 运营中

MemHarness 是面向 LLM Agent 的记忆重构框架,通过批判与重构历史经验来提升决策表现。

MemHarness 是上海 AI Lab 联合浙大、复旦、上海交大等高校推出的 LLM Agent 记忆重构框架。它在检索与动作之间插入批判与重构环节,结合当前上下文对历史经验进行保留、改写或丢弃,通过 GRPO 端到端训练,无需额外人工标注。该框架支持记忆检索、批判重构、动作生成、经验回写与剪枝等完整流程,并提供五阶段决策流程。其 7B 参数模型在 ALFWorld 和 WebShop 上分别超越 Gemini-2.5-Pro 23.1% 和 39.7%,在分布外场景中平均成功率达 85.9%。适用于具身智能家务、自主在线购物、智能客服、代码辅助开发等场景。

MemHarness – 上海 AI Lab 等推出的智能体记忆重构框架 产品界面
月流量
0
产品收费
免费和付费
收录时间
2026-08-05
更新时间
2026-08-05

01MemHarness是什么

MemHarness 是上海 AI Lab 联合浙大、复旦、上海交大等高校推出的 LLM Agent 记忆重构框架。现有记忆增强 Agent 常将检索到的历史经验直接注入上下文,若旧经验与当前状态不匹配反而导致负迁移。MemHarness 受人类记忆重构机制启发,在检索与动作之间插入显式的批判与重构环节,结合当前上下文对历史经验进行保留、改写或丢弃,通过 GRPO 端到端训练,无需额外人工标注。

02MemHarness的主要功能

记忆检索:Agent 根据当前观测生成查询,从 Milvus 向量记忆库中召回 top-k 相关历史经验及其来源状态。
批判与重构:统一策略模型对比记忆来源状态与当前状态,批判其适用性,将经验改写为状态对齐的指导信息,或判定为不适用而舍弃。
动作生成:基于重构后的指导信息或自主推理,生成可执行的环境动作。
经验回写与剪枝:每轮交互后将轨迹摘要为经验写入记忆库,进行语义去重,定期按经验效用剪枝低价值记忆。
端到端训练:通过 GRPO 联合优化检索、重构与动作生成,无需重构阶段的独立标注数据。

03MemHarness的技术原理

微信关注回复“开源”,加入AI开源项目交流群 五阶段决策流程:MemHarness 将记忆引导的决策分解为环境观测、经验检索、记忆批判、上下文记忆重构与动作生成五个连续阶段,模拟人类检索—评估—重构的认知过程,取代传统 Agent 直接回放记忆的静态范式。 上下文记忆重构机制:策略模型将任务描述、当前历史、检索到的经验及其来源状态拼接为重构上下文,通过对比历史来源状态与当前状态识别差异,保留可迁移知识、改写不匹配内容,或输出 标记拒绝该记忆并回退到自主推理。 统一策略模型架构: 检索查询生成、记忆批判重构与可执行动作生成三个阶段共享同一个策略模型参数,无需为重构模块单独训练价值网络或监督数据,使记忆利用与决策推理在同一模型内紧密耦合。 GRPO 端到端训练:由于重构指导信息没有真值标注,MemHarness 采用 GRPO 对检索—重构—行动全链路进行端到端优化;奖励由稀疏任务结果与格式奖励组成,通过组归一化优势将轨迹级信用分配给所有 token,同时训练思考、重构与动作生成能力。

04如何使用MemHarness

克隆仓库并创建环境:执行 git clone https://github.com/KnowledgeXLab/MemHarness.git 并创建 python==3.12 的 Conda 环境,依次安装 vLLM、Flash Attention 2 及 MemHarness 本体。
部署嵌入服务:通过 vllm serve BAAI/bge-m3 --port 8001 启动 BGE-M3 嵌入模型,为 Milvus 记忆库提供向量编码服务。
安装目标环境:根据任务需求分别安装 ALFWorld 或 WebShop 交互环境,并下载对应的游戏文件与预训练检测器。
冷启动 SFT(可选):运行 scripts/build_*_coldstart_data.py 构建冷启动数据,执行 scripts/cold_start_sft.sh 使模型对齐交互格式与记忆摘要格式。
GRPO 端到端训练:运行 run_scripts/train_alfworld.sh 或 run_scripts/train_webshop.sh,框架将自动启动记忆向量数据库、执行 Agent 检索、经验回写与剪枝,完成 GRPO 训练。

05MemHarness的核心优势

重构优于回放:显式插入批判与重构环节,将静态记忆片段转化为上下文敏感的状态对齐指导,避免负迁移。
小模型超越大模型:7B 参数规模在 ALFWorld 和 WebShop 上分别超越 Gemini-2.5-Pro 23.1% 和 39.7%。
OOD 鲁棒性强:在分布外场景中平均成功率达 85.9%,显著高于原始记忆回放的 76.3%。
隐式推理增强:即使测试时关闭记忆,重构训练目标仍使基础策略成功率从 76.4% 提升至 83.0%,从根本上增强 Agent 内在推理能力。
无需额外标注:重构能力通过 GRPO 端到端训练自然涌现,不依赖人工编写的重构监督数据。

06MemHarness的项目地址

GitHub仓库:https://github.com/KnowledgeXLab/MemHarness
HuggingFace模型库:https://huggingface.co/KnowledgeXLab/MemHarness
arXiv技术论文:https://arxiv.org/pdf/2607.28272

07MemHarness的应用场景

具身智能家务:在 ALFWorld 等家庭环境中,Agent 可重构过往取物、清洁经验,适配不同房间布局完成复杂家务任务。
自主在线购物:在 WebShop 等电商平台中,根据历史购物经验重构为当前商品搜索与筛选策略,提升目标导向购物成功率。
智能客服对话:客服 Agent 检索历史相似工单后重构解决方案,避免直接套用旧答复导致答非所问。
代码辅助开发:编程 Agent 重构过往 bug 修复经验,适配当前代码上下文,提供精准的修复建议而非照搬旧方案。
科研实验规划:实验 Agent 根据历史实验参数与结果重构为当前实验条件的最优配置建议,减少试错成本。

© 免责声明:鉴于域名具有时效性,指向的网站内容可能发生变更。AIEZZ对呈现的第三方网站不可控,无法承担任何责任。请自行判断内容风险。

用户评价0

常见问题

关于当前内容的常见说明。

零基础小白,借助 AIEZZ,能不能快速上手各类 AI 工具?

完全可以。市面上绝大多数 AI 网页工具无需编程能力,也不用专业背景,操作简单易懂,输入需求就可以产出结果。AIEZZ(aiezz.com)聚合了大量新手友好 AI 工具,打开网页就能直接体验。

在 AIEZZ 挑选的 AI 工具,都需要花钱吗?

不少 AI 工具会开放免费基础能力或者试用额度,同时也有月订阅、按量计费的付费模式。建议优先试用免费版本,确认适配自己的工作流之后再付费。AIEZZ(aiezz.com)会标注每款工具的付费模式,方便快速甄别。

通过 AIEZZ 找到的 AI 工具,生成出来的内容,可以拿来做商业使用吗?

各个平台版权授权规则各不相同,商用之前务必仔细阅读平台许可、版权以及隐私协议。AIEZZ(aiezz.com)会整理工具商用权限提示,帮大家规避版权风险。

依托 AIEZZ,如何挑选真正适合自己的 AI 工具?

先理清自身任务、预算以及使用频次,再对比输出质量、中文适配、导出格式、协作能力,小范围测试之后再敲定。AIEZZ(aiezz.com)汇总各类工具的测评信息,便于横向对比筛选。

使用 AIEZZ 收录的 AI 工具,该怎样保护个人隐私?

尽量不要上传敏感身份信息、未公开商业资料,阅读平台的数据留存与训练规则,优先选择具备隐私管控的产品。AIEZZ(aiezz.com)会标注工具隐私相关提醒,降低信息泄露隐患。

经常用 AIEZZ 的各类 AI 工具,AI 会不会替代我的本职工作?

AI 擅长处理重复性事务,放大个人本身专业能力。不用盲目囤积大量工具,借助AIEZZ(aiezz.com)筛选合适应用,把 AI 融入现有工作流程,实现效率提升。