- 月流量
- 0
- 产品收费
- 免费和付费
- 收录时间
- 2026-08-05
- 更新时间
- 2026-08-05
01MemHarness是什么
MemHarness 是上海 AI Lab 联合浙大、复旦、上海交大等高校推出的 LLM Agent 记忆重构框架。现有记忆增强 Agent 常将检索到的历史经验直接注入上下文,若旧经验与当前状态不匹配反而导致负迁移。MemHarness 受人类记忆重构机制启发,在检索与动作之间插入显式的批判与重构环节,结合当前上下文对历史经验进行保留、改写或丢弃,通过 GRPO 端到端训练,无需额外人工标注。
02MemHarness的主要功能
记忆检索:Agent 根据当前观测生成查询,从 Milvus 向量记忆库中召回 top-k 相关历史经验及其来源状态。
批判与重构:统一策略模型对比记忆来源状态与当前状态,批判其适用性,将经验改写为状态对齐的指导信息,或判定为不适用而舍弃。
动作生成:基于重构后的指导信息或自主推理,生成可执行的环境动作。
经验回写与剪枝:每轮交互后将轨迹摘要为经验写入记忆库,进行语义去重,定期按经验效用剪枝低价值记忆。
端到端训练:通过 GRPO 联合优化检索、重构与动作生成,无需重构阶段的独立标注数据。
03MemHarness的技术原理
04如何使用MemHarness
克隆仓库并创建环境:执行 git clone https://github.com/KnowledgeXLab/MemHarness.git 并创建 python==3.12 的 Conda 环境,依次安装 vLLM、Flash Attention 2 及 MemHarness 本体。
部署嵌入服务:通过 vllm serve BAAI/bge-m3 --port 8001 启动 BGE-M3 嵌入模型,为 Milvus 记忆库提供向量编码服务。
安装目标环境:根据任务需求分别安装 ALFWorld 或 WebShop 交互环境,并下载对应的游戏文件与预训练检测器。
冷启动 SFT(可选):运行 scripts/build_*_coldstart_data.py 构建冷启动数据,执行 scripts/cold_start_sft.sh 使模型对齐交互格式与记忆摘要格式。
GRPO 端到端训练:运行 run_scripts/train_alfworld.sh 或 run_scripts/train_webshop.sh,框架将自动启动记忆向量数据库、执行 Agent 检索、经验回写与剪枝,完成 GRPO 训练。
05MemHarness的核心优势
重构优于回放:显式插入批判与重构环节,将静态记忆片段转化为上下文敏感的状态对齐指导,避免负迁移。
小模型超越大模型:7B 参数规模在 ALFWorld 和 WebShop 上分别超越 Gemini-2.5-Pro 23.1% 和 39.7%。
OOD 鲁棒性强:在分布外场景中平均成功率达 85.9%,显著高于原始记忆回放的 76.3%。
隐式推理增强:即使测试时关闭记忆,重构训练目标仍使基础策略成功率从 76.4% 提升至 83.0%,从根本上增强 Agent 内在推理能力。
无需额外标注:重构能力通过 GRPO 端到端训练自然涌现,不依赖人工编写的重构监督数据。
06MemHarness的项目地址
GitHub仓库:https://github.com/KnowledgeXLab/MemHarness
HuggingFace模型库:https://huggingface.co/KnowledgeXLab/MemHarness
arXiv技术论文:https://arxiv.org/pdf/2607.28272
07MemHarness的应用场景
具身智能家务:在 ALFWorld 等家庭环境中,Agent 可重构过往取物、清洁经验,适配不同房间布局完成复杂家务任务。
自主在线购物:在 WebShop 等电商平台中,根据历史购物经验重构为当前商品搜索与筛选策略,提升目标导向购物成功率。
智能客服对话:客服 Agent 检索历史相似工单后重构解决方案,避免直接套用旧答复导致答非所问。
代码辅助开发:编程 Agent 重构过往 bug 修复经验,适配当前代码上下文,提供精准的修复建议而非照搬旧方案。
科研实验规划:实验 Agent 根据历史实验参数与结果重构为当前实验条件的最优配置建议,减少试错成本。
© 免责声明:鉴于域名具有时效性,指向的网站内容可能发生变更。AIEZZ对呈现的第三方网站不可控,无法承担任何责任。请自行判断内容风险。


用户评价0