メインコンテンツへ移動

MemHarness – 上海AI Labなどが開発したエージェント記憶再構成フレームワーク 運営中

MemHarnessは、LLMエージェント向けの記憶再構成フレームワークです。過去の経験を批判・再構成することで、意思決定性能を向上させます。

MemHarnessは、上海AI Labが浙江大学、復旦大学、上海交通大学などの大学と共同開発したLLMエージェント向け記憶再構成フレームワークです。検索と行動の間に批判・再構成の工程を挿入し、現在のコンテキストに基づいて過去の経験を保持、書き換え、または破棄します。GRPOによるエンドツーエンド学習を採用しており、追加の人手アノテーションは必要ありません。記憶検索、批判・再構成、行動生成、経験の書き戻し、剪定までの一連のプロセスをサポートし、5段階の意思決定フローを提供します。7BパラメータモデルはALFWorldとWebShopでGemini-2.5-Proをそれぞれ23.1%と39.7%上回り、分布外シナリオで平均成功率85.9%を達成しています。身体性知能による家事、自律型オンラインショッピング、インテリジェントカスタマーサービス、コード支援開発などに適しています。

MemHarness – 上海AI Labなどが開発したエージェント記憶再構成フレームワーク 製品インターフェース
月間訪問数
1
料金
無料、有料
掲載日
2026-08-05
更新済み
2026-08-05

01MemHarnessとは

MemHarnessは、上海AI Labが浙江大学、復旦大学、上海交通大学などの大学と共同開発したLLMエージェント向け記憶再構成フレームワークです。既存の記憶強化エージェントは、検索した過去の経験をそのままコンテキストに注入することが多く、古い経験が現在の状態と一致しない場合、かえって負の転移を引き起こします。MemHarnessは人間の記憶再構成メカニズムに着想を得て、検索と行動の間に明示的な批判・再構成工程を挿入します。現在のコンテキストに基づいて過去の経験を保持、書き換え、または破棄し、GRPOによるエンドツーエンド学習を行うため、追加の人手アノテーションは必要ありません。

02MemHarnessの主な機能

記憶検索:エージェントは現在の観測に基づいてクエリを生成し、Milvusベクトル記憶データベースから関連性の高い過去の経験と、その出典状態をtop-k件取得します。
批判・再構成:統合ポリシーモデルが記憶の出典状態と現在の状態を比較して適用可能性を批判し、経験を状態に整合した指針へ書き換えるか、不適用と判断して破棄します。
行動生成:再構成された指針、または自律的な推論に基づき、実行可能な環境アクションを生成します。
経験の書き戻しと剪定:各インタラクション後に軌跡を経験として要約して記憶データベースに書き込み、意味的重複を除去します。さらに、経験の有用性に基づいて低価値の記憶を定期的に剪定します。
エンドツーエンド学習:GRPOにより検索、再構成、行動生成を共同最適化し、再構成工程用の独立したアノテーションデータを必要としません。

03MemHarnessの技術原理

WeChatでフォローし「開源」と返信すると、AIオープンソースプロジェクト交流グループに参加できます。
5段階の意思決定フロー:MemHarnessは、記憶に基づく意思決定を、環境観測、経験検索、記憶批判、コンテキスト記憶再構成、行動生成という5つの連続した段階に分解します。人間の検索—評価—再構成という認知プロセスを模倣し、エージェントが記憶を直接再生する従来の静的な方式に置き換えます。
コンテキスト記憶再構成メカニズム:ポリシーモデルは、タスク記述、現在までの履歴、検索された経験、その出典状態を連結して再構成コンテキストを作成します。過去の出典状態と現在の状態を比較して差異を特定し、転用可能な知識を保持し、不一致の内容を書き換えます。または、マーカーを出力してその記憶を拒否し、自律推論に戻ります。
統合ポリシーモデルアーキテクチャ:検索クエリ生成、記憶の批判・再構成、実行可能な行動生成の3段階で同一のポリシーモデルパラメータを共有します。再構成モジュール専用の価値ネットワークや教師データを別途学習する必要がないため、記憶の活用と意思決定推論を同一モデル内で密接に結合できます。
GRPOによるエンドツーエンド学習:再構成された指針には正解ラベルがないため、MemHarnessはGRPOを用いて検索—再構成—行動の全経路をエンドツーエンドで最適化します。報酬は疎なタスク結果と形式報酬で構成され、グループ正規化したアドバンテージによって軌跡レベルの信用をすべてのトークンに配分します。これにより、思考、再構成、行動生成の能力を同時に学習します。

04MemHarnessの使い方

リポジトリをクローンして環境を作成:git clone https://github.com/KnowledgeXLab/MemHarness.git を実行し、python==3.12のConda環境を作成します。その後、vLLM、Flash Attention 2、MemHarness本体を順番にインストールします。
埋め込みサービスをデプロイ:vllm serve BAAI/bge-m3 --port 8001 を実行してBGE-M3埋め込みモデルを起動し、Milvus記憶データベースにベクトルエンコードサービスを提供します。
対象環境をインストール:タスクの要件に応じてALFWorldまたはWebShopのインタラクション環境をインストールし、対応するゲームファイルと事前学習済み検出器をダウンロードします。
コールドスタートSFT(任意):scripts/build_*_coldstart_data.pyを実行してコールドスタートデータを構築し、scripts/cold_start_sft.shを実行してモデルをインタラクション形式と記憶要約形式に適合させます。
GRPOによるエンドツーエンド学習:run_scripts/train_alfworld.shまたはrun_scripts/train_webshop.shを実行します。フレームワークが記憶ベクトルデータベースを自動的に起動し、エージェントによる検索、経験の書き戻し、剪定を実行して、GRPO学習を完了します。

05MemHarnessの主な強み

再構成は再生を上回る:批判・再構成工程を明示的に挿入し、静的な記憶断片をコンテキストに応じた状態整合型の指針へ変換することで、負の転移を防ぎます。
小規模モデルが大規模モデルを超える:7BパラメータモデルはALFWorldとWebShopでGemini-2.5-Proをそれぞれ23.1%と39.7%上回ります。
OODに対する高い頑健性:分布外シナリオで平均成功率85.9%を達成し、従来の記憶再生方式の76.3%を大きく上回ります。
暗黙的推論の強化:テスト時に記憶を無効にした場合でも、再構成学習の目標により、基礎ポリシーの成功率が76.4%から83.0%へ向上します。エージェント本来の推論能力を根本的に強化します。
追加アノテーション不要:再構成能力はGRPOによるエンドツーエンド学習を通じて自然に創発し、人手で作成した再構成用教師データに依存しません。

06MemHarnessのプロジェクトURL

GitHubリポジトリ:https://github.com/KnowledgeXLab/MemHarness
HuggingFaceモデルリポジトリ:https://huggingface.co/KnowledgeXLab/MemHarness
arXiv技術論文:https://arxiv.org/pdf/2607.28272

07MemHarnessの活用シーン

身体性知能による家事:ALFWorldなどの家庭環境で、エージェントは過去の物品取得や清掃の経験を再構成し、異なる部屋のレイアウトに適応して複雑な家事タスクを完了できます。
自律型オンラインショッピング:WebShopなどのECプラットフォームで、過去の購買経験を現在の商品検索・絞り込み戦略として再構成し、目的指向の購買成功率を高めます。
インテリジェントカスタマーサービス:カスタマーサービスエージェントが過去の類似チケットを検索した後、解決策を再構成します。古い回答をそのまま流用して質問に合わない回答をすることを防ぎます。
コード支援開発:コーディングエージェントが過去のバグ修正経験を再構成し、現在のコードコンテキストに適応させることで、古い解決策をそのまま適用するのではなく、正確な修正案を提示します。
科学研究の実験計画:実験エージェントが過去の実験パラメータと結果を、現在の実験条件における最適な設定案へ再構成し、試行錯誤のコストを削減します。

© 免責事項:ドメインやリンク先のコンテンツは時間の経過とともに変更される場合があります。AIEZZは第三者のウェブサイトを管理していません。外部コンテンツとリスクはご自身で確認してください。

ユーザーレビュー0