- Lượt truy cập hàng tháng
- 1
- Giá
- Miễn phí và Trả phí
- Được liệt kê
- 2026-08-05
- Đã cập nhật
- 2026-08-05
01MemHarness là gì
MemHarness là khung tái cấu trúc bộ nhớ cho LLM Agent do Shanghai AI Lab phối hợp với Đại học Chiết Giang, Đại học Phúc Đán, Đại học Giao thông Thượng Hải và các trường đại học khác phát triển. Các Agent tăng cường bộ nhớ hiện nay thường đưa trực tiếp kinh nghiệm lịch sử được truy xuất vào ngữ cảnh; nếu kinh nghiệm cũ không phù hợp với trạng thái hiện tại, điều này có thể gây chuyển giao tiêu cực. Lấy cảm hứng từ cơ chế tái cấu trúc ký ức của con người, MemHarness chèn bước phê bình và tái cấu trúc rõ ràng giữa quá trình truy xuất và thực thi hành động, kết hợp với ngữ cảnh hiện tại để giữ lại, viết lại hoặc loại bỏ kinh nghiệm lịch sử. Khung được huấn luyện đầu cuối bằng GRPO và không cần thêm dữ liệu gán nhãn thủ công.
02Các chức năng chính của MemHarness
Truy xuất bộ nhớ: Agent tạo truy vấn dựa trên quan sát hiện tại, sau đó truy xuất top-k kinh nghiệm lịch sử liên quan cùng trạng thái nguồn của chúng từ kho bộ nhớ vector Milvus.
Phê bình và tái cấu trúc: Mô hình chính sách thống nhất so sánh trạng thái nguồn của bộ nhớ với trạng thái hiện tại, đánh giá tính phù hợp, viết lại kinh nghiệm thành thông tin hướng dẫn phù hợp với trạng thái hoặc xác định là không phù hợp và loại bỏ.
Sinh hành động: Dựa trên thông tin hướng dẫn đã tái cấu trúc hoặc suy luận tự chủ, mô hình tạo ra hành động có thể thực thi trong môi trường.
Ghi lại và cắt tỉa kinh nghiệm: Sau mỗi vòng tương tác, quỹ đạo được tóm tắt thành kinh nghiệm và ghi vào kho bộ nhớ, đồng thời tiến hành loại trùng lặp ngữ nghĩa và định kỳ cắt tỉa các ký ức có giá trị thấp dựa trên hiệu dụng của kinh nghiệm.
Huấn luyện đầu cuối: Tối ưu kết hợp truy xuất, tái cấu trúc và sinh hành động thông qua GRPO, không cần dữ liệu gán nhãn riêng cho giai đoạn tái cấu trúc.
03Nguyên lý kỹ thuật của MemHarness
Theo dõi WeChat và trả lời “开源” để tham gia nhóm trao đổi dự án AI mã nguồn mở
Quy trình ra quyết định gồm năm giai đoạn: MemHarness phân rã quá trình ra quyết định được dẫn dắt bởi bộ nhớ thành năm giai đoạn liên tiếp: quan sát môi trường, truy xuất kinh nghiệm, phê bình bộ nhớ, tái cấu trúc bộ nhớ theo ngữ cảnh và sinh hành động. Cách này mô phỏng quá trình nhận thức truy xuất—đánh giá—tái cấu trúc của con người, thay thế mô hình tĩnh truyền thống trong đó Agent phát lại trực tiếp bộ nhớ.
Cơ chế tái cấu trúc bộ nhớ theo ngữ cảnh: Mô hình chính sách ghép mô tả nhiệm vụ, lịch sử hiện tại, kinh nghiệm được truy xuất và trạng thái nguồn của kinh nghiệm thành ngữ cảnh tái cấu trúc. Bằng cách so sánh trạng thái nguồn trong lịch sử với trạng thái hiện tại, mô hình nhận diện khác biệt, giữ lại kiến thức có thể chuyển giao, viết lại nội dung không phù hợp hoặc xuất ký hiệu để từ chối bộ nhớ đó và quay về suy luận tự chủ.
Kiến trúc mô hình chính sách thống nhất: Ba giai đoạn gồm tạo truy vấn truy xuất, phê bình và tái cấu trúc bộ nhớ, sinh hành động có thể thực thi cùng chia sẻ tham số của một mô hình chính sách. Không cần huấn luyện riêng mạng giá trị hoặc dữ liệu giám sát cho mô-đun tái cấu trúc, giúp việc sử dụng bộ nhớ và suy luận ra quyết định được kết hợp chặt chẽ trong cùng một mô hình.
Huấn luyện đầu cuối bằng GRPO: Do thông tin hướng dẫn tái cấu trúc không có nhãn đúng, MemHarness sử dụng GRPO để tối ưu đầu cuối toàn bộ chuỗi truy xuất—tái cấu trúc—hành động. Phần thưởng gồm kết quả nhiệm vụ thưa và phần thưởng định dạng; thông qua lợi thế chuẩn hóa theo nhóm, tín dụng ở cấp quỹ đạo được phân bổ cho tất cả token, đồng thời huấn luyện năng lực suy nghĩ, tái cấu trúc và sinh hành động.
04Cách sử dụng MemHarness
Sao chép kho mã và tạo môi trường: Chạy git clone https://github.com/KnowledgeXLab/MemHarness.git và tạo môi trường Conda với python==3.12, sau đó lần lượt cài đặt vLLM, Flash Attention 2 và chính MemHarness.
Triển khai dịch vụ embedding: Chạy vllm serve BAAI/bge-m3 --port 8001 để khởi động mô hình embedding BGE-M3, cung cấp dịch vụ mã hóa vector cho kho bộ nhớ Milvus.
Cài đặt môi trường mục tiêu: Tùy theo yêu cầu nhiệm vụ, cài đặt môi trường tương tác ALFWorld hoặc WebShop, đồng thời tải xuống các tệp trò chơi và bộ phát hiện được huấn luyện trước tương ứng.
SFT khởi động nguội (tùy chọn): Chạy scripts/build_*_coldstart_data.py để xây dựng dữ liệu khởi động nguội, sau đó thực thi scripts/cold_start_sft.sh để căn chỉnh mô hình với định dạng tương tác và định dạng tóm tắt bộ nhớ.
Huấn luyện đầu cuối bằng GRPO: Chạy run_scripts/train_alfworld.sh hoặc run_scripts/train_webshop.sh. Khung sẽ tự động khởi động cơ sở dữ liệu vector bộ nhớ, thực hiện truy xuất Agent, ghi lại và cắt tỉa kinh nghiệm, rồi hoàn tất huấn luyện GRPO.
05Ưu điểm cốt lõi của MemHarness
Tái cấu trúc tốt hơn phát lại: Chèn rõ ràng bước phê bình và tái cấu trúc, chuyển các mảnh bộ nhớ tĩnh thành hướng dẫn phù hợp với trạng thái và nhạy theo ngữ cảnh, từ đó tránh chuyển giao tiêu cực.
Mô hình nhỏ vượt mô hình lớn: Mô hình 7B tham số lần lượt vượt Gemini-2.5-Pro 23.1% và 39.7% trên ALFWorld và WebShop.
Khả năng chống chịu OOD mạnh: Tỷ lệ thành công trung bình đạt 85.9% trong các kịch bản ngoài phân phối, cao hơn đáng kể mức 76.3% của phương pháp phát lại bộ nhớ ban đầu.
Tăng cường suy luận tiềm ẩn: Ngay cả khi tắt bộ nhớ trong quá trình kiểm thử, mục tiêu huấn luyện tái cấu trúc vẫn nâng tỷ lệ thành công của chính sách cơ sở từ 76.4% lên 83.0%, qua đó tăng cường năng lực suy luận nội tại của Agent.
Không cần gán nhãn bổ sung: Năng lực tái cấu trúc tự nhiên xuất hiện thông qua huấn luyện đầu cuối bằng GRPO, không phụ thuộc vào dữ liệu giám sát tái cấu trúc do con người biên soạn.
06Địa chỉ dự án MemHarness
Kho GitHub: https://github.com/KnowledgeXLab/MemHarness
Kho mô hình HuggingFace: https://huggingface.co/KnowledgeXLab/MemHarness
Bài báo kỹ thuật arXiv: https://arxiv.org/pdf/2607.28272
07Các kịch bản ứng dụng của MemHarness
Tác vụ gia đình của trí tuệ thể hiện: Trong các môi trường gia đình như ALFWorld, Agent có thể tái cấu trúc kinh nghiệm lấy đồ và dọn dẹp trước đây để thích ứng với cách bố trí phòng khác nhau, hoàn thành các nhiệm vụ gia đình phức tạp.
Mua sắm trực tuyến tự động: Trên các nền tảng thương mại điện tử như WebShop, Agent tái cấu trúc kinh nghiệm mua sắm lịch sử thành chiến lược tìm kiếm và sàng lọc sản phẩm phù hợp với hiện tại, nâng cao tỷ lệ thành công của hoạt động mua sắm hướng mục tiêu.
Đối thoại chăm sóc khách hàng thông minh: Agent chăm sóc khách hàng truy xuất các yêu cầu tương tự trong lịch sử rồi tái cấu trúc giải pháp, tránh áp dụng máy móc câu trả lời cũ dẫn đến trả lời không đúng trọng tâm.
Hỗ trợ phát triển mã nguồn: Agent lập trình tái cấu trúc kinh nghiệm sửa lỗi trước đây để thích ứng với ngữ cảnh mã nguồn hiện tại, đưa ra đề xuất sửa lỗi chính xác thay vì sao chép phương án cũ.
Lập kế hoạch thí nghiệm nghiên cứu: Agent thí nghiệm tái cấu trúc các tham số và kết quả thí nghiệm lịch sử thành đề xuất cấu hình tối ưu cho điều kiện thí nghiệm hiện tại, giảm chi phí thử và sai.
© Tuyên bố miễn trừ trách nhiệm: tên miền và nội dung được liên kết có thể thay đổi theo thời gian. AIEZZ không kiểm soát các trang web của bên thứ ba. Hãy tự đánh giá nội dung bên ngoài và các rủi ro liên quan.


Đánh giá của người dùng0