- 월간 방문 수
- 1
- 가격
- 무료 및 유료
- 등록일
- 2026-08-05
- 업데이트됨
- 2026-08-05
01MemHarness란 무엇인가
MemHarness는 상하이 AI Lab이 저장대학교, 푸단대학교, 상하이교통대학교 등 여러 대학과 공동으로 공개한 LLM Agent 메모리 재구성 프레임워크입니다. 기존의 메모리 강화 Agent는 검색된 과거 경험을 컨텍스트에 그대로 삽입하는 경우가 많아, 이전 경험이 현재 상태와 맞지 않으면 오히려 부정적 전이를 일으킬 수 있습니다. MemHarness는 인간의 기억 재구성 메커니즘에서 영감을 받아 검색과 행동 사이에 명시적인 비판 및 재구성 단계를 삽입합니다. 현재 컨텍스트를 바탕으로 과거 경험을 유지·수정·폐기하며, 추가적인 수작업 라벨링 없이 GRPO를 통해 엔드투엔드로 학습합니다.
02MemHarness의 주요 기능
메모리 검색: Agent는 현재 관측을 바탕으로 질의를 생성하고, Milvus 벡터 메모리 데이터베이스에서 관련성이 높은 과거 경험 top-k개와 해당 출처 상태를 검색합니다.
비판 및 재구성: 통합 정책 모델이 메모리의 출처 상태와 현재 상태를 비교해 적용 가능성을 비판하고, 경험을 상태에 맞는 지침으로 수정하거나 적용할 수 없다고 판단해 폐기합니다.
행동 생성: 재구성된 지침 또는 자율적 추론을 바탕으로 실행 가능한 환경 행동을 생성합니다.
경험 기록 및 가지치기: 각 상호작용이 끝난 후 궤적을 경험으로 요약해 메모리 데이터베이스에 기록하고, 의미 중복을 제거하며, 정기적으로 경험 효용에 따라 가치가 낮은 메모리를 가지치기합니다.
엔드투엔드 학습: GRPO를 통해 검색, 재구성, 행동 생성을 공동 최적화하며, 재구성 단계에 별도의 라벨 데이터가 필요하지 않습니다.
03MemHarness의 기술 원리
WeChat에서 팔로우 후 “开源”라고 답장하여 AI 오픈소스 프로젝트交流群에 참여하세요.
5단계 의사결정 흐름: MemHarness는 메모리 기반 의사결정을 환경 관측, 경험 검색, 메모리 비판, 컨텍스트 메모리 재구성, 행동 생성의 5개 연속 단계로 분해합니다. 이를 통해 인간의 검색—평가—재구성 인지 과정을 모방하고, Agent가 메모리를 직접 재생하는 기존의 정적 방식을 대체합니다.
컨텍스트 메모리 재구성 메커니즘: 정책 모델은 작업 설명, 현재 이력, 검색된 경험 및 해당 출처 상태를 연결해 재구성 컨텍스트를 구성합니다. 과거 출처 상태와 현재 상태를 비교해 차이를 식별하고, 전이 가능한 지식은 유지하며, 맞지 않는 내용은 수정합니다. 또는 표시를 출력해 해당 메모리를 거부하고 자율적 추론으로 되돌아갑니다.
통합 정책 모델 아키텍처: 검색 질의 생성, 메모리 비판 및 재구성, 실행 가능한 행동 생성의 3개 단계가 동일한 정책 모델 파라미터를 공유합니다. 따라서 재구성 모듈을 위해 별도의 가치 네트워크나 지도 데이터를 학습할 필요가 없으며, 메모리 활용과 의사결정 추론이 하나의 모델 안에서 긴밀하게 결합됩니다.
GRPO 엔드투엔드 학습: 재구성 지침에는 정답 라벨이 없으므로 MemHarness는 GRPO를 사용해 검색—재구성—행동 전 과정을 엔드투엔드로 최적화합니다. 보상은 희소한 작업 결과 보상과 형식 보상으로 구성되며, 그룹 정규화 어드밴티지를 통해 궤적 수준의 신용을 모든 토큰에 할당합니다. 이를 통해 사고, 재구성, 행동 생성 능력을 동시에 학습합니다.
04MemHarness 사용 방법
저장소 복제 및 환경 생성: git clone https://github.com/KnowledgeXLab/MemHarness.git 를 실행하고 python==3.12 Conda 환경을 생성한 뒤, vLLM, Flash Attention 2, MemHarness 본체를 순서대로 설치합니다.
임베딩 서비스 배포: vllm serve BAAI/bge-m3 --port 8001 을 통해 BGE-M3 임베딩 모델을 시작하고, Milvus 메모리 데이터베이스에 벡터 인코딩 서비스를 제공합니다.
대상 환경 설치: 작업 요구 사항에 따라 ALFWorld 또는 WebShop 상호작용 환경을 설치하고, 해당 게임 파일과 사전 학습된 검출기를 다운로드합니다.
콜드 스타트 SFT(선택 사항): scripts/build_*_coldstart_data.py 를 실행해 콜드 스타트 데이터를 구축하고, scripts/cold_start_sft.sh 를 실행해 모델을 상호작용 형식과 메모리 요약 형식에 맞춥니다.
GRPO 엔드투엔드 학습: run_scripts/train_alfworld.sh 또는 run_scripts/train_webshop.sh 를 실행하면 프레임워크가 메모리 벡터 데이터베이스를 자동으로 시작하고 Agent 검색, 경험 기록 및 가지치기를 수행해 GRPO 학습을 완료합니다.
05MemHarness의 핵심 장점
재구성이 재생보다 우수: 비판 및 재구성 단계를 명시적으로 삽입해 정적인 메모리 조각을 컨텍스트에 민감한 상태 정렬 지침으로 변환하고, 부정적 전이를 방지합니다.
소형 모델이 대형 모델을 능가: 7B 파라미터 규모로 ALFWorld와 WebShop에서 각각 Gemini-2.5-Pro를 23.1%와 39.7% 앞섰습니다.
강력한 OOD 견고성: 분포 외 시나리오에서 평균 성공률 85.9%를 달성해 기존 메모리 재생 방식의 76.3%보다 크게 높았습니다.
암묵적 추론 강화: 테스트 시 메모리를 비활성화하더라도 재구성 학습 목표를 통해 기반 정책 성공률이 76.4%에서 83.0%로 향상되어 Agent의 본질적인 추론 능력을 근본적으로 강화합니다.
추가 라벨 불필요: 재구성 능력은 GRPO 엔드투엔드 학습을 통해 자연스럽게 발현되며, 사람이 작성한 재구성 감독 데이터에 의존하지 않습니다.
06MemHarness 프로젝트 주소
GitHub 저장소: https://github.com/KnowledgeXLab/MemHarness
HuggingFace 모델 저장소: https://huggingface.co/KnowledgeXLab/MemHarness
arXiv 기술 논문: https://arxiv.org/pdf/2607.28272
07MemHarness의 활용 시나리오
체화 지능 가사 작업: ALFWorld와 같은 가정 환경에서 Agent가 과거의 물건 가져오기 및 청소 경험을 재구성해 서로 다른 방 배치에 맞춰 복잡한 가사 작업을 수행할 수 있습니다.
자율 온라인 쇼핑: WebShop과 같은 전자상거래 플랫폼에서 과거 쇼핑 경험을 현재 상품 검색 및 선별 전략으로 재구성해 목표 지향적 쇼핑 성공률을 높입니다.
지능형 고객 서비스 대화: 고객 서비스 Agent가 과거의 유사 문의 사례를 검색한 후 해결 방안을 재구성해 기존 답변을 그대로 적용하여 질문과 맞지 않는 답변을 내놓는 문제를 방지합니다.
코드 보조 개발: 프로그래밍 Agent가 과거 버그 수정 경험을 재구성해 현재 코드 컨텍스트에 맞는 정확한 수정 제안을 제공하고, 기존 해결 방식을 그대로 복사하지 않습니다.
과학 연구 실험 계획: 실험 Agent가 과거 실험 매개변수와 결과를 현재 실험 조건에 맞는 최적 구성 제안으로 재구성해 시행착오 비용을 줄입니다.
© 면책 조항: 도메인 및 연결된 콘텐츠는 시간이 지나면서 변경될 수 있습니다. AIEZZ은(는) 제3자 웹사이트를 관리하지 않습니다. 외부 콘텐츠와 위험을 독립적으로 검토하세요.


사용자 리뷰0