주요 콘텐츠로 건너뛰기

PAST-Bench 운영 중

PAST-Bench는 프린스턴대학교 왕멍디 연구팀이 출시한 벤치마크로, 개인 AI Agent의 재귀적 자기 개선 능력을 검증합니다. PAST-Bench는 기억이 있는 조건과 없는 조건에서의 과제 수행을 비교하여, 판...

PAST-Bench는 프린스턴대학교 왕멍디 연구팀이 출시한 벤치마크로, 개인 AI Agent의 재귀적 자기 개선 능력을 검증합니다. PAST-Bench는 기억이 있는 조건과 없는 조건에서의 과제 수행을 비교하여, 판...

PAST-Bench 제품 인터페이스
월간 방문 수
0
가격
무료 및 유료
등록일
2026-08-12
업데이트됨
2026-08-12

01PAST-Bench란 무엇인가

PAST-Bench는 프린스턴대학교 왕멍디 연구팀이 출시한 벤치마크로, 개인 AI Agent의 재귀적 자기 개선 능력을 검증합니다. PAST-Bench는 기억이 있는 조건과 없는 조건에서의 과제 수행을 비교하여, Agent가 저장한 세션 간 경험이 이후 행동을 실제로 개선했는지 판단합니다. PAST-Bench는 기억, 프로세스 재사용, 정보 수집, 상태 업데이트의 네 가지 능력을 다루며, 총 26개 시나리오와 204개의 과제 라운드로 구성됩니다.

02PAST-Bench의 주요 기능

재귀적 자기 개선 평가: 개인 AI Agent가 저장한 세션 간 경험(기억, 기술, 과제 이력)이 이후 행동을 실제로 개선했는지 검증합니다.
경험 축적 효과의 분리: 점수 향상이 경험 축적에서 비롯된 것인지, 아니면 기반 모델의 향상, Prompt 변화, 과제 난이도 등 다른 요인에서 비롯된 것인지 구분합니다.
4차원 능력 진단: 기억, 프로세스 재사용, 정보 수집, 상태 업데이트의 네 가지 차원을 다루며, Agent의 어떤 능력에 결함이 있는지 파악합니다.
메커니즘 귀인 분석: 최종 점수만 확인하는 것이 아니라 ”저장→검색→적용”의 전체 경로를 추적하여, 개선이 실제 경로에 의해 뒷받침되는지 판단합니다.

03PAST-Bench의 기술 원리

과제군 시퀀스 설계: Agent가 동일한 과제군을 여러 차례의 세션에 걸쳐 순서대로 수행합니다. 초기 세션에서는 경험을 생성하고 저장할 기회를 제공하며, 후속 세션에서는 이러한 경험이 올바르게 사용되는지 검증합니다.
매칭 대조 실험: 각 후속 세션에 대해 영속화 기능을 끈 대조 버전을 설계하고, 그 외 조건은 완전히 동일하게 유지합니다. ”기억 있음 점수 – 기억 없음 점수”를 통해 자기 진화 차이 Δ를 산출합니다.
메커니즘 증거 추적: 실행 중 기억 쓰기, 기술 호출, 세션 검색, 상태 업데이트 등의 텔레메트리 데이터를 기록하고 Mechanism-Evidence Score를 계산하여, 개선이 예상된 경로를 따르는지 검증합니다.
영속화 산출물 감사: Agent가 실제로 저장한 내용(기억 항목, 기술 파일, 세션 인덱스)을 검사하고, 그 구조, 최신성, 재사용성을 분석합니다.

04PAST-Bench 사용 방법

환경 준비: GitHub에서 PAST-Bench 저장소를 클론하고 핵심 종속성과 Agent 어댑터를 설치합니다.
모델 구성: 환경 변수에 사용할 모델의 API Key를 설정합니다.
샌드박스 구축: past-bench build-image --kind sandbox를 실행하여 평가에 필요한 Docker 샌드박스 이미지를 구축합니다.
빠른 검증: past-bench evolve로 단일 과제군을 실행하고 --compare-no-persistence 매개변수를 추가하여 Smoke Test를 수행합니다.
전체 평가: 26개 과제군 전체를 순회하며 평가를 실행합니다. 각 과제군에서는 ”영속화 있음”과 ”영속화 없음”의 두 대조 실험이 자동으로 수행됩니다.
결과 분석: --trace-dir 디렉터리에서 sequence_comparison.json을 확인하여 Δ 값과 메커니즘 증거 점수를 얻습니다.
사용자 정의 연동: 자체 Agent를 평가하려면 agents/ 디렉터리에 어댑터를 구현하고 --compare-no-persistence 스위치를 지원하도록 하면 됩니다.

05PAST-Bench의 핵심 장점

정확한 귀인 능력: PAST-Bench는 개선이 경험 축적에서 비롯된 것인지, 모델 자체의 향상, Prompt 변화, 과제 단순화에서 비롯된 것인지 정확하게 구분합니다.
매칭 대조 실험 설계: 각 과제군에 영속화를 끈 대조 버전을 제공하고 다른 조건은 완전히 동일하게 유지하여, 기억 있음과 기억 없음의 직접적인 인과 비교를 실현합니다.
메커니즘 수준의 진단: Mechanism-Evidence Score를 제안하여 Agent가 정답을 맞혔는지만 판단하지 않고 ”저장→검색→적용”의 전체 경로를 추적합니다. 이를 통해 ”우연히 정답을 맞힌 경우”와 ”실제로 경험을 재사용한 경우”를 구분합니다.
4차원 능력 분해: 모호한 자기 개선을 기억, 프로세스 재사용, 정보 수집, 상태 업데이트라는 네 가지 구체적 능력으로 나누어 부족한 부분을 정확히 파악합니다.
진단 기반 개선: 벤치마크에서 드러난 런타임 장애를 바탕으로 Hermes+ 프레임워크를 직접 탄생시켰으며, 이를 통해 PAST-Bench가 평가 도구일 뿐 아니라 Agent 아키텍처 최적화를 위한 진단 엔진임을 입증합니다.

06PAST-Bench 프로젝트 주소

GitHub 저장소:https://github.com/Gen-Verse/PAST-Bench
arXiv 기술 논문:https://arxiv.org/pdf/2608.04003

07PAST-Bench의 활용 분야

학술 연구: Agent의 재귀적 자기 개선을 위한 표준화되고 재현 가능한 정량 평가 환경을 제공하여, 다양한 아키텍처를 객관적으로 비교할 수 있도록 지원합니다.
프레임워크 개발: 4차원 능력 분해를 통해 Agent 프레임워크의 약점을 정확히 파악하고 아키텍처 최적화를 안내합니다(예: Hermes+의 탄생).
모델 선정: 고정된 프레임워크에서 서로 다른 기반 모델의 세션 간 경험 재사용 성능을 비교하여 각 모델의 능력 편향을 파악합니다.
영속화 검증: 다양한 기억 구조와 검색 전략의 실제 효과를 테스트하여 ”저장했지만 찾지 못하는” 또는 ”저장했지만 사용하지 않는” 비효율적인 영속화를 방지합니다.
제품 반복 개선: 새 버전의 점수 향상이 ”세션 간 경험 축적”에서 비롯된 것인지, 아니면 ”기반 모델의 향상”에서 비롯된 것인지 구분하여 영속화 기능이 실제 가치를 창출하도록 합니다.

© 면책 조항: 도메인 및 연결된 콘텐츠는 시간이 지나면서 변경될 수 있습니다. AIEZZ은(는) 제3자 웹사이트를 관리하지 않습니다. 외부 콘텐츠와 위험을 독립적으로 검토하세요.

사용자 리뷰0