- Lượt truy cập hàng tháng
- 0
- Giá
- Miễn phí và Trả phí
- Được liệt kê
- 2026-08-12
- Đã cập nhật
- 2026-08-12
01PAST-Bench là gì
PAST-Bench là bộ tiêu chuẩn do nhóm của Wang Mengdi tại Đại học Princeton phát triển, dùng để đánh giá khả năng tự cải thiện đệ quy của các AI Agent cá nhân. PAST-Bench đánh giá bằng cách so sánh hiệu suất nhiệm vụ trong điều kiện có và không có bộ nhớ, xác định liệu kinh nghiệm liên phiên mà Agent lưu lại có thực sự cải thiện hành vi về sau hay không. PAST-Bench bao quát bốn năng lực: bộ nhớ, tái sử dụng quy trình, thu thập thông tin và cập nhật trạng thái, với tổng cộng 26 kịch bản và 204 lượt nhiệm vụ.
02Các chức năng chính của PAST-Bench
Đánh giá khả năng tự cải thiện đệ quy: kiểm tra liệu kinh nghiệm liên phiên mà AI Agent cá nhân lưu lại (bộ nhớ, kỹ năng, lịch sử nhiệm vụ) có thực sự cải thiện hành vi về sau hay không.
Cô lập hiệu quả tích lũy kinh nghiệm: phân biệt việc điểm số tăng là do tích lũy kinh nghiệm hay do các yếu tố khác như mô hình nền mạnh hơn, Prompt thay đổi hoặc độ khó nhiệm vụ thay đổi.
Chẩn đoán năng lực theo bốn chiều: bao quát bốn khía cạnh là bộ nhớ, tái sử dụng quy trình, thu thập thông tin và cập nhật trạng thái, từ đó xác định cụ thể loại năng lực nào của Agent còn thiếu sót.
Phân tích quy kết theo cơ chế: không chỉ xem điểm số cuối cùng mà còn theo dõi toàn bộ đường đi “lưu trữ → truy xuất → áp dụng”, xác định liệu sự cải thiện có được hỗ trợ bởi một cơ chế thực tế hay không.
03Nguyên lý kỹ thuật của PAST-Bench
Thiết kế chuỗi nhóm nhiệm vụ: Agent lần lượt thực hiện nhiều phiên của cùng một nhóm nhiệm vụ. Các phiên đầu tạo cơ hội lưu lại kinh nghiệm, còn các phiên sau kiểm tra xem những kinh nghiệm đó có được sử dụng đúng cách hay không.
Thí nghiệm đối chứng ghép cặp: thiết kế một phiên bản đối chứng cho mỗi phiên về sau, tắt khả năng lưu trữ lâu dài trong khi giữ nguyên mọi điều kiện khác. Hiệu số tự tiến hóa Δ được tính bằng “điểm có bộ nhớ – điểm không có bộ nhớ”.
Truy vết bằng chứng cơ chế: ghi lại dữ liệu đo từ xa trong thời gian chạy, bao gồm việc ghi bộ nhớ, gọi kỹ năng, truy xuất phiên và cập nhật trạng thái; sau đó tính Mechanism-Evidence Score để xác minh sự cải thiện có tuân theo đường đi dự kiến hay không.
Kiểm tra sản phẩm lưu trữ lâu dài: kiểm tra nội dung Agent thực sự lưu lại (mục bộ nhớ, tệp kỹ năng, chỉ mục phiên), đồng thời phân tích cấu trúc, tính cập nhật và khả năng tái sử dụng của chúng.
04Cách sử dụng PAST-Bench
Chuẩn bị môi trường: sao chép kho PAST-Bench từ GitHub và cài đặt các dependency cốt lõi cùng adapter cho Agent.
Cấu hình mô hình: cấu hình API Key của mô hình được sử dụng trong biến môi trường.
Xây dựng sandbox: thực thi past-bench build-image --kind sandbox để xây dựng image Docker sandbox cần thiết cho việc đánh giá.
Kiểm tra nhanh: dùng past-bench evolve để chạy một nhóm nhiệm vụ và thêm tham số --compare-no-persistence nhằm thực hiện Smoke Test.
Đánh giá đầy đủ: chạy đánh giá trên toàn bộ 26 nhóm nhiệm vụ; mỗi nhóm tự động thực hiện hai thí nghiệm đối chứng “có lưu trữ lâu dài” và “không có lưu trữ lâu dài”.
Phân tích kết quả: xem sequence_comparison.json trong thư mục --trace-dir để lấy giá trị Δ và điểm bằng chứng cơ chế.
Tích hợp tùy chỉnh: nếu cần đánh giá Agent riêng, hãy triển khai adapter trong thư mục agents/ và bảo đảm hỗ trợ tùy chọn --compare-no-persistence.
05Ưu thế cốt lõi của PAST-Bench
Khả năng quy kết thực sự: PAST-Bench có thể phân biệt chính xác sự cải thiện đến từ tích lũy kinh nghiệm hay từ việc bản thân mô hình mạnh hơn, Prompt thay đổi hoặc nhiệm vụ trở nên đơn giản hơn.
Thiết kế thí nghiệm đối chứng ghép cặp: mỗi nhóm nhiệm vụ đều có phiên bản đối chứng đã tắt khả năng lưu trữ lâu dài, trong khi mọi điều kiện khác hoàn toàn giống nhau, cho phép so sánh nhân quả trực tiếp giữa có và không có bộ nhớ.
Chẩn đoán ở cấp độ cơ chế: đề xuất Mechanism-Evidence Score, không chỉ đánh giá Agent trả lời đúng hay không mà còn theo dõi toàn bộ đường đi “lưu trữ → truy xuất → áp dụng”, phân biệt giữa “tình cờ trả lời đúng” và “thực sự tái sử dụng kinh nghiệm”.
Phân rã năng lực theo bốn chiều: chia khả năng tự cải thiện vốn mơ hồ thành bốn năng lực cụ thể là bộ nhớ, tái sử dụng quy trình, thu thập thông tin và cập nhật trạng thái, giúp xác định chính xác điểm yếu.
Cải thiện dựa trên chẩn đoán: các lỗi trong thời gian chạy do bộ tiêu chuẩn phát hiện đã trực tiếp thúc đẩy sự ra đời của framework Hermes+, chứng minh PAST-Bench không chỉ là công cụ đánh giá mà còn là động cơ chẩn đoán để tối ưu hóa kiến trúc Agent.
06Địa chỉ dự án PAST-Bench
Kho GitHub:https://github.com/Gen-Verse/PAST-Bench
Bài báo kỹ thuật arXiv:https://arxiv.org/pdf/2608.04003
07Các kịch bản ứng dụng của PAST-Bench
Nghiên cứu học thuật: cung cấp môi trường đánh giá định lượng tiêu chuẩn hóa và có thể tái lập cho khả năng tự cải thiện đệ quy của Agent, hỗ trợ so sánh khách quan giữa các kiến trúc khác nhau.
Phát triển framework: xác định chính xác điểm yếu của framework Agent thông qua phân rã năng lực theo bốn chiều, từ đó định hướng tối ưu hóa kiến trúc (như sự ra đời của Hermes+).
Lựa chọn mô hình: so sánh khả năng tái sử dụng kinh nghiệm liên phiên của các mô hình nền khác nhau trong cùng một framework cố định, qua đó nhận diện thiên hướng năng lực của từng mô hình.
Xác minh khả năng lưu trữ lâu dài: kiểm thử hiệu quả thực tế của các cấu trúc bộ nhớ và chiến lược truy xuất khác nhau, tránh tình trạng lưu nhưng không tìm thấy hoặc lưu nhưng không sử dụng được.
Lặp lại sản phẩm: phân biệt việc điểm số của phiên bản mới tăng là nhờ tích lũy kinh nghiệm liên phiên hay nhờ mô hình nền mạnh hơn, bảo đảm chức năng lưu trữ lâu dài thực sự tạo ra giá trị.
© Tuyên bố miễn trừ trách nhiệm: tên miền và nội dung được liên kết có thể thay đổi theo thời gian. AIEZZ không kiểm soát các trang web của bên thứ ba. Hãy tự đánh giá nội dung bên ngoài và các rủi ro liên quan.


Đánh giá của người dùng0