Asosiy kontentga o‘tish

PAST-Bench Faoliyat yuritmoqda

PAST-Bench — Prinston universitetidagi Van Men-di jamoasi tomonidan ishlab chiqilgan benchmark bo‘lib, shaxsiy AI Agent’larning rekursiv o‘z-o‘zini takomillashtirish qobiliyatini sinash uchun mo‘ljallangan. PAST-Bench xotirali va xotirasiz sharoitlardagi vazifalar natijalarini taqqoslash orqali...

PAST-Bench — Prinston universitetidagi Van Men-di jamoasi tomonidan ishlab chiqilgan benchmark bo‘lib, shaxsiy AI Agent’larning rekursiv o‘z-o‘zini takomillashtirish qobiliyatini sinash uchun mo‘ljallangan. PAST-Bench xotirali va xotirasiz sharoitlardagi vazifalar natijalarini taqqoslash orqali...

PAST-Bench Mahsulot interfeysi
Oylik tashriflar
0
Narxlar
bepul va To'lov
Ro‘yxatga kiritilgan
2026-08-12
Yangilangan
2026-08-12

01PAST-Bench nima?

PAST-Bench — Prinston universitetidagi Van Men-di jamoasi tomonidan ishlab chiqilgan benchmark bo‘lib, shaxsiy AI Agent’larning rekursiv o‘z-o‘zini takomillashtirish qobiliyatini sinash uchun mo‘ljallangan. PAST-Bench xotirali va xotirasiz sharoitlardagi vazifalar natijalarini taqqoslash orqali Agent saqlagan sessiyalararo tajriba keyingi xatti-harakatlarni haqiqatan ham yaxshilagan yoki yaxshilamaganini aniqlaydi. PAST-Bench xotira, jarayonni qayta ishlatish, axborot to‘plash va holatni yangilash kabi to‘rt turdagi qobiliyatni qamrab oladi hamda 26 ta stsenariy va 204 ta vazifa raundidan iborat.

02PAST-Bench’ning asosiy funksiyalari

Rekursiv o‘z-o‘zini takomillashtirishni baholash: shaxsiy AI Agent saqlagan sessiyalararo tajriba (xotira, ko‘nikmalar, vazifalar tarixi) keyingi xatti-harakatlarni haqiqatan ham yaxshilagan yoki yaxshilamaganini tekshiradi.
Tajriba to‘planishi ta’sirini ajratish: ball oshishi tajriba to‘planishi hisobidanmi yoki bazaviy model kuchaygani, Prompt o‘zgargani, vazifa murakkabligi kabi boshqa omillar hisobidanmi, farqlaydi.
To‘rt o‘lchovli qobiliyat diagnostikasi: xotira, jarayonni qayta ishlatish, axborot to‘plash va holatni yangilashning to‘rt asosiy yo‘nalishini qamrab olib, Agent’ning aynan qaysi qobiliyatida kamchilik borligini aniqlaydi.
Mexanizm sabablarini tahlil qilish: faqat yakuniy ballni ko‘rib chiqmaydi, balki “saqlash → qidirib topish → qo‘llash” to‘liq yo‘lini ham kuzatib, takomillashuv haqiqiy mexanizm bilan ta’minlanganini aniqlaydi.

03PAST-Bench’ning texnik tamoyillari

Vazifalar oilasi ketma-ketligini loyihalash: Agent bir xil vazifalar oilasidagi bir nechta sessiyani ketma-ket bajaradi. Dastlabki sessiyalar tajribani yaratish va saqlash imkonini beradi, keyingi sessiyalar esa bu tajriba to‘g‘ri ishlatilgan yoki ishlatilmaganini tekshiradi.
Juftlashtirilgan nazorat tajribasi: keyingi sessiyalarning har biri uchun doimiy saqlash imkoniyati o‘chirilgan nazorat varianti yaratiladi, qolgan shartlar esa aynan bir xil bo‘ladi. “Xotirali ball − xotirasiz ball” orqali o‘z-o‘zini evolyutsiya qilish farqi Δ olinadi.
Mexanizm dalillarini kuzatish: ish vaqtida xotiraga yozish, ko‘nikmalarni chaqirish, sessiyani qidirish, holatni yangilash kabi telemetriya ma’lumotlari qayd etiladi va takomillashuv kutilgan yo‘ldan borayotganini tekshirish uchun Mechanism-Evidence Score hisoblanadi.
Doimiy saqlangan natijalarni audit qilish: Agent amalda saqlagan ma’lumotlar (xotira yozuvlari, ko‘nikma fayllari, sessiya indekslari) tekshirilib, ularning tuzilishi, dolzarbligi va qayta ishlatilish imkoniyati tahlil qilinadi.

04PAST-Bench’dan qanday foydalanish kerak?

Muhitni tayyorlash: GitHub’dan PAST-Bench repozitoriysini klonlang va asosiy bog‘liqliklar hamda Agent adapterlarini o‘rnating.
Modelni sozlash: ishlatiladigan model API Key’ini muhit o‘zgaruvchilarida sozlang.
Sandbox yaratish: baholash uchun zarur Docker sandbox image’ini yaratish maqsadida past-bench build-image --kind sandbox buyrug‘ini bajaring.
Tezkor tekshiruv: bitta vazifalar oilasini ishga tushirish uchun past-bench evolve buyrug‘idan foydalaning va Smoke Test o‘tkazish uchun --compare-no-persistence parametrini qo‘shing.
To‘liq baholash: barcha 26 ta vazifalar oilasi bo‘yicha baholashni ishga tushiring; har bir vazifalar oilasi uchun “doimiy saqlash yoqilgan” va “doimiy saqlash o‘chirilgan” ikki nazorat tajribasi avtomatik bajariladi.
Natijalarni tahlil qilish: --trace-dir katalogidagi sequence_comparison.json faylini ko‘rib, Δ qiymati va mexanizm dalillari ballini oling.
Maxsus integratsiya: o‘zingizning Agent’ingizni baholash uchun agents/ katalogida adapter yarating va uning --compare-no-persistence kalitini qo‘llab-quvvatlashini ta’minlang.

05PAST-Bench’ning asosiy afzalliklari

Haqiqiy sababni aniqlash qobiliyati: PAST-Bench takomillashuv tajriba to‘planishidanmi yoki modelning o‘zi kuchaygani, Prompt o‘zgargani, vazifa soddalashganidanmi, aniq farqlay oladi.
Juftlashtirilgan nazorat tajribasi dizayni: har bir vazifalar oilasi uchun doimiy saqlash o‘chirilgan nazorat varianti mavjud, qolgan shartlar aynan bir xil bo‘lib, xotirali va xotirasiz holatlarni bevosita sababiy taqqoslash imkonini beradi.
Mexanizm darajasidagi diagnostika: Mechanism-Evidence Score Agent’ning javobni to‘g‘ri topganini aniqlash bilan cheklanmay, “saqlash → qidirib topish → qo‘llash” to‘liq yo‘lini ham kuzatadi va “tasodifan to‘g‘ri javob berish” bilan “tajribani haqiqatan qayta ishlatish” o‘rtasidagi farqni ko‘rsatadi.
Qobiliyatlarni to‘rt yo‘nalishga ajratish: noaniq o‘z-o‘zini takomillashtirishni xotira, jarayonni qayta ishlatish, axborot to‘plash va holatni yangilash kabi to‘rtta aniq qobiliyatga ajratib, zaif jihatlarni aniq topadi.
Diagnostikaga asoslangan takomillashtirish: benchmark aniqlagan ish vaqtidagi nosozliklar asosida bevosita Hermes+ framework’i yaratildi. Bu uning nafaqat baholash vositasi, balki Agent arxitekturasini optimallashtirish uchun diagnostika mexanizmi ekanini ko‘rsatadi.

06PAST-Bench loyihasi manzili

GitHub repozitoriysi:https://github.com/Gen-Verse/PAST-Bench
arXiv texnik maqolasi:https://arxiv.org/pdf/2608.04003

07PAST-Bench’ning qo‘llanilish sohalari

Akademik tadqiqotlar: Agent’larning rekursiv o‘z-o‘zini takomillashtirishini standartlashtirilgan, qayta tiklanadigan miqdoriy baholash muhiti bilan ta’minlab, turli arxitekturalarni xolis taqqoslashni qo‘llab-quvvatlaydi.
Framework ishlab chiqish: to‘rt o‘lchovli qobiliyat tahlili orqali Agent framework’ining zaif jihatlarini aniq topib, arxitekturani optimallashtirishga yo‘l ko‘rsatadi (masalan, Hermes+’ning yaratilishi).
Model tanlash: bir xil framework sharoitida turli bazaviy modellarning sessiyalararo tajribani qayta ishlatish ko‘rsatkichlarini taqqoslab, har bir modelning qobiliyat yo‘nalishini aniqlaydi.
Doimiy saqlashni tekshirish: turli xotira tuzilmalari va qidirish strategiyalarining amaliy samaradorligini sinab, “saqlandi, lekin topilmadi” yoki “saqlandi, lekin ishlatilmadi” kabi samarasiz saqlash holatlarining oldini oladi.
Mahsulotni takomillashtirish: yangi versiyadagi ball oshishi “sessiyalararo tajriba to‘planishi” hisobidanmi yoki “bazaviy model kuchaygani” hisobidanmi, farqlab, doimiy saqlash funksiyasi haqiqiy qiymat yaratishini ta’minlaydi.

© Ogohlantirish: domenlar va havola qilingan kontent vaqt o‘tishi bilan o‘zgarishi mumkin. AIEZZ uchinchi tomon veb-saytlarini nazorat qilmaydi. Tashqi kontent va xatarlarni mustaqil ravishda ko‘rib chiqing.

Foydalanuvchi sharhlari0