- Ziara za kila mwezi
- 0
- Bei
- Bure na Inalipiwa
- Imeorodheshwa
- 2026-08-12
- Imesasishwa
- 2026-08-12
01PAST-Bench ni nini
PAST-Bench ni kipimo cha ulinganishi kilichoundwa na timu ya Wang Mengdi katika Chuo Kikuu cha Princeton, kwa ajili ya kutathmini uwezo wa Agent binafsi wa AI wa kujiboresha kwa kujirudia. PAST-Bench hulinganisha utendaji wa kazi katika hali zenye kumbukumbu na zisizo na kumbukumbu ili kuamua kama uzoefu wa kuvuka vikao uliohifadhiwa na Agent umeboresha kweli tabia yake ya baadaye. PAST-Bench inashughulikia uwezo wa aina nne: kumbukumbu, utumiaji tena wa taratibu, ukusanyaji wa taarifa na usasishaji wa hali, ikiwa na matukio 26 na mizunguko 204 ya kazi.
02Kazi kuu za PAST-Bench
Tathmini ya kujiboresha kwa kujirudia: hukagua kama uzoefu wa kuvuka vikao uliohifadhiwa na Agent binafsi wa AI (kumbukumbu, ujuzi na historia ya kazi) umeboresha kweli tabia yake ya baadaye.
Kutenga athari ya mkusanyiko wa uzoefu: hutofautisha kama ongezeko la alama limetokana na mkusanyiko wa uzoefu au sababu nyingine kama vile kuboreka kwa modeli ya msingi, mabadiliko ya Prompt au ugumu wa kazi.
Utambuzi wa uwezo kwa vipimo vinne: hushughulikia vipimo vinne vya kumbukumbu, utumiaji tena wa taratibu, ukusanyaji wa taarifa na usasishaji wa hali, ili kubainisha aina mahususi ya upungufu wa uwezo wa Agent.
Uchambuzi wa chanzo cha utendaji: hauangalii alama ya mwisho pekee, bali pia hufuatilia njia kamili ya “kuhifadhi→kurejesha→kutumia” ili kubaini kama uboreshaji unaungwa mkono na njia halisi.
03Kanuni ya kiteknolojia ya PAST-Bench
Muundo wa mfululizo wa familia za kazi: Agent hutekeleza vikao vingi vya familia moja ya kazi kwa mpangilio. Vikao vya awali huunda fursa za kuhifadhi uzoefu, huku vikao vya baadaye vikikagua kama uzoefu huo umetumiwa kwa usahihi.
Jaribio la ulinganishi linalolingana: kwa kila kikao cha baadaye huundwa toleo la ulinganishi linalozima uwezo wa kudumu, huku masharti mengine yote yakibaki sawa kabisa. Tofauti ya kujiboresha Δ hupatikana kupitia “alama yenye kumbukumbu – alama bila kumbukumbu”.
Ufuatiliaji wa ushahidi wa kiutendaji: data za telemetry kuhusu uandishi wa kumbukumbu, matumizi ya ujuzi, urejeshaji wa vikao na usasishaji wa hali hurekodiwa wakati wa utekelezaji. Kisha Mechanism-Evidence Score huhesabiwa ili kuthibitisha kama uboreshaji unafuata njia inayotarajiwa.
Ukaguzi wa bidhaa za kudumu: hukagua maudhui ambayo Agent amehifadhi kwa kweli (maingizo ya kumbukumbu, faili za ujuzi na faharasa za vikao), na kuchanganua muundo, uhalali wa wakati na uwezo wa kuyatumia tena.
04Jinsi ya kutumia PAST-Bench
Maandalizi ya mazingira: kloni hazina ya PAST-Bench kutoka GitHub na usakinishe vitegemezi muhimu pamoja na adapta za Agent.
Usanidi wa modeli: weka API Key ya modeli inayotumika katika vigezo vya mazingira.
Uundaji wa sandbox: tekeleza past-bench build-image --kind sandbox ili kuunda picha ya Docker ya sandbox inayohitajika kwa tathmini.
Uthibitishaji wa haraka: tumia past-bench evolve kuendesha familia moja ya kazi, pamoja na kigezo --compare-no-persistence, kufanya Smoke Test.
Tathmini kamili: pitia familia zote 26 za kazi na kuendesha tathmini; kila familia ya kazi huendesha kiotomatiki makundi mawili ya majaribio ya ulinganishi, “yenye udumishaji” na “isiyo na udumishaji”.
Uchambuzi wa matokeo: tazama sequence_comparison.json katika saraka ya --trace-dir ili kupata thamani ya Δ na alama ya ushahidi wa kiutendaji.
Uunganishaji maalum: ili kutathmini Agent yako mwenyewe, tekeleza adapta katika saraka ya agents/ na uhakikishe kuwa inaunga mkono swichi ya --compare-no-persistence.
05Faida kuu za PAST-Bench
Uwezo halisi wa kubainisha chanzo: PAST-Bench inaweza kutofautisha kwa usahihi kama uboreshaji umetokana na mkusanyiko wa uzoefu au kuboreka kwa modeli yenyewe, mabadiliko ya Prompt au kurahisishwa kwa kazi.
Muundo wa jaribio la ulinganishi linalolingana: kila familia ya kazi ina toleo la ulinganishi linalozima udumishaji, huku masharti mengine yote yakibaki sawa kabisa, na hivyo kuwezesha ulinganishi wa moja kwa moja wa sababu kati ya hali zenye kumbukumbu na zisizo na kumbukumbu.
Utambuzi wa kiwango cha utendaji: huanzisha Mechanism-Evidence Score, ambayo haikagui tu kama Agent imejibu kwa usahihi, bali pia hufuatilia njia kamili ya “kuhifadhi→kurejesha→kutumia”, na kutambua tofauti kati ya “kujibu kwa usahihi kwa bahati” na “kutumia tena uzoefu kwa kweli”.
Mgawanyo wa uwezo katika vipimo vinne: hugawanya dhana isiyoeleweka ya kujiboresha kuwa uwezo mahususi wa kumbukumbu, utumiaji tena wa taratibu, ukusanyaji wa taarifa na usasishaji wa hali, na hivyo kubainisha kwa usahihi udhaifu.
Uboreshaji unaoendeshwa na utambuzi: kutokana na hitilafu za wakati wa utekelezaji zilizofichuliwa na kipimo, uliwezesha moja kwa moja kuibuka kwa mfumo wa Hermes+, na kuthibitisha kuwa si chombo cha tathmini pekee bali pia injini ya kutambua na kuboresha usanifu wa Agent.
06Anwani za mradi wa PAST-Bench
Hazina ya GitHub:https://github.com/Gen-Verse/PAST-Bench
论文 ya kiufundi ya arXiv:https://arxiv.org/pdf/2608.04003
07Matukio ya matumizi ya PAST-Bench
Utafiti wa kitaaluma: hutoa mazingira sanifu, yanayoweza kurudiwa na ya kiasi kwa ajili ya kutathmini kujiboresha kwa kujirudia kwa Agent, na kusaidia ulinganishi wa haki kati ya usanifu tofauti.
Uundaji wa mifumo: hutambua kwa usahihi udhaifu wa mfumo wa Agent kupitia mgawanyo wa uwezo katika vipimo vinne, na kuongoza uboreshaji wa usanifu, kama vile kuibuka kwa Hermes+.
Uteuzi wa modeli: chini ya mfumo uliowekwa, hulinganisha utendaji wa modeli tofauti za msingi katika kutumia tena uzoefu wa kuvuka vikao, na kutambua mielekeo ya uwezo ya kila modeli.
Uthibitishaji wa udumishaji: hupima matokeo halisi ya miundo tofauti ya kumbukumbu na mikakati ya urejeshaji, na kuzuia udumishaji usio na manufaa wa “kuhifadhi lakini kutopata” au “kuhifadhi lakini kutotumia”.
Marudio ya bidhaa: hutofautisha kama ongezeko la alama katika toleo jipya limetokana na “mkusanyiko wa uzoefu wa kuvuka vikao” au “kuboreka kwa modeli ya msingi”, na hivyo kuhakikisha kuwa utendaji wa udumishaji unaleta thamani halisi.
© Kanusho: vikoa na maudhui yaliyounganishwa vinaweza kubadilika kadiri muda unavyopita. AIEZZ haidhibiti tovuti za wahusika wengine. Kagua maudhui na hatari za nje kwa kujitegemea.


Ukaguzi wa watumiaji0