Asosiy kontentga o‘tish

MemHarness – Shanghai AI Lab va boshqalar tomonidan ishlab chiqilgan agent xotirasini qayta tuzish freymvorki Faoliyat yuritmoqda

MemHarness LLM Agentlar uchun mo‘ljallangan xotirani qayta tuzish freymvorki bo‘lib, tarixiy tajribalarni tanqid qilish va qayta tuzish orqali qaror qabul qilish samaradorligini oshiradi.

MemHarness — Shanghai AI Lab, Chjetszyan universiteti, Fudan universiteti, Shanghai Jiao Tong universiteti va boshqa oliy ta’lim muassasalari tomonidan ishlab chiqilgan LLM Agent xotirasini qayta tuzish freymvorki. U qidiruv va harakat o‘rtasiga tanqid qilish hamda qayta tuzish bosqichlarini qo‘shadi. Joriy kontekst asosida tarixiy tajribalar saqlanadi, qayta yoziladi yoki o‘chirib tashlanadi. GRPO yordamida uchidan-uchigacha o‘qitiladi va qo‘shimcha inson annotatsiyasini talab qilmaydi. Freymvork xotirani qidirish, tanqidiy qayta tuzish, harakat generatsiyasi, tajribani qayta yozish va budash kabi to‘liq jarayonlarni qo‘llab-quvvatlaydi hamda besh bosqichli qaror qabul qilish jarayonini taqdim etadi. Uning 7B parametrli modeli ALFWorld va WebShop platformalarida mos ravishda Gemini-2.5-Pro’dan 23.1% va 39.7% ga yuqori natija ko‘rsatgan, taqsimotdan tashqari (OOD) ssenariylarda o‘rtacha muvaffaqiyat darajasi 85.9% ga yetgan. Ushbu freymvork mujassamlangan aqlli uy yumushlari, avtonom onlayn xaridlar, aqlli mijozlarga xizmat ko‘rsatish, kod yozishda yordam va boshqa sohalarda qo‘llanadi.

MemHarness – Shanghai AI Lab va boshqalar tomonidan ishlab chiqilgan agent xotirasini qayta tuzish freymvorki Mahsulot interfeysi
Oylik tashriflar
1
Narxlar
bepul va To'lov
Ro‘yxatga kiritilgan
2026-08-05
Yangilangan
2026-08-05

01MemHarness nima?

MemHarness — Shanghai AI Lab, Chjetszyan universiteti, Fudan universiteti, Shanghai Jiao Tong universiteti va boshqa oliy ta’lim muassasalari tomonidan ishlab chiqilgan LLM Agent xotirasini qayta tuzish freymvorki. Mavjud xotira bilan kuchaytirilgan Agentlar ko‘pincha qidirilgan tarixiy tajribalarni to‘g‘ridan-to‘g‘ri kontekstga qo‘shadi. Agar eski tajriba joriy holatga mos kelmasa, bu aksincha salbiy transferga olib kelishi mumkin. Inson xotirasini qayta tuzish mexanizmidan ilhomlangan MemHarness qidiruv va harakat o‘rtasiga aniq tanqid qilish hamda qayta tuzish bosqichlarini qo‘shadi. Joriy kontekst asosida tarixiy tajribalar saqlanadi, qayta yoziladi yoki o‘chirib tashlanadi. GRPO yordamida uchidan-uchigacha o‘qitiladi va qo‘shimcha inson annotatsiyasini talab qilmaydi.

02MemHarness’ning asosiy funksiyalari

Xotirani qidirish: Agent joriy kuzatuv asosida so‘rov yaratadi va Milvus vektorli xotira bazasidan top-k ta tegishli tarixiy tajribani hamda ularning manba holatlarini qaytaradi.
Tanqid va qayta tuzish: Yagona strategiya modeli xotira manbasi holatini joriy holat bilan taqqoslaydi, uning mosligini tanqidiy baholaydi, tajribani holatga mos ko‘rsatmaga qayta yozadi yoki mos emas deb topib, undan voz kechadi.
Harakat generatsiyasi: Qayta tuzilgan ko‘rsatmalar yoki mustaqil fikrlash asosida bajariladigan muhit harakatlarini yaratadi.
Tajribani qayta yozish va budash: Har bir o‘zaro ta’sirdan so‘ng trayektoriya tajriba sifatida qisqartirib, xotira bazasiga yoziladi; semantik takrorlanishlar olib tashlanadi va past qiymatli xotiralar muntazam ravishda tajriba foydaliligiga ko‘ra budaladi.
Uchidan-uchigacha o‘qitish: GRPO orqali qidiruv, qayta tuzish va harakat generatsiyasi birgalikda optimallashtiriladi; qayta tuzish bosqichi uchun alohida annotatsiyalangan ma’lumotlar talab qilinmaydi.

03MemHarness’ning texnik tamoyillari

WeChat’da kuzatib boring va “开源” deb javob yuborib, AI ochiq manbali loyihalar guruhiga qo‘shiling
Besh bosqichli qaror qabul qilish jarayoni: MemHarness xotira asosidagi qaror qabul qilishni muhitni kuzatish, tajribani qidirish, xotirani tanqid qilish, kontekstual xotirani qayta tuzish va harakat generatsiyasi kabi beshta ketma-ket bosqichga ajratadi. Bu insonning qidirish — baholash — qayta tuzish kognitiv jarayonini taqlid qiladi va Agent xotirani to‘g‘ridan-to‘g‘ri statik tarzda qayta ijro etadigan an’anaviy yondashuvni almashtiradi.
Kontekstual xotirani qayta tuzish mexanizmi: Strategiya modeli vazifa tavsifi, joriy tarix, qidirilgan tajribalar va ularning manba holatlarini qayta tuzish kontekstiga birlashtiradi. Tarixiy manba holati bilan joriy holatni taqqoslab, farqlarni aniqlaydi, ko‘chirilishi mumkin bo‘lgan bilimlarni saqlaydi, mos kelmaydigan mazmunni qayta yozadi yoki xotirani rad etish uchun belgisini chiqarib, mustaqil fikrlashga qaytadi.
Yagona strategiya modeli arxitekturasi: Qidiruv so‘rovini yaratish, xotirani tanqidiy qayta tuzish va bajariladigan harakatni yaratish bosqichlari bir xil strategiya modeli parametrlaridan foydalanadi. Qayta tuzish moduli uchun alohida qiymat tarmog‘i yoki nazorat ma’lumotlarini o‘qitish talab qilinmaydi, natijada xotiradan foydalanish va qaror qabul qilishdagi fikrlash yagona modelda chambarchas bog‘lanadi.
GRPO asosida uchidan-uchigacha o‘qitish: Qayta tuzish ko‘rsatmalari uchun tayyor to‘g‘ri javob annotatsiyalari mavjud bo‘lmagani sababli, MemHarness qidiruv — qayta tuzish — harakatning butun zanjirini uchidan-uchigacha optimallashtirish uchun GRPO’dan foydalanadi. Mukofot siyrak vazifa natijalari va format mukofotidan tashkil topadi. Guruh bo‘yicha normallashtirilgan afzallik orqali trayektoriya darajasidagi kredit barcha tokenlarga taqsimlanadi; bunda fikrlash, qayta tuzish va harakat generatsiyasi qobiliyatlari birgalikda o‘qitiladi.

04MemHarness’dan qanday foydalaniladi?

Omborni klonlash va muhit yaratish: git clone https://github.com/KnowledgeXLab/MemHarness.git buyrug‘ini bajaring va python==3.12 asosidagi Conda muhitini yarating; keyin vLLM, Flash Attention 2 hamda MemHarness’ning o‘zini ketma-ket o‘rnating.
Embedding xizmatini ishga tushirish: Milvus xotira bazasiga vektor kodlash xizmatini taqdim etuvchi BGE-M3 embedding modelini ishga tushirish uchun vllm serve BAAI/bge-m3 --port 8001 buyrug‘ini bajaring.
Maqsadli muhitni o‘rnatish: Vazifaga qarab ALFWorld yoki WebShop interaktiv muhitini o‘rnating, shuningdek tegishli o‘yin fayllari va oldindan o‘qitilgan detektorlarni yuklab oling.
Sovuq start SFT (ixtiyoriy): Sovuq start ma’lumotlarini yaratish uchun scripts/build_*_coldstart_data.py skriptini ishga tushiring; modelni o‘zaro ta’sir formati va xotira qisqacha mazmuni formatiga moslashtirish uchun scripts/cold_start_sft.sh skriptini bajaring.
GRPO asosida uchidan-uchigacha o‘qitish: run_scripts/train_alfworld.sh yoki run_scripts/train_webshop.sh skriptini ishga tushiring. Freymvork xotira vektor bazasini avtomatik ishga tushiradi, Agent qidiruvi, tajribani qayta yozish va budashni bajaradi hamda GRPO o‘qitishini yakunlaydi.

05MemHarness’ning asosiy afzalliklari

Qayta tuzish qayta ijrodan ustun: Tanqid va qayta tuzish bosqichlarini aniq kiritib, statik xotira parchalarini kontekstga sezgir, holatga mos ko‘rsatmalarga aylantiradi va salbiy transferning oldini oladi.
Kichik model katta modellardan ustun: 7B parametrli model ALFWorld va WebShop platformalarida mos ravishda Gemini-2.5-Pro’dan 23.1% va 39.7% ga yuqori natija ko‘rsatadi.
OOD barqarorligi kuchli: Taqsimotdan tashqari ssenariylarda o‘rtacha muvaffaqiyat darajasi 85.9% ga yetadi, bu xotirani dastlabki qayta ijro etishdagi 76.3% ko‘rsatkichdan sezilarli yuqori.
Yashirin fikrlashni kuchaytirish: Sinov vaqtida xotira o‘chirib qo‘yilgan taqdirda ham, qayta tuzishga yo‘naltirilgan o‘qitish asosiy strategiyaning muvaffaqiyat darajasini 76.4% dan 83.0% gacha oshiradi va Agentning ichki fikrlash qobiliyatini tubdan kuchaytiradi.
Qo‘shimcha annotatsiya talab qilinmaydi: Qayta tuzish qobiliyati GRPO yordamida uchidan-uchigacha o‘qitish jarayonida tabiiy ravishda yuzaga keladi va inson tomonidan yozilgan qayta tuzish bo‘yicha nazorat ma’lumotlariga bog‘liq emas.

06MemHarness loyihasi manzillari

GitHub ombori: https://github.com/KnowledgeXLab/MemHarness
HuggingFace model ombori: https://huggingface.co/KnowledgeXLab/MemHarness
arXiv texnik maqolasi: https://arxiv.org/pdf/2607.28272

07MemHarness’ning qo‘llanish sohalari

Mujassamlangan aqlli uy yumushlari: ALFWorld kabi uy sharoitlarida Agent avvalgi buyum olish va tozalash tajribalarini qayta tuzib, turli xona joylashuvlariga moslashgan holda murakkab uy yumushlarini bajarishi mumkin.
Avtonom onlayn xaridlar: WebShop kabi elektron tijorat platformalarida tarixiy xarid tajribalarini joriy mahsulotlarni qidirish va saralash strategiyasiga qayta tuzib, maqsadga yo‘naltirilgan xaridlar muvaffaqiyatini oshiradi.
Aqlli mijozlarga xizmat ko‘rsatish dialogi: Mijozlarga xizmat ko‘rsatuvchi Agent tarixdagi o‘xshash murojaatlarni qidirgach, yechimni qayta tuzadi va eski javobni to‘g‘ridan-to‘g‘ri qo‘llash natijasida savolga mos kelmaydigan javob berishdan saqlanadi.
Kod yozishda yordam: Dasturlash Agenti avvalgi xatolarni tuzatish tajribalarini qayta tuzib, ularni joriy kod kontekstiga moslashtiradi va eski yechimni ko‘r-ko‘rona ko‘chirish o‘rniga aniq tuzatish tavsiyalarini beradi.
Ilmiy tajribalarni rejalashtirish: Tajriba Agenti tarixiy tajriba parametrlari va natijalarini joriy tajriba sharoitlari uchun optimal konfiguratsiya tavsiyalariga qayta tuzib, sinov-xato xarajatlarini kamaytiradi.

© Ogohlantirish: domenlar va havola qilingan kontent vaqt o‘tishi bilan o‘zgarishi mumkin. AIEZZ uchinchi tomon veb-saytlarini nazorat qilmaydi. Tashqi kontent va xatarlarni mustaqil ravishda ko‘rib chiqing.

Foydalanuvchi sharhlari0