Ruka hadi maudhui makuu

MemHarness – Mfumo wa Shanghai AI Lab na wengine wa uundaji upya wa kumbukumbu za mawakala wenye akili Inafanya kazi

MemHarness ni mfumo wa uundaji upya wa kumbukumbu kwa LLM Agent, unaoboresha utendaji wa kufanya maamuzi kwa kukosoa na kuunda upya uzoefu wa zamani.

MemHarness ni mfumo wa uundaji upya wa kumbukumbu wa LLM Agent uliotolewa na Shanghai AI Lab kwa ushirikiano na Zhejiang University, Fudan University, Shanghai Jiao Tong University na vyuo vingine. Unaingiza hatua za ukosoaji na uundaji upya kati ya urejeshaji na hatua, ukitumia muktadha wa sasa kuhifadhi, kuandika upya au kuacha uzoefu wa zamani. Mfumo huu hufunzwa kutoka mwanzo hadi mwisho kwa GRPO bila kuhitaji lebo za ziada zilizotengenezwa na binadamu. Unaunga mkono mchakato kamili unaojumuisha urejeshaji wa kumbukumbu, ukosoaji na uundaji upya, uzalishaji wa hatua, uandishi wa uzoefu na upunguzaji wa kumbukumbu, pamoja na mchakato wa maamuzi wa hatua tano. Modeli yake yenye vigezo 7B ilizidi Gemini-2.5-Pro kwa 23.1% na 39.7% mtawalia kwenye ALFWorld na WebShop, huku kiwango cha wastani cha mafanikio katika mazingira ya nje ya usambazaji kikifikia 85.9%. Inafaa kwa kazi za nyumbani za akili iliyojengeka mwilini, ununuzi huru mtandaoni, huduma kwa wateja yenye akili, usaidizi wa uundaji wa msimbo na matukio mengine.

MemHarness – Mfumo wa Shanghai AI Lab na wengine wa uundaji upya wa kumbukumbu za mawakala wenye akili Kiolesura cha bidhaa
Ziara za kila mwezi
1
Bei
Bure na Inalipiwa
Imeorodheshwa
2026-08-05
Imesasishwa
2026-08-05

01MemHarness ni nini

MemHarness ni mfumo wa uundaji upya wa kumbukumbu wa LLM Agent uliotolewa na Shanghai AI Lab kwa ushirikiano na Zhejiang University, Fudan University, Shanghai Jiao Tong University na vyuo vingine. Mawakala walioboreshwa kwa kumbukumbu mara nyingi huingiza moja kwa moja uzoefu wa zamani uliorejeshwa kwenye muktadha; hata hivyo, uzoefu wa zamani usiolingana na hali ya sasa unaweza kusababisha uhamishaji hasi. Kwa kuchochewa na utaratibu wa uundaji upya wa kumbukumbu za binadamu, MemHarness huingiza kwa uwazi hatua za ukosoaji na uundaji upya kati ya urejeshaji na hatua. Hutumia muktadha wa sasa kuhifadhi, kuandika upya au kuacha uzoefu wa zamani, na hufunzwa kutoka mwanzo hadi mwisho kwa GRPO bila kuhitaji lebo za ziada zilizotengenezwa na binadamu.

02Kazi kuu za MemHarness

Urejeshaji wa kumbukumbu: Agent hutengeneza swali kulingana na uchunguzi wa sasa, kisha hurejesha uzoefu wa zamani unaohusiana zaidi wa top-k pamoja na hali zake za chanzo kutoka kwenye hifadhidata ya kumbukumbu za vekta ya Milvus.
Ukosoaji na uundaji upya: Modeli ya sera ya pamoja hulinganisha hali ya chanzo ya kumbukumbu na hali ya sasa, hukosoa ufaafu wake, na huandika upya uzoefu huo kuwa mwongozo unaolingana na hali, au huamua kuwa haufai na kuutupa.
Uzalishaji wa hatua: Kulingana na mwongozo ulioundwa upya au hoja huru, mfumo hutengeneza hatua zinazoweza kutekelezwa katika mazingira.
Uandishi na upunguzaji wa uzoefu: Baada ya kila mzunguko wa mwingiliano, mfuatano hufupishwa kuwa uzoefu na kuandikwa kwenye hifadhidata ya kumbukumbu; kumbukumbu zilizorudiwa kimaana huondolewa, na kumbukumbu zenye thamani ndogo hupunguzwa mara kwa mara kulingana na manufaa yake.
Mafunzo kutoka mwanzo hadi mwisho: GRPO hutumika kuboresha kwa pamoja urejeshaji, uundaji upya na uzalishaji wa hatua, bila data huru ya lebo kwa hatua ya uundaji upya.

03Kanuni ya kiteknolojia ya MemHarness

Fuata kwenye WeChat na ujibu “开源” ili ujiunge na kikundi cha mawasiliano cha miradi ya AI ya chanzo huria
Mchakato wa maamuzi wa hatua tano: MemHarness hugawanya maamuzi yanayoongozwa na kumbukumbu katika hatua tano zinazofuatana: uchunguzi wa mazingira, urejeshaji wa uzoefu, ukosoaji wa kumbukumbu, uundaji upya wa kumbukumbu kulingana na muktadha na uzalishaji wa hatua. Hivyo huiga mchakato wa utambuzi wa binadamu wa kurejesha—kutathmini—kuunda upya, badala ya mtindo tuli wa mawakala wa jadi wa kucheza tena kumbukumbu moja kwa moja.
Utaratibu wa uundaji upya wa kumbukumbu kulingana na muktadha: Modeli ya sera huunganisha maelezo ya kazi, historia ya sasa, uzoefu uliorejeshwa na hali zake za chanzo kuwa muktadha wa uundaji upya. Kwa kulinganisha hali ya kihistoria ya chanzo na hali ya sasa, hutambua tofauti, huhifadhi maarifa yanayoweza kuhamishwa, huandika upya maudhui yasiyolingana, au hutoa alama kukataa kumbukumbu hiyo na kurejea kwenye hoja huru.
Muundo wa modeli ya sera ya pamoja: Hatua tatu za kutengeneza swali la urejeshaji, kukosoa na kuunda upya kumbukumbu, na kutengeneza hatua zinazoweza kutekelezwa hushiriki vigezo vya modeli moja ya sera. Hakuna haja ya kufunza mtandao wa thamani au data ya usimamizi tofauti kwa moduli ya uundaji upya, hivyo matumizi ya kumbukumbu na hoja ya maamuzi huunganishwa kwa karibu ndani ya modeli moja.
Mafunzo ya GRPO kutoka mwanzo hadi mwisho: Kwa kuwa mwongozo wa uundaji upya hauna lebo sahihi, MemHarness hutumia GRPO kuboresha mnyororo mzima wa urejeshaji—uundaji upya—hatua kutoka mwanzo hadi mwisho. Tuzo huundwa na matokeo machache ya kazi pamoja na tuzo ya umbizo; faida iliyosanifishwa kwa vikundi hugawa sifa ya kiwango cha mfuatano kwa tokeni zote, huku ikifunza kwa pamoja uwezo wa kufikiri, kuunda upya na kutengeneza hatua.

04Jinsi ya kutumia MemHarness

Nakili hazina na uunde mazingira: Tekeleza git clone https://github.com/KnowledgeXLab/MemHarness.git na uunde mazingira ya Conda yenye python==3.12, kisha sakinisha vLLM, Flash Attention 2 na MemHarness yenyewe kwa mfuatano.
Sanidi huduma ya embedding: Tekeleza vllm serve BAAI/bge-m3 --port 8001 ili kuanzisha modeli ya embedding ya BGE-M3, ambayo hutoa huduma ya usimbaji wa vekta kwa hifadhidata ya kumbukumbu ya Milvus.
Sakinisha mazingira lengwa: Kulingana na mahitaji ya kazi, sakinisha mazingira ya mwingiliano ya ALFWorld au WebShop, na upakue faili za mchezo pamoja na vitambua vilivyofunzwa awali vinavyohusika.
SFT ya kuanza bila kumbukumbu (hiari): Tekeleza scripts/build_*_coldstart_data.py ili kujenga data ya kuanza bila kumbukumbu, kisha endesha scripts/cold_start_sft.sh ili kuoanisha modeli na umbizo la mwingiliano na umbizo la muhtasari wa kumbukumbu.
Mafunzo ya GRPO kutoka mwanzo hadi mwisho: Endesha run_scripts/train_alfworld.sh au run_scripts/train_webshop.sh. Mfumo utaanzisha kiotomatiki hifadhidata ya vekta za kumbukumbu, kutekeleza urejeshaji wa Agent, uandishi wa uzoefu na upunguzaji wa kumbukumbu, na kukamilisha mafunzo ya GRPO.

05Faida kuu za MemHarness

Uundaji upya ni bora kuliko kucheza tena: Kwa kuingiza wazi hatua za ukosoaji na uundaji upya, vipande tuli vya kumbukumbu hubadilishwa kuwa mwongozo unaolingana na hali na unaozingatia muktadha, hivyo kuzuia uhamishaji hasi.
Modeli ndogo huzidi modeli kubwa: Modeli yenye vigezo 7B ilizidi Gemini-2.5-Pro kwa 23.1% na 39.7% mtawalia kwenye ALFWorld na WebShop.
Ustahimilivu mkubwa wa OOD: Katika mazingira ya nje ya usambazaji, kiwango cha wastani cha mafanikio kilifikia 85.9%, juu kwa kiasi kikubwa kuliko 76.3% ya kucheza tena kumbukumbu asili.
Uboreshaji wa hoja fiche: Hata kumbukumbu inapozimwa wakati wa majaribio, lengo la mafunzo ya uundaji upya huongeza kiwango cha mafanikio cha sera ya msingi kutoka 76.4% hadi 83.0%, na kuimarisha kimsingi uwezo wa ndani wa Agent wa kufikiri.
Hakuna lebo za ziada zinazohitajika: Uwezo wa uundaji upya hujitokeza kiasili kupitia mafunzo ya GRPO kutoka mwanzo hadi mwisho, bila kutegemea data ya usimamizi wa uundaji upya iliyoandikwa na binadamu.

06Anwani za mradi wa MemHarness

Hazina ya GitHub: https://github.com/KnowledgeXLab/MemHarness
Hazina ya modeli ya HuggingFace: https://huggingface.co/KnowledgeXLab/MemHarness
Makala ya kiufundi ya arXiv: https://arxiv.org/pdf/2607.28272

07Matukio ya matumizi ya MemHarness

Kazi za nyumbani za akili iliyojengeka mwilini: Katika mazingira ya nyumbani kama ALFWorld, Agent anaweza kuunda upya uzoefu wa awali wa kuchukua vitu na kusafisha, na kukabiliana na mipangilio tofauti ya vyumba ili kukamilisha kazi changamano za nyumbani.
Ununuzi huru mtandaoni: Katika majukwaa ya biashara ya mtandaoni kama WebShop, uzoefu wa zamani wa ununuzi huundwa upya kuwa mikakati ya sasa ya kutafuta na kuchuja bidhaa, na hivyo kuongeza kiwango cha mafanikio cha ununuzi unaolenga lengo.
Mazungumzo ya huduma kwa wateja yenye akili: Agent wa huduma kwa wateja hurejesha tiketi za zamani zinazofanana na kuunda upya suluhisho, akiepuka kutumia moja kwa moja majibu ya zamani yasiyolingana na swali.
Usaidizi wa uundaji wa msimbo: Agent wa programu huunda upya uzoefu wa awali wa kurekebisha hitilafu kulingana na muktadha wa sasa wa msimbo, na kutoa mapendekezo sahihi ya marekebisho badala ya kunakili suluhisho la zamani.
Mipango ya majaribio ya utafiti: Agent wa majaribio huunda upya vigezo na matokeo ya majaribio ya zamani kuwa mapendekezo ya usanidi bora kwa masharti ya sasa ya majaribio, na hivyo kupunguza gharama ya kujaribu na kukosea.

© Kanusho: vikoa na maudhui yaliyounganishwa vinaweza kubadilika kadiri muda unavyopita. AIEZZ haidhibiti tovuti za wahusika wengine. Kagua maudhui na hatari za nje kwa kujitegemea.

Ukaguzi wa watumiaji0