- ماہانہ وزٹس
- 1
- قیمتیں
- مفت اور ادائیگی
- فہرست میں شامل
- 2026-08-05
- اپ ڈیٹ شدہ
- 2026-08-05
01MemHarness کیا ہے
MemHarness، شنگھائی AI Lab نے ژے جیانگ یونیورسٹی، فودان یونیورسٹی، شنگھائی جیاو تونگ یونیورسٹی اور دیگر جامعات کے ساتھ مل کر تیار کیا ہے۔ یہ LLM Agent کے لیے میموری کی بازتشکیل کا فریم ورک ہے۔ موجودہ میموری سے تقویت یافتہ Agent عموماً بازیافت شدہ تاریخی تجربات کو براہِ راست سیاق و سباق میں شامل کرتے ہیں، لیکن اگر پرانا تجربہ موجودہ حالت سے مطابقت نہ رکھتا ہو تو یہ منفی منتقلی کا باعث بن سکتا ہے۔ انسانی میموری کی بازتشکیل کے طریقۂ کار سے متاثر ہو کر MemHarness بازیافت اور عمل کے درمیان واضح تنقید اور بازتشکیل کا مرحلہ شامل کرتا ہے۔ یہ موجودہ سیاق و سباق کی بنیاد پر تاریخی تجربات کو برقرار رکھتا، دوبارہ لکھتا یا ترک کرتا ہے، اور GRPO کے ذریعے آخر سے آخر تک تربیت پاتا ہے، جس کے لیے اضافی انسانی لیبلنگ درکار نہیں ہوتی۔
02MemHarness کے اہم افعال
میموری بازیافت: Agent موجودہ مشاہدے کی بنیاد پر استفسار تیار کرتا ہے اور Milvus ویکٹر میموری ڈیٹا بیس سے top-k متعلقہ تاریخی تجربات اور ان کی ماخذ حالتیں بازیافت کرتا ہے۔
تنقید اور بازتشکیل: متحدہ پالیسی ماڈل میموری کی ماخذ حالت اور موجودہ حالت کا موازنہ کرتا ہے، اس کی موزونیت پر تنقید کرتا ہے، تجربے کو حالت سے ہم آہنگ رہنما معلومات میں دوبارہ لکھتا ہے، یا اسے غیر موزوں قرار دے کر ترک کر دیتا ہے۔
عمل کی تخلیق: بازتشکیل شدہ رہنما معلومات یا خودمختار استدلال کی بنیاد پر ماحول میں قابلِ عمل عمل تیار کرتا ہے۔
تجربے کی واپسی اور چھانٹی: ہر دور کے تعامل کے بعد ٹریجکٹری کا خلاصہ بطور تجربہ میموری ڈیٹا بیس میں لکھا جاتا ہے، معنوی تکرار ختم کی جاتی ہے، اور کم افادیت والی یادداشتوں کو باقاعدگی سے چھانٹ دیا جاتا ہے۔
آخر سے آخر تک تربیت: GRPO کے ذریعے بازیافت، بازتشکیل اور عمل کی تخلیق کو مشترکہ طور پر بہتر بنایا جاتا ہے، جس کے لیے بازتشکیل کے مرحلے کا الگ لیبل شدہ ڈیٹا درکار نہیں ہوتا۔
03MemHarness کا تکنیکی اصول
WeChat پر فالو کر کے “开源” کا جواب دیں اور AI اوپن سورس پروجیکٹس کے گروپ میں شامل ہوں
پانچ مرحلوں پر مشتمل فیصلہ سازی کا عمل: MemHarness میموری سے رہنمائی یافتہ فیصلہ سازی کو ماحول کا مشاہدہ، تجربے کی بازیافت، میموری پر تنقید، سیاقی میموری کی بازتشکیل اور عمل کی تخلیق کے پانچ مسلسل مراحل میں تقسیم کرتا ہے۔ یہ انسانی بازیافت—جائزہ—بازتشکیل کے ادراکی عمل کی نقالی کرتا ہے اور Agent کے براہِ راست میموری دہرانے کے روایتی جامد طریقے کی جگہ لیتا ہے۔
سیاقی میموری کی بازتشکیل کا طریقۂ کار: پالیسی ماڈل کام کی وضاحت، موجودہ تاریخ، بازیافت شدہ تجربات اور ان کی ماخذ حالتوں کو جوڑ کر بازتشکیل کا سیاق تیار کرتا ہے۔ تاریخی ماخذ حالت اور موجودہ حالت کا موازنہ کر کے فرق کی شناخت کی جاتی ہے، قابلِ منتقلی علم برقرار رکھا جاتا ہے، غیر مطابقت رکھنے والے مواد کو دوبارہ لکھا جاتا ہے، یا نشان جاری کر کے اس میموری کو مسترد کیا جاتا ہے اور خودمختار استدلال کی طرف واپسی کی جاتی ہے۔
متحدہ پالیسی ماڈل کا معماری ڈھانچہ: بازیافت کے استفسار کی تخلیق، میموری کی تنقیدی بازتشکیل اور قابلِ عمل عمل کی تخلیق، تینوں مراحل ایک ہی پالیسی ماڈل کے پیرامیٹرز کا اشتراک کرتے ہیں۔ اس لیے بازتشکیل ماڈیول کے لیے الگ ویلیو نیٹ ورک یا نگران ڈیٹا کی تربیت درکار نہیں ہوتی، اور میموری کا استعمال و فیصلہ سازی کا استدلال ایک ہی ماڈل میں مضبوطی سے مربوط رہتے ہیں۔
GRPO کے ذریعے آخر سے آخر تک تربیت: چونکہ بازتشکیل کی رہنما معلومات کے لیے حقیقی لیبل موجود نہیں ہوتے، MemHarness بازیافت—بازتشکیل—عمل کے پورے سلسلے کو آخر سے آخر تک بہتر بنانے کے لیے GRPO استعمال کرتا ہے۔ انعام کم یاب کام کے نتائج اور فارمیٹ انعام پر مشتمل ہوتا ہے۔ گروپ نارملائزڈ ایڈوانٹیج کے ذریعے ٹریجکٹری کی سطح کا کریڈٹ تمام token کو تفویض کیا جاتا ہے، اور سوچ، بازتشکیل اور عمل کی تخلیق کی صلاحیتوں کو بیک وقت تربیت دی جاتی ہے۔
04MemHarness کا استعمال کیسے کریں
ذخیرہ کلون کر کے ماحول بنائیں: git clone https://github.com/KnowledgeXLab/MemHarness.git چلائیں، python==3.12 والا Conda ماحول بنائیں، اور vLLM، Flash Attention 2 اور MemHarness کو بالترتیب انسٹال کریں۔
ایمبیڈنگ سروس تعینات کریں: BGE-M3 ایمبیڈنگ ماڈل شروع کرنے کے لیے vllm serve BAAI/bge-m3 --port 8001 چلائیں، جو Milvus میموری ڈیٹا بیس کو ویکٹر انکوڈنگ سروس فراہم کرے گا۔
ہدف ماحول انسٹال کریں: کام کی ضرورت کے مطابق ALFWorld یا WebShop کا تعاملی ماحول انسٹال کریں، اور متعلقہ گیم فائلیں و پری ٹرینڈ ڈیٹیکٹر ڈاؤن لوڈ کریں۔
کولڈ اسٹارٹ SFT (اختیاری): کولڈ اسٹارٹ ڈیٹا بنانے کے لیے scripts/build_*_coldstart_data.py چلائیں، پھر ماڈل کو تعاملی اور میموری خلاصہ فارمیٹس کے ساتھ ہم آہنگ کرنے کے لیے scripts/cold_start_sft.sh چلائیں۔
GRPO کے ذریعے آخر سے آخر تک تربیت: run_scripts/train_alfworld.sh یا run_scripts/train_webshop.sh چلائیں۔ فریم ورک خودکار طور پر میموری ویکٹر ڈیٹا بیس شروع کرے گا، Agent کی بازیافت، تجربے کی واپسی اور چھانٹی انجام دے گا، اور GRPO تربیت مکمل کرے گا۔
05MemHarness کے بنیادی فوائد
بازتشکیل، دہرانے سے بہتر: تنقید اور بازتشکیل کے واضح مراحل شامل کر کے جامد میموری حصوں کو سیاق سے حساس، حالت سے ہم آہنگ رہنما معلومات میں تبدیل کرتا ہے اور منفی منتقلی سے بچاتا ہے۔
چھوٹا ماڈل بڑے ماڈل سے بہتر: 7B پیرامیٹر ماڈل نے ALFWorld اور WebShop پر بالترتیب Gemini-2.5-Pro سے 23.1% اور 39.7% بہتر کارکردگی دکھائی۔
OOD میں مضبوط مزاحمت: تقسیم سے باہر کے منظرناموں میں اوسط کامیابی کی شرح 85.9% رہی، جو اصل میموری دہرانے کے 76.3% سے نمایاں طور پر زیادہ ہے۔
ضمنی استدلال میں بہتری: ٹیسٹنگ کے دوران میموری بند ہونے کے باوجود، بازتشکیل کے تربیتی ہدف نے بنیادی پالیسی کی کامیابی کی شرح 76.4% سے بڑھا کر 83.0% کر دی، جس سے Agent کی داخلی استدلالی صلاحیت بنیادی طور پر مضبوط ہوئی۔
اضافی لیبلنگ کی ضرورت نہیں: بازتشکیل کی صلاحیت GRPO کی آخر سے آخر تک تربیت کے ذریعے قدرتی طور پر ابھرتی ہے اور انسانی طور پر تیار کردہ بازتشکیلی نگران ڈیٹا پر منحصر نہیں ہوتی۔
06MemHarness کا پروجیکٹ لنک
GitHub ذخیرہ:https://github.com/KnowledgeXLab/MemHarness
HuggingFace ماڈل ذخیرہ:https://huggingface.co/KnowledgeXLab/MemHarness
arXiv تکنیکی مقالہ:https://arxiv.org/pdf/2607.28272
07MemHarness کے اطلاقی منظرنامے
مجسم ذہانت پر مبنی گھریلو کام: ALFWorld جیسے گھریلو ماحول میں Agent ماضی کے اشیا اٹھانے اور صفائی کے تجربات کو دوبارہ تشکیل دے کر مختلف کمروں کی ترتیب کے مطابق پیچیدہ گھریلو کام مکمل کر سکتا ہے۔
خودکار آن لائن خریداری: WebShop جیسے ای کامرس پلیٹ فارم پر تاریخی خریداری کے تجربات کو موجودہ مصنوعات کی تلاش اور چھان بین کی حکمتِ عملی میں دوبارہ تشکیل دے کر ہدف پر مبنی خریداری کی کامیابی کی شرح بہتر بناتا ہے۔
ذہین کسٹمر سروس مکالمہ: کسٹمر سروس Agent تاریخی ملتے جلتے ٹکٹ بازیافت کرنے کے بعد حل کی بازتشکیل کرتا ہے، جس سے پرانے جواب کو براہِ راست استعمال کرنے کے نتیجے میں غیر متعلقہ جواب دینے سے بچا جا سکتا ہے۔
کوڈ کی معاون ترقی: پروگرامنگ Agent ماضی کے بگ حل کرنے کے تجربات کو موجودہ کوڈ کے سیاق و سباق کے مطابق دوبارہ تشکیل دے کر پرانے حل کی نقل کرنے کے بجائے درست اصلاحی تجاویز فراہم کرتا ہے۔
سائنسی تجربات کی منصوبہ بندی: تجرباتی Agent تاریخی تجرباتی پیرامیٹرز اور نتائج کی بنیاد پر موجودہ تجرباتی حالات کے لیے بہترین ترتیب کی تجاویز دوبارہ تشکیل دیتا ہے، جس سے آزمائش و خطا کی لاگت کم ہوتی ہے۔
© دستبرداری: ڈومینز اور لنک شدہ مواد وقت کے ساتھ تبدیل ہو سکتے ہیں۔ AIEZZ فریقِ ثالث کی ویب سائٹس کو کنٹرول نہیں کرتا۔ بیرونی مواد اور خطرات کا آزادانہ جائزہ لیں۔


صارف کے جائزے0