- الزيارات الشهرية
- 1
- الأسعار
- مجاني & مدفوع
- مدرج
- 2026-08-05
- تحدّث
- 2026-08-05
01شنو هو MemHarness؟
MemHarness هو إطار لإعادة بناء ذاكرة وكلاء LLM طوّراتو Shanghai AI Lab بشراكة مع Zhejiang University وFudan University وShanghai Jiao Tong University ومؤسسات جامعية أخرى. وكلاء الذكاء المعززين بالذاكرة غالباً كيدخلو التجارب السابقة المسترجعة مباشرة فالسياق، ولكن إلا ما كانتش التجربة القديمة مناسبة للحالة الحالية تقدر تسبب انتقالاً سلبياً. مستوحى من آلية إعادة بناء الذاكرة عند الإنسان، كيدمج MemHarness مرحلة واضحة ديال النقد وإعادة البناء بين الاسترجاع وتنفيذ الأفعال، وكيستعمل السياق الحالي باش يحتافظ بالتجارب السابقة أو يعاود يكتبها أو يحيدها. وكيتم تدريبو من البداية للنهاية عبر GRPO بلا حاجة لوسوم بشرية إضافية.
02الوظائف الرئيسية ديال MemHarness
استرجاع الذاكرة: الوكيل كينشئ استعلاماً انطلاقاً من الملاحظة الحالية، وكيسترجع من قاعدة الذاكرة المتجهية Milvus أفضل k من التجارب التاريخية المرتبطة، مع الحالات الأصلية ديالها.
النقد وإعادة البناء: نموذج سياسة موحّد كيقارن بين الحالة الأصلية ديال الذاكرة والحالة الحالية، وكيقيّم مدى صلاحية التجربة، ثم كيعاود يكتبها فشكل توجيهات متوافقة مع الحالة الحالية، أو كيحكم بأنها غير مناسبة وكيهملها.
توليد الأفعال: اعتماداً على التوجيهات المعاد بناؤها أو على الاستدلال الذاتي، كينتج أفعالاً قابلة للتنفيذ داخل البيئة.
كتابة التجارب من جديد وتقليص الذاكرة: من بعد كل جولة تفاعل، كيتلخّص المسار فشكل تجربة وكتتكتب فقاعدة الذاكرة، مع إزالة التكرار الدلالي، وتقليص الذكريات قليلة القيمة بشكل دوري حسب الفائدة ديال كل تجربة.
التدريب من البداية للنهاية: باستعمال GRPO كيتحسّنو بشكل مشترك الاسترجاع وإعادة البناء وتوليد الأفعال، بلا حاجة لبيانات مستقلة موسومة لمرحلة إعادة البناء.
03المبدأ التقني ديال MemHarness
تابع الحساب فـ WeChat وردّ بكلمة “开源” باش تنضم لمجموعة تبادل مشاريع الذكاء الاصطناعي مفتوحة المصدر
مسار القرار من خمس مراحل: MemHarness كيفكك اتخاذ القرار الموجّه بالذاكرة لخمس مراحل متتابعة: ملاحظة البيئة، واسترجاع التجارب، ونقد الذاكرة، وإعادة بناء الذاكرة حسب السياق، وتوليد الأفعال. بهاد الطريقة كيحاكي المسار المعرفي البشري ديال الاسترجاع—التقييم—إعادة البناء، وكيعوّض النمط التقليدي اللي كيعتمد على إعادة تشغيل الذاكرة بشكل مباشر وثابت.
آلية إعادة بناء الذاكرة حسب السياق: نموذج السياسة كيجمع وصف المهمة، والتاريخ الحالي، والتجارب المسترجعة، والحالات الأصلية ديالها فـ سياق إعادة البناء. ومن خلال مقارنة الحالة الأصلية السابقة بالحالة الحالية، كيتعرّف على الاختلافات، وكيحتافظ بالمعرفة القابلة للنقل، أو كيعاود يكتب المحتوى غير المتوافق، أو كيخرج الوسم باش يرفض الذاكرة ويرجع للاستدلال الذاتي.
بنية نموذج سياسة موحّدة: المراحل الثلاث ديال إنشاء استعلام الاسترجاع، ونقد الذاكرة وإعادة بنائها، وتوليد الأفعال القابلة للتنفيذ، كتشترك فـ نفس معاملات نموذج السياسة. ما كايناش حاجة لتدريب شبكة قيمة مستقلة أو بيانات إشراف خاصة بوحدة إعادة البناء، وبهذا كيتربط استعمال الذاكرة والاستدلال لاتخاذ القرار بشكل وثيق داخل نفس النموذج.
التدريب الشامل من البداية للنهاية عبر GRPO: حيث إن توجيهات إعادة البناء ما عندهاش وسوم صحيحة جاهزة، كيستعمل MemHarness تقنية GRPO لتحسين السلسلة كاملة من الاسترجاع إلى إعادة البناء ثم الفعل. المكافأة كتتكوّن من نتيجة المهمة المتناثرة ومكافأة التنسيق، وكيتم توزيع الفضل على مستوى المسار على جميع الرموز باستعمال أفضلية موحّدة حسب المجموعة، مع تدريب قدرات التفكير وإعادة البناء وتوليد الأفعال فـ نفس الوقت.
04كيفاش تستعمل MemHarness؟
نسخ المستودع وإنشاء البيئة: نفّذ git clone https://github.com/KnowledgeXLab/MemHarness.git وأنشئ بيئة Conda بـ python==3.12، ومن بعد ثبّت بالتتابع vLLM وFlash Attention 2 وMemHarness نفسو.
نشر خدمة التضمين: شغّل BGE-M3 باستعمال vllm serve BAAI/bge-m3 --port 8001 باش توفّر خدمة ترميز المتجهات لقاعدة الذاكرة Milvus.
تثبيت البيئة المستهدفة: حسب المهمة، ثبّت بيئة التفاعل ديال ALFWorld أو WebShop، وحمّل ملفات اللعبة وكواشف ما قبل التدريب المرتبطة بها.
الضبط الدقيق SFT ديال الانطلاقة الباردة (اختياري): شغّل scripts/build_*_coldstart_data.py لبناء بيانات الانطلاقة الباردة، ومن بعد نفّذ scripts/cold_start_sft.sh باش توائم النموذج مع صيغة التفاعل وصيغة تلخيص الذاكرة.
التدريب الشامل عبر GRPO: شغّل run_scripts/train_alfworld.sh أو run_scripts/train_webshop.sh، وغادي يطلق الإطار تلقائياً قاعدة بيانات الذاكرة المتجهية، وينفّذ استرجاع الوكيل، وكتابة التجارب من جديد، وتقليص الذاكرة، ثم يكمل تدريب GRPO.
05المزايا الأساسية ديال MemHarness
إعادة البناء أحسن من إعادة التشغيل: إدماج مرحلة واضحة ديال النقد وإعادة البناء كيحوّل مقاطع الذاكرة الثابتة لتوجيهات متوافقة مع الحالة وحساسة للسياق، وكيجنب الانتقال السلبي.
نموذج صغير كيتفوّق على نموذج كبير: النموذج بحجم 7B من المعاملات تفوّق على Gemini-2.5-Pro بـ 23.1% و39.7% على التوالي فـ ALFWorld وWebShop.
متانة قوية خارج التوزيع: حقق معدل نجاح متوسط قدره 85.9% فالمشاهد خارج توزيع التدريب، وهو أعلى بشكل واضح من 76.3% ديال إعادة تشغيل الذاكرة الأصلية.
تعزيز الاستدلال الضمني: حتى إلا تسدّات الذاكرة وقت الاختبار، أهداف التدريب ديال إعادة البناء كتطلع معدل نجاح السياسة الأساسية من 76.4% حتى لـ 83.0%، وكتقوّي من الجذر القدرة الداخلية ديال الوكيل على الاستدلال.
بلا حاجة لوسوم إضافية: قدرة إعادة البناء كتنشأ بشكل طبيعي عبر التدريب الشامل من البداية للنهاية بـ GRPO، وما كتحتاجش لبيانات إشراف على إعادة البناء مكتوبة يدوياً.
06عنوان مشروع MemHarness
مستودع GitHub: https://github.com/KnowledgeXLab/MemHarness
مستودع نماذج HuggingFace: https://huggingface.co/KnowledgeXLab/MemHarness
البحث التقني على arXiv: https://arxiv.org/pdf/2607.28272
07مجالات استعمال MemHarness
الأعمال المنزلية بالذكاء المتجسد: فبيئات منزلية بحال ALFWorld، يقدر الوكيل يعاود يبني تجارب سابقة ديال جلب الأغراض والتنظيف، ويتأقلم مع توزيعات مختلفة ديال الغرف باش يكمل مهام منزلية معقدة.
التسوق الذاتي عبر الإنترنت: فمنصات التجارة الإلكترونية بحال WebShop، كيعيد الوكيل بناء تجارب الشراء السابقة فشكل استراتيجيات للبحث على المنتجات وتصفيتها حسب الحالة الحالية، وكيحسّن معدل نجاح التسوق الموجّه نحو الهدف.
محادثات خدمة الزبناء الذكية: من بعد ما كيرجع وكيل خدمة الزبناء لتذاكر مشابهة سابقة، كيعيد بناء الحل، وكيجنب الاستعمال المباشر لجوابات قديمة اللي تقدر تسبب جواباً ما مناسبش للسؤال.
المساعدة فالتطوير البرمجي: وكيل البرمجة كيعيد بناء تجارب إصلاح الأخطاء السابقة بما يتناسب مع سياق الكود الحالي، وكيقدّم اقتراحات دقيقة للإصلاح بلا ما ينسخ الحلول القديمة حرفياً.
تخطيط التجارب العلمية: وكيل التجارب كيعيد بناء معطيات ونتائج التجارب السابقة فشكل اقتراحات لأفضل إعدادات التجربة الحالية، وكيقلل من تكلفة التجربة والخطأ.
© إخلاء المسؤولية: النطاقات والمحتوى المرتبط يقدرو يتبدلو مع الوقت. AIEZZ ما كيتحكمش فالمواقع التابعة لجهات أخرى. راجع المحتوى الخارجي والمخاطر بشكل مستقل.


تقييمات المستخدمين0