- الزيارات الشهرية
- 0
- الأسعار
- مجاني & مدفوع
- مدرج
- 2026-08-12
- تحدّث
- 2026-08-12
01شنو هو PAST-Bench؟
PAST-Bench هو معيار اختبار طوّراتو فرقة وانغ منغدي فجامعة برينستون، باش يختبر القدرة ديال وكيل الذكاء الاصطناعي الشخصي على التحسين الذاتي التكراري. كيقارن PAST-Bench بين أداء المهام فحالات فيها ذاكرة وحالات بلا ذاكرة، باش يحكم واش التجارب اللي حفظها الوكيل بين الجلسات حسّنت فعلاً السلوك ديالو من بعد. كيغطي PAST-Bench أربع قدرات: الذاكرة، إعادة استعمال المسارات، جمع المعلومات، والتحديث، فمجموع 26 سيناريو و204 جولات ديال المهام.
02الوظائف الرئيسية ديال PAST-Bench
تقييم التحسين الذاتي التكراري: كيتحقق واش التجارب اللي كيحفظها وكيل الذكاء الاصطناعي الشخصي بين الجلسات، بحال الذاكرة والمهارات وتاريخ المهام، حسّنت فعلاً السلوك ديالو من بعد.
عزل تأثير تراكم التجارب: كيميّز واش تحسّن النقطة جاي من تراكم التجارب، ولا من عوامل أخرى بحال تحسّن النموذج الأساسي أو تبدّل Prompt أو تغيّر صعوبة المهمة.
تشخيص القدرات من أربع زوايا: كيغطي الذاكرة، إعادة استعمال المسارات، جمع المعلومات، وتحديث الحالة، وكيحدّد بالضبط شنو النوع ديال القدرات اللي ناقص عند الوكيل.
تحليل أسباب الآلية: ما كيشوفش غير النقطة النهائية، بل كيتبع المسار الكامل ديال التخزين→الاسترجاع→التطبيق، باش يحكم واش التحسين مسنود بمسار حقيقي.
03المبدأ التقني ديال PAST-Bench
تصميم تسلسل عائلات المهام: كينفّذ الوكيل جولات متعددة ديال الجلسات لنفس عائلة المهام بالترتيب. الجلسات الأولى كتوفّر فرص باش تتخلق وتتخزن التجارب، والجلسات اللاحقة كتختبر واش تستعملات هاد التجارب بشكل صحيح.
تجربة مقارنة متطابقة: لكل جلسة لاحقة كيتصمّم إصدار للمقارنة كيتسدّ فيه التخزين الدائم، مع بقاء جميع الشروط الأخرى مطابقة. ومن خلال ”النقطة بالذاكرة – النقطة بلا ذاكرة” كتتحسب قيمة الفرق ديال التطور الذاتي Δ.
تتبّع الأدلة الآلية: وقت التشغيل كيتسجلو معطيات القياس بحال كتابة الذاكرة، استدعاء المهارات، استرجاع الجلسات، وتحديث الحالة، وكيُحسب Mechanism-Evidence Score باش يتأكد واش التحسين تبع المسار المتوقع.
تدقيق المخرجات الدائمة: كيتفحص المحتوى اللي حفظو الوكيل فعلياً، بحال عناصر الذاكرة وملفات المهارات وفهارس الجلسات، وكيتم تحليل البنية ديالو، والصلاحية الزمنية، وقابلية إعادة الاستعمال.
04كيفاش تستعمل PAST-Bench
تحضير البيئة: كلونِي مستودع PAST-Bench من GitHub وثبّت الاعتماديات الأساسية ومحوّلات الوكلاء.
إعداد النموذج: ضبّط API Key ديال النموذج المستعمل فمتغيرات البيئة.
بناء الصندوق المعزول: نفّذ past-bench build-image --kind sandbox باش تبني صورة Docker المعزولة اللازمة للتقييم.
تحقق سريع: استعمل past-bench evolve لتشغيل عائلة مهام وحدة، وزِد عليها --compare-no-persistence باش تدير Smoke Test.
تقييم كامل: دُزّ على جميع عائلات المهام الـ26 وشغّل التقييم؛ كل عائلة مهام غادي تنفّذ أوتوماتيكياً جوج تجارب مقارنة: وحدة ”بالتخزين الدائم” ووحدة ”بلا تخزين دائم”.
تحليل النتائج: شوف sequence_comparison.json فالمجلد --trace-dir باش تحصل على قيمة Δ ونقطة الأدلة الآلية.
الربط المخصص: إلا بغيتي تقيّم وكيل ديالك، نفّذ محوّل فمجلد agents/ وتأكد غير بلي كيدعم الخيار --compare-no-persistence.
05المزايا الأساسية ديال PAST-Bench
قدرة حقيقية على تحديد السبب: PAST-Bench كيقدر يميّز بدقة واش التحسين جاي من تراكم التجارب، ولا من كون النموذج براسو ولا أقوى، أو من تبدّل Prompt، أو من كون المهمة ولات أسهل.
تصميم تجربة مقارنة متطابقة: كل عائلة مهام عندها إصدار للمقارنة مسدود فيه التخزين الدائم، مع بقاء جميع الشروط الأخرى مطابقة، وهادشي كيوفّر مقارنة سببية مباشرة بين الذاكرة وغياب الذاكرة.
تشخيص على مستوى الآلية: كيقدّم Mechanism-Evidence Score، وما كيتحققش غير واش الوكيل جاوب مزيان، بل كيتبع حتى المسار الكامل ديال التخزين→الاسترجاع→التطبيق، وكيحدّد الفرق بين ”جاوب مزيان بالصدفة” و”عاود استعمل التجربة فعلاً”.
تفكيك القدرات إلى أربع فئات: كيفكك التحسين الذاتي الغامض إلى أربع قدرات محددة: الذاكرة، إعادة استعمال المسارات، جمع المعلومات، وتحديث الحالة، باش يحدّد نقط الضعف بدقة.
تحسين موجّه بالتشخيص: بناءً على الأعطاب اللي كيكشفها المعيار وقت التشغيل، تْطوّر مباشرة إطار Hermes+، وهادشي كيثبت بلي PAST-Bench ماشي غير أداة للتقييم، بل حتى محرّك لتشخيص وتحسين بنية الوكلاء.
06عنوان مشروع PAST-Bench
مستودع GitHub: https://github.com/Gen-Verse/PAST-Bench
البحث التقني فـ arXiv: https://arxiv.org/pdf/2608.04003
07مجالات استعمال PAST-Bench
البحث الأكاديمي: كيوفّر بيئة موحّدة وقابلة لإعادة الإنتاج للتقييم الكمي ديال التحسين الذاتي التكراري للوكلاء، وكيعاون على المقارنة الموضوعية بين البنيات المختلفة.
تطوير الأطر: من خلال تفكيك القدرات إلى أربع فئات، كيحدّد بدقة نقاط الضعف فإطار الوكيل وكيعاون على تحسين البنية، بحال ولادة Hermes+.
اختيار النماذج: كيقارن، داخل إطار ثابت، أداء النماذج الأساسية المختلفة فإعادة استعمال التجارب بين الجلسات، وكيكشف التوجهات المختلفة فالمقدرات ديال كل نموذج.
التحقق من التخزين الدائم: كيختبر الفعالية الحقيقية لهياكل الذاكرة واستراتيجيات الاسترجاع المختلفة، وكيجنب التخزين اللي ”تخزّن ولكن ما كتلقاش” أو ”تخزّن ولكن ما كتستعملش”.
تطوير المنتجات: كيميّز واش تحسّن النقطة فالإصدار الجديد جاي من ”تراكم التجارب بين الجلسات” ولا من ”تحسّن النموذج الأساسي”، وكيضمن بلي وظيفة التخزين الدائم كتخلق قيمة حقيقية.
© إخلاء المسؤولية: النطاقات والمحتوى المرتبط يقدرو يتبدلو مع الوقت. AIEZZ ما كيتحكمش فالمواقع التابعة لجهات أخرى. راجع المحتوى الخارجي والمخاطر بشكل مستقل.


تقييمات المستخدمين0