مرکزی مواد پر جائیں

PAST-Bench آپریشن میں

PAST-Bench پرنسٹن یونیورسٹی کی وانگ مینگڈی کی ٹیم کی جانب سے پیش کیا گیا ایک بینچ مارک ہے، جو ذاتی AI Agent کی تکراری خود بہتری کی صلاحیت جانچنے کے لیے استعمال ہوتا ہے۔ PAST-Bench یادداشت کے ساتھ اور یادداشت کے بغیر حالات میں کام کی کارکردگی کا موازنہ کرکے یہ فیصلہ کرتا ہے کہ...

PAST-Bench پرنسٹن یونیورسٹی کی وانگ مینگڈی کی ٹیم کی جانب سے پیش کیا گیا ایک بینچ مارک ہے، جو ذاتی AI Agent کی تکراری خود بہتری کی صلاحیت جانچنے کے لیے استعمال ہوتا ہے۔ PAST-Bench یادداشت کے ساتھ اور یادداشت کے بغیر حالات میں کام کی کارکردگی کا موازنہ کرکے یہ فیصلہ کرتا ہے کہ...

PAST-Bench مصنوعات کا انٹرفیس
ماہانہ وزٹس
0
قیمتیں
مفت اور ادائیگی
فہرست میں شامل
2026-08-12
اپ ڈیٹ شدہ
2026-08-12

01PAST-Bench کیا ہے

PAST-Bench پرنسٹن یونیورسٹی کی وانگ مینگڈی کی ٹیم کی جانب سے پیش کیا گیا ایک بینچ مارک ہے، جو ذاتی AI Agent کی تکراری خود بہتری کی صلاحیت جانچنے کے لیے استعمال ہوتا ہے۔ PAST-Bench یادداشت کے ساتھ اور یادداشت کے بغیر حالات میں کام کی کارکردگی کا موازنہ کرکے یہ فیصلہ کرتا ہے کہ Agent کی جانب سے محفوظ کیا گیا بین السیشن تجربہ بعد کے رویے کو واقعی بہتر بناتا ہے یا نہیں۔ PAST-Bench میں یادداشت، ورک فلو کا دوبارہ استعمال، معلومات جمع کرنا اور اپ ڈیٹ، یہ چار صلاحیتیں شامل ہیں، جن میں مجموعی طور پر 26 منظرنامے اور 204 کام کے راؤنڈز ہیں۔

02PAST-Bench کے主要 افعال

تکراری خود بہتری کا جائزہ: یہ جانچتا ہے کہ ذاتی AI Agent کی جانب سے محفوظ کیا گیا بین السیشن تجربہ (یادداشت، مہارتیں اور کام کی تاریخ) بعد کے رویے کو واقعی بہتر بناتا ہے یا نہیں۔
تجربے کے جمع ہونے کے اثر کو الگ کرنا: یہ فرق کرتا ہے کہ اسکور میں اضافہ تجربے کے جمع ہونے کی وجہ سے ہے یا بنیادی ماڈل کے بہتر ہونے، Prompt میں تبدیلی، کام کی دشواری اور دیگر عوامل کی وجہ سے۔
چار جہتی صلاحیتوں کی تشخیص: یادداشت، ورک فلو کا دوبارہ استعمال، معلومات جمع کرنا اور حالت کی تازہ کاری، ان چار بنیادی جہتوں کا احاطہ کرتے ہوئے یہ معلوم کرتا ہے کہ Agent میں کس قسم کی صلاحیت کی کمی ہے۔
طریقۂ کار کی نسبت کا تجزیہ: صرف حتمی اسکور نہیں دیکھا جاتا، بلکہ ”محفوظ کرنے → بازیافت → اطلاق“ کے مکمل راستے کا بھی سراغ لگایا جاتا ہے تاکہ معلوم ہو سکے کہ بہتری کو حقیقی راستے کی حمایت حاصل ہے یا نہیں۔

03PAST-Bench کیسے استعمال کریں

ماحول کی تیاری: GitHub سے PAST-Bench ریپوزٹری کلون کریں اور بنیادی انحصارات اور Agent اڈاپٹرز انسٹال کریں۔
ماڈل کی تشکیل: ماحول کے متغیرات میں استعمال ہونے والے ماڈل کی API Key ترتیب دیں۔
سینڈ باکس کی تعمیر: جائزے کے لیے مطلوبہ Docker سینڈ باکس امیج بنانے کے لیے past-bench build-image --kind sandbox چلائیں۔
فوری تصدیق: ایک ٹاسک فیملی چلانے کے لیے past-bench evolve استعمال کریں اور Smoke Test کے لیے --compare-no-persistence پیرامیٹر شامل کریں۔
مکمل جائزہ: تمام 26 ٹاسک فیملیز پر جائزہ چلائیں؛ ہر ٹاسک فیملی خودکار طور پر ”پائیدار یادداشت کے ساتھ“ اور ”پائیدار یادداشت کے بغیر“ دو تقابلی تجربات انجام دے گی۔
نتائج کا تجزیہ: --trace-dir ڈائریکٹری میں sequence_comparison.json دیکھیں تاکہ Δ قدر اور طریقۂ کار کے ثبوت کا اسکور حاصل کیا جا سکے۔
حسب ضرورت انضمام: اپنے Agent کا جائزہ لینے کے لیے agents/ ڈائریکٹری میں اڈاپٹر نافذ کریں اور یقینی بنائیں کہ --compare-no-persistence سوئچ سپورٹ ہوتا ہے۔

04PAST-Bench کے تکنیکی اصول

ٹاسک فیملی کی سلسلہ وار ساخت: Agent ایک ہی ٹاسک فیملی کے متعدد سیشنز ترتیب وار انجام دیتا ہے۔ ابتدائی سیشنز محفوظ کیے جانے والے تجربے کے مواقع پیدا کرتے ہیں، جبکہ بعد کے سیشنز جانچتے ہیں کہ آیا ان تجربات کو درست طور پر استعمال کیا گیا یا نہیں۔
مطابق کنٹرول تجربہ: ہر بعد کے سیشن کے لیے ایک کنٹرول ورژن تیار کیا جاتا ہے جس میں مستقل مزاجی کی صلاحیت بند ہوتی ہے، جبکہ دیگر تمام حالات یکساں رہتے ہیں۔ ”یادداشت کے ساتھ اسکور – یادداشت کے بغیر اسکور“ کے ذریعے خود ارتقائی فرق Δ حاصل کیا جاتا ہے۔
طریقۂ کار کے شواہد کا سراغ: رن ٹائم پر یادداشت میں اندراج، مہارت کا استعمال، سیشن کی بازیافت اور حالت کی تازہ کاری جیسے ٹیلی میٹری ڈیٹا ریکارڈ کیے جاتے ہیں۔ پھر Mechanism-Evidence Score کا حساب لگا کر تصدیق کی جاتی ہے کہ بہتری متوقع راستے کی پیروی کرتی ہے یا نہیں۔
محفوظ شدہ نتائج کا آڈٹ: Agent کی جانب سے حقیقتاً محفوظ کیے گئے مواد (یادداشت کے اندراجات، مہارت کی فائلیں اور سیشن انڈیکس) کا جائزہ لے کر ان کی ساخت، بروقت ہونے اور دوبارہ استعمال کی صلاحیت کا تجزیہ کیا جاتا ہے۔

05PAST-Bench کے بنیادی فوائد

حقیقی نسبت کی صلاحیت: PAST-Bench درست طور پر فرق کر سکتا ہے کہ بہتری تجربے کے جمع ہونے سے آئی ہے یا ماڈل کے بہتر ہونے، Prompt میں تبدیلی یا کام کے آسان ہونے سے۔
مطابق کنٹرول تجربے کا ڈیزائن: ہر ٹاسک فیملی کے ساتھ مستقل مزاجی بند رکھنے والا کنٹرول ورژن موجود ہے، جبکہ دیگر تمام حالات یکساں رہتے ہیں، جس سے یادداشت کے ساتھ اور یادداشت کے بغیر براہِ راست سببی موازنہ ممکن ہوتا ہے۔
طریقۂ کار کی سطح پر تشخیص: Mechanism-Evidence Score پیش کیا گیا ہے، جو یہ جانچنے کے ساتھ کہ Agent نے درست جواب دیا یا نہیں، ”محفوظ کرنے → بازیافت → اطلاق“ کے مکمل راستے کا بھی سراغ لگاتا ہے، اور ”اتفاقاً درست جواب“ اور ”حقیقی تجربہ دوبارہ استعمال“ کے درمیان فرق واضح کرتا ہے۔
چار جہتی صلاحیتوں کی تقسیم: مبہم خود بہتری کو یادداشت، ورک فلو کا دوبارہ استعمال، معلومات جمع کرنا اور حالت کی تازہ کاری، ان چار مخصوص صلاحیتوں میں تقسیم کرکے کمزوریوں کی درست نشاندہی کی جاتی ہے۔
تشخیص پر مبنی بہتری: بینچ مارک سے سامنے آنے والی رن ٹائم خرابیوں کی بنیاد پر Hermes+ فریم ورک وجود میں آیا، جس سے ثابت ہوتا ہے کہ یہ صرف جائزے کا آلہ نہیں بلکہ Agent کے معماری ڈھانچے کو بہتر بنانے کا تشخیصی انجن بھی ہے۔

06PAST-Bench کا پروجیکٹ ایڈریس

GitHub ریپوزٹری:https://github.com/Gen-Verse/PAST-Bench
arXiv تکنیکی مقالہ:https://arxiv.org/pdf/2608.04003

07PAST-Bench کے اطلاقی منظرنامے

تعلیمی تحقیق: Agent کی تکراری خود بہتری کے لیے معیاری، قابل تکرار مقداری جائزے کا ماحول فراہم کرتا ہے اور مختلف معماری ڈھانچوں کا غیر جانب دارانہ موازنہ ممکن بناتا ہے۔
فریم ورک کی تیاری: چار جہتی صلاحیتوں کی تقسیم کے ذریعے Agent فریم ورک کی کمزوریوں کی درست نشاندہی کی جاتی ہے، جو معماری اصلاح کی رہنمائی کرتی ہے، جیسے Hermes+ کا وجود میں آنا۔
ماڈل کا انتخاب: ایک مقررہ فریم ورک کے تحت مختلف بنیادی ماڈلز کی بین السیشن تجربہ دوبارہ استعمال کرنے کی کارکردگی کا موازنہ کرکے ہر ماڈل کی صلاحیتوں کے رجحانات کی شناخت کی جاتی ہے۔
مستقل مزاجی کی تصدیق: مختلف یادداشتی ساختوں اور بازیافت کی حکمت عملیوں کے حقیقی اثرات کی جانچ کی جاتی ہے تاکہ ”محفوظ کیا مگر مل نہ سکا“ یا ”محفوظ کیا مگر استعمال نہ ہوا“ جیسی غیر مؤثر مستقل مزاجی سے بچا جا سکے۔
مصنوعاتی تکرار: یہ فرق کیا جاتا ہے کہ نئے ورژن کے اسکور میں اضافہ ”بین السیشن تجربے کے جمع ہونے“ سے آیا ہے یا ”بنیادی ماڈل کے بہتر ہونے“ سے، تاکہ مستقل مزاجی کی سہولت حقیقی قدر پیدا کرے۔

© دستبرداری: ڈومینز اور لنک شدہ مواد وقت کے ساتھ تبدیل ہو سکتے ہیں۔ AIEZZ فریقِ ثالث کی ویب سائٹس کو کنٹرول نہیں کرتا۔ بیرونی مواد اور خطرات کا آزادانہ جائزہ لیں۔

صارف کے جائزے0