মূল কনটেন্টে যান

MemHarness – সাংহাই AI Lab প্রমুখের তৈরি এজেন্ট মেমরি পুনর্গঠন ফ্রেমওয়ার্ক চালু আছে

MemHarness হলো LLM Agent-এর জন্য একটি মেমরি পুনর্গঠন ফ্রেমওয়ার্ক, যা অতীত অভিজ্ঞতার সমালোচনা ও পুনর্গঠনের মাধ্যমে সিদ্ধান্ত গ্রহণের সক্ষমতা উন্নত করে।

MemHarness হলো সাংহাই AI Lab, ঝেজিয়াং বিশ্ববিদ্যালয়, ফুদান বিশ্ববিদ্যালয়, সাংহাই জিয়াও টং বিশ্ববিদ্যালয়সহ বিভিন্ন উচ্চশিক্ষা প্রতিষ্ঠানের যৌথভাবে তৈরি LLM Agent মেমরি পুনর্গঠন ফ্রেমওয়ার্ক। এটি তথ্য পুনরুদ্ধার ও অ্যাকশনের মধ্যে সমালোচনা এবং পুনর্গঠন ধাপ যুক্ত করে। বর্তমান কনটেক্সটের সঙ্গে মিলিয়ে অতীত অভিজ্ঞতা সংরক্ষণ, পুনর্লিখন বা বাতিল করা হয়। GRPO-এর মাধ্যমে সম্পূর্ণ এন্ড-টু-এন্ড প্রশিক্ষণ দেওয়া যায় এবং অতিরিক্ত মানব-লেবেলিংয়ের প্রয়োজন হয় না। ফ্রেমওয়ার্কটি মেমরি পুনরুদ্ধার, সমালোচনা ও পুনর্গঠন, অ্যাকশন তৈরি, অভিজ্ঞতা পুনঃলিখন এবং ছাঁটাইসহ সম্পূর্ণ প্রক্রিয়া সমর্থন করে এবং পাঁচ ধাপের সিদ্ধান্ত গ্রহণ প্রক্রিয়া প্রদান করে। এর 7B প্যারামিটারের মডেল ALFWorld ও WebShop-এ যথাক্রমে Gemini-2.5-Pro-এর তুলনায় 23.1% ও 39.7% বেশি সফলতা অর্জন করেছে এবং ডিস্ট্রিবিউশনের বাইরের পরিস্থিতিতে গড় সফলতার হার 85.9% এ পৌঁছেছে। এটি এমবডিড ইন্টেলিজেন্স গৃহস্থালি কাজ, স্বায়ত্তশাসিত অনলাইন কেনাকাটা, বুদ্ধিমান কাস্টমার সার্ভিস, কোড সহায়তায় উন্নয়নসহ বিভিন্ন ক্ষেত্রে প্রযোজ্য।

MemHarness – সাংহাই AI Lab প্রমুখের তৈরি এজেন্ট মেমরি পুনর্গঠন ফ্রেমওয়ার্ক পণ্যের ইন্টারফেস
মাসিক ভিজিট
1
মূল্য
বিনামূল্যে এবং পে করুন
তালিকাভুক্ত
2026-08-05
আপডেট করা হয়েছে
2026-08-05

01MemHarness কী

MemHarness হলো সাংহাই AI Lab, ঝেজিয়াং বিশ্ববিদ্যালয়, ফুদান বিশ্ববিদ্যালয়, সাংহাই জিয়াও টং বিশ্ববিদ্যালয়সহ বিভিন্ন উচ্চশিক্ষা প্রতিষ্ঠানের যৌথভাবে তৈরি LLM Agent মেমরি পুনর্গঠন ফ্রেমওয়ার্ক। প্রচলিত মেমরি-সমৃদ্ধ Agent সাধারণত পুনরুদ্ধার করা অতীত অভিজ্ঞতা সরাসরি কনটেক্সটে যুক্ত করে। পুরোনো অভিজ্ঞতা বর্তমান অবস্থার সঙ্গে অসামঞ্জস্যপূর্ণ হলে এটি উল্টো নেতিবাচক স্থানান্তর ঘটাতে পারে। মানব স্মৃতির পুনর্গঠন প্রক্রিয়া থেকে অনুপ্রাণিত MemHarness তথ্য পুনরুদ্ধার ও অ্যাকশনের মধ্যে সুস্পষ্ট সমালোচনা এবং পুনর্গঠন ধাপ যুক্ত করে। বর্তমান কনটেক্সটের সঙ্গে মিলিয়ে অতীত অভিজ্ঞতা সংরক্ষণ, পুনর্লিখন বা বাতিল করা হয়। GRPO-এর মাধ্যমে সম্পূর্ণ এন্ড-টু-এন্ড প্রশিক্ষণ দেওয়া যায় এবং অতিরিক্ত মানব-লেবেলিংয়ের প্রয়োজন হয় না।

02MemHarness-এর প্রধান কার্যাবলি

মেমরি পুনরুদ্ধার: Agent বর্তমান পর্যবেক্ষণের ভিত্তিতে একটি কুয়েরি তৈরি করে এবং Milvus ভেক্টর মেমরি ডেটাবেস থেকে top-k প্রাসঙ্গিক অতীত অভিজ্ঞতা ও তাদের উৎস-অবস্থা পুনরুদ্ধার করে।
সমালোচনা ও পুনর্গঠন: একটি একীভূত নীতি মডেল মেমরির উৎস-অবস্থা ও বর্তমান অবস্থার তুলনা করে এর প্রযোজ্যতা যাচাই করে। এরপর অভিজ্ঞতাটিকে বর্তমান অবস্থার সঙ্গে সামঞ্জস্যপূর্ণ নির্দেশনায় পুনর্লিখন করে, অথবা অনুপযুক্ত হিসেবে বাতিল করে।
অ্যাকশন তৈরি: পুনর্গঠিত নির্দেশনা বা স্বায়ত্তশাসিত যুক্তির ভিত্তিতে পরিবেশে কার্যকর করা যায় এমন অ্যাকশন তৈরি করে।
অভিজ্ঞতা পুনঃলিখন ও ছাঁটাই: প্রতিটি ইন্টার‌্যাকশনের পর ট্রাজেক্টরির সারাংশ অভিজ্ঞতা হিসেবে মেমরি ডেটাবেসে সংরক্ষণ করা হয়, সেমান্টিক ডিডুপ্লিকেশন করা হয় এবং নির্দিষ্ট সময় পর অভিজ্ঞতার কার্যকারিতা অনুযায়ী কম-মূল্যের মেমরি ছাঁটাই করা হয়।
এন্ড-টু-এন্ড প্রশিক্ষণ: GRPO-এর মাধ্যমে পুনরুদ্ধার, পুনর্গঠন ও অ্যাকশন তৈরির যৌথ অপ্টিমাইজেশন করা হয়; পুনর্গঠন ধাপের জন্য আলাদা লেবেলযুক্ত ডেটার প্রয়োজন হয় না।

03MemHarness-এর প্রযুক্তিগত নীতি

WeChat-এ ফলো করে “开源” লিখে উত্তর দিন, AI ওপেন সোর্স প্রকল্পের আলোচনা গ্রুপে যোগ দিন

পাঁচ ধাপের সিদ্ধান্ত গ্রহণ প্রক্রিয়া: MemHarness মেমরি-নির্দেশিত সিদ্ধান্ত গ্রহণকে পরিবেশ পর্যবেক্ষণ, অভিজ্ঞতা পুনরুদ্ধার, মেমরি সমালোচনা, কনটেক্সটভিত্তিক মেমরি পুনর্গঠন এবং অ্যাকশন তৈরির পাঁচটি ধারাবাহিক ধাপে ভাগ করে। এটি মানুষের পুনরুদ্ধার—মূল্যায়ন—পুনর্গঠন জ্ঞানীয় প্রক্রিয়ার অনুকরণ করে এবং Agent-এর সরাসরি মেমরি রিপ্লে-ভিত্তিক প্রচলিত স্থির পদ্ধতির পরিবর্তে কাজ করে।
কনটেক্সটভিত্তিক মেমরি পুনর্গঠন প্রক্রিয়া: নীতি মডেলটি কাজের বিবরণ, বর্তমান ইতিহাস, পুনরুদ্ধার করা অভিজ্ঞতা এবং তার উৎস-অবস্থা একত্র করে পুনর্গঠন কনটেক্সট তৈরি করে। অতীতের উৎস-অবস্থা ও বর্তমান অবস্থার তুলনা করে পার্থক্য শনাক্ত করা হয়, স্থানান্তরযোগ্য জ্ঞান সংরক্ষণ করা হয়, অসামঞ্জস্যপূর্ণ বিষয় পুনর্লিখন করা হয়, অথবা চিহ্ন আউটপুট দিয়ে ওই মেমরি প্রত্যাখ্যান করে স্বায়ত্তশাসিত যুক্তিতে ফিরে যায়।
একীভূত নীতি মডেল স্থাপত্য: পুনরুদ্ধার কুয়েরি তৈরি, মেমরি সমালোচনা ও পুনর্গঠন এবং কার্যকর অ্যাকশন তৈরির তিনটি ধাপে একই নীতি মডেলের প্যারামিটার শেয়ার করা হয়। পুনর্গঠন মডিউলের জন্য আলাদা ভ্যালু নেটওয়ার্ক বা তত্ত্বাবধানে প্রশিক্ষিত ডেটা প্রয়োজন হয় না, ফলে একই মডেলের মধ্যে মেমরি ব্যবহার ও সিদ্ধান্ত-যুক্তি ঘনিষ্ঠভাবে যুক্ত থাকে।
GRPO এন্ড-টু-এন্ড প্রশিক্ষণ: পুনর্গঠন নির্দেশনার কোনো সত্য-লেবেল না থাকায় MemHarness GRPO ব্যবহার করে পুনরুদ্ধার—পুনর্গঠন—অ্যাকশন পুরো শৃঙ্খলকে এন্ড-টু-এন্ড অপ্টিমাইজ করে। পুরস্কার গঠিত হয় স্পার্স কাজের ফলাফল ও ফরম্যাট পুরস্কার থেকে। গ্রুপ-স্বাভাবিকীকৃত অ্যাডভান্টেজের মাধ্যমে ট্রাজেক্টরি-স্তরের ক্রেডিট সব token-এর মধ্যে বণ্টন করা হয় এবং একই সঙ্গে চিন্তা, পুনর্গঠন ও অ্যাকশন তৈরির সক্ষমতা প্রশিক্ষিত হয়।

04MemHarness কীভাবে ব্যবহার করবেন

রিপোজিটরি ক্লোন করে পরিবেশ তৈরি করুন: git clone https://github.com/KnowledgeXLab/MemHarness.git চালিয়ে python==3.12-এর একটি Conda পরিবেশ তৈরি করুন। এরপর vLLM, Flash Attention 2 এবং MemHarness মূল প্যাকেজ ধারাবাহিকভাবে ইনস্টল করুন।
এম্বেডিং পরিষেবা চালু করুন: Milvus মেমরি ডেটাবেসের জন্য ভেক্টর এনকোডিং পরিষেবা দিতে vllm serve BAAI/bge-m3 --port 8001 চালিয়ে BGE-M3 এম্বেডিং মডেল চালু করুন।
লক্ষ্য পরিবেশ ইনস্টল করুন: কাজের প্রয়োজন অনুযায়ী ALFWorld বা WebShop ইন্টার‌্যাকশন পরিবেশ ইনস্টল করুন এবং সংশ্লিষ্ট গেম ফাইল ও প্রি-ট্রেইনড ডিটেক্টর ডাউনলোড করুন।
কোল্ড-স্টার্ট SFT (ঐচ্ছিক): কোল্ড-স্টার্ট ডেটা তৈরি করতে scripts/build_*_coldstart_data.py চালান। এরপর ইন্টার‌্যাকশন ফরম্যাট ও মেমরি সারাংশের ফরম্যাটের সঙ্গে মডেলকে সামঞ্জস্য করতে scripts/cold_start_sft.sh চালান।
GRPO এন্ড-টু-এন্ড প্রশিক্ষণ: run_scripts/train_alfworld.sh অথবা run_scripts/train_webshop.sh চালান। ফ্রেমওয়ার্ক স্বয়ংক্রিয়ভাবে মেমরি ভেক্টর ডেটাবেস চালু করবে, Agent-এর পুনরুদ্ধার, অভিজ্ঞতা পুনঃলিখন ও ছাঁটাই সম্পন্ন করবে এবং GRPO প্রশিক্ষণ শেষ করবে।

05MemHarness-এর মূল সুবিধা

রিপ্লের চেয়ে পুনর্গঠন উন্নত: সুস্পষ্ট সমালোচনা ও পুনর্গঠন ধাপ যুক্ত করে স্থির মেমরি অংশকে কনটেক্সট-সংবেদনশীল, বর্তমান অবস্থার সঙ্গে সামঞ্জস্যপূর্ণ নির্দেশনায় রূপান্তর করা হয়, ফলে নেতিবাচক স্থানান্তর এড়ানো যায়।
ছোট মডেল বড় মডেলকে ছাড়িয়ে যায়: 7B প্যারামিটার ALFWorld ও WebShop-এ যথাক্রমে Gemini-2.5-Pro-এর তুলনায় 23.1% ও 39.7% বেশি সফলতা অর্জন করে।
OOD পরিস্থিতিতে শক্তিশালী স্থিতিস্থাপকতা: ডিস্ট্রিবিউশনের বাইরের পরিস্থিতিতে গড় সফলতার হার 85.9%, যা মূল মেমরি রিপ্লের 76.3%-এর তুলনায় উল্লেখযোগ্যভাবে বেশি।
অন্তর্নিহিত যুক্তির উন্নতি: পরীক্ষার সময় মেমরি বন্ধ থাকলেও পুনর্গঠন প্রশিক্ষণ লক্ষ্য বেস নীতির সফলতার হার 76.4% থেকে 83.0%-এ উন্নীত করে এবং Agent-এর অন্তর্নিহিত যুক্তির সক্ষমতা মৌলিকভাবে বাড়ায়।
অতিরিক্ত লেবেলিংয়ের প্রয়োজন নেই: পুনর্গঠন সক্ষমতা GRPO এন্ড-টু-এন্ড প্রশিক্ষণের মাধ্যমে স্বাভাবিকভাবে বিকশিত হয় এবং মানুষের তৈরি পুনর্গঠন তত্ত্বাবধান ডেটার ওপর নির্ভর করে না।

06MemHarness-এর প্রকল্প ঠিকানা

GitHub রিপোজিটরি:https://github.com/KnowledgeXLab/MemHarness
HuggingFace মডেল রিপোজিটরি:https://huggingface.co/KnowledgeXLab/MemHarness
arXiv প্রযুক্তিগত গবেষণাপত্র:https://arxiv.org/pdf/2607.28272

07MemHarness-এর প্রয়োগ ক্ষেত্র

এমবডিড ইন্টেলিজেন্স গৃহস্থালি কাজ: ALFWorld-এর মতো গৃহস্থালি পরিবেশে Agent অতীতে জিনিস সংগ্রহ ও পরিষ্কারের অভিজ্ঞতা পুনর্গঠন করে বিভিন্ন ঘরের বিন্যাসে জটিল গৃহস্থালি কাজ সম্পন্ন করতে পারে।
স্বায়ত্তশাসিত অনলাইন কেনাকাটা: WebShop-এর মতো ই-কমার্স প্ল্যাটফর্মে অতীত কেনাকাটার অভিজ্ঞতাকে বর্তমান পণ্যের অনুসন্ধান ও বাছাইয়ের কৌশলে পুনর্গঠন করে লক্ষ্যভিত্তিক কেনাকাটার সফলতার হার বাড়ানো যায়।
বুদ্ধিমান কাস্টমার সার্ভিস সংলাপ: কাস্টমার সার্ভিস Agent অতীতের অনুরূপ টিকিট পুনরুদ্ধার করে সমাধান পুনর্গঠন করে, ফলে পুরোনো উত্তর সরাসরি প্রয়োগ করে অপ্রাসঙ্গিক জবাব দেওয়ার ঝুঁকি কমে।
কোড সহায়তায় উন্নয়ন: প্রোগ্রামিং Agent অতীতের বাগ-সমাধানের অভিজ্ঞতা পুনর্গঠন করে বর্তমান কোড কনটেক্সটের সঙ্গে মানিয়ে নেয় এবং পুরোনো সমাধান হুবহু অনুসরণ না করে নির্ভুল সমাধান পরামর্শ দেয়।
বৈজ্ঞানিক গবেষণা পরীক্ষার পরিকল্পনা: পরীক্ষামূলক Agent অতীতের পরীক্ষার প্যারামিটার ও ফলাফল পুনর্গঠন করে বর্তমান পরীক্ষার শর্তের জন্য সর্বোত্তম কনফিগারেশনের পরামর্শ দেয় এবং ট্রায়াল-অ্যান্ড-এরর খরচ কমায়।

© দাবিত্যাগ: সময়ের সঙ্গে ডোমেইন ও লিংক করা কনটেন্ট পরিবর্তিত হতে পারে। AIEZZ তৃতীয় পক্ষের ওয়েবসাইট নিয়ন্ত্রণ করে না। বাহ্যিক কনটেন্ট ও ঝুঁকি স্বাধীনভাবে পর্যালোচনা করুন।

ব্যবহারকারীর রিভিউ0