- মাসিক ভিজিট
- 0
- মূল্য
- সেট করা হয়নি
- তালিকাভুক্ত
- —
- আপডেট করা হয়েছে
- 2026-09-21
01WebCraftBench কী
WebCraftBench হলো Tencent Hunyuan-এর Tsinghua ও Peking University-এর যৌথভাবে推出 করা AI ওয়েবপেজ জেনারেশন মূল্যায়ন বেঞ্চমার্ক। WebCraftBench প্রথমে জেনারেট করা অ্যাপে স্বয়ংক্রিয় ইনস্ট্রুমেন্টেশন যোগ করে, যাতে এজেন্ট Playwright-এর মাধ্যমে বাস্তবে ওয়েবপেজ পরিচালনা করে ফিচার অন্বেষণ করতে পারে এবং কোড কভারেজের সাহায্যে বাদ পড়া বিষয় খুঁজে নিতে পারে; এরপর ইন্টারঅ্যাকশন রেকর্ডকে স্টেট গ্রাফে রূপান্তর করে, সৌন্দর্য, ব্যবহারযোগ্যতা ও চাহিদা পূরণের মাত্রা, এই তিনটি দিক থেকে পৃথকভাবে স্কোর দেয়। বেঞ্চমার্কটিতে 369টি বাস্তব চাহিদা এবং মানুষের যাচাই করা 5,088টি গ্রহণযোগ্যতার মানদণ্ড রয়েছে। এটি 17টি অগ্রসর মডেলের 6,273টি অ্যাপ কভার করে এবং মানুষের পছন্দের সঙ্গে 85.3% সামঞ্জস্য অর্জন করেছে।
02WebCraftBench-এর প্রধান ফিচার
বাস্তব চাহিদাভিত্তিক মূল্যায়ন সেট: বাস্তব ব্যবহারকারীর ট্রাফিক থেকে সংগৃহীত 369টি ব্যবহারকারীর চাহিদা রয়েছে, যার সঙ্গে ফাংশন, কনটেন্ট ও ভিজ্যুয়াল, এই তিন ধরনের প্রয়োজন কভার করা মানুষের যাচাই করা 5,088টি গ্রহণযোগ্যতার মানদণ্ড যুক্ত।
ইন্টারঅ্যাক্টিভ স্বয়ংক্রিয় অন্বেষণ: এজেন্ট Playwright MCP-এর মাধ্যমে পরীক্ষকের মতো ক্লিক, ইনপুট ও পেজ পরিবর্তন করে, সক্রিয়ভাবে ফিচার খুঁজে বের করে এবং সীমান্ত পরিস্থিতি পরীক্ষা করে।
কোড কভারেজ-নির্দেশিত অন্বেষণ: Istanbul-ভিত্তিক স্বয়ংক্রিয় ইনস্ট্রুমেন্টেশন ব্যবহার করে রিয়েল টাইমে কভারেজ পর্যবেক্ষণ করা হয়। অন্বেষণ অপর্যাপ্ত হলে সহায়ক মডেল অনাবিষ্কৃত কোডের দিক নির্দেশ করে।
স্টেটের বিমূর্তীকরণ ও সংগঠন: দীর্ঘ অপারেশন রেকর্ড থেকে পুনরাবৃত্তি সরিয়ে ও মানসম্মত করে স্টেট ট্রানজিশন গ্রাফে একত্র করা হয় এবং স্কোরিংয়ের জন্য গুরুত্বপূর্ণ রানটাইম প্রমাণ বের করা হয়।
ত্রিমাত্রিক স্বাধীন স্কোরিং: সৌন্দর্য, ব্যবহারযোগ্যতা ও চাহিদা পূরণের মাত্রা পৃথকভাবে মূল্যায়ন করে মানসম্মত সম্মিলিত স্কোর তৈরি করা হয়।
মানুষের পছন্দ যাচাই: একটি স্বাধীন যাচাই সেটে পর্যালোচিত মানব ভোটের সঙ্গে তুলনা করে জোড়াভিত্তিক সিদ্ধান্তের সামঞ্জস্য 85.3% পাওয়া গেছে, যা মূল্যায়নের নির্ভরযোগ্যতা যাচাই করে।
03WebCraftBench-এর প্রযুক্তিগত নীতি
স্বয়ংক্রিয় ইনস্ট্রুমেন্টেশনের মাধ্যমে রানটাইম প্রমাণ সংগ্রহ: সিস্টেম অ্যাপ্লিকেশনের কোডে কাউন্টার ইনজেক্ট করে এবং স্ট্যাটিক HTML, Vite, Next, CRA, Astro-সহ বিভিন্ন ফ্রেমওয়ার্ক সমর্থন করে। অ্যাপ চালু হওয়ার পর প্রতিটি ইন্টারঅ্যাকশনে কোড কভারেজ ও এর পরিবর্তন ফেরত পাঠানো হয়, ফলে “কোন কোড সম্পাদিত হয়েছে” তা পর্যবেক্ষণযোগ্য হয়ে ওঠে।
কভারেজ-নির্দেশিত এজেন্ট অন্বেষণ: অন্বেষণকারী এজেন্ট সোর্স কোড বা গ্রহণযোগ্যতার তালিকা দেখে না; GUI টেস্টিং প্রক্রিয়া অনুসরণ করে ওয়েবপেজ পরিচালনা করে। পরপর তিনটি ইন্টারঅ্যাকশনে নতুন কভারেজ না এলে সিস্টেম আরেকটি মডেলকে অনিষ্পন্ন কোড বিশ্লেষণ করতে বলে এবং সেই পরামর্শকে স্বাভাবিক ভাষায় রূপান্তর করে অন্বেষণকারী এজেন্টকে আরও চেষ্টা করতে দেয়।
স্টেট বিমূর্তীকরণের মাধ্যমে ইন্টারঅ্যাকশন ট্র্যাক সংকোচন: পেজের কাঠামো মানসম্মত করা হয়, একই পেজকে একই স্টেট হিসেবে একত্র করা হয় এবং অপারেশনগুলোকে স্টেট ট্রানজিশন গ্রাফে সংযুক্ত করা হয়। এতে পুনরাবৃত্ত স্ক্রিনশট স্কোরিং মডেলের কনটেক্সট দখল করে না এবং ত্রুটির পথ স্পষ্টভাবে দেখা যায়।
অন্বেষণ ও স্কোরিং পৃথক রেখে বহুমাত্রিক মূল্যায়ন: অন্বেষণ পর্যায়ে প্রমাণ সংগ্রহের সময় গ্রহণযোগ্যতার তালিকা দেখা হয় না; স্কোরিং পর্যায়ে প্রতিটি মানদণ্ডের সঙ্গে মিলিয়ে প্রমাণ খোঁজা হয়। সৌন্দর্য ও ব্যবহারযোগ্যতার ক্ষেত্রে “ভালো দিক খোঁজা—ত্রুটি চিহ্নিত করা—বিচারকের স্কোর প্রদান”, এই তিন ধাপের মূল্যায়ন করা হয়(; চাহিদা পূরণের মাত্রায় প্রতিটি সিদ্ধান্তে রানটাইম প্রমাণ উদ্ধৃত করতে হয় এবং পূরণের অনুপাত অনুযায়ী স্কোর দেওয়া হয়। তিনটি মাত্রা সম্মিলিত স্কোরের এক-তৃতীয়াংশ করে গঠন করে।
04WebCraftBench কীভাবে ব্যবহার করবেন
জেনারেট করা অ্যাপ প্রস্তুত করুন: মূল্যায়নাধীন মডেলকে চাহিদা অনুযায়ী একটি ওয়েব অ্যাপ জেনারেট করতে দিন এবং সেটিকে রানযোগ্য অবস্থায় ডিপ্লয় করুন।
স্বয়ংক্রিয় ইনস্ট্রুমেন্টেশন: WebCraftBench-এর ইনস্ট্রুমেন্টেশন টুল চালিয়ে অ্যাপের কোডে কভারেজ কাউন্টার ইনজেক্ট করুন, যাতে প্রতিটি ইন্টারঅ্যাকশনে কোড এক্সিকিউশনের তথ্য ফেরত পাঠানো যায়।
ইন্টারঅ্যাক্টিভ অন্বেষণ: অন্বেষণকারী এজেন্ট চালু করে Playwright MCP-এর মাধ্যমে ওয়েবপেজ পরিচালনা করুন। ক্লিক, ইনপুট ও পেজ পরিবর্তনের মতো কাজ সম্পাদন করে সক্রিয়ভাবে ফিচার খুঁজে বের করুন এবং সীমান্ত পরিস্থিতি পরীক্ষা করুন।
কভারেজ-নির্দেশিত বাদ পড়া বিষয় খোঁজা: পরপর তিনটি ইন্টারঅ্যাকশনে নতুন কভারেজ না এলে সহায়ক মডেল অনিষ্পন্ন কোড বিশ্লেষণ করে স্বাভাবিক ভাষায় পরামর্শ তৈরি করবে এবং অন্বেষণকারী এজেন্টকে আরও অন্বেষণের জন্য দেবে (সর্বোচ্চ 100 ধাপ)।
রানটাইম প্রমাণ সংগঠিত করুন: সিস্টেম স্বয়ংক্রিয়ভাবে পেজের কাঠামোকে স্টেটে বিমূর্ত করবে, অপারেশন রেকর্ড থেকে পুনরাবৃত্তি সরিয়ে স্টেট ট্রানজিশন গ্রাফে একত্র করবে এবং স্ক্রিনশট ও ইন্টারঅ্যাকশন ট্র্যাক সংরক্ষণ করবে।
ত্রিমাত্রিক স্কোরিং: স্কোরিং এজেন্ট সৌন্দর্য ও ব্যবহারযোগ্যতা পৃথকভাবে মূল্যায়ন করবে এবং প্রতিটি গ্রহণযোগ্যতার মানদণ্ডের সঙ্গে মিলিয়ে চাহিদা পূরণের মাত্রা পরীক্ষা করবে। প্রতিটি সিদ্ধান্তে রানটাইম প্রমাণ উদ্ধৃত করতে হবে।
ফলাফল প্রকাশ: তিনটি মাত্রার মানসম্মত স্কোর এবং সম্মিলিত মোট স্কোর পাওয়া যাবে, যা মডেল পুলের র্যাঙ্কিংয়ের সঙ্গে তুলনা করা যায়। স্কোরের পার্থক্য যত বেশি, ফলাফল তত বেশি নির্ভরযোগ্য।
05WebCraftBench-এর মূল সুবিধা
বাস্তব ব্যবহারের ওপর ভিত্তি: এজেন্টকে বাস্তবে ওয়েবপেজ পরিচালনা করিয়ে স্কোর দেওয়া হয়, শুধু কোড বা স্ক্রিনশট দেখে নয়। ফলে “এন্ট্রি বোতাম কাজ করছে না, হোমপেজ খোলা যাচ্ছে না”, এমন সমস্যা ধরা পড়ে যা স্থির মূল্যায়নে বাদ যেতে পারে।
কভারেজ-নির্দেশিত অন্বেষণ: কোড কভারেজকে “বাদ পড়া বিষয় খোঁজার সূত্র” হিসেবে ব্যবহার করা হয়। টেস্টিং এজেন্ট কোনো ফিচার খুঁজে না পেলে ব্যাকগ্রাউন্ড মডেল দিক নির্দেশ করে, ফলে অন্বেষণে ব্যর্থতাকে পণ্যের ত্রুটি হিসেবে ভুলভাবে চিহ্নিত করার ঝুঁকি কমে।
অন্বেষণ ও স্কোরিং পৃথক: গ্রহণযোগ্যতার তালিকা শুধু স্কোরিং পর্যায়ে ব্যবহার করা হয়। এতে চাহিদার সীমাবদ্ধতা বজায় থাকে, আবার তালিকার বাইরের ইন্টারঅ্যাকশন পর্যবেক্ষণেও বাধা থাকে না, ফলে মূল্যায়নের পরিধি বাড়ে।
বহুমাত্রিক স্বাধীন স্কোরিং: সৌন্দর্য, ব্যবহারযোগ্যতা ও চাহিদা পূরণের মাত্রা পৃথকভাবে স্কোর করা হয়, ফলে “দেখতে সুন্দর কিন্তু ব্যবহার করলেই ভেঙে পড়ে”, এমন মডেলের দুর্বলতা একটি মাত্র সম্মিলিত স্কোরে আড়াল হয় না।
মানুষের পছন্দের সঙ্গে উচ্চ সামঞ্জস্য: 197টি পর্যালোচিত মানব তুলনায় সিদ্ধান্তের সামঞ্জস্য 85.3% ছিল। স্কোরের পার্থক্য বড় হলে(≥0.75)সামঞ্জস্য 98%-এ পৌঁছায়, তাই ফলাফলের নির্ভরযোগ্যতা বেশি।
উচ্চ মূল্যায়ন স্থিতিশীলতা: স্কোরিং বিচারক মডেল পরিবর্তন করার পরও র্যাঙ্কিংয়ের সহসম্পর্ক সহগ 0.980 ছিল, এবং শীর্ষ চারটির ক্রম অপরিবর্তিত ছিল। ফলে সিদ্ধান্ত কোনো একক বিচারকের ওপর নির্ভরশীল নয়।
06WebCraftBench-এর প্রকল্প ঠিকানা
arXiv প্রযুক্তিগত গবেষণাপত্র:https://arxiv.org/pdf/2609.15387
07WebCraftBench-এর প্রয়োগক্ষেত্র
AI প্রোগ্রামিং টুলের মডেল নির্বাচন: কোনো দল ওয়েব অ্যাপ জেনারেট করতে কোন বড় মডেল ব্যবহার করবে তা নির্বাচন করার সময় WebCraftBench-এর ত্রিমাত্রিক স্কোর দিয়ে বস্তুনিষ্ঠ তুলনা করতে পারে, ফলে শুধু ডেমোর চেহারা দেখে সিদ্ধান্ত নেওয়া এড়ানো যায়।
AI ওয়েবপেজ জেনারেশন পণ্যের গ্রহণযোগ্যতা পরীক্ষা: WebCraftBench-এর “বাস্তব পরীক্ষা প্রক্রিয়া” পণ্য সরবরাহের ধাপে যুক্ত করে প্রতি পেজে মানুষের পরীক্ষা প্রতিস্থাপন করা যায় এবং এন্ট্রি অকার্যকর বা ফিচার অপ্রাপ্য হওয়ার মতো সমস্যা স্বয়ংক্রিয়ভাবে শনাক্ত করা যায়।
কোড জেনারেশন মডেলের পুনরাবৃত্তি পরীক্ষা: মডেল প্রতিবার আপগ্রেডের পর বেঞ্চমার্ক চালিয়ে সৌন্দর্য, ব্যবহারযোগ্যতা ও চাহিদা পূরণের মাত্রার পরিবর্তন তুলনা করা যায় এবং নতুন সংস্করণ উন্নত হয়েছে নাকি অবনতি হয়েছে তা পরিমাপ করা যায়।
জেনারেশন মানের স্তরভিত্তিক নির্ণয়: মাত্রাভিত্তিক বিভাজন ও কম কভারেজের সূত্র ব্যবহার করে সমস্যা চিহ্নিত করা যায়—ডিজাইন দুর্বল, ইন্টারঅ্যাকশনে বাগ আছে, নাকি চাহিদা বোঝার ক্ষেত্রে বিচ্যুতি ঘটেছে—এবং সেই অনুযায়ী লক্ষ্যভিত্তিক উন্নয়ন করা যায়।
© দাবিত্যাগ: সময়ের সঙ্গে ডোমেইন ও লিংক করা কনটেন্ট পরিবর্তিত হতে পারে। AIEZZ তৃতীয় পক্ষের ওয়েবসাইট নিয়ন্ত্রণ করে না। বাহ্যিক কনটেন্ট ও ঝুঁকি স্বাধীনভাবে পর্যালোচনা করুন।


ব্যবহারকারীর রিভিউ0