মূল কনটেন্টে যান
WebCraftBench

WebCraftBench চালু আছে

WebCraftBench হলো Tencent Hunyuan-এর Tsinghua ও Peking University-এর যৌথভাবে推出 করা AI ওয়েবপেজ জেনারেশন মূল্যায়ন বেঞ্চমার্ক। WebCraftBench প্রথমে জেনারেট করা অ্যাপে স্বয়ংক্রিয় ইনস্ট্রুমেন্টেশন যোগ করে, তারপর এজেন্টকে Playwright-এর মাধ্যমে বাস্তবে ওয়েবপেজ পরিচালনা করে ফিচার অন্বেষণ করতে দেয়,...

WebCraftBench হলো Tencent Hunyuan-এর Tsinghua ও Peking University-এর যৌথভাবে推出 করা AI ওয়েবপেজ জেনারেশন মূল্যায়ন বেঞ্চমার্ক। WebCraftBench প্রথমে জেনারেট করা অ্যাপে স্বয়ংক্রিয় ইনস্ট্রুমেন্টেশন যোগ করে, তারপর এজেন্টকে Playwright-এর মাধ্যমে বাস্তবে ওয়েবপেজ পরিচালনা করে ফিচার অন্বেষণ করতে দেয়,...

WebCraftBench
মাসিক ভিজিট
0
মূল্য
সেট করা হয়নি
তালিকাভুক্ত
—
আপডেট করা হয়েছে
2026-09-21

01WebCraftBench কী

WebCraftBench হলো Tencent Hunyuan-এর Tsinghua ও Peking University-এর যৌথভাবে推出 করা AI ওয়েবপেজ জেনারেশন মূল্যায়ন বেঞ্চমার্ক। WebCraftBench প্রথমে জেনারেট করা অ্যাপে স্বয়ংক্রিয় ইনস্ট্রুমেন্টেশন যোগ করে, যাতে এজেন্ট Playwright-এর মাধ্যমে বাস্তবে ওয়েবপেজ পরিচালনা করে ফিচার অন্বেষণ করতে পারে এবং কোড কভারেজের সাহায্যে বাদ পড়া বিষয় খুঁজে নিতে পারে; এরপর ইন্টারঅ্যাকশন রেকর্ডকে স্টেট গ্রাফে রূপান্তর করে, সৌন্দর্য, ব্যবহারযোগ্যতা ও চাহিদা পূরণের মাত্রা, এই তিনটি দিক থেকে পৃথকভাবে স্কোর দেয়। বেঞ্চমার্কটিতে 369টি বাস্তব চাহিদা এবং মানুষের যাচাই করা 5,088টি গ্রহণযোগ্যতার মানদণ্ড রয়েছে। এটি 17টি অগ্রসর মডেলের 6,273টি অ্যাপ কভার করে এবং মানুষের পছন্দের সঙ্গে 85.3% সামঞ্জস্য অর্জন করেছে।

02WebCraftBench-এর প্রধান ফিচার

বাস্তব চাহিদাভিত্তিক মূল্যায়ন সেট: বাস্তব ব্যবহারকারীর ট্রাফিক থেকে সংগৃহীত 369টি ব্যবহারকারীর চাহিদা রয়েছে, যার সঙ্গে ফাংশন, কনটেন্ট ও ভিজ্যুয়াল, এই তিন ধরনের প্রয়োজন কভার করা মানুষের যাচাই করা 5,088টি গ্রহণযোগ্যতার মানদণ্ড যুক্ত।
ইন্টারঅ্যাক্টিভ স্বয়ংক্রিয় অন্বেষণ: এজেন্ট Playwright MCP-এর মাধ্যমে পরীক্ষকের মতো ক্লিক, ইনপুট ও পেজ পরিবর্তন করে, সক্রিয়ভাবে ফিচার খুঁজে বের করে এবং সীমান্ত পরিস্থিতি পরীক্ষা করে।
কোড কভারেজ-নির্দেশিত অন্বেষণ: Istanbul-ভিত্তিক স্বয়ংক্রিয় ইনস্ট্রুমেন্টেশন ব্যবহার করে রিয়েল টাইমে কভারেজ পর্যবেক্ষণ করা হয়। অন্বেষণ অপর্যাপ্ত হলে সহায়ক মডেল অনাবিষ্কৃত কোডের দিক নির্দেশ করে।
স্টেটের বিমূর্তীকরণ ও সংগঠন: দীর্ঘ অপারেশন রেকর্ড থেকে পুনরাবৃত্তি সরিয়ে ও মানসম্মত করে স্টেট ট্রানজিশন গ্রাফে একত্র করা হয় এবং স্কোরিংয়ের জন্য গুরুত্বপূর্ণ রানটাইম প্রমাণ বের করা হয়।
ত্রিমাত্রিক স্বাধীন স্কোরিং: সৌন্দর্য, ব্যবহারযোগ্যতা ও চাহিদা পূরণের মাত্রা পৃথকভাবে মূল্যায়ন করে মানসম্মত সম্মিলিত স্কোর তৈরি করা হয়।
মানুষের পছন্দ যাচাই: একটি স্বাধীন যাচাই সেটে পর্যালোচিত মানব ভোটের সঙ্গে তুলনা করে জোড়াভিত্তিক সিদ্ধান্তের সামঞ্জস্য 85.3% পাওয়া গেছে, যা মূল্যায়নের নির্ভরযোগ্যতা যাচাই করে।

03WebCraftBench-এর প্রযুক্তিগত নীতি

স্বয়ংক্রিয় ইনস্ট্রুমেন্টেশনের মাধ্যমে রানটাইম প্রমাণ সংগ্রহ: সিস্টেম অ্যাপ্লিকেশনের কোডে কাউন্টার ইনজেক্ট করে এবং স্ট্যাটিক HTML, Vite, Next, CRA, Astro-সহ বিভিন্ন ফ্রেমওয়ার্ক সমর্থন করে। অ্যাপ চালু হওয়ার পর প্রতিটি ইন্টারঅ্যাকশনে কোড কভারেজ ও এর পরিবর্তন ফেরত পাঠানো হয়, ফলে “কোন কোড সম্পাদিত হয়েছে” তা পর্যবেক্ষণযোগ্য হয়ে ওঠে।
কভারেজ-নির্দেশিত এজেন্ট অন্বেষণ: অন্বেষণকারী এজেন্ট সোর্স কোড বা গ্রহণযোগ্যতার তালিকা দেখে না; GUI টেস্টিং প্রক্রিয়া অনুসরণ করে ওয়েবপেজ পরিচালনা করে। পরপর তিনটি ইন্টারঅ্যাকশনে নতুন কভারেজ না এলে সিস্টেম আরেকটি মডেলকে অনিষ্পন্ন কোড বিশ্লেষণ করতে বলে এবং সেই পরামর্শকে স্বাভাবিক ভাষায় রূপান্তর করে অন্বেষণকারী এজেন্টকে আরও চেষ্টা করতে দেয়।
স্টেট বিমূর্তীকরণের মাধ্যমে ইন্টারঅ্যাকশন ট্র্যাক সংকোচন: পেজের কাঠামো মানসম্মত করা হয়, একই পেজকে একই স্টেট হিসেবে একত্র করা হয় এবং অপারেশনগুলোকে স্টেট ট্রানজিশন গ্রাফে সংযুক্ত করা হয়। এতে পুনরাবৃত্ত স্ক্রিনশট স্কোরিং মডেলের কনটেক্সট দখল করে না এবং ত্রুটির পথ স্পষ্টভাবে দেখা যায়।
অন্বেষণ ও স্কোরিং পৃথক রেখে বহুমাত্রিক মূল্যায়ন: অন্বেষণ পর্যায়ে প্রমাণ সংগ্রহের সময় গ্রহণযোগ্যতার তালিকা দেখা হয় না; স্কোরিং পর্যায়ে প্রতিটি মানদণ্ডের সঙ্গে মিলিয়ে প্রমাণ খোঁজা হয়। সৌন্দর্য ও ব্যবহারযোগ্যতার ক্ষেত্রে “ভালো দিক খোঁজা—ত্রুটি চিহ্নিত করা—বিচারকের স্কোর প্রদান”, এই তিন ধাপের মূল্যায়ন করা হয়(; চাহিদা পূরণের মাত্রায় প্রতিটি সিদ্ধান্তে রানটাইম প্রমাণ উদ্ধৃত করতে হয় এবং পূরণের অনুপাত অনুযায়ী স্কোর দেওয়া হয়। তিনটি মাত্রা সম্মিলিত স্কোরের এক-তৃতীয়াংশ করে গঠন করে।

04WebCraftBench কীভাবে ব্যবহার করবেন

জেনারেট করা অ্যাপ প্রস্তুত করুন: মূল্যায়নাধীন মডেলকে চাহিদা অনুযায়ী একটি ওয়েব অ্যাপ জেনারেট করতে দিন এবং সেটিকে রানযোগ্য অবস্থায় ডিপ্লয় করুন।
স্বয়ংক্রিয় ইনস্ট্রুমেন্টেশন: WebCraftBench-এর ইনস্ট্রুমেন্টেশন টুল চালিয়ে অ্যাপের কোডে কভারেজ কাউন্টার ইনজেক্ট করুন, যাতে প্রতিটি ইন্টারঅ্যাকশনে কোড এক্সিকিউশনের তথ্য ফেরত পাঠানো যায়।
ইন্টারঅ্যাক্টিভ অন্বেষণ: অন্বেষণকারী এজেন্ট চালু করে Playwright MCP-এর মাধ্যমে ওয়েবপেজ পরিচালনা করুন। ক্লিক, ইনপুট ও পেজ পরিবর্তনের মতো কাজ সম্পাদন করে সক্রিয়ভাবে ফিচার খুঁজে বের করুন এবং সীমান্ত পরিস্থিতি পরীক্ষা করুন।
কভারেজ-নির্দেশিত বাদ পড়া বিষয় খোঁজা: পরপর তিনটি ইন্টারঅ্যাকশনে নতুন কভারেজ না এলে সহায়ক মডেল অনিষ্পন্ন কোড বিশ্লেষণ করে স্বাভাবিক ভাষায় পরামর্শ তৈরি করবে এবং অন্বেষণকারী এজেন্টকে আরও অন্বেষণের জন্য দেবে (সর্বোচ্চ 100 ধাপ)।
রানটাইম প্রমাণ সংগঠিত করুন: সিস্টেম স্বয়ংক্রিয়ভাবে পেজের কাঠামোকে স্টেটে বিমূর্ত করবে, অপারেশন রেকর্ড থেকে পুনরাবৃত্তি সরিয়ে স্টেট ট্রানজিশন গ্রাফে একত্র করবে এবং স্ক্রিনশট ও ইন্টারঅ্যাকশন ট্র্যাক সংরক্ষণ করবে।
ত্রিমাত্রিক স্কোরিং: স্কোরিং এজেন্ট সৌন্দর্য ও ব্যবহারযোগ্যতা পৃথকভাবে মূল্যায়ন করবে এবং প্রতিটি গ্রহণযোগ্যতার মানদণ্ডের সঙ্গে মিলিয়ে চাহিদা পূরণের মাত্রা পরীক্ষা করবে। প্রতিটি সিদ্ধান্তে রানটাইম প্রমাণ উদ্ধৃত করতে হবে।
ফলাফল প্রকাশ: তিনটি মাত্রার মানসম্মত স্কোর এবং সম্মিলিত মোট স্কোর পাওয়া যাবে, যা মডেল পুলের র‌্যাঙ্কিংয়ের সঙ্গে তুলনা করা যায়। স্কোরের পার্থক্য যত বেশি, ফলাফল তত বেশি নির্ভরযোগ্য।

05WebCraftBench-এর মূল সুবিধা

বাস্তব ব্যবহারের ওপর ভিত্তি: এজেন্টকে বাস্তবে ওয়েবপেজ পরিচালনা করিয়ে স্কোর দেওয়া হয়, শুধু কোড বা স্ক্রিনশট দেখে নয়। ফলে “এন্ট্রি বোতাম কাজ করছে না, হোমপেজ খোলা যাচ্ছে না”, এমন সমস্যা ধরা পড়ে যা স্থির মূল্যায়নে বাদ যেতে পারে।
কভারেজ-নির্দেশিত অন্বেষণ: কোড কভারেজকে “বাদ পড়া বিষয় খোঁজার সূত্র” হিসেবে ব্যবহার করা হয়। টেস্টিং এজেন্ট কোনো ফিচার খুঁজে না পেলে ব্যাকগ্রাউন্ড মডেল দিক নির্দেশ করে, ফলে অন্বেষণে ব্যর্থতাকে পণ্যের ত্রুটি হিসেবে ভুলভাবে চিহ্নিত করার ঝুঁকি কমে।
অন্বেষণ ও স্কোরিং পৃথক: গ্রহণযোগ্যতার তালিকা শুধু স্কোরিং পর্যায়ে ব্যবহার করা হয়। এতে চাহিদার সীমাবদ্ধতা বজায় থাকে, আবার তালিকার বাইরের ইন্টারঅ্যাকশন পর্যবেক্ষণেও বাধা থাকে না, ফলে মূল্যায়নের পরিধি বাড়ে।
বহুমাত্রিক স্বাধীন স্কোরিং: সৌন্দর্য, ব্যবহারযোগ্যতা ও চাহিদা পূরণের মাত্রা পৃথকভাবে স্কোর করা হয়, ফলে “দেখতে সুন্দর কিন্তু ব্যবহার করলেই ভেঙে পড়ে”, এমন মডেলের দুর্বলতা একটি মাত্র সম্মিলিত স্কোরে আড়াল হয় না।
মানুষের পছন্দের সঙ্গে উচ্চ সামঞ্জস্য: 197টি পর্যালোচিত মানব তুলনায় সিদ্ধান্তের সামঞ্জস্য 85.3% ছিল। স্কোরের পার্থক্য বড় হলে(≥0.75)সামঞ্জস্য 98%-এ পৌঁছায়, তাই ফলাফলের নির্ভরযোগ্যতা বেশি।
উচ্চ মূল্যায়ন স্থিতিশীলতা: স্কোরিং বিচারক মডেল পরিবর্তন করার পরও র‌্যাঙ্কিংয়ের সহসম্পর্ক সহগ 0.980 ছিল, এবং শীর্ষ চারটির ক্রম অপরিবর্তিত ছিল। ফলে সিদ্ধান্ত কোনো একক বিচারকের ওপর নির্ভরশীল নয়।

06WebCraftBench-এর প্রকল্প ঠিকানা

arXiv প্রযুক্তিগত গবেষণাপত্র:https://arxiv.org/pdf/2609.15387

07WebCraftBench-এর প্রয়োগক্ষেত্র

AI প্রোগ্রামিং টুলের মডেল নির্বাচন: কোনো দল ওয়েব অ্যাপ জেনারেট করতে কোন বড় মডেল ব্যবহার করবে তা নির্বাচন করার সময় WebCraftBench-এর ত্রিমাত্রিক স্কোর দিয়ে বস্তুনিষ্ঠ তুলনা করতে পারে, ফলে শুধু ডেমোর চেহারা দেখে সিদ্ধান্ত নেওয়া এড়ানো যায়।
AI ওয়েবপেজ জেনারেশন পণ্যের গ্রহণযোগ্যতা পরীক্ষা: WebCraftBench-এর “বাস্তব পরীক্ষা প্রক্রিয়া” পণ্য সরবরাহের ধাপে যুক্ত করে প্রতি পেজে মানুষের পরীক্ষা প্রতিস্থাপন করা যায় এবং এন্ট্রি অকার্যকর বা ফিচার অপ্রাপ্য হওয়ার মতো সমস্যা স্বয়ংক্রিয়ভাবে শনাক্ত করা যায়।
কোড জেনারেশন মডেলের পুনরাবৃত্তি পরীক্ষা: মডেল প্রতিবার আপগ্রেডের পর বেঞ্চমার্ক চালিয়ে সৌন্দর্য, ব্যবহারযোগ্যতা ও চাহিদা পূরণের মাত্রার পরিবর্তন তুলনা করা যায় এবং নতুন সংস্করণ উন্নত হয়েছে নাকি অবনতি হয়েছে তা পরিমাপ করা যায়।
জেনারেশন মানের স্তরভিত্তিক নির্ণয়: মাত্রাভিত্তিক বিভাজন ও কম কভারেজের সূত্র ব্যবহার করে সমস্যা চিহ্নিত করা যায়—ডিজাইন দুর্বল, ইন্টারঅ্যাকশনে বাগ আছে, নাকি চাহিদা বোঝার ক্ষেত্রে বিচ্যুতি ঘটেছে—এবং সেই অনুযায়ী লক্ষ্যভিত্তিক উন্নয়ন করা যায়।

© দাবিত্যাগ: সময়ের সঙ্গে ডোমেইন ও লিংক করা কনটেন্ট পরিবর্তিত হতে পারে। AIEZZ তৃতীয় পক্ষের ওয়েবসাইট নিয়ন্ত্রণ করে না। বাহ্যিক কনটেন্ট ও ঝুঁকি স্বাধীনভাবে পর্যালোচনা করুন।

ব্যবহারকারীর রিভিউ0