- মাসিক ভিজিট
- 0
- মূল্য
- সেট করা হয়নি
- তালিকাভুক্ত
- —
- আপডেট করা হয়েছে
- 2026-09-09
01H3-World কী
H3-World হলো Tencent, National University of Singapore এবং The Hong Kong Polytechnic University-এর যৌথভাবে推出 করা একটি অ্যাকশন-নিয়ন্ত্রিত ওয়ার্ল্ড মডেল, যা 33B MiniMax-H3 ভিডিও জেনারেটরের ওপর ফাইন-টিউন করা হয়েছে। মডেলটি কীবোর্ড অপারেশনকে ইংরেজি নির্দেশনায় রূপান্তর করে এবং প্রি-ট্রেইনড টেক্সট পাথওয়ের মাধ্যমে মডেলে প্রবেশ করায়। এরপর টাইম অ্যাটেনশন রাউটিং ব্যবহার করে প্রতিটি নির্দেশনাকে সংশ্লিষ্ট ভিডিও ফ্রেমের সঙ্গে যুক্ত করা হয়, ফলে সুনির্দিষ্ট সময়-সমন্বিত নিয়ন্ত্রণ সম্ভব হয়। H3-World মাত্র 8000টি গেম ভিডিও ব্যবহার করে এবং rank-32 LoRA-এর মাধ্যমে 0.199% প্যারামিটার ফাইন-টিউন করে। এর ফলে মডেলটি কীবোর্ড ইনপুট অনুযায়ী রিয়েল টাইমে নিয়ন্ত্রিত দৃশ্য তৈরি করতে পারে এবং অপরিচিত দৃশ্যেও সাধারণীকরণ করতে পারে। এটি ইন্টার্যাক্টিভভাবে জেনারেট হওয়া বিশ্বের দিকে একটি গুরুত্বপূর্ণ পদক্ষেপ।
02H3-World-এর প্রধান বৈশিষ্ট্য
কীবোর্ড অ্যাকশন থেকে ভিডিও নিয়ন্ত্রণ: কীবোর্ডে দেওয়া চরিত্রের গতিবিধি ও ক্যামেরা অপারেশনকে সংশ্লিষ্ট ভিডিও দৃশ্যের পরিবর্তনে রূপান্তর করে, ফলে ”বোতাম চাপলেই নিয়ন্ত্রণ” ধরনের ইন্টার্যাক্টিভ বিশ্ব সিমুলেশন সম্ভব হয়।
সময়-নির্ভুল নিয়ন্ত্রণ: একই ভিডিওর বিভিন্ন সময়পর্বে ভিন্ন ভিন্ন অ্যাকশন নির্দেশনা কার্যকর করে অ্যাকশন সংঘটনের সময় সুনির্দিষ্টভাবে নিয়ন্ত্রণ করা যায়।
বহু পরিবেশে সাধারণীকরণ: গেমের দৃশ্য দিয়ে প্রশিক্ষণ শুরু হলেও এটি নিয়ন নগরী, মরূদ্যান, কল্পনার গির্জাসহ বিভিন্ন ভিজ্যুয়াল পরিবেশে সাধারণীকরণ করতে পারে এবং দৃশ্যের বিষয়বস্তু স্থিতিশীল রাখে।
সমন্বিত অ্যাকশনে সাধারণীকরণ: প্রশিক্ষণে দেখা চরিত্র ও ক্যামেরা অ্যাকশনের মৌলিক উপাদানগুলো মিলিয়ে আগে কখনও দেখা যায়নি এমন অ্যাকশন জোড়া তৈরি করতে পারে।
দীর্ঘমেয়াদি জেনারেশন: দীর্ঘ সময়ধারার ধারাবাহিক নিয়ন্ত্রিত ভিডিও তৈরি সমর্থন করে; অ্যাকশন নির্দেশনা দৃশ্যের বিবর্তনকে অব্যাহতভাবে চালিত করতে পারে।
03H3-World-এর প্রযুক্তিগত নীতি
WeChat-এ ফলো করে “开源” লিখে উত্তর দিন, AI ওপেন-সোর্স প্রকল্পের আলোচনা গ্রুপে যোগ দিন
অ্যাকশনের ভাষিক উপস্থাপন: প্রতিটি ফ্রেমের কীবোর্ড অপারেশনকে একটি সংক্ষিপ্ত ইংরেজি নির্দেশনায় অনুবাদ করা হয়, যেমন ”strafe left”, যাতে অ্যাকশন প্রাকৃতিক ভাষায় উপস্থাপিত হয়।
প্রি-ট্রেইনড টেক্সট পাথওয়ের পুনর্ব্যবহার: নির্দেশনাগুলো MiniMax-H3-এর মূল টেক্সট এনকোডিং পথ দিয়ে মডেলে প্রবেশ করে। ফলে ভিডিও প্রি-ট্রেইনিং পর্যায়ে শেখা সেমান্টিক উপস্থাপন সরাসরি পুনর্ব্যবহার করা যায় এবং মডেলটি স্বাভাবিকভাবেই অ্যাকশনের অর্থ বুঝতে পারে; শুরু থেকে অ্যাকশন এনকোডিং শেখানোর প্রয়োজন হয় না।
টাইম অ্যাটেনশন রাউটিং: নির্দেশিত অ্যাটেনশন মাস্কের মাধ্যমে প্রতিটি নির্দেশনাকে সংশ্লিষ্ট ভিডিও ল্যাটেন্ট ফ্রেমের সঙ্গে যুক্ত করা হয় এবং নির্দেশনার প্রভাব নির্ধারিত সময়সীমার মধ্যে সীমাবদ্ধ রাখা হয়। এতে পার্শ্ববর্তী অ্যাকশনের মধ্যে নিয়ন্ত্রণের লিকেজ এড়ানো যায়, যা সময়-নির্ভুল নিয়ন্ত্রণের মূল চাবিকাঠি।
হালকা LoRA ফাইন-টিউনিং: শুধু H3-এর সেল্ফ-অ্যাটেনশন প্রজেকশনে একটি rank-32 LoRA প্রশিক্ষণ দেওয়া হয়। 0.199% প্রশিক্ষণযোগ্য প্যারামিটার, 8000টি গেম ভিডিও এবং 10000 ধাপ অপ্টিমাইজেশনের মাধ্যমে অভিযোজন সম্পন্ন হয়, ফলে ভিডিও জেনারেটরকে ওয়ার্ল্ড মডেলে রূপান্তরের খরচ উল্লেখযোগ্যভাবে কমে।
04H3-World কীভাবে ব্যবহার করবেন
পদ্ধতি এক: অনলাইনে ব্যবহার
পদ্ধতি দুই: স্থানীয়ভাবে স্থাপন
Hugging Face-এর ইন্টার্যাক্টিভ ডেমো Space (hugging-apps/h3-world-action-demo) খুলুন। 135GB ওজন ডাউনলোড না করেই কীবোর্ড-চালিত নিয়ন্ত্রণ ব্যবহার করে দেখা যাবে।
একটি প্রাথমিক ফ্রেমের ছবি আপলোড বা নির্বাচন করুন এবং দৃশ্যের বর্ণনা হিসেবে prompt লিখুন।
পূর্বনির্ধারিত অ্যাকশন বা কীবোর্ড বোতাম ব্যবহার করে চরিত্রের গতিবিধি ও ক্যামেরা অপারেশনের নিয়ন্ত্রণ নির্দেশনা দিন।
মডেল রিয়েল টাইমে প্রায় 5.2 সেকেন্ডের 832×480 নিয়ন্ত্রিত ভিডিও ক্লিপ তৈরি করে।
পরিবেশ প্রস্তুতি: Python 3.10 + CUDA 12.8-এর conda পরিবেশ তৈরি করে PyTorch 2.10 এবং requirements.txt-এর নির্ভরতা ইনস্টল করুন।
কোড সংগ্রহ: H3-World-এর অফিসিয়াল রিপোজিটরি ক্লোন করুন। এরপর DiffSynth-Studio নির্দিষ্ট ডিরেক্টরিতে ক্লোন করে নির্দিষ্ট commit-এ স্যুইচ করুন এবং অফিসিয়াল attention patch প্রয়োগ করুন। এটি বাদ দেওয়া যাবে না, নইলে LoRA কার্যকর হবে না।
ওজন ডাউনলোড: Hugging Face থেকে MiniMax-H3 বেস ওজন প্রায় 135GB এবং H3-World LoRA (step-10000.safetensors) ডাউনলোড করে রিপোজিটরির সংশ্লিষ্ট ডিরেক্টরিতে রাখুন।
ক্যাশ কনফিগারেশন: env.sh চালিয়ে Hugging Face, Torch এবং Triton ক্যাশ রিপোজিটরির ভেতরে নির্দেশ করুন।
ইনফারেন্স চালানো: প্রথম ফ্রেমের ছবি, স্থির সেমান্টিক শর্ত এবং সময়সূচিভিত্তিক অ্যাকশন সিকোয়েন্স দিন, যেখানে প্রতিটি অংশে চরিত্র বা ক্যামেরার একটি নির্দেশনা থাকবে।
ফলাফল তৈরি: মডেল অ্যাকশনের সময়সূচি অনুযায়ী সংশ্লিষ্ট সময়ধারার ভিডিও ল্যাটেন্ট তৈরি ও ডিকোড করে আউটপুট দেয়; এটি অটোরিগ্রেসিভভাবে আরও দীর্ঘ সময়ধারায় সম্প্রসারিত করা যায়।
05H3-World-এর মূল সুবিধা
নতুন মডিউল ছাড়াই মার্জিত নকশা: প্রি-ট্রেইনড টেক্সট পাথওয়ে সরাসরি পুনর্ব্যবহার করে অ্যাকশন নিয়ন্ত্রণের সমস্যাকে মডেলের স্বাভাবিক ভাষা বোঝার দক্ষতার সমস্যায় রূপান্তর করা হয়েছে।
অত্যন্ত কম প্রশিক্ষণ খরচ: মাত্র 8000টি গেম ভিডিও, 10000 ধাপ অপ্টিমাইজেশন এবং rank-32 LoRA-এর মাধ্যমে 0.199% প্যারামিটার ফাইন-টিউন করে 33B মডেলের ইন্টার্যাক্টিভ নিয়ন্ত্রণ ক্ষমতা উন্মুক্ত করা হয়েছে।
সময়-নির্ভুল নিয়ন্ত্রণ ক্ষমতা: টাইম অ্যাটেনশন রাউটিংয়ের মাধ্যমে একই ভিডিওতে সময়সূচি অনুযায়ী বিভিন্ন অ্যাকশন কার্যকর করা যায়, ফলে গ্লোবাল prompt দিয়ে অ্যাকশনের সময় নির্ভুলভাবে নিয়ন্ত্রণ না করতে পারার সমস্যা দূর হয়।
প্রচলিত কন্ডিশন ইনজেকশন পদ্ধতির তুলনায় উল্লেখযোগ্যভাবে উন্নত: additive-bias, FiLM-এর মতো সরাসরি অ্যাকশন কন্ডিশনিং পদ্ধতির তুলনায় ভাষাভিত্তিক পদ্ধতি সমন্বিত চরিত্র ও ক্যামেরা মুভমেন্ট তৈরি করতে পারে এবং দৃশ্যের বিষয়বস্তু নষ্ট করে না।
শক্তিশালী সমন্বিত সাধারণীকরণ: প্রশিক্ষণে দেখা অ্যাকশন উপাদানগুলো মিলিয়ে আগে কখনও দেখা যায়নি এমন অ্যাকশন জোড়া তৈরি করতে পারে এবং প্রশিক্ষণ-বণ্টনের বাইরের ভিজ্যুয়াল পরিবেশেও সাধারণীকরণ করতে পারে।
উচ্চ বহুমুখিতা: একটি মডেলই প্রথম-ব্যক্তি ও তৃতীয়-ব্যক্তি দৃষ্টিভঙ্গি, চরিত্রের গতিবিধি এবং ক্যামেরা মুভমেন্টসহ বিভিন্ন ধরনের নিয়ন্ত্রণ সামলাতে পারে; আলাদা কাজের জন্য পৃথকভাবে প্রশিক্ষণের প্রয়োজন হয় না।
06H3-World-এর প্রকল্প ঠিকানা
প্রকল্পের অফিসিয়াল ওয়েবসাইট:https://danzer1xxxxchan.github.io/H3-World/
GitHub রিপোজিটরি:https://github.com/Danzer1xxxxChan/H3-World
HuggingFace মডেল রিপোজিটরি:https://modelscope.cn/models/DANNY621/H3-World
প্রযুক্তিগত গবেষণাপত্র:https://modelscope.cn/papers/2609.01560
07H3-World-এর প্রয়োগ ক্ষেত্র
গেম প্রোটোটাইপ তৈরি: ডিজাইনার প্রাথমিক দৃশ্য ইনপুট দিয়ে ভার্চুয়াল পরিবেশ রিয়েল টাইমে ”খেলতে” পারেন, দ্রুত লেভেলের ধারণা ও ক্যামেরা ভাষা যাচাই করতে পারেন; সম্পূর্ণ গেম ইঞ্জিন আগে তৈরি করার প্রয়োজন হয় না।
AI Agent প্রশিক্ষণ স্যান্ডবক্স: embodied agent-এর জন্য একটি ইন্টার্যাক্টিভ ভার্চুয়াল পরিবেশ তৈরি করে, যেখানে agent কীবোর্ড অ্যাকশনের মাধ্যমে বিশ্ব অন্বেষণ ও ভিজ্যুয়াল প্রতিক্রিয়া পায়; এতে বাস্তব বিশ্বের প্রশিক্ষণ খরচ কমে।
চলচ্চিত্র ও অ্যানিমেশন প্রিভিজ: পরিচালক কীবোর্ড দিয়ে ভার্চুয়াল ক্যামেরা নিয়ন্ত্রণ করতে পারেন, যেমন প্যান, সরানো ও ওঠানামা; রিয়েল টাইমে শট প্রিভিউ তৈরি করে প্রাথমিক previz তৈরির সময়সীমা উল্লেখযোগ্যভাবে কমানো যায়।
রোবট অপারেশন কৌশল যাচাই: রোবটিক বাহু বা ড্রোনের চলাচলের নির্দেশনাকে অ্যাকশন ভাষায় রূপান্তর করে তৈরি সিমুলেশন পরিবেশে অ্যাকশন সিকোয়েন্সের সময়গত যৌক্তিকতা পরীক্ষা করা যায়।
ইমার্সিভ কনটেন্ট তৈরি: VR বা গেম ইন্টার্যাকশনের সঙ্গে মিলিয়ে এমন UGC টুল তৈরি করা যায়, যেখানে ব্যবহারকারীরা স্বাভাবিক বোতাম ব্যবহারের মাধ্যমে ব্যক্তিগতকৃত ভার্চুয়াল বিশ্বের বিকাশ পরিচালনা করতে পারেন এবং সবাই ”খেলাযোগ্য ভিডিও” তৈরি করতে পারেন।
© দাবিত্যাগ: সময়ের সঙ্গে ডোমেইন ও লিংক করা কনটেন্ট পরিবর্তিত হতে পারে। AIEZZ তৃতীয় পক্ষের ওয়েবসাইট নিয়ন্ত্রণ করে না। বাহ্যিক কনটেন্ট ও ঝুঁকি স্বাধীনভাবে পর্যালোচনা করুন।

ব্যবহারকারীর রিভিউ0