- মাসিক ভিজিট
- 0
- মূল্য
- সেট করা হয়নি
- তালিকাভুক্ত
- —
- আপডেট করা হয়েছে
- 2026-09-10
01VDN-MiniMax-H3 কী
VDN-MiniMax-H3 হলো OpenVDN টিমের ওপেন-সোর্স করা ভিডিও জেনারেশন ত্বরান্বিতকরণ সমাধান, যা MiniMax-H3-এর ভিত্তিতে উন্নত করা হয়েছে। মডেলটি একটি হাইব্রিড অ্যাটেনশন আর্কিটেকচার ব্যবহার করে: স্থানীয় স্লাইডিং-উইন্ডো Softmax সূক্ষ্ম বিবরণ ধরে রাখে, দূরবর্তী লিনিয়ার অ্যাটেনশন দীর্ঘ-পরিসরের প্রসঙ্গ প্রক্রিয়া করে, এরপর 8 ধাপের ডিস্টিলেশনের মাধ্যমে ডিনয়জিং ধাপের সংখ্যা উল্লেখযোগ্যভাবে কমিয়ে আনে। 8টি NVIDIA B200-এ মডেলটি মাত্র 11.23 সেকেন্ডে প্রায় 14.4 সেকেন্ডের 768p ভিডিও তৈরি করতে পারে; ভিডিওর মান মূল 50 ধাপের Dense H3-এর প্রায় ক্ষতিহীন সমতুল্য।
02VDN-MiniMax-H3-এর প্রধান বৈশিষ্ট্য
হাইব্রিড অ্যাটেনশন আর্কিটেকচার: ভিডিও অ্যাটেনশনকে লোকাল Softmax শাখা ও দূরবর্তী লিনিয়ার শাখায় বিভক্ত করে সূক্ষ্ম বিবরণ এবং দীর্ঘ-পাল্লার প্রাসঙ্গিকতার সমন্বয় ঘটায়।
৮ ধাপে দ্রুত জেনারেশন: DMD2 ডিস্টিলেশনের মাধ্যমে ডিনয়জিং ধাপ ৫০ থেকে ৮ ধাপে কমিয়ে জেনারেশনের সময় উল্লেখযোগ্যভাবে হ্রাস করে।
প্রায় ক্ষতিহীন ছবির মান: ১১.২৩ সেকেন্ডে ১৪.৪ সেকেন্ডের ভিডিও তৈরি করার পাশাপাশি, ভিজ্যুয়াল মান মূল ৫০-ধাপের Dense H3 বেসলাইনের কাছাকাছি রাখে।
তিন-পর্যায়ের প্রশিক্ষণ অভিযোজন: স্তরভিত্তিক অ্যালাইনমেন্ট, এন্ড-টু-এন্ড শাখা অভিযোজন এবং LoRA যৌথ অভিযোজন ব্যবহার করে, যাতে র্যান্ডম ইনিশিয়ালাইজেশনের কারণে প্রি-ট্রেইনড মডেলে বিঘ্ন না ঘটে।
শাখাভিত্তিক বিশেষায়িত সমান্তরাল প্রক্রিয়াকরণ: Softmax ও লিনিয়ার শাখাকে ভিন্ন GPU-তে বরাদ্দ করে, স্ট্যান্ডার্ড Ulysses সমান্তরাল প্রক্রিয়াকরণের তুলনায় লেটেন্সি আরও ১৩.৩% কমায়।
03VDN-MiniMax-H3-এর প্রযুক্তিগত নীতি
WeChat-এ ফলো করে “开源” লিখে উত্তর দিন, AI ওপেন-সোর্স প্রকল্পের আলোচনা গ্রুপে যোগ দিন
হাইব্রিড অ্যাটেনশন আর্কিটেকচার: VDN ভিডিও অ্যাটেনশনকে স্থানীয় Softmax এবং দূরবর্তী লিনিয়ার দুটি পরিপূরক শাখায় বিভক্ত করে। প্রথমটি সূক্ষ্ম বিবরণ সংরক্ষণ করে, আর দ্বিতীয়টি লিনিয়ার জটিলতায় দীর্ঘ-পাল্লার প্রাসঙ্গিকতা প্রক্রিয়া করে। এভাবে পূর্ণাঙ্গ দ্বিঘাত-জটিলতার অ্যাটেনশনের বিকল্প তৈরি হয়।
স্থানীয় Softmax শাখা: দ্বিমুখী স্লাইডিং উইন্ডো ব্যবহার করে প্রতি 5টি ফ্রেমকে একটি গ্রুপ হিসেবে নিকটবর্তী ব্লকগুলোর প্রতি অ্যাটেনশন দেওয়া হয়। শুরু ও শেষের ফ্রেমকে সীমানা-অ্যাঙ্কর হিসেবে যুক্ত করা হয়। এতে অ্যাটেনশনের ঘনত্ব মাত্র 3.57% বাড়িয়েই বৈশ্বিক সময়গত সামঞ্জস্য বজায় রাখা যায়।
Video Delta Attention: প্রচলিত প্রতি-টোকেন Delta Rule-কে প্রতি-ফ্রেম যৌথ সমাধানে উন্নীত করা হয়। নরমাল সমীকরণের মাধ্যমে সব স্থানিক টোকেন যৌথভাবে নতুন অবস্থা নির্ধারণ করে। এটি স্বাভাবিকভাবেই নন-এক্সপ্যানসিভ এবং টোকেনের পারস্পরিক সম্পর্কের সঙ্গে স্বয়ংক্রিয়ভাবে মানিয়ে নিতে পারে, তাই ফ্রেমের আকার জোরপূর্বক স্কেল করার প্রয়োজন হয় না।
পাঠ্যের দ্বৈত-শাখা ইনজেকশন: Softmax শাখায় পাঠ্য প্রতিটি ফ্রেমের জন্য বৈশ্বিকভাবে দৃশ্যমান থাকে; লিনিয়ার শাখায় সূচনাকালেই পাঠ্য একবার দ্বিমুখী অবস্থায় লেখা হয়, ফলে পুনরাবৃত্ত গণনা এড়ানো যায়।
গেটেড ফিউশন প্রক্রিয়া: দুটি শাখার আউটপুটের স্কেল ভিন্ন। তাই প্রতিটির জন্য বিষয়বস্তু-সম্পর্কিত Sigmoid গেট এবং স্বতন্ত্র আউটপুট প্রজেকশন ব্যবহারের পর সেগুলো একত্র করা হয়। প্রশিক্ষণের প্রথম দুটি পর্যায়ে Softmax গেট হিমায়িত রাখা হয়, যাতে অপ্টিমাইজার মূল শাখার আউটপুট কমিয়ে ক্ষতি হ্রাস করতে না পারে।
তিন-পর্যায়ের প্রশিক্ষণ অভিযোজন: প্রথমে স্তরভিত্তিকভাবে লিনিয়ার শাখার সঙ্গে সামঞ্জস্য করা হয়, এরপর সব হাইব্রিড মডিউলকে এন্ড-টু-এন্ড যৌথভাবে অপ্টিমাইজ করা হয়। শেষে QKVO LoRA এবং লিনিয়ার শাখার সঙ্গে যৌথভাবে ফাইন-টিউন করা হয়। পুরো প্রক্রিয়ায় প্রাক-প্রশিক্ষিত মূল কাঠামো হিমায়িত রাখা হয়, যাতে উৎপাদনের মান নষ্ট না হয়।
04VDN-MiniMax-H3 কীভাবে ব্যবহার করবেন
পরিবেশ প্রস্তুতি: GitHub রিপোজিটরি ক্লোন করার পর Python 3.12 পরিবেশ তৈরি করুন এবং PyTorch 2.13.0 ও প্রকল্পের নির্ভরতা ইনস্টল করুন।
মডেল ডাউনলোড: ModelScope-এর মাধ্যমে OpenVDN/vdn-minimax-h3 ওজনগুলো স্থানীয় ckpts ডিরেক্টরিতে ডাউনলোড করুন।
অফিশিয়াল উদাহরণ চালানো: scripts/inference/8nfe_tuned_fp8.sh চালালে একটি GPU ব্যবহার করে উদাহরণ ভিডিও তৈরি করা যাবে।
মাল্টি-GPU ইনফারেন্স: হার্ডওয়্যার অনুযায়ী 8টি GPU-তে চালানোর জন্য 8nfe_tuned_fp8_ulysses_h200.sh অথবা b200.sh স্ক্রিপ্ট বেছে নিন।
কাস্টম প্রম্পট: encode_prompt.py ব্যবহার করে Qwen3-VL-32B-এর মাধ্যমে পাঠ্যকে .pt বৈশিষ্ট্য ফাইলে এনকোড করুন, তারপর infer.py-তে পাঠিয়ে ভিডিও তৈরি করুন।
05VDN-MiniMax-H3-এর মূল সুবিধা
অতি দ্রুত জেনারেশন: ৮ ধাপের ডিস্টিলেশন ও হাইব্রিড অ্যাটেনশন ব্যবহার করে ৮টি B200-এ মাত্র ১১.২৩ সেকেন্ডে প্রায় ১৪.৪ সেকেন্ডের 768p ভিডিও তৈরি করা যায়, যা মূল মডেলের তুলনায় ৭৪.৫ গুণ দ্রুত।
প্রায় অপরিবর্তিত ছবির মান: ভিজ্যুয়াল বিবরণ, বিষয়বস্তুর সামঞ্জস্য এবং নির্দেশনা অনুসরণের সক্ষমতা ৫০ ধাপের Dense H3 বেসলাইনের কাছাকাছি, যা ৪ ধাপের FastH3-এর তুলনায় উল্লেখযোগ্যভাবে উন্নত।
হাইব্রিড অ্যাটেনশন আর্কিটেকচার: স্থানীয় Softmax সূক্ষ্ম সময়গত বিবরণ ধরে রাখে, আর দূরপাল্লার লিনিয়ার অ্যাটেনশন লিনিয়ার জটিলতায় দীর্ঘ-পরিসরের প্রসঙ্গ প্রক্রিয়া করে, ফলে মান ও দক্ষতার মধ্যে ভারসাম্য বজায় থাকে।
ফ্রেম-স্তরের যৌথ সমাধান (VDA): token-ভিত্তিক পৃথক আপডেটকে ফ্রেম-ভিত্তিক যৌথ অপ্টিমাইজেশনে উন্নীত করে; এটি স্বাভাবিকভাবেই non-expansive এবং token-গুলোর পারস্পরিক সম্পর্কের সঙ্গে অভিযোজিত, তাই কঠোর স্কেলিংয়ের প্রয়োজন হয় না।
পর্যায়ক্রমিক স্থিতিশীল অভিযোজন: স্তরভিত্তিক অ্যালাইনমেন্ট, end-to-end ব্রাঞ্চ অ্যাডাপ্টেশন এবং LoRA যৌথ ফাইন-টিউনিংয়ের তিন ধাপের প্রশিক্ষণের মাধ্যমে র্যান্ডম ইনিশিয়ালাইজেশনের কারণে প্রি-ট্রেইনড মডেলে সৃষ্ট বিঘ্ন এড়ানো হয়।
ব্রাঞ্চ-নির্দিষ্ট প্যারালালিজম: Softmax ও VDA ব্রাঞ্চকে ভিন্ন GPU-তে চালানো হয়, ফলে স্ট্যান্ডার্ড Ulysses প্যারালালিজমের তুলনায় লেটেন্সি আরও ১৩.৩% কমে।
06VDN-MiniMax-H3-এর প্রকল্পের ঠিকানা
প্রকল্পের অফিসিয়াল ওয়েবসাইট: https://openvdn.github.io/
GitHub রিপোজিটরি: https://github.com/OpenVDN/vdn-minimax-h3
HuggingFace মডেল রিপোজিটরি: https://huggingface.co/OpenVDN/vdn-minimax-h3
07VDN-MiniMax-H3-এর প্রয়োগের ক্ষেত্র
রিয়েল-টাইম ইন্টারঅ্যাক্টিভ ভিডিও নির্মাণ: ৮ ধাপে দ্রুত তৈরির সুবিধা কনটেন্ট নির্মাতাদের রিয়েল টাইমে প্রম্পট সামঞ্জস্য করতে এবং তাৎক্ষণিকভাবে ফলাফল প্রিভিউ করতে সক্ষম করে, ফলে সৃজনশীল পুনরাবৃত্তির সময় উল্লেখযোগ্যভাবে কমে যায়।
বিজ্ঞাপন ও বিপণন উপকরণের ব্যাপক উৎপাদন: ই-কমার্স ও ব্র্যান্ডগুলো দ্রুত একাধিক সংস্করণের পণ্য প্রদর্শনী ভিডিও এবং অ্যানিমেটেড পোস্টার তৈরি করতে পারে, যা উৎসবের প্রচারণার মতো ঘন ঘন উপকরণের চাহিদা পূরণ করে।
চলচ্চিত্রের প্রি-ভিজুয়ালাইজেশন ও ডায়নামিক স্টোরিবোর্ড: পরিচালক ও প্রযোজনা দল চূড়ান্ত শুটিংয়ের আগে দ্রুত স্টোরিবোর্ড অ্যানিমেশন তৈরি করে শটের ভাষা, দৃশ্য বিন্যাস এবং বর্ণনার গতি যাচাই করতে পারে।
গেমের ডায়নামিক কনটেন্ট তৈরি: ওপেন-ওয়ার্ল্ড গেম বা ভার্চুয়াল সোশ্যাল প্ল্যাটফর্মের জন্য রিয়েল টাইমে NPC অ্যানিমেশন, পরিবেশগত ট্রানজিশন এবং খেলোয়াড়ের ব্যক্তিগতকৃত কাহিনির অংশ তৈরি করা যায়।
সোশ্যাল মিডিয়ার স্বল্পদৈর্ঘ্য ভিডিওর শিল্পভিত্তিক উৎপাদন: MCN প্রতিষ্ঠান ও স্বতন্ত্র কনটেন্ট নির্মাতারা কম খরচে এবং একসঙ্গে বিপুল পরিমাণে নাট্যাংশ, ভার্চুয়াল চরিত্রের Vlogসহ স্বল্পদৈর্ঘ্য ভিডিও কনটেন্ট তৈরি করতে পারে।
© দাবিত্যাগ: সময়ের সঙ্গে ডোমেইন ও লিংক করা কনটেন্ট পরিবর্তিত হতে পারে। AIEZZ তৃতীয় পক্ষের ওয়েবসাইট নিয়ন্ত্রণ করে না। বাহ্যিক কনটেন্ট ও ঝুঁকি স্বাধীনভাবে পর্যালোচনা করুন।


ব্যবহারকারীর রিভিউ0