- মাসিক ভিজিট
- 0
- মূল্য
- বিনামূল্যে এবং পে করুন
- তালিকাভুক্ত
- 2026-08-05
- আপডেট করা হয়েছে
- 2026-08-05
01MAGI-2-preview কী
MAGI-2-preview হলো Sand.ai-এর ওপেন সোর্স করা বিশ্বের প্রথম ১০০ বিলিয়ন-স্তরের MoE মাল্টিমোডাল ভিডিও জেনারেশন মডেল; এতে মোট 114B প্যারামিটার রয়েছে, যার মধ্যে সক্রিয় হয় মাত্র 6B। মডেলটি সিঙ্গেল-স্ট্রিম আর্কিটেকচার বজায় রেখে টেক্সট, ভিডিও ও অডিওকে একই Transformer-এ যৌথভাবে মডেল করে এবং নেটিভ মাল্টিমোডাল জেনারেশন সক্ষম করে। AA ভিডিও জেনারেশন তালিকায় মডেলটি ষষ্ঠ স্থানে রয়েছে। মডেলের কোড ও প্রি-ট্রেইনড ওজন উন্মুক্ত করা হয়েছে, যা ভিডিও জেনারেশন ক্ষেত্রে দক্ষ Scaling-এর একটি নতুন পথ যাচাই করে।
02MAGI-2-preview-এর প্রধান বৈশিষ্ট্য
মাল্টিমোডাল ভিডিও জেনারেশন: টেক্সট, ছবি এবং ভিডিও-টু-ভিডিও জেনারেশন সমর্থন করে এবং নেটিভ অডিও বোঝাপড়া যুক্ত করে।
MoE স্পার্স অ্যাক্টিভেশন: মোট 114B প্যারামিটারের মধ্যে মাত্র 6B সক্রিয় হয়, ফলে ইনফারেন্স খরচ ব্যাপকভাবে কমে।
সিঙ্গেল-স্ট্রিম ইউনিফায়েড আর্কিটেকচার: প্রচলিত cross-attention সংযুক্তি পদ্ধতি বাদ দিয়ে প্রথম স্তর থেকেই ছবি ও শব্দকে যৌথভাবে মডেল করে।
দক্ষ Scaling: ভিডিও জেনারেশন পরিস্থিতির জন্য MoE যোগাযোগ ও প্রশিক্ষণের স্থিতিশীলতা পুনর্গঠন করে, দীর্ঘ সিকোয়েন্সে একাধিক কার্ডের মধ্যে যোগাযোগের বাধা সমাধান করে।
03MAGI-2-preview-এর প্রযুক্তিগত নীতি
WeChat-এ ফলো করে “开源” লিখে উত্তর দিন, AI ওপেন সোর্স প্রকল্পের আলোচনা গ্রুপে যোগ দিন
MoE Mixture-of-Experts আর্কিটেকচার: মডেলের মোট ক্ষমতা 114B, কিন্তু প্রতিটি ফরোয়ার্ড পাসে মাত্র 6B প্যারামিটার সক্রিয় হয়; ফলে ক্ষমতা ও গণনাকে পৃথক করা যায়।
সিঙ্গেল-স্ট্রিম Transformer: ইনপুট স্তর থেকেই টেক্সট, ভিডিও ও অডিও token একই Transformer-এ প্রবেশ করে এবং self-attention-এর মাধ্যমে সরাসরি আন্তঃমোডাল তথ্য বিনিময় করে। বহু-টাওয়ার সংযুক্ত আর্কিটেকচারের তুলনায় এটি অডিও-ভিজ্যুয়াল সমন্বয়ের সূক্ষ্ম বিষয় ধরতে বেশি কার্যকর।
ডিস্ট্রিবিউটেড যোগাযোগ অপ্টিমাইজেশন: ভিডিওর দীর্ঘ সিকোয়েন্সের বৈশিষ্ট্য বিবেচনায় expert parallelism-এর token routing ও যোগাযোগ কৌশল পুনর্গঠন করা হয়েছে, ফলে GPU-গুলোর মধ্যে ডেটা স্থানান্তরের খরচ কমে।
প্রশিক্ষণ স্থিতিশীলতার সমাধান: ডায়নামিক routing, expert load balancing এবং মাল্টিমোডাল ডেটার যৌথ প্রশিক্ষণ, এই তিন স্তরের স্থিতিশীলতা ব্যবস্থা।
04MAGI-2-preview কীভাবে ব্যবহার করবেন
পরিবেশ প্রস্তুতি: GitHub রিপোজিটরি SandAI-org/MAGI-2-preview ক্লোন করে README অনুযায়ী নির্ভরতা কনফিগার করুন।
ওজন ডাউনলোড: GitHub Releases থেকে প্রি-ট্রেইনড ওজন সংগ্রহ করুন।
ইনফারেন্স চালানো: কনফিগারেশন ফাইল ও স্ক্রিপ্টের প্যারামিটার পরিবর্তন করুন। t2v / i2v / v2v তিনটি মোড সমর্থিত; MAGI-1-এর run.sh ফরম্যাট অনুসরণ করে চালান।
হার্ডওয়্যার প্রয়োজনীয়তা: নির্দিষ্ট কনফিগারেশন এখনো অফিসিয়াল ডকুমেন্টেশনে প্রকাশিত হয়নি। MAGI-1-এর 24B মাল্টি-কার্ড H100 অথবা 4.5B সিঙ্গেল-কার্ড 24GB VRAM সমাধান অনুসরণ করার পরামর্শ দেওয়া হয়।
05MAGI-2-preview-এর মূল সুবিধা
ওপেন সোর্স ও বাণিজ্যিকভাবে ব্যবহারযোগ্য: মডেলটি Apache 2.0 লাইসেন্সের অধীনে প্রকাশিত; প্রি-ট্রেইনড ওজন ও ইনফারেন্স কোড সম্পূর্ণ উন্মুক্ত।
১০০ বিলিয়ন-স্তরের MoE-তে অগ্রণী: সফলভাবে ওপেন সোর্স করা বিশ্বের প্রথম ১০০ বিলিয়ন-স্তরের MoE ভিডিও জেনারেশন মডেল, যা ভিডিও ক্ষেত্রে Scaling-এর নতুন পথ যাচাই করে।
কম খরচে উচ্চ ক্ষমতা: মাত্র 6B সক্রিয় প্যারামিটার দিয়ে 114B মডেল চালানো যায়; একই আকারের dense মডেলের তুলনায় ইনফারেন্স খরচ অনেক কম।
নেটিভ মাল্টিমোডাল: সিঙ্গেল-স্ট্রিম আর্কিটেকচার মডেলের নিম্নস্তরেই অডিও-ভিডিওকে গভীরভাবে একীভূত করে, ফলে পরবর্তী পর্যায়ের alignment-এর কারণে হওয়া বিলম্ব ও গুণগত ক্ষতি এড়ানো যায়।
06MAGI-2-preview-এর প্রকল্প ঠিকানা
প্রকল্পের অফিসিয়াল ওয়েবসাইট:https://sand.ai/blog/magi-2-preview
GitHub রিপোজিটরি:https://github.com/SandAI-org/MAGI-2-preview
HuggingFace মডেল রিপোজিটরি:https://huggingface.co/sand-ai/MAGI-2-preview
07MAGI-2-preview-এর প্রয়োগক্ষেত্র
দীর্ঘ ভিডিও বিজ্ঞাপন ও শর্ট ড্রামা: MoE-এর উচ্চ ক্ষমতা জটিল বর্ণনামূলক মডেলিং সমর্থন করে এবং মিনিট-দৈর্ঘ্যের ধারাবাহিক কাহিনিনির্ভর ভিডিও তৈরি করতে পারে।
মাল্টিমোডাল চলচ্চিত্র প্রিভিজুয়ালাইজেশন: নেটিভ অডিও বোঝাপড়ার মাধ্যমে ডাবিং, সাউন্ড ইফেক্ট ও দৃশ্যের সমন্বিত জেনারেশন এবং সম্পাদনা সম্ভব।
AI ভিডিও একাডেমিক গবেষণা: ওপেন সোর্স ১০০ বিলিয়ন-স্তরের ভিডিও MoE ওজন একাডেমিক ক্ষেত্রকে পুনরুৎপাদনযোগ্য Scaling বেসলাইন প্রদান করে।
এন্টারপ্রাইজ প্রাইভেট ডিপ্লয়মেন্ট: Apache 2.0 লাইসেন্সের ভিত্তিতে মডেলটি আর্থিক ও চিকিৎসার মতো সংবেদনশীল খাতে ব্যক্তিগত ভিডিও জেনারেশন সক্ষমতা তৈরিতে ব্যবহার করা যায়।
রিয়েল-টাইম স্ট্রিমিং জেনারেশন: স্পার্স অ্যাক্টিভেশন ইনফারেন্স খরচ কমায় এবং কম-বিলম্বের রিয়েল-টাইম ভিডিও জেনারেশন ও লাইভস্ট্রিমিং পরিস্থিতি সমর্থন করতে পারে।
© দাবিত্যাগ: সময়ের সঙ্গে ডোমেইন ও লিংক করা কনটেন্ট পরিবর্তিত হতে পারে। AIEZZ তৃতীয় পক্ষের ওয়েবসাইট নিয়ন্ত্রণ করে না। বাহ্যিক কনটেন্ট ও ঝুঁকি স্বাধীনভাবে পর্যালোচনা করুন।


ব্যবহারকারীর রিভিউ0