- ماہانہ وزٹس
- 0
- قیمتیں
- مفت اور ادائیگی
- فہرست میں شامل
- 2026-08-09
- اپ ڈیٹ شدہ
- 2026-08-09
01Wan-Animate-2 کیا ہے
Wan-Animate-2 وان-اینیمیٹ ٹیم کا اوپن سورس کردہ نئی نسل کا کردار اینیمیشن ماڈل ہے۔ یہ Wan-Animate کا ایک اہم آرکیٹیکچرل اپ گریڈ ہے، جس میں واضح پوز اسکیلیٹن اور معاون پوز ایکسٹریکشن نیٹ ورک پر انحصار ختم کر کے اینڈ ٹو اینڈ دو شاخہ Diffusion Transformer (DiT) استعمال کیا گیا ہے، جو براہِ راست حوالہ جاتی ویڈیو سے حرکتی پیشگی معلومات حاصل کرتا ہے۔ ماڈل متن کے ذریعے زاویۂ نظر کنٹرول کو سپورٹ کرتا ہے اور 24 fps تک حقیقی وقت کی اسٹریمنگ variant فراہم کرتا ہے۔
02Wan-Animate-2 کے اہم افعال
ڈرائیونگ ویڈیو کو کردار اینیمیشن میں تبدیل کرنا: حوالہ جاتی تصویر reference.png اور ڈرائیونگ ٹیمپلیٹ ویڈیو template.mp4 داخل کریں، تاکہ حوالہ جاتی کردار ڈرائیونگ ویڈیو کی حرکات اور کیمرہ تال کی نقل کرے۔
اینڈ ٹو اینڈ حرکت کی منتقلی: ازسرنو تیار کردہ DiT براہِ راست ڈرائیونگ ویڈیو استعمال کرتا ہے اور درمیانی حرکتی ایکسٹریکٹر سے گزرنے کی ضرورت نہیں رہتی، جس کا مقصد حرکت کی وفاداری اور شناخت کی یکسانیت دونوں بہتر بنانا ہے۔
شناخت/ظاہری شکل برقرار رکھنا: reference image token اور reference video token کو attention calculation میں شامل کر کے حوالہ جاتی ظاہری شکل کو تخلیقی عمل میں شامل کیا جاتا ہے، جس سے “حرکت درست مگر چہرہ خراب” ہونے کے امکانات کم ہوتے ہیں۔
متنی معیاری کنٹرول: inference سے پہلے LLM کے ذریعے مقررہ فارمیٹ میں caption تیار کیا جاتا ہے، جس میں صرف “شخص کی ظاہری شکل کی تفصیل + پس منظر کی تفصیل” لکھی جاتی ہے؛ حرکت بیان یا جذبات کا اندازہ نہیں لگایا جاتا، پھر اسے Wan-Animate-2 کے prompt کے طور پر استعمال کیا جاتا ہے۔
متن کے ذریعے زاویۂ نظر کنٹرول: متن کے ذریعے آؤٹ پٹ کیمرہ زاویے کو ڈرائیونگ ویڈیو سے الگ کیا جا سکتا ہے، جس سے “ایک ہی حرکات، مختلف کیمرہ پوزیشن/زاویہ” بنانا آسان ہو جاتا ہے۔
Base اعلیٰ معیار موڈ: ڈیفالٹ inference اسکرپٹ معمول کی configuration استعمال کرتا ہے؛ سرکاری Diffusers مثال میں num_inference_steps=40 ہے، جو معیار کو ترجیح دیتی ہے۔
Distillation کم مراحل موڈ: distilled weights کی مثال 10 steps، guidance_scale=1.0، Euler solver/no CFG استعمال کرتی ہے، جو تیز تخلیق اور کم تاخیر کی جانچ کے لیے ہے۔
حقیقی وقت کی پیش رفت: مقالے میں Wan-Animate-2-Lite پیش کیا گیا ہے، جو teacher forcing، error buffer، Self-Forcing distillation اور chunk-wise backpropagation کے ذریعے تاخیر کو حقیقی وقت کی حد تک کم کرنے کی کوشش کرتا ہے اور اسٹریمنگ کردار اینیمیشن کے لیے تیار کیا گیا ہے۔
مقامی اور آن لائن تجربہ: مقامی Gradio اسکرپٹ فراہم کیا گیا ہے؛ Base کے لیے wan_animate_2_gradio.py اور distilled version کے لیے wan_animate_2_gradio_distillation.py استعمال ہوتا ہے۔ README آن لائن ModelScope Studio demo کی طرف بھی رہنمائی کرتا ہے۔
انجینئرنگ ایکو سسٹم کے داخلی راستے: weights HuggingFace/ModelScope پر دستیاب ہیں، جبکہ ماڈل ID کی مثال Wan-AI/Wan2.2-Animate-2-14B ہے؛ Diffusers کو source سے install کر کے شامل کیا جا سکتا ہے، جبکہ ComfyUI/DiffSynth-Studio ابھی Todo ہیں۔
قابلِ تشکیل متوازی تخلیق: ڈیفالٹ tuning 8×A800، 720P کے مطابق ہے، جبکہ 2×A800، 480P بھی آزمائے گئے ہیں؛ مختلف hardware کے لیے YAML parallel configuration تبدیل کرنا ضروری ہے۔
03Wan-Animate-2 کو کیسے استعمال کریں
WeChat کو فالو کریں اور “اوپن سورس” کا جواب بھیج کر AI اوپن سورس پروجیکٹ گروپ میں شامل ہوں
hardware تیار کریں: ترجیحاً سرکاری ڈیفالٹ 8×A800، 720P کے مطابق منصوبہ بنائیں؛ سرکاری طور پر 2×A800، 480P بھی آزمایا گیا ہے، اس لیے یہ فرض نہ کریں کہ صارفین کے لیے عام single GPU پر لازماً چل جائے گا۔
repository clone کریں: git clone --recursive https://github.com/Wan-Video/Wan-Animate-2.git۔
environment بنائیں: Python 3.11؛ torch 2.7.0 / torchvision 0.22.0 / torchaudio 2.7.0 اور CUDA 12.6 source انسٹال کریں؛ پھر requirements.txt، flash-attn انسٹال کریں اور آخر میں pip install -e . چلائیں۔
weights ڈاؤن لوڈ کریں: HuggingFace کے لیے huggingface-cli download Wan-AI/Wan2.2-Animate-2-14B --local-dir ./ckpts/؛ ModelScope کے لیے modelscope download --model Wan-AI/Wan2.2-Animate-2-14B --local_dir ./ckpts/۔
پہلے caption تیار کریں: Qwen3.7-Plus جیسے LLM کا استعمال کریں اور سرکاری چینی فارمیٹ کے مطابق صرف “شخص کی ظاہری شکل کی تفصیل + پس منظر کی تفصیل” لکھیں؛ حرکت، جذبات یا رائے شامل نہ کریں۔
Base چلائیں: infer directory میں جائیں، wan_animate_2_demo.py چلائیں اور --prompt، --refer-img-file، --refer-video-file، --config ./wan_animate_2.yaml فراہم کریں۔
distilled version چلائیں: wan_animate_2_distillation.yaml استعمال کریں اور --sample_guide_scale 1.0 --step 10 شامل کریں؛ Diffusers میں متعلقہ parameters guidance_scale=1.0، flow_solver="euler" ہیں۔
parallel configuration تبدیل کریں: اگر GPU کی تعداد/میموری سرکاری configuration سے مختلف ہو تو پہلے YAML parallel configs تبدیل کریں، پھر OOM یا رفتار کی خرابی کی جانچ کریں۔
فوری تجربہ: deployment نہیں کرنا چاہتے تو پہلے ModelScope Studio آزمائیں؛ مقامی طور پر wan_animate_2_gradio.py یا wan_animate_2_gradio_distillation.py چلائیں۔
04Wan-Animate-2 کے بنیادی فوائد
حرکت کی وفاداری اور شناخت کی یکسانیت اس کی بنیادی خصوصیات ہیں: درمیانی حرکتی ایکسٹریکٹر ہٹا دینے سے نظری طور پر غلطیوں کے جمع ہونے کی ایک تہہ کم ہو جاتی ہے۔
پروڈکشن ورک فلو سے زیادہ مطابقت: سرکاری طریقے میں caption کو مقررہ فارمیٹ میں پہلے تیار کیا جاتا ہے، جس میں کردار کی ظاہری شکل اور پس منظر بیان کیے جاتے ہیں مگر حرکت نہیں، اس سے نتائج کو مستقل طور پر دوبارہ بنانا آسان ہوتا ہے۔
کم تاخیر کی سمت واضح ہے: Distillation کے ذریعے 10 مراحل کی inference چلائی جا سکتی ہے؛ Lite مقالہ حقیقی وقت/اسٹریمنگ ڈیجیٹل انسانوں پر براہِ راست توجہ دیتا ہے۔
تجارتی استعمال کے لیے نسبتاً موزوں: Apache-2.0 ثانوی ترقی کے لیے زیادہ سہولت فراہم کرتا ہے، تاہم حقیقی تجارتی استعمال میں مواد کے copyright، حقِ تصویر اور پلیٹ فارم کے قواعد سے نمٹنا پھر بھی ضروری ہے۔
05Wan-Animate-2 کا پروجیکٹ ایڈریس
پروجیکٹ ویب سائٹ: https://humanaigc.github.io/wan-animate-2
Github repository: https://github.com/Wan-Video/Wan-Animate-2
ModelScope: https://modelscope.cn/models/Wan-AI/Wan2.2-Animate-2-14B
arXiv تکنیکی مقالہ: https://arxiv.org/pdf/2608.06009
آن لائن demo: https://www.modelscope.cn/studios/Wan-AI/Wan2.2-Animate
06Wan-Animate-2 کے استعمال کے منظرنامے
ورچوئل اینکر / ڈیجیٹل انسانوں کی لائیو اسٹریمنگ: Lite کا راستہ حقیقی وقت کی حد اور اسٹریمنگ کردار اینیمیشن کی جانب واضح طور پر اشارہ کرتا ہے، اس لیے “حقیقی انسان سے چلنے والی ورچوئل شخصیت” والی کم تاخیر کی لائیو اسٹریمنگ کے لیے موزوں ہے۔
مختصر ویڈیو / مختصر ڈرامے کے کردار کا متبادل: اداکار کی پرفارمنس ویڈیو کو driving video کے طور پر استعمال کر کے اسے کردار کی illustration یا حوالہ جاتی تصویر پر لاگو کیا جا سکتا ہے۔ یہ فینٹسی کرداروں، IP شخصیات اور کم لاگت متبادل مناظر کے لیے موزوں ہے؛ بنیادی خصوصیات اینڈ ٹو اینڈ حرکت کی منتقلی اور شناخت برقرار رکھنا ہیں۔
رقص، MV اور اشاروں پر مبنی رقص کی تخلیق نو: ایک رقص ٹیمپلیٹ کے ذریعے مختلف کرداروں کی شکلیں چلائیں اور متعدد کرداروں کی نقل، ایک فریم میں لباس کی تبدیلی یا stylized MV تیار کریں؛ زاویۂ نظر کنٹرول “ایک ہی حرکت، مختلف کیمرہ پوزیشن” والی تدوینی مواد بھی بنا سکتا ہے۔
ای کامرس اور برانڈ مواد: برانڈ mascot یا ورچوئل ماڈل کو یکساں ٹیمپلیٹ کے مطابق حرکات دکھانے کے لیے استعمال کریں، مثلاً نئی مصنوعات کی مختصر ویڈیوز، سرگرمیوں کے صفحات کی ویڈیوز اور سوشل میڈیا مواد؛ تجارتی استعمال سے پہلے حقِ تصویر، لباس کے copyright اور پلیٹ فارم compliance سے نمٹنا ضروری ہے۔
تعلیم / علم پر مبنی بلاگر کا تعلیمی مواد: لیکچرر یا کارٹون لیکچرر کی شکل کو مقررہ حرکتی ٹیمپلیٹس کے ذریعے متحرک کر کے آغاز، منتقلی اور نکات کی یاد دہانی والے مناظر بڑی تعداد میں تیار کریں، جس سے بار بار filming کی لاگت کم ہو۔
گیم NPC / cutscene کی پیشگی تیاری: منصوبہ ساز پہلے حقیقی انسان کی پرفارمنس سے کردار کے prototype کو تیزی سے متحرک کر کے حرکت کی تال، کیمرہ اور جذبات کی جانچ کر سکتے ہیں، پھر فیصلہ کر سکتے ہیں کہ اسے باضابطہ motion capture اور rendering workflow میں شامل کرنا ہے یا نہیں۔
© دستبرداری: ڈومینز اور لنک شدہ مواد وقت کے ساتھ تبدیل ہو سکتے ہیں۔ AIEZZ فریقِ ثالث کی ویب سائٹس کو کنٹرول نہیں کرتا۔ بیرونی مواد اور خطرات کا آزادانہ جائزہ لیں۔


صارف کے جائزے0