- ماہانہ وزٹس
- 0
- قیمتیں
- متعین نہیں
- فہرست میں شامل
- —
- اپ ڈیٹ شدہ
- 2026-09-08
01LLaDA-Image کیا ہے؟
LLaDA-Image، Ant Group کے inclusionAI کی جانب سے اوپن سورس کیا گیا 6B پیرامیٹرز والا متحدہ امیج جنریشن اور ایڈیٹنگ ماڈل ہے۔ یہ ماڈل پہلے خالص تصویری پری ٹریننگ اور بعد میں لسانی الائنمنٹ کے جدید طریقۂ کار کو اپناتا ہے۔ مکمل ڈفیوژن آرکیٹیکچر (LLaDA2.0-mini تفہیم + 6B DiT جنریشن) کے ذریعے یہ متن سے تصویر بنانا، ہدایتی ایڈیٹنگ، اور چینی و انگریزی متن کی رینڈرنگ ممکن بناتا ہے۔ Turbo ورژن صرف 2–4 مراحل میں تصویر تیار کرتا ہے اور Qwen-Image-Bench کے چینی اور انگریزی دونوں مقابلوں میں اوپن سورس ماڈلز میں پہلی پوزیشن حاصل کر چکا ہے۔
02LLaDA-Image کی اہم خصوصیات
متن سے تصویر کی تخلیق: قدرتی زبان کی وضاحت کی بنیاد پر اعلیٰ معیار اور بھرپور تفصیلات والی فوٹو ریئلسٹک تصاویر تخلیق کریں۔
ہدایتی تصویر ایڈیٹنگ: حوالہ جاتی تصویر اپ لوڈ کریں اور قدرتی زبان میں ہدایات درج کرکے مخصوص حصوں میں درست تبدیلیاں کریں، جبکہ باقی حصوں کو برقرار رکھیں۔
چینی اور انگریزی متن کی دو لسانی رینڈرنگ: تخلیق کردہ تصاویر میں چینی اور انگریزی متن کو درست طور پر پیش کریں، پوسٹرز، لے آؤٹ اور فنکارانہ خطاطی کے ڈیزائن کو سپورٹ کریں۔
VQ مشروط تخلیق: بصری کوانٹائزیشن (VQ) ٹوکنز کو مشروط ان پٹ کے طور پر استعمال کرکے قابلِ کنٹرول تصویر تخلیق کریں۔
حوالہ جاتی تصویر کی ایڈیٹنگ: اپ لوڈ کی گئی تصویر کو حوالہ بنا کر اسٹائل ٹرانسفر، مواد میں ترمیم اور دیگر ایڈیٹنگ کے کام انجام دیں۔
Turbo تیز رفتار استدلال: ڈسٹلڈ ماڈل صرف 2–4 سیمپلنگ مراحل میں 1024×1024 ریزولوشن کی اعلیٰ معیار کی تصاویر تخلیق کر سکتا ہے۔
03LLaDA-Image کے تکنیکی اصول
WeChat پر فالو کریں اور “开源” کا جواب دے کر AI اوپن سورس پروجیکٹس کے گروپ میں شامل ہوں
مکمل ڈفیوژن پر مبنی متحدہ معماری: ماڈل تفہیمی ماڈیول LLaDA2.0-mini (MoE پر مبنی ڈفیوژن لینگویج ماڈل) اور جنریشن ماڈیول 6B DiT پر مشتمل ہے۔ دونوں کے بیک اینڈ ڈفیوژن ماڈلز ہیں، جنہیں Connector کے ذریعے جوڑا گیا ہے، اس طرح معنوی تفہیم اور پکسل جنریشن کو الگ کیا گیا ہے۔
مرحلہ وار تربیتی حکمتِ عملی: ”پہلے تصویر بنانا سیکھو، پھر ہدایات پر عمل کرنا سیکھو“ کے طریقے کے تحت پہلے خالص تصویری پری ٹریننگ اور درمیانی مرحلے کی تربیت کے ذریعے مضبوط بصری جنریشن پرائر قائم کیا جاتا ہے، پھر متن-بصری ہم آہنگی مکمل کرنے کے لیے جوڑی دار زبان کی نگرانی شامل کی جاتی ہے۔
اعلیٰ معیار کے ڈیٹا کی تیاری: جنریشن کی تربیت میں مجموعی طور پر تقریباً 2.2 کروڑ نمونے استعمال کیے گئے، جن میں 98% حقیقی تصاویر تھیں؛ زبان کی ہم آہنگی کے مرحلے میں تصویری متن کی وضاحتیں Qwen سیریز کے بڑے ماڈلز نے تیار اور جانچ کیں، تاکہ ہدایات پر عمل کی درستگی یقینی بنائی جا سکے۔
مؤثر تربیتی اصلاح: پورے عمل میں LayerNorm کے متبادل کے طور پر پیرامیٹر سے آزاد RMSNorm استعمال کیا گیا، جبکہ Muon آپٹیمائزر کے ذریعے بڑے پیمانے کی تربیت کے استحکام اور کارکردگی کو بہتر بنایا گیا۔
Twin-DMD تیز رفتار ڈسٹلیشن: Turbo ورژن Twin-DMD ڈسٹلیشن ٹیکنالوجی کے ذریعے Base ماڈل کو کمپریس کرتا ہے۔ 2–4 مراحل کی سیمپلنگ سے 1024×1024 اعلیٰ معیار کی تصاویر تیار کی جا سکتی ہیں، جس سے رفتار اور معیار میں توازن قائم ہوتا ہے۔
04LLaDA-Image کا استعمال کیسے کریں
ماحولیاتی ترتیب: Python 3.11، PyTorch 2.8، Diffusers 0.39.0 اور FlashAttention 2.8.3 سمیت ضروری انحصارات انسٹال کریں اور مقامی inference ماحول تیار کریں۔
ماڈل وزن حاصل کریں: Hugging Face یا ModelScope سے LLaDA-Image (اعلیٰ وفاداری والا ورژن) یا LLaDA-Image-Turbo (تیز رفتار ورژن) کی ماڈل فائلیں ڈاؤن لوڈ کریں۔
متن سے تصویر بنائیں: ماڈل لوڈ کرنے کے بعد وضاحتی متن درج کریں۔ Base ورژن کے لیے 50 steps اور guidance scale 5.0، جبکہ Turbo ورژن کے لیے 2–4 steps اور guidance scale 1.0 مقرر کریں، تاکہ 1024×1024 تصویر تیار ہو۔
ہدایات کے ذریعے تصویر میں ترمیم کریں: حوالہ تصویر اپ لوڈ کریں اور قدرتی زبان میں ترمیمی ہدایت درج کریں (مثلاً ”پس منظر کو سمندر کے کنارے میں تبدیل کریں“)، ماڈل خودکار طور پر غیر ترمیم شدہ حصوں کو برقرار رکھے گا۔
سائز کے اصولوں کا خیال رکھیں: متن سے تصویر اور VQ کنڈیشنڈ جنریشن کے لیے ان پٹ سائز 16 کے مضرب ہونے چاہییں، جبکہ ترمیمی کاموں کے لیے 32 کے مضرب ہونے چاہییں۔
05LLaDA-Image کے بنیادی فوائد
اوپن سورس کارکردگی میں برتری: Qwen-Image-Bench کے چینی اور انگریزی دونوں ٹریکس میں اوپن سورس ماڈلز میں پہلی پوزیشن حاصل کی، اور مجموعی اسکور FLUX.2 Max جیسے معروف اوپن سورس ماڈلز سے بھی زیادہ ہے۔
متحدہ تخلیق اور تدوین: ایک ہی ماڈل اعلیٰ معیار کی متن سے تصویر تخلیق اور باریک ہدایتی تصویری تدوین، دونوں کو سپورٹ کرتا ہے؛ مختلف ماڈلز کے درمیان تبدیل ہونے کی ضرورت نہیں۔
تیز رفتار استدلال: Turbo ڈسٹل ورژن کو 1024×1024 ہائی فِڈیلیٹی تصاویر تخلیق کرنے کے لیے صرف 2–4 سیمپلنگ مراحل درکار ہوتے ہیں، جس سے انتظار کا وقت نمایاں طور پر کم ہو جاتا ہے۔
چینی اور انگریزی متن کی رینڈرنگ: چینی اور انگریزی متن تخلیق کرنے کی عمدہ صلاحیت رکھتا ہے، اور پوسٹرز، لے آؤٹ، فنکارانہ حروف اور دیگر ڈیزائن سے متعلق کاموں کے لیے موزوں ہے۔
فوٹو جیسی حقیقت پسندی: 98% حقیقی تصاویر پر مشتمل پری ٹریننگ ڈیٹا کی بنیاد پر، تخلیق کردہ نتائج میں قدرتی روشنی، بھرپور تفصیلات اور اعلیٰ حقیقت پسندی ہوتی ہے۔
06LLaDA-Image کا پروجیکٹ لنک
GitHub ریپوزٹری: https://github.com/inclusionAI/LLaDA-Image
HuggingFace ماڈل کلیکشن: https://huggingface.co/collections/inclusionAI/llada-image
arXiv تکنیکی مقالہ: https://arxiv.org/pdf/2609.03796
07LLaDA-Image کے استعمال کے مواقع
ای کامرس بصری ڈیزائن: مصنوعات کی تفصیل کی بنیاد پر ایک کلک سے پروڈکٹ کی مرکزی تصویر تیار کریں، یا ہدایات کے ذریعے پس منظر تبدیل کریں اور روشنی و سائے کو تیزی سے ایڈجسٹ کریں، جس سے فوٹوگرافی اور بعد از پروڈکشن کے اخراجات کم ہوں۔
مارکیٹنگ پوسٹرز کی تیاری: چینی اور انگریزی متن کو عمدگی سے رینڈر کرنے کی صلاحیت کے ساتھ برانڈ کے Slogan اور مہم کی معلومات پر مشتمل تجارتی پوسٹرز اور سوشل میڈیا تصاویر براہِ راست تیار کریں۔
سوشل میڈیا مواد کی تخلیق: بلاگرز اور تخلیق کاروں کے لیے فوٹو جیسی پورٹریٹ، مناظر اور طرزِ زندگی کی تصاویر تیار کریں، جبکہ اسٹائلائزڈ ایڈیٹنگ اور فوری تصویر سازی کی سہولت بھی حاصل ہو۔
گیمز اور فلم و ٹی وی کے تصوری ڈیزائن: متن کی بنیاد پر کرداروں اور مناظر کے تصوری خاکے تیزی سے تیار کریں، پھر ہدایات کے ذریعے تفصیلات میں بار بار ترمیم کریں اور ابتدائی تخلیقی عمل کو تیز کریں۔
ذاتی فوٹو ایڈیٹنگ: تصویر اپ لوڈ کرنے کے بعد قدرتی زبان کی ہدایات سے غیر ضروری اشیا ہٹائیں، آسمان تبدیل کریں، رنگوں کو ایڈجسٹ کریں اور دیگر کام انجام دیں، جبکہ غیر ترمیم شدہ حصے اپنی اصل حالت میں برقرار رہیں؛ یوں پیچیدہ فوٹو ایڈیٹنگ سافٹ ویئر کا متبادل فراہم ہوتا ہے۔
© دستبرداری: ڈومینز اور لنک شدہ مواد وقت کے ساتھ تبدیل ہو سکتے ہیں۔ AIEZZ فریقِ ثالث کی ویب سائٹس کو کنٹرول نہیں کرتا۔ بیرونی مواد اور خطرات کا آزادانہ جائزہ لیں۔


صارف کے جائزے0