- الزيارات الشهرية
- 0
- الأسعار
- مجاني & مدفوع
- مدرج
- 2026-08-12
- تحدّث
- 2026-08-12
01شنو هو HOMIE؟
HOMIE هو إطار مفتوح المصدر من جامعة هونغ كونغ للعلوم والتكنولوجيا لتوليد فيديوهات الشخصيات الرقمية، مبني على شبكة Wan2.1-T2V-14B ومدمج مع النموذج متعدد الوسائط الكبير Qwen3-VL. كيقدر الإطار يعالج بشكل موحّد أربعة عناصر: الشخصية الرقمية + المنتوج + الشعار + النص، وكيحل بدقة أربعة تحديات رئيسية: التفاعل بين الإنسان والمنتوج، وضع العلامة التجارية، الحفاظ على وضوح نصوص OCR، والاتساق بين زوايا الرؤية المتعددة. تدريب النموذج كيحتاج غير لـ 5.5K خطوة وحوالي 10 آلاف ساعة على A100، وكتفوق دقة OCR أقوى النماذج المفتوحة المصدر بـ 38.7%. كيدعم الاستدلال بدقة 480P على بطاقة وحدة حتى لـ 720P باستعمال عدة بطاقات، وكيخفض بزاف عتبة إنتاج فيديوهات التجارة الإلكترونية والبث الافتراضي وغيرها.
02أهم وظائف HOMIE
تخصيص فيديوهات التفاعل بين الإنسان والمنتوج: كيدعم ظهور عدة أشخاص وأنواع مختلفة من الأشياء فالفيديو نفسه، مع الحفاظ على تناسق مظهر كل عنصر، وتنفيذ حركات تفاعل طبيعية ومنطقية، بحال حمل المنتوج وعرضه وتسليمه.
إلصاق الشعار والمفاهيم المجرّدة بدقة: باستعمال قدرة النموذج الكبير متعدد الوسائط (MLLM) على الاستدلال الدلالي، كيتم إلصاق شعار العلامة التجارية والمفاهيم المجرّدة الأخرى تلقائياً بالعنصر الأكثر ارتباطاً بها دلالياً، بلا ما تكون الحاجة لوصف علاقات الموقع بشكل صريح فالتوجيهات.
توليد نصوص OCR بجودة عالية: بالاعتماد على صورة مرجعية لـ OCR، كيضمن بقاء النصوص الموجودة على تغليف المنتوج والملصقات واضحة ومقروءة فالفيديو المولّد، بلا ضبابية ولا خلط بين الحروف، وكيحل مشكل “النص اللي كيتحوّل لكتلة مشوشة” ففيديوهات الذكاء الاصطناعي.
توليد متناسق من زوايا متعددة: عند توفير صور مرجعية متعددة الزوايا لنفس الشيء، كيحافظ النموذج على مظهره وتفاصيله بشكل متناسق ملي كيدور أو كيتحرك فالفيديو، وهاد الشي مناسب لعرض المجسمات ونماذج 3D والدمى وغيرها.
03المبدأ التقني ديال HOMIE
تابع WeChat وردّ بـ “开源” باش تنضم لمجموعة تبادل مشاريع الذكاء الاصطناعي مفتوحة المصدر
البنية العامة: كيعتمد الإطار على DiT ديال Wan2.1-T2V-14B من Alibaba كشبكة أساسية، وكيستخدم Qwen3-VL-2B-Thinking كوحدة للفهم البصري، مع مشفّر النصوص UmT5 ومشفّر الرؤية VAE، باش يكوّن بنية توليد متوازية من ثلاثة مسارات: النص + الدلالة متعددة الوسائط + الرؤية.
طريقة دمج MLLM: بلا ما يخرّب علاقة المحاذاة الأصلية بين النص والفيديو، وبلا ما يفرض تكلفة مرتفعة لإعادة المحاذاة، كيدمج النموذج الكبير متعدد الوسائط قدرة الاستدلال الدلالي داخل DiT، باش يقدر النموذج يفهم تلقائياً العلاقات الكامنة بين الصور المرجعية.
التوجيه بالانتباه الذاتي العالمي متعدد الوسائط (GMG): فطبقات الانتباه الذاتي ديال DiT، كتتم محاذاة الخصائص الدلالية المستخرجة من MLLM مع رموز الرؤية ديال VAE بشكل عالمي. وباستعمال الإسقاط والتجميع والتحويل الأفيني، كيولي كل رمز فيديو أثناء التوليد قادر “يشوف” المعلومات الدلالية الشاملة للصورة المرجعية.
تضمين الوسائط والمرجع (MRE): كيتعطى لكل من رموز خصائص MLLM ورموز الرؤية ديال VAE تضمين خاص بالوسيط، وكيتعطى لكل صورة مرجعية تضمين مستقل، مع ربط رموز الصور المرجعية متعددة الزوايا أو صور OCR الخاصة بنفس العنصر، لتفادي خلط المعلومات.
التدريب التدريجي على ثلاث مراحل: عنصر واحد بدقة 480P ← عدة عناصر بدقة 480P ← جودة عالية بدقة 720P، وبمجموع 5.5K خطوة فقط لإكمال التدريب، أي أقل بزاف من عشرات الآلاف من الخطوات المطلوبة فالطرق المشابهة.
04كيفاش تستعمل HOMIE
تحضير البيئة: كلون مستودع HOMIE من GitHub للحاسوب المحلي وثبّت جميع التبعيات المطلوبة.
تحميل الأوزان: حمّل الأوزان الرسمية المدربة مسبقاً من HuggingFace وحطّها فمجلد النموذج المحدد.
تحضير المواد: وجد الصور المرجعية، بحال صور الأشخاص وصور المنتجات والشعارات وصور نصوص OCR وغيرها من المواد متعددة العناصر.
كتابة التوجيهات: كتب توجيهات نصية كتشرح بدقة الحركات التفاعلية والمشهد بين الأشخاص والأشياء فالفيديو المستهدف.
تشغيل الاستدلال: شغّل سكريبت الاستدلال، وغادي يدمج HOMIE المعلومات المرجعية متعددة الوسائط تلقائياً ويولّد فيديو مخصص.
اختيار الدقة: تقدر بطاقة GPU وحدة تولّد مباشرة فيديو بدقة 832×480، بينما يقدر FSDP على عدة بطاقات يوسّع الإخراج حتى لجودة 720P.
05المزايا الأساسية ديال HOMIE
إطار موحّد: إطار واحد كيعالج فآن واحد التفاعل بين الإنسان والمنتوج، وإلصاق الشعار، والحفاظ على وضوح نصوص OCR، والاتساق بين زوايا الرؤية المتعددة، بلا حاجة لتبديل النماذج حسب كل سيناريو.
تدريب فعّال: كيحتاج غير لـ 5.5K خطوة وحوالي 10 آلاف ساعة على A100 لإكمال التدريب، بتكلفة أقل بزاف من الطرق المشابهة اللي كتحتاج عادةً لـ 30–40 ألف خطوة.
دمج MLLM بلا فقدان: كيدمج قدرة النموذج الكبير متعدد الوسائط على الاستدلال الدلالي فخط توليد الفيديو، بلا التضحية بقابلية التحكم فمشفّر النصوص وبلا تكلفة مرتفعة لإعادة المحاذاة.
جودة متقدمة: تحسنت دقة OCR بنسبة 38.7%، وتحسن الاتساق بين زوايا الرؤية المتعددة بنسبة 8.2%، واعتبر 64.7% من المشاركين فدراسة شملت 40 مستخدماً أن الجودة العامة هي الأفضل.
استدلال مرن: كيدعم الاستدلال من 480P على بطاقة وحدة حتى 720P على عدة بطاقات، ويقدر يخرج فيديو عمودي بدقة 1280×720، مناسب مباشرة للبث التجاري وصناعة الفيديوهات القصيرة.
06رابط مشروع HOMIE
الموقع الرسمي للمشروع: https://yiyangcai.github.io/homie-page.github.io
مستودع GitHub: https://github.com/YIYANGCAI/HOMIE
مستودع نماذج HuggingFace: https://huggingface.co/yychai/homie-r2v-wan2.1
البحث التقني على arXiv: https://arxiv.org/pdf/2607.18217
07مجالات استعمال HOMIE
البث التجاري للتجارة الإلكترونية: توليد فيديوهات لشخصية رقمية محددة وهي كتحمل منتوجاً محدداً وكتنفذ حركات محددة، مع دعم الإخراج العمودي بدقة 1280×720، مناسب مباشرة لمنصات الفيديوهات القصيرة.
صناعة إعلانات العلامات التجارية: إلصاق شعار العلامة التجارية تلقائياً بالمنتوج المرتبط به دلالياً، بلا حاجة لتحديد علاقة الموقع بشكل صريح فالتوجيهات.
المذيعون الافتراضيون والشخصيات الرقمية: الحفاظ على هوية الشخصية الرقمية مع تمكينها من التفاعل بشكل طبيعي مع منتجات متعددة.
عرض المنتجات من زوايا متعددة: عند توفير صور مرجعية متعددة الزوايا لمجسم أو نموذج 3D أو دمية، كيتم توليد فيديو عرض دوراني مع الحفاظ على تناسق المظهر من جميع الزوايا.
الحفاظ على وضوح نصوص التغليف: بالاعتماد على صورة مرجعية لـ OCR، كيضمن بقاء النصوص الموجودة على تغليف المنتوج والملصقات واضحة ومقروءة فالفيديو، وهاد الشي مناسب للمنتجات الغذائية ومستحضرات التجميل والمكملات الصحية وغيرها من المجالات اللي كتحتاج عرض المكونات أو التعليمات.
© إخلاء المسؤولية: النطاقات والمحتوى المرتبط يقدرو يتبدلو مع الوقت. AIEZZ ما كيتحكمش فالمواقع التابعة لجهات أخرى. راجع المحتوى الخارجي والمخاطر بشكل مستقل.


تقييمات المستخدمين0