- الزيارات الشهرية
- 0
- الأسعار
- ما تحددش
- مدرج
- —
- تحدّث
- 2026-09-15
01شنو هو YuE2؟
YuE2 هو موديل مفتوح المصدر لتوليد الموسيقى، طوّراتو جامعة هونغ كونغ للعلوم والتكنولوجيا وفريق M-A-P. كيقدر الموديل يولّد نوتة موسيقية ABC قابلة للتعديل (اللحن + الأكوردات) انطلاقاً من الكلمات والستايل، ومن بعد كيحوّلها لأغنية كاملة بجودة 48kHz، باش تكون عملية الإبداع واضحة وقابلة للتحكم. كيدعم الموديل الإبداع من الصفر، وإعادة الغناء بلا عينات، وتعديل النوتة بالحوار مع Agent. فمعيار WildSongBench، وصل SongBench Avg لـ6.9632، وتفوّق على موديلات تجارية بحال Suno v5.
02الوظائف الرئيسية ديال YuE2
الإبداع بالتخطيط الرمزي: دخل الكلمات وموجّه الستايل، والموديل كيولّد أولاً نوتة ABC قابلة للتعديل فيها اللحن والأكوردات، ومن بعد كيحوّلها لأغنية كاملة بالصوت والمصاحبة الموسيقية.
إعادة الغناء بلا عينات: استعمل SheetSage2 باش تحوّل تسجيل الأغنية الأصلية لنوتة موسيقية، ومن بعد عاود قدّمها بستايل ولا كلمات جديدة، بلا ما تحتاج تدير fine-tuning لمهمة إعادة الغناء.
التعديل بالحوار مع Agent: تحاور مع Agent على النوتة، وعدّل الهارموني أو اللحن أو السرعة أو البنية الموسيقية، ومن بعد عاود ولّد نسخة جديدة.
تحويل الصوت لنوتة (SheetSage2): حوّل أي تسجيل لنوتة موسيقية قابلة للفحص والتعديل، وهاد الشي هو المدخل لإعادة الغناء والتعديل.
فهم الموسيقى (MERT2): كيوفّر تمثيلاً موسيقياً على مستوى الأغنية كاملة، وكيعاون فمهام لاحقة بحال تحويل الصوت لنوتة. وحتى هو حصل على 14 نتيجة SOTA من أصل 15 فمعيار MARBLE.
03المبدأ التقني ديال YuE2
تابع微信 وردّ بـ“开源” باش تنضم لمجموعة التواصل ديال مشاريع الذكاء الاصطناعي مفتوحة المصدر
طبقة وسطية للتخطيط الرمزي: التصميم الأساسي ديال YuE2 هو إدخال طبقة صريحة ديال النوتة الموسيقية الرمزية (ترميز ABC، فيه اللحن والأكوردات) بين شروط النص/الصوت والموجة الصوتية النهائية. النوتة كتخدم كواجهة “الصندوق المفتوح”، يقدر الإنسان ولا Agent يقراها ويعدّلها، وكتحدّد كذلك بنية التوليد الصوتي من بعد. بهاد الطريقة كيتحوّل الإبداع من اختيار عشوائي فـ“صندوق مغلق” لعملية تأليف قابلة للتحكم.
بنية هجينة ديال الخبراء AR–NAR: كيستعمل الموديل عموداً واحداً من نوع Mixture-of-Transformers. خبير AR كيستعمل الانتباه السببي باش يتنبأ بشكل ذاتي بـ tokens ديال النوتة والـtokens الدلالية، وكيضمن تماسك الموسيقى وتطابقها مع الكلمات. وخبير NAR كيستعمل الانتباه ثنائي الاتجاه باش يتنبأ بـ acoustic latent عبر flow matching (25 Hz × 64)، وكيضمن جودة الصوت. الخبيران كيتشاركو طبقات الانتباه الذاتي المختلط وFFN، وكيعالجو التخطيط والتصيير داخل checkpoint واحد.
مسار توليد صوتي مبني على VAE: الـacoustic latent اللي كيخرّجو خبير NAR كيرجعو Decoder ديال VAE لصوت ستيريو بجودة 48 kHz، بلا خسارة ناتجة عن التكميم فالمسار كامل. فالتدريب، كيبني موديل أوفلاين الأهداف: SheetSage2 كيستخرج هدف النوتة من الصوت، وMERT2+CVQ كيولّد هدف الـsemantic tokens، وEncoder ديال VAE كيولّد هدف الـlatent.
ثلاثة أنماط بنفس الأوزان: الإبداع، وإعادة الغناء، والتعديل كيتقاسمو نفس generation checkpoint. الفرق الوحيد هو مصدر النوتة: كيولّدها الموديل، ولا كيحوّلها SheetSage2، ولا كيعدّلها الإنسان أو Agent. فإعادة الغناء، كيتستعمل نمط “اللحن فقط” باش المصاحبة تتكيّف بحرية مع الستايل الجديد.
واجهة API للاستدلال على مراحل: عملية الاستدلال مقسّمة لأربع مراحل: plan() → generate_semantic() → synthesize() → decode(). النوتة والـsemantic tokens والـacoustic latent ومعطيات التوليد كاملين كيتحفظو فالديسك. يقدر المستخدم يتدخل فحتى مرحلة: يصدّر النوتة ويعدّلها ومن بعد يعاود التصيير، ولا يعاود يستعمل plan سبق تولّد ويبدّل غير Decoder، مع الحفاظ على المرونة وقابلية إعادة الإنتاج.
04كيفاش تستعمل YuE2؟
تحضير البيئة: خاص نظام Linux وPython 3.12، وكارت NVIDIA GPU كتدعم BF16. أوزان الموديل كتهبط أوتوماتيكياً من Hugging Face فأول تشغيل.
التثبيت والنشر: من بعد ما تدير git clone للمستودع وتنشئ بيئة افتراضية، نفّذ pip install . باش يكمل التثبيت.
توليد أول أغنية بسرعة: شغّل python examples/generate.py --output outputs/first-song باش تولّد أغنية من المثال المدمج. مجلد الإخراج فيه الصوت (flac) والنوتة وجميع النتائج الوسيطة.
استعمال Python API: حمّل المسار عبر YuE2Pipeline.from_pretrained("m-a-p/YuE2-3B")، ودوز الستايل والكلمات باش تولّد الأغنية. معامل cot كيتحكم فالنمط: "full" كيولّد نوتة قابلة للتعديل (الافتراضي)، و"melody" كيخطط غير للحن، و"off" كيولّد مباشرة.
إعادة غناء أغنية: استعمل أولاً SheetSage2 باش تحوّل تسجيل الأغنية الأصلية لنوتة ABC ديال اللحن، ومن بعد مرّر كلمات جديدة ولا ستايل مستهدف مع cot="melody" باش تعاود التوليد.
تعديل عمل موجود: عيّط لـpipe.plan() وصدّر النوتة، وعدّل ملف ABC يدوياً ولا خلّي Agent يعدّلو، ومن بعد عاود التصيير باستعمال --abc-file edited.abc --cot full.
استعمال Agent skill: دخّل skills/yue2-music/ من المستودع لأي Agent كيدعم SKILL.md، وغادي تقدر عبر الحوار الطبيعي تكتب الأغاني، وتحول الصوت لنوتة، وتعدّل النوتات، وتقارن بين النسخ.
05المزايا الأساسية ديال YuE2
جودة كتقارن مع الموديلات التجارية: فـWildSongBench وصل SongBench Avg لـ6.9632 (best-of-8)، وتفوّق على منتجات تجارية بحال Suno v5 وMureka 9، ورفع سقف توليد الموسيقى مفتوحة المصدر.
إبداع واضح وقابل للتحكم: أول مسار مبني على “التخطيط الرمزي”، بحيث اللحن والأكوردات كيبانو بوضوح فشكل نوتة ABC، والإنسان وAgent بجوج يقدرو يقراو العمل ويعدّلوه قبل التصيير.
ثلاثة أنماط بنفس الأوزان: الإبداع، وإعادة الغناء بلا عينات، والتعديل الحواري كيتقاسمو نفس checkpoint. وإعادة الغناء كتخدم بلا fine-tuning خاص، وكتوصل لدرجة الحفاظ على الأغنية الأصلية قدرها 0.647 CLEWS mAP.
مفتوح المصدر ومحلي بالكامل: الكود تابع لـApache 2.0، والأوزان 3.6B متاحة للتحميل، وكارت وحدة بذاكرة 24GB كتقدر تشغلو أوفلاين، والبيانات ما كتخرجش من الجهاز.
منظومة متكاملة: مفتوحين فالنفس الوقت SheetSage2 لتحويل الصوت لنوتة، وموديل MERT2 للفهم، ومجموعة تقييم WildSongBench، وAgent skill ديال yue2-music، وهاد الشي كيغطي السلسلة كاملة من “التحويل لنوتة → الإبداع → التعديل → التقييم”.
التدخل على مراحل: API من أربع مراحل plan() → generate_semantic() → synthesize() → decode()، مع حفظ النوتة والـsemantic token والـlatent كاملين فالديسك، ودعم إعادة استعمال الخطة وتبديل Decoder فوسط العملية.
06فين تلقى مشروع YuE2؟
الموقع الرسمي: https://map-yue2.github.io/
مستودع GitHub: https://github.com/multimodal-art-projection/YuE
07فين يقدر يتستعمل YuE2؟
الإبداع الموسيقي الشخصي: حتى اللي ما كيعرفش يألف ولا يوزّع يقدر يدخل الكلمات والستايل ويخرج أغنية، ويعدّل اتجاه اللحن بدقة عبر تغيير النوتة، ويحوّل “الإلهام” لعمل كامل.
إعادة الغناء والإبداع الثانوي: استعمل SheetSage2 لتحويل الأغنية الأصلية لنوتة، ومن بعد بدّلها بنقرة لستايل جديد بحال الجاز ولا الروك، ولا عوّض الكلمات باش تدير نسخة بلغات متعددة، بما يناسب إبداعات المعجبين وتعديلات الفيديوهات القصيرة.
Demo ديال موسيقى الأفلام والألعاب والإعلانات: يقدر المنتج يولّد بسرعة موسيقى مرشحة بالصوت أو غير بالمصاحبة، ويجرّب بتكلفة قليلة قبل ما يقرر واش يعيّن موسيقي محترف، وبهذا كيقلّص بزاف تكلفة التواصل فالمرحلة الأولى.
التعليم الموسيقي وتحليل الهارموني: الأستاذ يقدر يولّد أمثلة موسيقية فيها أكوردات وبنيات موسيقية محددة، والطالب يقدر يقارنها مع نوتة ABC ويتعلّم تقنيات التأليف، باش يتحقق مسار تعليمي “مسموع، ومرئي، وقابل للتعديل”.
© إخلاء المسؤولية: النطاقات والمحتوى المرتبط يقدرو يتبدلو مع الوقت. AIEZZ ما كيتحكمش فالمواقع التابعة لجهات أخرى. راجع المحتوى الخارجي والمخاطر بشكل مستقل.


تقييمات المستخدمين0