شنو هو anything2explainer؟
anything2explainer هي مهارة لـ Claude Code وCodex كتحوّل موضوع، مقال، ولا وثيقة لفيديو شارح بالموشن غرافيك ومرفوق بالتعليق الصوتي. كاتجمع البحث، كتابة السكريبت، تحويل النص لصوت، الترجمة النصية المضبوطة مع الفريمات، إعداد الستوريبورد، التطوير المتوازي ديال اللقطات، الرندرة، ومراقبة الجودة فمسار عمل واحد وموجّه.
المشروع ماشي تطبيق مستقل كيخدم من سطر الأوامر. بالعكس، كيوفّر لوكيل برمجة بالذكاء الاصطناعي طريقة إنتاج كاملة: قالب Remotion 4 قابل للترجمة، عناصر بصرية بـ React وTypeScript، سكريبتات التعليق الصوتي والرندرة، مواصفات مكتوبة للأسلوب، تعليمات البناء متعدد الوكلاء، أدوات مراقبة الجودة، وفيلم مرجعي.
كل فريم كيتترسم بالكود، ماشي كيتولّد بنموذج فيديو ولا كيتنسخ من لقطات موجودة. الحركات هي دوال صافية مرتبطة برقم الفريم وكتستعمل العشوائية المهيّأة ببذرة، وهاد الشي كيخلي إعادة الرندرة قابلة لإعادة الإنتاج.
شنو كينتج مسار العمل
الخرج الافتراضي هو 1280×720، 30fps، H.264 MP4. المشروع المكتمل يقدر يشمل:
- تعليق صوتي متزامن بالصينية ولا بالإنجليزية.
- ترجمة نصية مضبوطة مع حدود الكلمات.
- بطاقات الفصول وشريط تقدّم الفصول فالأسفل.
- واجهة HUD علوية على شكل كبسولة وسكة اختيارية لمسار العمل.
- مكوّنات Remotion خاصة بكل لقطة.
- وثيقة بحث موثّقة بالمصادر، والتعليق الصوتي، والستوريبورد، وتقارير مراقبة الجودة، وملاحظات التسليم.
النظام البصري كيستعمل خلفية سوداء، ورسم خطي أبيض، ولمسات بنفسجية، وعناوين بارزة، ومعاها إما خلفية ديال النجوم مع الضباب أو موجة ديال النقاط. القالب الحالي موجّه غير للفيديو الأفقي؛ الخرج العمودي 9:16 ما مدعومش.
المدد المدعومة
مدعومة الأفلام اللي كتتراوح بين جوج وثمانية دقايق. فيديو ديال جوج حتى لثلاث دقايق كيستعمل غالباً 24–32 سطر ولا لقطة وكيحتاج تقريباً ساعة. إنتاج بمستوى الفيلم المرجعي، من ثلاث حتى لخمس دقايق، كيستعمل عادة 40–50 لقطة وكيحتاج تقريباً جوج ساعات. الأفلام الأطول، من خمس حتى لثمانية دقايق، تقدر تستعمل 60–80 لقطة وكتحتاج تقريباً من جوج حتى لثلاث ساعات.
هاد التقديرات ديال الوقت الفعلي، وماشي ضمانات. جزء كبير من الخدمة كينفذوه وكلاء البناء بالتوازي.
المتطلبات المسبقة
قبل التثبيت، وجد هاد الحوايج:
- Claude Code ولا Codex.
- Node.js 18 ولا أحدث.
- Python 3.
- FFmpeg لاستخراج الفريمات وتحويل الترميز.
- على الأقل 5 GB ديال المساحة الخاوية ملي كتشغّل بزاف ديال وكلاء البناء فآن واحد.
السكريبتات المرفقة ديال shell كتستعمل zsh وتطوّرات وتجرّبات على macOS. خاص Linux يخدم، ولكن Windows ما تجرّبش. ما كايناش حاجة لـ GPU حيث Remotion كيرندر عبر Chromium بلا واجهة رسومية على المعالج.
ثبّت المهارة
1. نسخ المستودع
git clone https://github.com/Vincentwei1021/anything2explainer.git2. ربطها بوكيل البرمجة ديالك
بالنسبة لـ Claude Code، صايب رابطاً رمزياً فمجلد المهارات ديالو:
ln -s "$PWD/anything2explainer" ~/.claude/skills/anything2explainerبالنسبة لـ Codex، استعمل مجلد مهارات Codex المقابل:
ln -s "$PWD/anything2explainer" ~/.codex/skills/anything2explainer3. تثبيت تبعيات النظام وPython
على macOS، ثبّت FFmpeg باستعمال Homebrew:
brew install ffmpegصايب بيئة مخصّصة لـ Python وثبّت التبعيات المشتركة:
python3 -m venv ~/.venvs/a2e
source ~/.venvs/a2e/bin/activate
pip install 'edge-tts==7.2.8' numpy pillow scipyالـ README كيثبّت edge-tts فالنسخة 7.2.8 حيث كيعتمد على نقطة نهاية ديال Microsoft وقد يوقع ليه مشكل مع التحديثات. الحزمة scipy مطلوبة غير من طرف سكريبت مراقبة الجودة الكمية، frame_metrics.py.
4. إضافة تبعيات التعليق الصوتي بالإنجليزية
التعليق الصوتي بالإنجليزية كيعتمد افتراضياً على النموذج المحلي kokoro-82m مع الصوت am_liam. ثبّت المتطلبات الإضافية إلا كنت ناوي تنتج فيديوهات بالإنجليزية:
pip install kokoro soundfile
brew install espeak-ngالتعليق الصوتي بالصينية كيعتمد افتراضياً على صوت edge-tts السحابي zh-CN-YunxiNeural.
صايب فيديو بـ Claude Code ولا Codex
أسهل طريقة هي توصف الفيلم اللي بغيتي باللغة الطبيعية. المهارة خاصها تفعّل راسها ملي تكون متاحة للوكيل.
صايب ليا فيديو شارح على قواعد البيانات المتجهية.
وتقدر حتى تدير الطلب بالصينية:
讲一下向量数据库,做成一条讲解视频
المدخل ديالك يقدر يكون موضوع عام ولا مقال ولا وثيقة موجودة من قبل. وغادي تختار حتى المدة واللغة المستهدفة.
فهم مراحل الإنتاج التسعة
- التهيئة: الوكيل كينسخ قالب Remotion فمشروع جديد.
- البحث: وكيل البحث كيحضّر وثيقة موثقة بالمصادر، فيها أرقام مفيدة وتشبيهات مع الروابط.
- التعليق الصوتي والخط الزمني: الوكيل كيكتب السكريبت، وكيولّد ولا كيستورد التعليق الصوتي، وكيحوّل حدود الكلمات لخط زمني مضبوط مع الفريمات وجدول الترجمة النصية.
- الستوريبورد: كل لقطة كتحصل على نطاق الفريمات، والنبضة السردية، والخطة البصرية، واتجاه الحركة، والعنصر الرئيسي، وخطة الإضاءة.
- الطبقات والعناصر الأساسية: المشروع كيضيف العنوان ديالو، وبطاقات الفصول، وHUD، وسكة مسار العمل، ومن جوج حتى لخمس أيقونات خاصة بالموضوع.
- التجربة الأولية: وكيل واحد كيبني أول مجموعة ديال اللقطات وكيرندر معاينة ديال 30 ثانية.
- البناء المتوازي: وكلاء إضافيين كيبنيو المجموعات الباقية، وكيهتم كل واحد منهم غالباً بخمس حتى لسبع لقطات.
- الرندرة: الفيلم كامل كيرندر وكيتحلل باستعمال مقاييس كمية للفريمات.
- مراقبة الجودة والإصلاحات: وكلاء مراقبة الجودة كيراجعو الفصول، ووكلاء الإصلاح كيعالجو المشاكل، ومن بعد كيتعاود التحقق من المشروع قبل التسليم.
استعمل نقاط المراجعة الأربعة
هاد الـworkflow كيوقف عن قصد 4 مرات باش تقدر تاخذ قرارات مهمّة قبل ما تولّي التغييرات مكلفة.
نقطة المراقبة 1: المدة واللغة
ختار مدة الفيلم يا إمّا الصينية ولا الإنجليزية قبل ما يبدا كتابة السكريبت. المدة كتأثر على التغطية، حجم التعليق الصوتي، عدد اللقطات، استعمال القرص، وعدد الـagents اللي خدامين بالتوازي. اللغة كتبدّل الطباعة، الميزانية ديال الترجمة، الإيقاع، والصوت الافتراضي عبر lang فـ src/config.ts.
نقطة المراقبة 2: الموافقة على التعليق الصوتي
راجع التعليق الصوتي كامل قبل توليد الصوت. منين كيتثبت الـvoiceover، كيتدمجو أرقام الإطارات فاللقطات الفردية. تبديل حتى كلمة وحدة يقدر يفرض إعادة توقيت الفيلم كامل، وهاد الشي كيخلي هادي أكثر مرحلة اقتصادية للمراجعات التحريرية.
نقطة المراقبة 3: اختيار الصوت
ختار الصوت الافتراضي، ولا محرّك TTS آخر، ولا التسجيل النهائي ديالك. إلا ما حددتيش بديل، فالـpipeline كيستعمل edge-tts Yunxi للصينية وkokoro-82m Liam للإنجليزية.
نقطة المراقبة 4: أول 30 ثانية
راجع الـpilot render قبل ما يتبناو مجموعات اللقطات الباقية. تصحيح التوجيه البصري فهاد المرحلة كيأثر غير على المجموعة الأولى؛ أما إلا تصلّح من بعد الـrender الكامل، فقد يتطلب تغييرات فكل مجموعة.
سَيّر القالب يدوياً
تقدر تستعمل السكريبتات المرفقة مباشرة ملي تبغي تحكم أكثر فعملية الإنتاج. صايب مشروع من القالب ودخل للمجلد ديالو:
template/scripts/new_project.sh ~/work/my-video myslug
cd ~/work/my-videoومن بعد تبع التسلسل اليدوي:
- كتب ملف البحث فـ
research/调研.md. - صايب
script/narration.txtوولّد الـtimeline ديال الـvoiceover. - كتب
script/storyboard_src.mdورَيّدر الـstoryboard. - بدّل اللغة، الخلفية، والإعدادات المرتبطة بها فـ
src/config.ts. - طبّق مجموعات اللقطات تحت
src/shots/G1حتىsrc/shots/Gn. - رَيّدر المعاينة الافتتاحية.
- رَيّدر فيديو نهائي بنسخة محددة وشغّل مقاييس الإطارات.
- راجع، صلّح، ورَيّدر نسخ لاحقة بحال v2 ولا v3.
python3 scripts/tts_build.py
python3 scripts/render_storyboard.py
scripts/preview.sh 30
VER=v1 scripts/render.sh
python3 scripts/frame_metrics.pyخصّص اللغة والخلفية
الإعدادات الرئيسية ديال المشروع كاينة فـ src/config.ts. عيّن lang لـ 'zh' ولا 'en'. الصينية كتستعمل ميزانية ترجمة ديال 16 حرف فكل بلوك، بينما الإنجليزية كتستعمل 48 حرف فكل بلوك.
مفتاح الخلفية المدعوم هو:
bg: 'stars' | 'dots'اختيار النجوم كيجمع بين حقل ديال النجوم وتدرّج ضبابي. اختيار النقط كيستعمل موجة ديال حقل النقط. المشروع كيوفّر عن قصد لغة بصرية وحدة بهاد جوج اختيارات ديال الخلفية.
إلى بغيتي تغييرات بصرية أوسع، عدّل reference/style-guide.md وsrc/ui.tsx. مكوّنات اللقطات كتعتمد على الـprimitives المشتركة، وهاد الشي كيخلي تبديل التعريفات المركزية أفضل من تنسيق كل لقطة بوحدها.
استعمل الـVoiceover ديالك
ماشي محدود بالافتراضيات المدمجة ديال TTS. حط الصوت النهائي فـ:
public/assets/<slug>/audio.wavومن بعد عمّر src/common/timeline.ts وsubs.ts يدوياً. الصيغة المطلوبة موثقة فالأعلى ديال tts_build.py. منين كتكون بيانات الـtimeline والترجمة موجودة، كيبقاو مراحل الـstoryboard، بناء اللقطات، الـrender، وQC بلا تغيير.
نصائح متقدمة للإنتاج
وافق على الكلمات قبل ما تزيّن الصور
اعتبر الموافقة على التعليق الصوتي قفلاً نهائياً. حيث إن اللقطات كتستعمل نطاقات إطارات ثابتة، فالتعديلات المتأخرة فالسكريبت كتكون أكثر إزعاجاً من التصحيحات البصرية العادية.
استعمل الـpilot كاختبار للأسلوب
تفقد الطباعة، التكوين، سرعة الحركة، الإضاءة، قابلية قراءة الترجمة، والخلفية خلال أول مراجعة ديال 30 ثانية. ما توافقش على الـpilot غير حيث تدار الـrender بنجاح.
كبّر العمل الموازي بحذر
الأفلام الطويلة تقدر تستعمل 10–14 agents للبناء. عدة agents يقدرو يديرو bundle لـRemotion فـنفس الوقت، وهاد الشي كيزيد فالتخزين والضغط على النظام. خلي على الأقل 5 GB خاوية ووزّع الـagents على دفعات ملي تقرب للحد الأقصى ديال نوافذ tmux اللي موصوف فالمشروع.
حافظ على تتبّع المصادر
كل رقم، عام، منظمة، ومصطلح بالإنجليزية كيبان فالشاشة خاصو يكون مربوط برابط URL فوثيقة البحث. الادعاءات اللي ما متحققاش خاصها تبقى خارج التعليق الصوتي والصور بجوج.
استعمل الـrenders بنسخ محددة
عيّن VER=v1، راجع المقاييس وملاحظات QC على مستوى الفصول، ومن بعد صايب نسخ مصححة بحال v2 ولا v3. هاد الشي كيحافظ على تاريخ مراجعة واضح بلا ما يكتب فوق الإخراج القديم.
درس المواد المرجعية
المجلد examples/rag/ فيه المسار الإنتاجي للفيلم المرجعي، بما فيه البحث، التعليق الصوتي، الـstoryboard، مصدر اللقطات، التقارير، وملاحظات التسليم. والمجلد examples/contrast/ فيه 6 أزواج ديال الإطارات السيئة مقابل الجيدة لتقييم التكوين والإضاءة.
المجلد reference/ كيوثق حتى المناطق الآمنة، لوحات الألوان، الخطوط، صيغ الحركة، قواعد الإضاءة، معايير الـstoryboard، بروتوكولات الـagents، قوالب الـprompts، والدروس المستفادة من الأفلام السابقة.
قيود وترخيص مهمّان
- اللغات المدعومة هي الصينية والإنجليزية.
- القالب كيفترض فيديو أفقي بمقاس 1280×720، وما كيدعمش حالياً الإخراج بمقاس 9:16.
- ما متصممش للعروض اللي فيها متحدث كيهضر قدّام الكاميرا، ولا للإنتاجات اللي فيها تصوير حي فالغالب، ولا لإعادة إنتاج فيديو موجود.
- لقطات التصوير الحي الاختيارية خاصها تكون من مصادر خالية من حقوق الملكية، وخاص يتسجلو فملف manifest فيه رابط المصدر، والرخصة، وبصمة SHA-256، وطريقة الاستعمال.
- الأدوات كتستعمل رخصة PolyForm Noncommercial 1.0.0. الاستعمال غير التجاري مجاني، أما الاستعمال التجاري فكيحتاج ترخيص مسبق من المؤلف.
- الفيديوهات اللي كتدار بهاد الأدوات كيبقاو ملك للمبدعين ديالها.
- الخطوط المرفقة وRemotion عندهم شروط الترخيص الخاصة بهم.
راجع صفحة المشروع وملفات الرخصة فالمستودع قبل الإنتاج أو التوزيع، خصوصاً فالأعمال التجارية.
الخلاصة
anything2explainer كيوفر أكثر من قالب لفيديو: كيعطي Claude Code أو Codex نظام إنتاج منظم كيحوّل المواد اللي تم البحث عليها لأنيميشن Remotion محدد النتائج. بدا بموضوع مركز، وخد قرارات مدروسة فـنقاط المراجعة الأربعة، ووافق على التعليق الصوتي قبل TTS، وتحقق من النسخة التجريبية ديال 30 ثانية، واستعمل الإخراج بإصدارات مراقبة الجودة الكمية باش تحسن الفيلم النهائي.
