মূল কনটেন্টে যান
এআই টিউটোরিয়াল

শূন্য থেকে AI লোলি ভয়েস মডেল প্রশিক্ষণের সম্পূর্ণ টিউটোরিয়াল

RVC ওপেন-সোর্স প্রকল্প ব্যবহার করে নিজের লোলি ভয়েস মডেল প্রশিক্ষণ করুন

শূন্য থেকে AI লোলি ভয়েস মডেল প্রশিক্ষণের সম্পূর্ণ টিউটোরিয়াল


01 প্রথমেই উপসংহারআমি RVC ওপেন-সোর্স প্রকল্প ব্যবহার করে কয়েক ঘণ্টা ব্যয় করে একটি নিজস্ব লোলি ভয়েস মডেল প্রশিক্ষণ করেছি। ফলাফল পেইড বাণিজ্যিক ভয়েস চেঞ্জারের চেয়ে অনেক ভালো—কণ্ঠ স্বাভাবিক, আবেগপূর্ণ; আমি যে ভঙ্গিতে কথা বলি, এটি সেই ভঙ্গিতেই আউটপুট দেয়।02 RVC-এর মূল কার্যপ্রণালিএক কথায়: **আপনার কণ্ঠকে আপনার পছন্দের টিম্বারে পরিবর্তন করা।**RVC শুধু “টিম্বার” পরিবর্তন করে, “আবেগ” পরিবর্তন করে না। আপনি আনন্দের সঙ্গে বললে এটি আনন্দের সঙ্গেই উত্তর দেবে; আপনি শান্তভাবে বললে এটি শান্তভাবেই উত্তর দেবে। তাই ভালো একটি মডেলের শব্দ স্বাভাবিক ও আবেগপূর্ণ হওয়া উচিত, যান্ত্রিক নয়।প্রশিক্ষণ সূত্র: **আপনার পছন্দের ভয়েস অডিও + RVC প্রশিক্ষণ = আপনার নিজস্ব মডেল**03 প্রথম ধাপ: উপকরণ খোঁজাউপকরণের মানই মডেলের ফলাফল নির্ধারণ করে।

  • একটি লোলি ভয়েস খুঁজুন

  • মানদণ্ড: টিম্বার একরকম, আবেগ বৈচিত্র্যময়, কোনো ব্যাকগ্রাউন্ড শব্দ নেই, 10-20 মিনিট

  • সতর্কতা: পুরো সময়ের নিষ্প্রাণ ফিসফিসে উপকরণ ব্যবহার করবেন না, নইলে মডেলও “আবেগহীন” হবে

04 দ্বিতীয় ধাপ: উপকরণ প্রক্রিয়াকরণAudacity (বিনামূল্যে) দিয়ে করুন:

  1. অডিও ইমপোর্ট করুন

  2. **মোনো**তে রূপান্তর করুন

  3. স্যাম্পলিং রেট **44100 Hz** নিশ্চিত করুন

  4. **WAV ফরম্যাটে** এক্সপোর্ট করুন

ব্যাকগ্রাউন্ড শব্দ বা রিভার্ব থাকলে RVC-এর নিজস্ব “ব্যাকিং ট্র্যাক ও ভোকাল পৃথকীকরণ” ফাংশন ব্যবহার করে `VR-DeEchoNormal` নির্বাচন করে তা কমিয়ে নিন।05 তৃতীয় ধাপ: মডেল প্রশিক্ষণRVC WebUI খুলুন (`go-web.bat`-এ ডাবল-ক্লিক করুন) → “প্রশিক্ষণ” ট্যাবে প্রবেশ করুন| গুরুত্বপূর্ণ প্যারামিটার | প্রস্তাবিত মান ||---------|--------|| পরীক্ষার নাম | ইংরেজিতে, যেমন `my_loli_v1` || সংস্করণ | `v2` || পিচ অ্যালগরিদম | `rmvpe` || মোট প্রশিক্ষণ রাউন্ড | `200-300` || batch_size | `8` |সেটিং সম্পন্ন হলে **`এক ক্লিকে প্রশিক্ষণ`**-এ ক্লিক করুন এবং 1-2 ঘণ্টা অপেক্ষা করুন। প্রতি 50 রাউন্ডে স্বয়ংক্রিয়ভাবে একটি মডেল সংরক্ষিত হবে।06 চতুর্থ ধাপ: ফলাফল শোনা“মডেল ইনফারেন্স” ট্যাবে প্রবেশ করুন:

  1. ভয়েস তালিকা রিফ্রেশ করে আপনার মডেল নির্বাচন করুন

  2. নিজের রেকর্ড করা অডিও আপলোড করুন

  3. পিচ পরিবর্তন: পুরুষ কণ্ঠ থেকে নারী কণ্ঠে রূপান্তরের জন্য `+12`, নারী কণ্ঠ থেকে নারী কণ্ঠে `0` লিখুন

  4. `rmvpe` নির্বাচন করুন

  5. “রূপান্তর” এ ক্লিক করুন

সন্তুষ্ট না হলে অন্য রাউন্ডের মডেল দিয়ে চেষ্টা করুন, অথবা “অরক্ষিত নরম ব্যঞ্জনধ্বনি” প্যারামিটার সামঞ্জস্য করুন।07 পঞ্চম ধাপ: লাইভস্ট্রিমে ভয়েস পরিবর্তন`go-realtime-gui.bat`-এ ডাবল-ক্লিক করুন:

  1. আপনার `.pth` মডেল লোড করুন (`.index` খালি রাখুন, রিট্রিভাল অনুপাত `0` করুন)

  2. ইনপুট ডিভাইস হিসেবে মাইক্রোফোন এবং আউটপুট হিসেবে ভার্চুয়াল অডিও কেবল নির্বাচন করুন

  3. পিচ পরিবর্তনে `+12` লিখুন (পুরুষ থেকে নারী), `rmvpe` নির্বাচন করুন

  4. “অডিও রূপান্তর শুরু করুন”-এ ক্লিক করুন

এরপর OBS-এ মাইক্রোফোন হিসেবে ভার্চুয়াল অডিও কেবল সেট করলেই হবে।08 সাধারণ সমস্যা

  • কণ্ঠ শক্ত, আবেগহীন? → উপকরণের সমস্যা; আবেগে সমৃদ্ধ অন্য উপকরণ নিয়ে পুনরায় প্রশিক্ষণ দিন

  • নিজে প্রশিক্ষণ দেওয়া মডেল পেইড মডেলের চেয়ে ভালো কেন? → বাণিজ্যিক সফটওয়্যার তাদের ইকোসিস্টেমে আপনাকে আটকে রাখে; আপনি শুধু তাদের নির্দিষ্ট মডেল কিনতে পারেন। RVC সম্পূর্ণ আপনার নিয়ন্ত্রণে

  • কী ধরনের কনফিগারেশন প্রয়োজন? → 4GB বা তার বেশি VRAM-সহ N কার্ড, 16GB RAM

09 শেষে“কঠিন মডেল কিনতে টাকা খরচ করা” থেকে “নিজে উচ্চমানের মডেল প্রশিক্ষণ করা”—এর মধ্যে আসলে শুধু একটি টিউটোরিয়ালের ব্যবধান। এখন আপনার কাছে শুধু একাধিক মডেল নয়, **যেকোনো কণ্ঠ তৈরি করার ক্ষমতাও** রয়েছে।

#এআই ডিজাইন#মুক্ত উৎস