- ماہانہ وزٹس
- 0
- قیمتیں
- مفت اور ادائیگی
- فہرست میں شامل
- 2026-08-12
- اپ ڈیٹ شدہ
- 2026-08-12
01IndexTTS-2.5 کیا ہے؟
IndexTTS-2.5، Bilibili کا اوپن سورس صنعتی معیار کا زیرو شاٹ وائس کلوننگ ماڈل ہے، جس کے پیرامیٹرز کی تعداد صرف 0.8B ہے۔ یہ چینی، انگریزی، جاپانی، ہسپانوی اور عربی، یعنی پانچ زبانوں کے درمیان کراس لِنگوئل منتقلی کو سپورٹ کرتا ہے۔ ماڈل نے inference architecture کو ازسرنو ترتیب دیا ہے، جس سے inference کی رفتار 2.28 گنا بڑھ گئی ہے۔ یہ 0.5x سے 2.0x تک رفتار کی ایڈجسٹمنٹ کے ساتھ تلفظ اور جذبات سمیت باریک کنٹرول بھی فراہم کرتا ہے۔ مکمل کوڈ، ماڈل weights اور تحقیقی مقالہ جاری کیے جا چکے ہیں، اور یہ Bilibili Model License کے تحت دستیاب ہے۔
02IndexTTS-2.5 کی اہم خصوصیات
زیرو شاٹ وائس کلوننگ: صرف 3 سے 10 سیکنڈ کی reference audio کے ذریعے کسی بھی بولنے والے کی آواز کی خصوصیات کو درست طور پر نقل کیا جا سکتا ہے، اور ہدف بولنے والے کے لیے اضافی training کی ضرورت نہیں ہوتی۔
پانچ زبانوں کی کراس لِنگوئل سپورٹ: چینی، انگریزی، جاپانی، ہسپانوی اور عربی کو سپورٹ کرتا ہے۔
باریک جذباتی کنٹرول: جذبات کو ایڈجسٹ کرنے کے متعدد طریقے فراہم کرتا ہے: الگ emotional reference audio کے ذریعے جذبات منتقل کرنا، آٹھ جہتی emotional vector سے جذبات کی شدت متعین کرنا، متن پر مبنی خودکار emotional inference فعال کرنا، اور emo_alpha پیرامیٹر سے جذبات کی شدت ایڈجسٹ کرنا۔
آواز اور جذبات کی علیحدگی: voice prompt audio اور emotion prompt audio کو مکمل طور پر الگ الگ متعین کیا جا سکتا ہے۔ صارف یہ کنٹرول کر سکتا ہے کہ ”کون بول رہا ہے“ اور ”کس انداز میں بول رہا ہے“۔
رفتار میں مسلسل ایڈجسٹمنٹ: duration_factor پیرامیٹر کے ذریعے synthesized speech کی رفتار کو 0.5 گنا سے 2.0 گنا تک آزادانہ طور پر ایڈجسٹ کیا جا سکتا ہے، تاکہ مختلف حالات کی rhythm کی ضروریات پوری ہوں۔
درست تلفظی مداخلت: چینی Pinyin، انگریزی CMU phonemes اور جاپانی Kana کی تین سطحوں پر تلفظ کنٹرول فراہم کرتا ہے، جس سے کثیرالتلفظ حروف، مختلف قرأت والے الفاظ اور سیاق پر منحصر تلفظ کے مسائل مؤثر طور پر حل ہوتے ہیں۔
03IndexTTS-2.5 کا تکنیکی اصول
WeChat پر فالو کریں اور ”开源“ کا جواب دے کر AI اوپن سورس پروجیکٹ کمیونٹی میں شامل ہوں
تین مرحلوں پر مشتمل generation pipeline: ماڈل ”متن → semantic Token → Mel-spectrogram → waveform“ کے تین مرحلوں پر مبنی architecture استعمال کرتا ہے۔ Transformer پر مبنی text-to-semantic (T2S) language model semantic Token تیار کرتا ہے، non-autoregressive semantic-to-Mel-spectrogram (S2M) flow-matching module کے ذریعے Mel-spectrogram تیار ہوتا ہے، اور آخر میں neural vocoder اسے حتمی audio میں تبدیل کرتا ہے۔
Semantic codec compression: semantic Token کے frame rate کو 50Hz سے کم کر کے 25Hz کیا جاتا ہے، جس سے sequence length براہِ راست آدھی ہو جاتی ہے۔ اس طرح training اور inference کے دوران T2S module کی computational cost اور memory usage نمایاں طور پر کم ہوتی ہے، جو inference acceleration کی ایک اہم وجہ ہے۔
Zipformer architecture upgrade: S2M module کے backbone network کو U-DiT سے زیادہ مؤثر Zipformer architecture میں تبدیل کیا گیا ہے۔ Zipformer کم پیرامیٹرز کے ساتھ طویل مدتی dependencies کو زیادہ مضبوطی سے model کرتا ہے، جس سے Mel-spectrogram generation تیز اور مستحکم ہوتی ہے، جبکہ synthesized audio کا معیار برقرار رہتا ہے۔
Cross-lingual modeling strategy: کثیر لسانی حالات میں حروف کے overlap سے پیدا ہونے والی الجھن کے لیے ٹیم نے تین strategies پیش کی ہیں: boundary-aware alignment (متن کے شروع اور آخر میں زبان کے markers شامل کرنا، جیسے )، Token-level concatenation (ہر input Token کے ساتھ زبان کے مخصوص embedding کو ملانا)، اور instruction-guided generation (متن کے شروع میں قدرتی زبان کی instruction prefix شامل کرنا، جیسے ”براہِ کرم انگریزی میں پڑھیں“)۔
GRPO reinforcement learning optimization: T2S module کے post-training مرحلے میں GRPO (Group Relative Policy Optimization) شامل کیا گیا ہے۔ منجمد ASR model کی word error rate (WER) کو reward signal کے طور پر استعمال کیا جاتا ہے، ہر بار چار candidate samples تیار کیے جاتے ہیں، اور زیادہ reward والے samples کی relative likelihood کو optimize کر کے تلفظ کی درستگی اور آواز کی فطری روانی میں مسلسل بہتری لائی جاتی ہے۔
04IndexTTS-2.5 استعمال کرنے کا طریقہ
ماحول کی تیاری: پہلے Git اور uv package manager انسٹال کریں، پھر git clone https://github.com/index-tts/index-tts.git کے ذریعے official code repository مقامی کمپیوٹر پر ڈاؤن لوڈ کریں۔
Dependencies کی تنصیب: project directory میں داخل ہو کر uv sync --all-extras کمانڈ چلائیں، جو خودکار طور پر virtual environment بنائے گی اور تمام ضروری Python dependencies انسٹال کرے گی۔
ماڈل ڈاؤن لوڈ: huggingface-cli یا modelscope tool کے ذریعے official repository IndexTeam/IndexTTS-2.5 سے model weights کو مقامی checkpoints directory میں ڈاؤن لوڈ کریں۔
Web interface شروع کرنا: Gradio interactive interface شروع کرنے کے لیے uv run webui.py چلائیں، پھر browser میں http://127.0.0.1:7860 کھول کر visual speech synthesis انجام دیں۔
ماڈل لوڈ کرنا: Python script میں indextts.infer_v2_5 سے IndexTTS2 class import کریں، پھر configuration file کا path اور model directory فراہم کر کے model instance بنائیں۔
بنیادی voice cloning: instance کے infer method کو reference audio path، target text اور language code کے ساتھ call کریں، جس سے cloned voice والی audio file تیار اور محفوظ کی جا سکتی ہے۔
جذباتی کنٹرول: infer method میں emo_audio_prompt پیرامیٹر کے ذریعے emotional reference audio متعین کریں، یا synthesized speech کے جذباتی اظہار کو کنٹرول کرنے کے لیے emo_vector میں آٹھ جہتی emotional vector فراہم کریں۔
رفتار کی ایڈجسٹمنٹ: inference کے وقت duration_factor پیرامیٹر کو 0.5 سے 2.0 کے درمیان کسی قدر پر set کریں، جس سے synthesized speech کی رفتار متناسب طور پر تیز یا سست ہو جائے گی۔
تلفظی مداخلت: کثیرالتلفظ حروف یا مختلف قرأت والے الفاظ کے تلفظ کو درست طور پر کنٹرول کرنے کے لیے input text میں <行|XING2>، یا <上手|じょうず> جیسے annotations شامل کریں۔
05IndexTTS-2.5 کے بنیادی فوائد
کم پیرامیٹرز، اعلیٰ کارکردگی: ماڈل میں صرف 0.8B پیرامیٹرز ہیں۔ semantic codec compression اور Zipformer architecture upgrade کے ذریعے inference میں 2.28 گنا تیزی حاصل ہوتی ہے، جبکہ BF16 precision میں real-time factor (RTF) کم از کم 0.20 تک پہنچتا ہے، یوں ہلکا پن اور اعلیٰ کارکردگی دونوں برقرار رہتے ہیں۔
پانچ زبانوں کے درمیان کراس لِنگوئل منتقلی: چینی، انگریزی، جاپانی، ہسپانوی اور عربی کو سپورٹ کرتا ہے۔ صارف کسی بھی زبان کی reference audio سے دوسری زبان میں آواز clone کر سکتا ہے، اور target language کے emotional training data کے بغیر بھی جذبات کی کراس لِنگوئل منتقلی ممکن ہے۔
کثیر جہتی باریک کنٹرول: ماڈل 0.5x سے 2.0x تک مسلسل رفتار ایڈجسٹمنٹ، آٹھ جہتی emotional vector control، متن پر مبنی emotional inference، اور Pinyin، CMU phonemes اور Japanese Kana کی تین سطحوں پر تلفظی مداخلت کو سپورٹ کرتا ہے، جس سے content creation میں speech synthesis کو باریک انداز میں ایڈجسٹ کیا جا سکتا ہے۔
آواز اور جذبات کی مکمل علیحدگی: صارف voice prompt audio اور emotion prompt audio کو الگ الگ متعین کر سکتا ہے۔ یہ دونوں مختلف زبانوں سے بھی ہو سکتے ہیں، اس طرح target speaker کی آواز برقرار رکھتے ہوئے مطلوبہ جذباتی انداز شامل کیا جا سکتا ہے۔
عربی کے لیے اوپن سورس سپورٹ: بڑے اوپن سورس TTS models میں IndexTTS-2.5 ان چند models میں شامل ہے جو عربی voice cloning اور کراس لِنگوئل منتقلی کو مکمل طور پر سپورٹ کرتے ہیں، یوں اوپن سورس speech synthesis کے میدان میں عربی کے خلا کو پُر کرتا ہے۔
06IndexTTS-2.5 کا پروجیکٹ لنک
GitHub repository: https://github.com/index-tts/index-tts
arXiv تحقیقی مقالہ: https://arxiv.org/pdf/2601.03888
07IndexTTS-2.5 کے استعمال کے منظرنامے
AI dubbing اور audio content generation: content creators صرف کسی host یا کردار کی reference audio فراہم کر کے کثیر لسانی اور مختلف جذباتی انداز کی audio books، radio dramas اور podcasts تیزی سے تیار کر سکتے ہیں، اور بار بار recording کی ضرورت نہیں رہتی۔
کراس لِنگوئل video localization: فلم اور short-video teams چینی reference audio سے براہِ راست انگریزی، جاپانی، ہسپانوی یا عربی dubbing تیار کر سکتی ہیں، اصل اداکار کی آواز برقرار رکھتے ہوئے بیرونِ ملک distribution کی لاگت نمایاں طور پر کم کر سکتی ہیں۔
گیمز اور virtual characters کی آوازیں: game developers NPCs یا virtual idols کے لیے مخصوص آواز clone کر سکتے ہیں، emotional vectors کے ذریعے خوشی، غصے، غم اور مسرت کے درمیان real time میں تبدیلی لا سکتے ہیں، اور dynamic story voices و live-stream interaction ممکن بنا سکتے ہیں۔
real-time voice interaction اور digital humans: 0.20 کے انتہائی کم real-time factor کی بدولت IndexTTS-2.5 کو intelligent customer service، digital human live streaming اور real-time translation میں deploy کیا جا سکتا ہے، جہاں کم تاخیر والی personalized voice replies فراہم کی جاتی ہیں۔
تعلیم اور زبان سیکھنا: تعلیمی ادارے pronunciation control feature کے ذریعے معیاری Pinyin، CMU phonemes یا Japanese Kana کی demonstration audio تیار کر سکتے ہیں، اور اساتذہ کی آواز clone کر کے کثیر لسانی synchronized courses بنا سکتے ہیں۔
© دستبرداری: ڈومینز اور لنک شدہ مواد وقت کے ساتھ تبدیل ہو سکتے ہیں۔ AIEZZ فریقِ ثالث کی ویب سائٹس کو کنٹرول نہیں کرتا۔ بیرونی مواد اور خطرات کا آزادانہ جائزہ لیں۔


صارف کے جائزے0