مرکزی مواد پر جائیں

تمام اے آئی ٹولز

AI اسپیچ ریکگنیشن

یہاں AI اسپیچ ریکگنیشن کے مقبول پروڈکٹس جمع ہیں، جو تخلیق، پروسیسنگ اور کارکردگی بڑھانے جیسے عام استعمالات کا احاطہ کرتے ہیں۔

Spark-ASR-2.0AI اسپیچ ریکگنیشنSpark-ASR-2.0، iFlytek کا Spark-Audio اسپیچ فاؤنڈیشن ماڈل پر مبنی جدید ترین نسل کا اسپیچ ریکگنیشن ماڈل ہے۔ یہ ماڈل ’نان آٹو ریگریسو + LLM سے增强 شدہ آٹو ریگریسو‘ اشتراکی معماری استعمال کرتا ہے اور چینی و انگریزی کے مرکب، بولیوں، پیشہ ورانہ...00Qwen-Audio-3.1AI اسپیچ ریکگنیشنQwen-Audio-3.1، ٹونگ‌یی چیان‌وین کی جانب سے پیش کردہ بڑے صوتی ماڈلز کا سلسلہ ہے، جس میں پانچ ماڈلز شامل ہیں: ASR صوتی شناخت، ASR-Next آڈیو فہم، TTS صوتی ترکیب، TTS-Next آڈیو تخلیق، اور Realtime حقیقی وقت میں تعامل،...00Xiaomi-CocktailASR-1AI اسپیچ ریکگنیشنXiaomi-CocktailASR-1 ژیاؤمی کا اوپن سورس ٹارگٹ اسپیکر اسپیچ ریکگنیشن کا بڑا ماڈل ہے۔ یہ LLM اینڈ ٹو اینڈ معماری پر مبنی ہے اور حوالہ جاتی آواز کو اسپیکر ایمبیڈنگ پرامپٹ کے طور پر استعمال کرتا ہے۔ اس کے ذریعے اسپیچ سیپریشن کے بغیر متعدد افراد کی ملی جلی آواز میں سے مطلوبہ اسپیکر کی گفتگو درست طور پر تحریر میں تبدیل کی جا سکتی ہے...00MAI-Transcribe-2AI اسپیچ ریکگنیشنMAI-Transcribe-2 مائیکروسافٹ کا سب سے طاقتور AI اسپیچ ٹو ٹیکسٹ ماڈل ہے، جو درستگی، رفتار اور لاگت کے لحاظ سے مجموعی طور پر سبقت رکھتا ہے۔ یہ ماڈل 60 زبانوں کو سپورٹ کرتا ہے، اور FLEURS ٹیسٹ سیٹ پر اس کی اوسط لفظی غلطی کی شرح صرف 5.2% ہے۔00SmartSub – اوپن سورس آل اِن ون آڈیو ویڈیو سب ٹائٹل پروسیسنگ ڈیسک ٹاپ ٹولAI اسپیچ ریکگنیشنSmartSub (妙幕) ایک اوپن سورس آل اِن ون آڈیو ویڈیو سب ٹائٹل پروسیسنگ ڈیسک ٹاپ ٹول ہے۔ یہ ٹول مکمل ورک فلو کو ایک ہی ایپلی کیشن میں یکجا کرتا ہے، اور Whisper، FunASR، Qwen3-ASR جیسے مقامی ماڈلز کی مدد سے آف لائن صوتی متن نگاری کرتا ہے۔ یہ 20 سے زائد ترجمہ سروسز اور متعدد کرداروں والی AI وائس اوور کو سپورٹ کرتا ہے۔ اس میں آن لائن ویڈیو ڈاؤن لوڈر شامل ہے جو B站، YouTube جیسے پلیٹ فارمز سے مطابقت رکھتا ہے۔ NVIDIA CUDA، Apple Core ML جیسی ہارڈویئر ایکسلریشن کے ساتھ یہ Windows، macOS، Linux تینوں پلیٹ فارمز پر مقامی طور پر چلتا ہے۔00Hy ASR 3.0 preview – Tencent Hunyuan کا پیش کردہ نئی نسل کا اسپیچ ریکگنیشن ماڈلAI اسپیچ ریکگنیشنHy ASR 3.0 preview – Tencent Hunyuan کا پیش کردہ نئی نسل کا اسپیچ ریکگنیشن ماڈل، Hy3 بڑے زبان ماڈل پر مبنی نئی نسل کا اسپیچ ریکگنیشن سسٹم ہے، جو اعلیٰ درستگی والی آواز کی شناخت اور گہری معنوی سمجھ کو یکجا کرتا ہے۔ یہ چینی، انگریزی، کینٹونیز اور 10 بڑی بولی کے علاقوں کو سپورٹ کرتا ہے، اور سیاق و سباق پر مبنی ذہین تصحیح، اہم الفاظ کی شمولیت، نیز زیادہ شور اور سرگوشی جیسے پیچیدہ حالات میں مضبوط کارکردگی فراہم کرتا ہے۔ اوپن سورس تشخیصی ڈیٹا سیٹ پر WER تقریباً 3% تک محدود ہے، جبکہ خود تیار کردہ تشخیصی ڈیٹا سیٹ پر یہ تمام حریفوں سے بہتر کارکردگی دکھاتا ہے۔ یہ ماڈل ذہین کسٹمر سروس، مواد تخلیق، صوتی تلاش، دفتری تعاون اور ذہین ٹرمینلز جیسے حالات کے لیے موزوں ہے۔ اسے Tencent Cloud API کے ذریعے مربوط کیا جا سکتا ہے یا Tencent Yuanbao میں مفت آزمایا جا سکتا ہے۔00

اس زمرے کے تمام ٹولز دکھائے گئے ہیں۔

AI اسپیچ ریکگنیشن - AIEZZ