دوز مباشرة للمحتوى الرئيسي

جميع أدوات الذكاء الاصطناعي

التعرّف على الكلام بالذكاء الاصطناعي

هنا كاينين أشهر منتجات الذكاء الاصطناعي فمجال التعرّف على الكلام، كيغطي الاستعمالات الشائعة بحال الإبداع، المعالجة وتحسين الفعالية.

Spark-ASR-2.0التعرّف على الكلام بالذكاء الاصطناعيSpark-ASR-2.0 هو أحدث موديل كبير للتعرّف على الكلام من iFlytek، مبني على الموديل الأساسي للصوت Spark-Audio ديال Spark. كيستعمل الموديل بنية تعاونية «غير ذاتية الانحدار + ذاتية الانحدار معززة بـLLM»، وكيحقق التعرّف على الكلام المختلط بالعربية؟00Qwen-Audio-3.1التعرّف على الكلام بالذكاء الاصطناعيQwen-Audio-3.1 هي سلسلة ديال النماذج الصوتية الكبيرة من Tongyi Qianwen، وكتضم خمسة نماذج: ASR للتعرّف على الكلام، ASR-Next لفهم الصوت، TTS لتركيب الكلام، TTS-Next للإبداع الصوتي، وRealtime للتفاعل الفوري، ...00Xiaomi-CocktailASR-1التعرّف على الكلام بالذكاء الاصطناعيXiaomi-CocktailASR-1 هو نموذج كبير مفتوح المصدر من Xiaomi للتعرّف على كلام المتحدث المستهدف، مبني على بنية LLM من البداية للنهاية، وكيستعمل صوت مرجعي كإشارة للبصمة الصوتية، وكيقدر يفرّغ بدقة كلام المتحدث المستهدف من صوت مختلط ديال عدة متحدثين بلا ما يحتاج لفصل الصوت...00MAI-Transcribe-2التعرّف على الكلام بالذكاء الاصطناعيMAI-Transcribe-2 هو أقوى موديل ديال تحويل الصوت لنص من مايكروسوفت، وكيقدّم أداء متفوّق فالدقة والسرعة والتكلفة. كيدعم 60 لغة، وكيحقق متوسط نسبة أخطاء الكلمات غير 5.2% فاختبار FLEURS.00SmartSub – أداة مكتبية مفتوحة المصدر لمعالجة ترجمات الصوتيات والفيديوهات فحل واحدالتعرّف على الكلام بالذكاء الاصطناعيSmartSub (妙幕) هي أداة مكتبية مفتوحة المصدر لمعالجة ترجمات الصوتيات والفيديوهات فحل واحد. كتجمع الأداة المسار كامل فـ تطبيق واحد، وكتعتمد على نماذج محلية بحال Whisper وFunASR وQwen3-ASR باش تحوّل الصوت لنص بلا إنترنت، وكتدعم أكثر من 20 خدمة للترجمة ودوبلاج بالذكاء الاصطناعي بعدة شخصيات. فيها حتى أداة مدمجة لتحميل الفيديوهات من الإنترنت، ومتوافقة مع منصات بحال B站 وYouTube، وكتدعم تسريع العتاد بحال NVIDIA CUDA وApple Core ML، وكتخدم محلياً على Windows وmacOS وLinux.00Hy ASR 3.0 preview – موديل الجيل الجديد للتعرّف على الكلام من Tencent Hunyuanالتعرّف على الكلام بالذكاء الاصطناعيHy ASR 3.0 preview – موديل الجيل الجديد للتعرّف على الكلام من Tencent Hunyuan هو نظام جديد للتعرّف على الكلام مبني على النموذج اللغوي الكبير Hy3، وكيجمع بين التعرّف عالي الدقة على الكلام والفهم الدلالي العميق. كيدعم الصينية والإنجليزية والكانتونية و10 مناطق لهجية، وكيتميّز بالتصحيح الذكي حسب السياق، وإدماج الكلمات المفتاحية، والقدرة على العمل بثبات فسيناريوهات معقّدة بحال الضجيج القوي والهمس. نسبة WER فمجموعة التقييم المفتوحة المصدر كتوصل لحوالي 3%، ومجموعة التقييم الداخلية كاتتفوق بشكل شامل على النماذج المنافسة. كيناسب الموديل سيناريوهات بحال خدمة الزبناء الذكية، وصناعة المحتوى، والبحث الصوتي، والتعاون فالمكتب، والأجهزة الذكية، ويمكن ربطو عبر Tencent Cloud API أو تجربتو مجاناً فـ Tencent Yuanbao.00

كاينين هنا جميع الأدوات فهاد الفئة.

التعرّف على الكلام بالذكاء الاصطناعي - AIEZZ