Asosiy kontentga o‘tish

SALMONN-2 – Tsinghua va boshqalar tomonidan ochiq manbaga chiqarilgan universal audio katta til modeli Faoliyat yuritmoqda

SALMONN-2 — Tsinghua universiteti, Shanxay sun’iy intellekt laboratoriyasi va Kembrij universiteti tomonidan birgalikda ochiq manbaga chiqarilgan universal audio katta til modeli.

SALMONN-2 – Tsinghua va boshqalar tomonidan ochiq manbaga chiqarilgan universal audio katta til modeli ByteDance’ning SPEAR yagona o‘z-o‘zini nazorat qiluvchi audio enkoderi va ko‘p qatlamli xususiyatlarni birlashtirish adapteri asosida qurilgan, matn bazasi sifatida Qwen3’dan foydalanadigan universal audio katta til modelidir. U nutqni tanish, audioni tavsiflash, musiqani tushunish, hissiyotlarni aniqlash, so‘zlovchini verifikatsiya qilish kabi domenlararo vazifalarni qo‘llab-quvvatlaydi. Shuningdek, u birinchi marta universal ALLM’da tovush hodisalarini aniqlash, audio qalbakilashtirilganligini aniqlash, nutq sifatini baholash va multimodal kontekstli nutqni tanish kabi ilg‘or imkoniyatlarni tizimli ravishda amalga oshiradi. Model an’anaviy ikki enkoderli yechim o‘rniga yagona SPEAR enkoderidan foydalanadi va MLF adapteri orqali ko‘p qatlamli akustik xususiyatlarni birlashtirib, domenlararo yanada muvozanatli natijalarni ta’minlaydi. Atigi taxminan 18 ming soatlik nazoratli ma’lumotlar bilan samarali o‘qitilgan SALMONN-2 MMAU-Pro, MMAR va MMSU uchta kompleks benchmarkida bir xil miqyosdagi ochiq modellar orasida eng yaxshi natijaga erishadi. U aqlli konferensiya yordamchisi, audio kontentni moderatsiya qilish va nutq sifatini monitoring qilish kabi holatlarda qo‘llanadi.

SALMONN-2 – Tsinghua va boshqalar tomonidan ochiq manbaga chiqarilgan universal audio katta til modeli Mahsulot interfeysi
Oylik tashriflar
0
Narxlar
bepul va To'lov
Ro‘yxatga kiritilgan
2026-08-07
Yangilangan
2026-08-07

01SALMONN-2 nima

SALMONN-2 — Tsinghua universiteti, Shanxay sun’iy intellekt laboratoriyasi va Kembrij universiteti tomonidan birgalikda ochiq manbaga chiqarilgan universal audio katta til modeli. U ByteDance’ning SPEAR yagona o‘z-o‘zini nazorat qiluvchi audio enkoderi va ko‘p qatlamli xususiyatlarni birlashtirish adapteri asosida qurilgan, matn bazasi sifatida Qwen3’dan foydalanadi. Taxminan 18 ming soatlik nazoratli ma’lumotlar bilan MMAU-Pro, MMAR va MMSU uchta kompleks benchmarkida bir xil miqyosdagi ochiq modellar orasida eng yaxshi natijaga erishgan. Shuningdek, u birinchi marta universal ALLM’da tovush hodisalarini aniqlash, audio qalbakilashtirilganligini aniqlash, nutq sifatini baholash va multimodal kontekstli nutqni tanish kabi ilg‘or imkoniyatlarni tizimli ravishda amalga oshiradi.

02SALMONN-2 ning asosiy funksiyalari

Universal audioni tushunish: nutqni tanish, audioni tavsiflash, musiqani tushunish, hissiyotlarni aniqlash, so‘zlovchini verifikatsiya qilish kabi domenlararo vazifalarni qo‘llab-quvvatlaydi.
Tovush hodisalarini aniqlash (SED): it hurishi, qadam tovushi kabi atrof-muhit tovush hodisalarini aniqlab, ularning boshlanish va tugash vaqtlarini chiqaradi.
Audioning chuqur qalbakilashtirilganligini aniqlash: nutqning haqiqiy yoki soxta ekanini baholaydi hamda sintez qilingan yoki tahrirlangan bo‘lishi mumkin bo‘lgan mahalliy parchalarning vaqt oralig‘ini aniqlaydi.
Nutq sifatini baholash (SQA): shovqin, buzilish, ravshanlik kabi quyi darajadagi akustik xususiyatlarni sezadi va sifat bahosi hamda izoh beradi.
Multimodal kontekstli nutqni tanish (MICL): yozuv shakli va namunaviy talaffuz audiosini birlashtirib, kam uchraydigan so‘zlar va noyob ismlarni tanish aniqligini oshiradi.

03SALMONN-2 ning texnik prinsiplari

WeChat’da kuzatib boring va “开源” deb javob yuborib, AI ochiq manba loyihalari guruhiga qo‘shiling
Yagona o‘z-o‘zini nazorat qiluvchi audio enkoderi: SALMONN-2 yagona audio frontend sifatida SPEAR’dan foydalanadi. Enkoder katta hajmdagi belgilanmagan audio ma’lumotlarida o‘z-o‘zini nazorat qiluvchi o‘qitish orqali tayyorlangan bo‘lib, semantika, talaffuz, tembr, so‘zlovchi va akustik muhit haqidagi ma’lumotlarni bir vaqtda ushlay oladi. U an’anaviy Whisper+BEATs ikki enkoderli yechimining o‘rnini egallab, arxitekturani soddalashtirish bilan birga domenlararo yanada muvozanatli qobiliyatni saqlaydi.
Ko‘p qatlamli xususiyatlarni birlashtirish (MLF) adapteri: SPEAR qatlamlaridagi kodlangan ma’lumotlarning darajasi turlicha: quyi qatlamlar akustik va talaffuz tafsilotlarini saqlaydi, o‘rta qatlamlar tembr va so‘zlovchi ma’lumotlarini olib yuradi, yuqori qatlamlar esa semantik tushunchalarni jamlaydi. MLF adapteri avval har bir qatlamning yashirin holatlarini qatlam bo‘yicha normallashtiradi va birlashtiradi, so‘ng o‘rganiladigan quyi proyeksiya hamda kadrlarni guruhlab siqish orqali ularni qayta ishlaydi. Yakunda birlashtirilgan ierarxik tasvir til modeli embedding makoniga xaritalanadi, shuning uchun model vazifa talabiga ko‘ra turli darajadagi akustik signallardan moslashuvchan foydalanadi.
Vaqt belgilarini kiritish mexanizmi: model vaqt belgilarini tabiiy til matni shaklida (masalan, <2.0 seconds>) to‘g‘ridan-to‘g‘ri audio ketma-ketligiga joylashtiradi va ularni audio embeddinglari bilan navbatma-navbat til modeliga uzatadi. Shu tariqa model yagona generatsiya doirasida vaqtni aniqlash vazifalarini bajaradi va alohida vaqt belgisi embedding qatlamini talab qilmaydi.
Multimodal kontekstual o‘rganish (MICL) orqali o‘qitish: kontekstli nutqni tanish vazifasida model nafaqat matnli bias so‘zlar ro‘yxatini qabul qiladi, balki ushbu so‘zlarning namunaviy talaffuz audiosini ham multimodal kontekst sifatida bir vaqtda oladi. O‘qitish jarayonida ortiqcha biasning oldini olish uchun chalg‘ituvchi so‘zlar va maqsadli so‘zlarni tasodifiy tashlab yuborish strategiyasi qo‘llanadi. Natijada model akustik dalillar bilan qo‘llab-quvvatlanganda kontekst signallaridan oqilona foydalanishni o‘rganadi.

04SALMONN-2 dan qanday foydalanish

Repositoryga kirib, kodni klonlang: GitHub repositorysi https://github.com/bytedance/SALMONN/tree/salmonn2 manziliga kiring va git clone orqali kodni mahalliy kompyuterga yuklab oling.
Ishlash muhitini yarating: conda create -n salmonn2 python=3.10 buyrug‘i bilan virtual muhit yarating va uni faollashtiring, so‘ng pip, setuptools hamda wheel’ni yangilang.
Bog‘liqliklar va loyihani o‘rnating: repository ildiz katalogida pip install -r requirements.txt hamda pip install -e . --no-deps buyrug‘ini ishga tushirib, SALMONN-2 va uning ishlash uchun zarur bog‘liqliklarini o‘rnating.
Oldindan o‘qitilgan og‘irliklarni yuklab oling: model checkpoint’ini HuggingFace CLI orqali yuklab oling: hf download marcoyang/SALMONN-2-8B --repo-type model --local-dir /path/to/salmonn-2-hf.
Modelni yuklab, inferensni ishga tushiring: AutoProcessor va AutoModelForCausalLM yordamida mahalliy og‘irliklarni yuklang, audio fayli va ko‘rsatma matnini uzating, so‘ng model.generate() ni chaqirib audio tushunish natijasini oling.

05SALMONN-2 ning asosiy afzalliklari

Ma’lumotlardan samarali foydalanish: taxminan 18 ming soatlik nazoratli ma’lumotlardan foydalanadi. Bu bir xil miqyosdagi raqobatchilar odatda ishlatadigan yuz minglab yoki millionlab soatlardan ancha kam bo‘lib, belgilash xarajatlarini sezilarli kamaytiradi.
Yagona frontend yanada muvozanatli: yagona SPEAR o‘z-o‘zini nazorat qiluvchi enkoderi ikki enkoderning o‘rnini egallab, nutq, atrof-muhit tovushlari, musiqa va paralingvistik vazifalar o‘rtasida yanada muvozanatli natijani ta’minlaydi.
Ierarxik ma’lumotlardan to‘liq foydalanish: MLF adapteri enkoderning barcha qatlamlari xususiyatlarini birlashtiradi va faqat oxirgi qatlamdan foydalanish natijasida akustika yoki tembr kabi muhim tafsilotlarning yo‘qolishiga yo‘l qo‘ymaydi.
Audio tahlil imkoniyatlarini kengaytirish: universal ALLM’da ilk bor SED, qalbakilashtirilganlikni aniqlash va SQA kabi avval e’tibordan chetda qolgan tovush tahlili vazifalarini tizimli ravishda qo‘llab-quvvatlaydi.
Masshtablash imkoniyati: matn bazasi 8B’dan 30B-A3B’gacha kengaytirilganda, uchta kompleks benchmarkdagi ballar izchil oshgan. Bu arxitekturaning yaxshi scale-up salohiyatiga ega ekanini tasdiqlaydi.

06SALMONN-2 loyihasi manzillari

GitHub repositorysi: https://github.com/bytedance/SALMONN/tree/salmonn2
HuggingFace model repositorysi: https://huggingface.co/marcoyang/SALMONN-2-8B
arXiv texnik maqolasi: https://arxiv.org/pdf/2607.17079

07SALMONN-2 ning qo‘llanish holatlari

Aqlli konferensiya yordamchisi: konferensiya mazmunini real vaqt rejimida transkripsiya qiladi, ishtirokchilarning talaffuz namunalari yordamida xorijiy ismlar va professional atamalarni aniq taniydi.
Audio kontentni moderatsiya qilish: jonli efir yoki podkastlardagi noodatiy tovush hodisalarini avtomatik aniqlaydi hamda firibgarlikning oldini olish uchun deepfake nutqni taniydi.
Nutq sifatini monitoring qilish: mijozlarga xizmat ko‘rsatish qo‘ng‘iroqlari va ovoz yozish studiyasi materiallari sifatini avtomatik baholaydi, shovqin va buzilish mavjud parchalarni aniqlaydi.
Multimedia arxivlarini qidirish: tarixiy audio va radio dasturlari uchun vaqt belgilari bilan hodisa tavsiflarini yaratib, mazmunga asoslangan aniq qidiruvni ta’minlaydi.
Eshitishida nuqsoni bo‘lganlar uchun yordamchi qurilmalar: eshik qo‘ng‘irog‘i yoki signalizatsiya kabi atrof-muhit tovush hodisalarini eshitishida nuqsoni bo‘lgan foydalanuvchilarga real vaqt rejimida matn va vaqt belgisi ko‘rinishida bildiradi.

© Ogohlantirish: domenlar va havola qilingan kontent vaqt o‘tishi bilan o‘zgarishi mumkin. AIEZZ uchinchi tomon veb-saytlarini nazorat qilmaydi. Tashqi kontent va xatarlarni mustaqil ravishda ko‘rib chiqing.

Foydalanuvchi sharhlari0