Ruka hadi maudhui makuu

SALMONN-2 – Muundo mkubwa wa lugha za sauti wa matumizi ya jumla uliowekwa wazi na Chuo Kikuu cha Tsinghua na wengine Inafanya kazi

SALMONN-2 ni muundo mkubwa wa lugha za sauti wa matumizi ya jumla uliowekwa wazi kwa pamoja na Chuo Kikuu cha Tsinghua, Maabara ya Akili Bandia ya Shanghai na Chuo Kikuu cha Cambridge.

SALMONN-2 – Muundo mkubwa wa lugha za sauti wa matumizi ya jumla uliowekwa wazi na Chuo Kikuu cha Tsinghua na wengine ni muundo wa lugha wa matumizi ya jumla unaotegemea Qwen3 kama msingi wa maandishi, ukiwa umejengwa kwa kisimbaji cha sauti cha SPEAR cha ByteDance cha kujifunza bila usimamizi na adapta ya kuunganisha vipengele vya tabaka nyingi. Unaunga mkono kazi mbalimbali za sauti, zikiwemo utambuzi wa usemi, maelezo ya sauti, uelewa wa muziki, utambuzi wa hisia na uthibitishaji wa mzungumzaji. Pia, kwa mara ya kwanza katika ALLM ya matumizi ya jumla, unatekeleza kwa utaratibu uwezo wa hali ya juu kama vile utambuzi wa matukio ya sauti, utambuzi wa sauti ghushi, tathmini ya ubora wa usemi na utambuzi wa usemi wenye muktadha wa aina nyingi. Muundo huu hutumia kisimbaji kimoja cha SPEAR badala ya usanidi wa kawaida wa visimbaji viwili, na huunganisha vipengele vya akustika vya tabaka nyingi kupitia adapta ya MLF, hivyo kupata utendaji uliosawazika zaidi katika nyanja mbalimbali. Kwa mafunzo yenye ufanisi kwa kutumia takriban saa 18,000 za data yenye usimamizi, SALMONN-2 imepata utendaji bora zaidi miongoni mwa miundo ya wazi yenye ukubwa sawa kwenye vigezo vitatu vikuu vya jumla vya MMAU-Pro, MMAR na MMSU. Inafaa kwa hali kama vile wasaidizi mahiri wa mikutano, ukaguzi wa maudhui ya sauti na ufuatiliaji wa ubora wa usemi.

SALMONN-2 – Muundo mkubwa wa lugha za sauti wa matumizi ya jumla uliowekwa wazi na Chuo Kikuu cha Tsinghua na wengine Kiolesura cha bidhaa
Ziara za kila mwezi
0
Bei
Bure na Inalipiwa
Imeorodheshwa
2026-08-07
Imesasishwa
2026-08-07

01SALMONN-2 ni nini

SALMONN-2 ni muundo mkubwa wa lugha za sauti wa matumizi ya jumla uliowekwa wazi kwa pamoja na Chuo Kikuu cha Tsinghua, Maabara ya Akili Bandia ya Shanghai na Chuo Kikuu cha Cambridge. Umejengwa kwa kisimbaji cha sauti cha SPEAR cha ByteDance cha kujifunza bila usimamizi na adapta ya kuunganisha vipengele vya tabaka nyingi, ukiwa na Qwen3 kama msingi wa maandishi. Kwa kutumia takriban saa 18,000 za data yenye usimamizi, umefikia utendaji bora zaidi miongoni mwa miundo ya wazi yenye ukubwa sawa kwenye vigezo vitatu vya jumla vya MMAU-Pro, MMAR na MMSU. Kwa mara ya kwanza katika ALLM ya matumizi ya jumla, unawezesha kwa utaratibu uwezo wa hali ya juu kama vile utambuzi wa matukio ya sauti, utambuzi wa sauti ghushi, tathmini ya ubora wa usemi na utambuzi wa usemi wenye muktadha wa aina nyingi.

02Kazi kuu za SALMONN-2

Uelewa wa sauti wa matumizi ya jumla: Unaunga mkono kazi mbalimbali kama vile utambuzi wa usemi, maelezo ya sauti, uelewa wa muziki, utambuzi wa hisia na uthibitishaji wa mzungumzaji.
Utambuzi wa matukio ya sauti (SED): Unaweza kubainisha na kutoa vipindi vya kuanza na kumalizika kwa matukio ya sauti za mazingira, kama vile kubweka kwa mbwa na hatua za miguu.
Utambuzi wa ughushi wa kina wa sauti: Huamua kama usemi ni halisi au ghushi, na kubainisha vipindi vya muda vya sehemu zinazoshukiwa kuwa zilitengenezwa au kuhaririwa.
Tathmini ya ubora wa usemi (SQA): Hutambua vipengele vya kiwango cha chini vya akustika kama vile kelele, upotoshaji na uwazi, kisha kutoa alama na maelezo ya ubora.
Utambuzi wa usemi wenye muktadha wa aina nyingi (MICL): Huunganisha tahajia ya maandishi na sauti za matamshi za marejeo ili kuboresha usahihi wa kutambua maneno yasiyo ya kawaida na majina adimu ya watu.

03Kanuni ya teknolojia ya SALMONN-2

Fuatilia akaunti ya WeChat na ujibu “开源” ili ujiunge na kikundi cha majadiliano cha miradi ya AI iliyo wazi
Kisimbaji cha sauti cha kujifunza bila usimamizi kilichounganishwa: SALMONN-2 hutumia SPEAR kama sehemu yake pekee ya mbele ya sauti. Kisimbaji hiki hufunzwa kwa kujifunza bila usimamizi kwenye data kubwa ya sauti isiyo na lebo, na kinaweza kunasa kwa pamoja taarifa za maana, matamshi, rangi ya sauti, mzungumzaji na mazingira ya akustika. Hivyo kinachukua nafasi ya usanidi wa kawaida wa visimbaji viwili vya Whisper+BEATs, na kurahisisha usanifu huku kikidumisha uwezo uliosawazika zaidi katika nyanja mbalimbali.
Adapta ya kuunganisha vipengele vya tabaka nyingi (MLF): Tabaka mbalimbali za SPEAR hubeba viwango tofauti vya taarifa—tabaka za chini huhifadhi maelezo ya akustika na matamshi, tabaka za kati hubeba taarifa za rangi ya sauti na mzungumzaji, huku tabaka za juu zikikusanya dhana za kimaana. Adapta ya MLF kwanza hufanya usanifishaji wa tabaka na kuunganisha hali fiche za kila tabaka, kisha hupunguza vipimo na kubana makundi ya fremu kwa kutumia makadirio ya chini yanayoweza kujifunza. Hatimaye, hupeleka uwakilishi wa tabaka uliounganishwa kwenye nafasi ya upachikaji ya muundo wa lugha, hivyo kuuwezesha kutumia kwa urahisi vidokezo vya akustika vya viwango tofauti kulingana na mahitaji ya kazi.
Utaratibu wa kuingiza mihuri ya muda: Muundo huingiza mihuri ya muda kama maandishi ya lugha asilia, kwa mfano <2.0 seconds>, moja kwa moja kwenye mfuatano wa sauti, na kuyaingiza kwa kupishana na upachikaji wa sauti kwenye muundo wa lugha. Hivyo, unaweza kutekeleza kazi za kubainisha muda ndani ya mfumo mmoja wa uzalishaji bila kuhitaji tabaka maalumu la upachikaji wa mihuri ya muda.
Mafunzo ya ujifunzaji wa muktadha wa aina nyingi (MICL): Katika kazi za utambuzi wa usemi wenye muktadha, muundo haupokei tu orodha ya maneno ya upendeleo ya maandishi, bali pia hupokea kwa wakati mmoja sauti za matamshi ya marejeo ya maneno hayo kama muktadha wa aina nyingi. Wakati wa mafunzo, mkakati wa kuacha kwa nasibu maneno ya kuvuruga na maneno lengwa hutumiwa ili kuzuia upendeleo uliopitiliza, na kuufundisha muundo kutumia vidokezo vya muktadha kwa njia inayofaa inapoungwa mkono na ushahidi wa akustika.

04Jinsi ya kutumia SALMONN-2

Fikia hazina na kloni msimbo: Tembelea hazina ya GitHub https://github.com/bytedance/SALMONN/tree/salmonn2, kisha tumia git clone kupakua msimbo kwenye kifaa chako.
Unda mazingira ya uendeshaji: Tekeleza conda create -n salmonn2 python=3.10 ili kuunda na kuamilisha mazingira pepe, kisha sasisha pip, setuptools na wheel.
Sakinisha vitegemezi na mradi: Katika mzizi wa hazina, endesha pip install -r requirements.txt na pip install -e . --no-deps ili kukamilisha usakinishaji wa SALMONN-2 na vitegemezi vyake vya uendeshaji.
Pakua uzito uliofunzwa awali: Tumia HuggingFace CLI kupakua kituo cha muundo: hf download marcoyang/SALMONN-2-8B --repo-type model --local-dir /path/to/salmonn-2-hf.
Pakia muundo na ufanye uelekezaji: Tumia AutoProcessor na AutoModelForCausalLM kupakia uzito wa ndani, pitisha faili ya sauti na maandishi ya maagizo, kisha ita model.generate() ili kupata matokeo ya uelewa wa sauti.

05Faida kuu za SALMONN-2

Ufanisi wa data: Kwa kutumia takriban saa 18,000 za data yenye usimamizi—chini sana ya mamia ya maelfu hadi mamilioni ya saa zinazotumiwa na washindani wa ukubwa sawa—hupunguza kwa kiasi kikubwa gharama za kuweka lebo.
Sehemu ya mbele iliyounganishwa na iliyosawazika zaidi: Kisimbaji kimoja cha SPEAR cha kujifunza bila usimamizi kinachukua nafasi ya visimbaji viwili, na kupata utendaji uliosawazika zaidi katika usemi, sauti za mazingira, muziki na kazi za lugha zisizo za maneno.
Matumizi kamili ya taarifa za kihierarkia: Adapta ya MLF huunganisha vipengele kutoka tabaka zote za kisimbaji, hivyo kuzuia upotevu wa maelezo muhimu ya akustika na rangi ya sauti unaoweza kutokea endapo tabaka la mwisho pekee lingetumika.
Uwezo mpana wa uchanganuzi wa sauti: Kwa mara ya kwanza katika ALLM ya matumizi ya jumla, inaunga mkono kwa utaratibu kazi za uchanganuzi wa sauti kama SED, utambuzi wa ughushi na SQA, ambazo hapo awali zilipuuzwa.
Uwezo wa kupanuka: Baada ya kupanua msingi wa maandishi kutoka 8B hadi 30B-A3B, alama kwenye vigezo vitatu vya jumla ziliendelea kuongezeka, jambo linalothibitisha kuwa usanifu huu una uwezo mzuri wa scale-up.

06Anwani za mradi wa SALMONN-2

Hazina ya GitHub: https://github.com/bytedance/SALMONN/tree/salmonn2
Maktaba ya miundo ya HuggingFace: https://huggingface.co/marcoyang/SALMONN-2-8B
Makala ya kiufundi ya arXiv: https://arxiv.org/pdf/2607.17079

07Matukio ya matumizi ya SALMONN-2

Msaidizi mahiri wa mikutano: Hunakili maudhui ya mkutano kwa wakati halisi, na kwa kutumia mifano ya matamshi ya washiriki hutambua kwa usahihi majina ya kigeni ya watu na istilahi za kitaalamu.
Ukaguzi wa maudhui ya sauti: Hutambua kiotomatiki matukio ya sauti yasiyo ya kawaida katika matangazo ya moja kwa moja au podikasti, na kutambua usemi wa ughushi wa kina ili kuzuia ulaghai.
Ufuatiliaji wa ubora wa usemi: Hutoa alama za ubora kiotomatiki kwa simu za huduma kwa wateja na nyenzo za studio ya kurekodia, na kubainisha sehemu zenye kelele au upotoshaji.
Utafutaji wa kumbukumbu za media nyingi: Hutengeneza maelezo ya matukio yenye mihuri ya muda kwa sauti za kihistoria na vipindi vya redio, na kuwezesha utafutaji sahihi kulingana na maudhui.
Vifaa saidizi kwa wenye ulemavu wa kusikia: Huwatahadharisha watumiaji wenye ulemavu wa kusikia kwa wakati halisi kuhusu matukio ya sauti za mazingira, kama vile kengele za milango na ving’ora, kwa kutumia maandishi na mihuri ya muda.

© Kanusho: vikoa na maudhui yaliyounganishwa vinaweza kubadilika kadiri muda unavyopita. AIEZZ haidhibiti tovuti za wahusika wengine. Kagua maudhui na hatari za nje kwa kujitegemea.

Ukaguzi wa watumiaji0