Ruka hadi maudhui makuu
Xiaomi-CocktailASR-1

Xiaomi-CocktailASR-1 Inafanya kazi

Xiaomi-CocktailASR-1 ni modeli kubwa ya Xiaomi ya utambuzi wa sauti wa mzungumzaji lengwa iliyotolewa kama chanzo huria. Inategemea usanifu wa mwisho hadi mwisho wa LLM na hutumia sauti ya marejeo kama kidokezo cha alama za sauti. Bila kutenganisha sauti, inaweza kunakili kwa usahihi mzungumzaji lengwa kutoka katika sauti mchanganyiko ya watu wengi...

Xiaomi-CocktailASR-1 ni modeli kubwa ya Xiaomi ya utambuzi wa sauti wa mzungumzaji lengwa iliyotolewa kama chanzo huria. Inategemea usanifu wa mwisho hadi mwisho wa LLM na hutumia sauti ya marejeo kama kidokezo cha alama za sauti. Bila kutenganisha sauti, inaweza kunakili kwa usahihi mzungumzaji lengwa kutoka katika sauti mchanganyiko ya watu wengi...

Xiaomi-CocktailASR-1
Ziara za kila mwezi
0
Bei
Haijawekwa
Imeorodheshwa
—
Imesasishwa
2026-09-14

01Xiaomi-CocktailASR-1 ni nini

Xiaomi-CocktailASR-1 ni modeli kubwa ya Xiaomi ya utambuzi wa sauti wa mzungumzaji lengwa iliyotolewa kama chanzo huria. Inategemea usanifu wa mwisho hadi mwisho wa LLM na hutumia sauti ya marejeo kama kidokezo cha alama za sauti. Bila kutenganisha sauti, inaweza kunakili kwa usahihi mzungumzaji lengwa kutoka katika sauti mchanganyiko ya watu wengi. Modeli hii imefikia kiwango cha SOTA kwenye viwango vya majaribio vya wazungumzaji wengi, huku ikiendana pia na hali ya mzungumzaji mmoja. Ina uwezo wa kukataa sampuli hasi na kutoa uelekezaji unaoweza kufafanuliwa kupitia mnyororo wa mawazo, na imetolewa chini ya leseni ya Apache 2.0.

02Vipengele vikuu vya Xiaomi-CocktailASR-1

Utambuzi wa sauti wa mzungumzaji lengwa: Ukipewa sauti ya marejeo na sauti mchanganyiko ya watu wengi, hunakili moja kwa moja maudhui ya mzungumzaji lengwa bila kutenganisha sauti.
Uwezo wa mzungumzaji mmoja: Modeli hiyo hiyo inaweza kushughulikia hali ya mtu mmoja, ikiwa na utendaji unaolingana na ASR maarufu za mzungumzaji mmoja, bila kubadilisha modeli.
Kukataa sampuli hasi: Mzungumzaji lengwa asipokuwapo kwenye sauti, hutoa maandishi tupu na hivyo kupunguza kwa ufanisi uanzishaji wa kimakosa.
Uelekezaji wa mnyororo wa mawazo: Katika hali ya CoT, hutoa mchakato wa uelekezaji, kama vile idadi ya wazungumzaji, jinsia na ufanano wa alama za sauti, huku ikidumisha ufasiri na usahihi wa utambuzi.

03Kanuni ya kiteknolojia ya Xiaomi-CocktailASR-1

Usanifu jumuishi wa mwisho hadi mwisho: Modeli hii ina sehemu tatu: kisimbaji cha sauti cha 0.6B kilichoboreshwa kutoka Data2Vec2, Adapter nyepesi ya mstari, na msingi wa modeli kubwa ya lugha Qwen3-8B. Ingizo huunganishwa kwa mpangilio wa «sauti ya marejeo + sekunde 1 ya ukimya + sauti mchanganyiko». Baada ya kisimbaji kutoa vipengele vya kiwango cha fremu, Adapter huvilinganisha na nafasi fiche ya LLM, kisha huviwasilisha pamoja na Prompt ya maandishi kwa LLM ili kuzalisha unakili wa mzungumzaji lengwa.
Sauti ya marejeo kama kidokezo cha masharti: Kisimbaji hutumia utaratibu wa Data2Vec2 wa utabiri wa kujisimamia kupitia kuficha. Ndani ya mtandao mmoja, huunganisha taarifa za kisemantiki na za mzungumzaji bila kisimbaji huru cha alama za sauti. Sauti ya marejeo huchukuliwa kama Prompt ya masharti, hivyo kisimbaji hujielekeza kiotomatiki kwa mzungumzaji lengwa na kukandamiza sauti zinazosumbua tangu hatua ya kutoa vipengele, na kuzuia tangu mwanzo mkusanyiko wa makosa wa mifumo ya jadi ya «kutenganisha + kutambua».
Mafunzo ya hatua nyingi yenye kusawazisha uwezo mbalimbali: Kupitia uwiano wa data wa takriban saa milioni moja, uwezo minne huunganishwa: takriban saa 400,000 za data ya wazungumzaji wengi kwa mafunzo ya kutoa mzungumzaji lengwa; takriban saa 600,000 za jozi za marejeo na lengwa za mzungumzaji yuleyule ili kuzuia ukandamizaji kupita kiasi katika hali ya mtu mmoja; takriban saa 10,000 za marejeo yasiyolingana ili kujenga uwezo wa kukataa sampuli hasi bila hitaji la kizingiti wakati wa uelekezaji; pamoja na data ya CoT inayoifundisha modeli kutoa mnyororo wa uelekezaji kwanza kisha jibu.
Prompt ya hali mbili na utaratibu wa kukataa: Hali ya kawaida hutumia Prompt moja inayojumuisha kazi tatu: utambuzi wa mzungumzaji mmoja, utambuzi wa mzungumzaji lengwa katika sauti ya watu wengi, na kukataa sampuli hasi. Mzungumzaji lengwa akikosekana, modeli hutoa maandishi tupu kwa kawaida. Hali ya CoT hutumia Prompt huru kuanzisha lebo za uelekezaji, ikitoa hatua za kati kama idadi ya wazungumzaji, jinsia na ufanano wa alama za sauti kabla ya kutoa unakili wa mwisho, jambo linaloboresha ufasiri na kupunguza WER kwa kiasi kidogo.

04Jinsi ya kutumia Xiaomi-CocktailASR-1

Sakinisha vitegemezi: Tekeleza pip install torch torchaudio transformers soundfile ili kusakinisha mazingira yanayohitajika.
Pakua modeli: Pakua faili za uzani wa modeli kutoka HuggingFace (Ease3/Xiaomi-CocktailASR-1).
Pakia modeli: Tumia AutoModel.from_pretrained("Ease3/Xiaomi-CocktailASR-1", trust_remote_code=True, torch_dtype="bfloat16").cuda().eval() kupakia modeli.
Andaa sauti: Andaa sauti ya marejeo ya 16k mono yenye alama za sauti za mzungumzaji lengwa na sauti ya mtu mmoja au watu wengi ya kutambuliwa (isiyo ya 16k itabadilishwa sampuli kiotomatiki).
Uelekezaji wa rekodi moja: Ita model("target.wav", "ref_speaker.wav") ili kurudisha maandishi ya unakili wa mzungumzaji lengwa. Kwa sampuli hasi, maandishi tupu hutolewa kiotomatiki bila vigezo vya ziada.
Uelekezaji wa mnyororo wa mawazo: Ongeza kigezo cot=True; modeli itaweka mchakato wa uelekezaji katika na matokeo ya mwisho katika .
Uelekezaji wa kundi: Panga data katika TSV yenye safu 5 (utt_id, wav, text, ref_wav, ref_id), kisha endesha tools/test_batch_scp.py na ubainishe njia ya modeli, TSV ya ingizo na faili la matokeo ili kunakili kwa kundi.

05Faida kuu za Xiaomi-CocktailASR-1

Utendaji wa SOTA kwa wazungumzaji wengi: Imefikia kiwango bora cha utambuzi kwenye viwango kadhaa maarufu vya wazungumzaji wengi, kama AliMeeting, AMI na LibriMix (kwa mfano, AliMeeting Far WER ni 20.63%, ikilinganishwa na SOTA ya awali ya 27.5%).
Muundo mmoja kwa hali ya mtu mmoja na wengi: Modeli hiyo hiyo ina utendaji unaolingana na ASR maarufu katika hali ya mzungumzaji mmoja, bila kubadilisha modeli kulingana na idadi ya wazungumzaji.
Uwezo wa kukataa sampuli hasi: Mzungumzaji lengwa asipokuwapo, hutoa maandishi tupu. Kiwango cha kukataa ni 68%-80%, huku modeli za Qwen3-ASR na StepAudio zikiwa na kiwango cha 0.
Uelekezaji unaoweza kufafanuliwa kupitia mnyororo wa mawazo: Hali ya CoT hutoa mchakato wa uelekezaji, kama vile idadi ya wazungumzaji, jinsia na ufanano wa alama za sauti, na huboresha ufasiri huku ikipunguza WER kwa kiasi kidogo.
Usanifu rahisi wa mwisho hadi mwisho: Sauti ya marejeo hutumiwa moja kwa moja kama Prompt ya alama za sauti, hivyo kuondoa moduli ya jadi ya kutenganisha sauti na kuzuia mkusanyiko wa makosa wa mfumo jumuishi.
Rahisi kutumia: Inahitaji mstari mmoja wa msimbo, inasaidia kubadilisha sampuli kiotomatiki na uelekezaji wa kundi, na hutoa Demo za sampuli chanya na hasi kwa matumizi ya moja kwa moja.

06Anwani za mradi wa Xiaomi-CocktailASR-1

Hifadhi ya GitHub:https://github.com/xiaomi-research/xiaomi-cocktailasr-1
Hifadhi ya modeli ya HuggingFace:https://huggingface.co/Ease3/Xiaomi-CocktailASR-1
Karatasi ya kiufundi ya arXiv:https://arxiv.org/pdf/2609.11274

07Matukio ya matumizi ya Xiaomi-CocktailASR-1

Unakili mahususi wa mikutano mahiri: Katika mkutano wa watu wengi, sikiliza na kunakili tu maudhui ya mzungumzaji maalum, huku ukichuja kiotomatiki maingiliano na mijadala ya washiriki wengine.
Utambuzi wa maagizo ya mmiliki kwa visaidizi vya sauti: Katika simu, spika au gari, jibu tu sauti ya mmiliki wa kifaa ili sauti za watu walio nyuma zisianzishe maagizo kimakosa.
Uchambuzi wa rekodi za huduma kwa wateja na ukaguzi wa ubora: Toa kwa usahihi mazungumzo kamili ya upande maalum kutoka katika rekodi za simu za watu wengi kwa ukaguzi wa uzingatiaji na tathmini ya huduma.
Udhibiti wa sauti wa nyumba mahiri: Katika mazingira ya nyumbani yenye kelele za televisheni na mazungumzo ya watu wengi, tambua kwa usahihi maagizo ya sauti ya mtu anayeshikilia kidhibiti ili kuzuia uendeshaji usio sahihi.
Vifaa vya usaidizi wa kusikia na kurekodi kwa ajili ya ufikivu: Toa kwa kulenga maudhui ya sauti ya mzungumzaji maalum na kuyabadilisha kuwa maandishi kwa wakati halisi kwa watu wenye ulemavu wa kusikia au warekodi, ili kuzingatia mtu anayetarajiwa kusikika katika mikusanyiko yenye kelele.

© Kanusho: vikoa na maudhui yaliyounganishwa vinaweza kubadilika kadiri muda unavyopita. AIEZZ haidhibiti tovuti za wahusika wengine. Kagua maudhui na hatari za nje kwa kujitegemea.

Ukaguzi wa watumiaji0