- 月間訪問数
- 0
- 料金
- 未設定
- 掲載日
- —
- 更新済み
- 2026-09-14
01Xiaomi-CocktailASR-1とは
Xiaomi-CocktailASR-1は、Xiaomiがオープンソースで公開するターゲット話者音声認識の大規模モデルです。LLMエンドツーエンドアーキテクチャに基づき、参照音声を話者特徴のプロンプトとして使用し、音声分離なしで複数人の混合音声からターゲット話者を正確に書き起こします。複数話者ベンチマークでSOTAレベルを達成すると同時に、単一話者シーンにも対応しています。負例の拒否認識と、思考の連鎖による説明可能な推論機能を備え、Apache 2.0ライセンスで公開されています。
02Xiaomi-CocktailASR-1の主な機能
ターゲット話者音声認識:参照音声と複数人の混合音声を入力すると、音声分離なしでターゲット話者の発話を直接書き起こします。
単一話者対応:同じモデルで単一話者のシーンも処理でき、主要な単一話者ASRに匹敵する性能を発揮します。モデルの切り替えは不要です。
負例の拒否認識:ターゲット話者が音声に含まれていない場合は空のテキストを出力し、誤作動を効果的に低減します。
思考の連鎖推論:CoTモードでは、話者数、性別、話者特徴の類似度などの推論過程を出力し、説明可能性と認識精度を両立します。
03Xiaomi-CocktailASR-1の技術原理
エンドツーエンドの統合アーキテクチャ:モデルは、Data2Vec2を改良した0.6B音声エンコーダー、軽量な線形Adapter、Qwen3-8B大規模言語モデルのバックボーンという3つの部分で構成されます。入力は「参照音声 + 1秒間の無音 + 混合音声」の順に連結されます。エンコーダーがフレーム単位の特徴量を出力した後、AdapterでLLMの潜在空間にアラインメントし、テキストPromptとともにLLMへ入力してターゲット話者の書き起こしを生成します。
参照音声を条件付きプロンプトとして使用:エンコーダーはData2Vec2の自己教師ありマスク予測メカニズムを用い、単一ネットワーク内で意味情報と話者情報を融合します。独立した話者特徴エンコーダーは不要です。参照音声を条件付きPromptとして扱うことで、エンコーダーは特徴抽出段階からターゲット話者に適応的に焦点を合わせ、干渉音声を抑制します。これにより、従来の「分離+認識」カスケードシステムで生じる誤差の蓄積を根本から回避します。
複数能力のバランスを取る多段階学習:約100万時間のデータを配分して学習し、4つの能力を統合します。約40万時間の複数話者データでターゲット話者抽出を学習し、約60万時間の同一話者による参照音声とターゲット音声のペアで、単一シーンへの過度な抑制を防ぎます。約1万時間の不一致参照による負例で拒否認識能力を内在化し、推論時のしきい値を不要にします。さらに、CoTデータによって、モデルが先に推論チェーンを出力してから回答するよう学習します。
2種類のPromptと拒否認識メカニズム:標準モードでは、統一Promptで単一話者認識、複数話者からのターゲット認識、負例の拒否認識という3種類のタスクに対応します。ターゲット話者が不在の場合、モデルは自然に空のテキストを出力します。CoTモードでは独立したPromptで推論ラベルを呼び出し、話者数、性別、話者特徴の類似度などの中間ステップを出力してから最終的な書き起こしを提示します。説明可能性が向上し、WERもわずかに低下します。
04Xiaomi-CocktailASR-1の使用方法
依存関係のインストール:pip install torch torchaudio transformers soundfileを実行して必要な環境をインストールします。
モデルのダウンロード:HuggingFace(Ease3/Xiaomi-CocktailASR-1)からモデルの重みファイルをダウンロードします。
モデルの読み込み:AutoModel.from_pretrained("Ease3/Xiaomi-CocktailASR-1", trust_remote_code=True, torch_dtype="bfloat16").cuda().eval()でモデルを読み込みます。
音声の準備:16kHz・モノラルの参照音声(ターゲット話者の話者特徴)と、認識対象となる単一話者または複数話者の音声を用意します(16kHzでない場合は自動的にリサンプリングされます)。
単一推論:model("target.wav", "ref_speaker.wav")を呼び出すと、ターゲット話者の書き起こしテキストが返されます(負例の場合は追加パラメーターなしで自動的に空のテキストを出力します)。
思考の連鎖推論:cot=Trueパラメーターを追加すると、モデルは に推論過程を、 に最終結果を出力します。
バッチ推論:データを5列のTSV(utt_id, wav, text, ref_wav, ref_id)に整理し、tools/test_batch_scp.pyを実行してモデルパス、入力TSV、出力ファイルを指定すると、一括で書き起こせます。
05Xiaomi-CocktailASR-1の主な強み
複数話者でのSOTA性能:AliMeeting、AMI、LibriMixなど複数の主要な複数話者ベンチマークで最高水準の認識性能を達成しています(例:AliMeeting Far WERは20.63%、従来のSOTAは27.5%)。
単一話者と複数話者を統合:同じモデルで単一話者シーンにも対応し、主要なASRに匹敵する性能を発揮します。話者数に応じたモデル切り替えは不要です。
負例の拒否認識能力:ターゲット話者が不在の場合は空のテキストを出力し、拒否認識率は68%-80%に達します。一方、Qwen3-ASRやStepAudioなどのモデルの拒否認識率は0です。
思考の連鎖による説明可能な推論:CoTモードでは、話者数、性別、話者特徴の類似度などの推論過程を出力します。説明可能性を高めるとともに、WERもわずかに低下させます。
シンプルなエンドツーエンド構成:参照音声を直接話者特徴Promptとして使用するため、従来の音声分離モジュールが不要で、カスケードシステムの誤差蓄積を回避します。
導入が容易:1行のコードで呼び出せ、自動リサンプリングとバッチ推論に対応し、正例・負例のDemoも提供されているため、すぐに利用できます。
06Xiaomi-CocktailASR-1のプロジェクトURL
GitHubリポジトリ:https://github.com/xiaomi-research/xiaomi-cocktailasr-1
HuggingFaceモデルリポジトリ:https://huggingface.co/Ease3/Xiaomi-CocktailASR-1
arXiv技術論文:https://arxiv.org/pdf/2609.11274
07Xiaomi-CocktailASR-1の利用シーン
スマート会議の対象話者書き起こし:複数人の会議で指定した話者の発言だけを認識し、他の参加者の割り込みや議論を自動的に除外します。
音声アシスタントにおける所有者の指示認識:スマートフォン、スピーカー、車載環境で所有者の音声にのみ反応し、周囲の人の声による誤作動を防ぎます。
カスタマーサービスと品質検査の録音分析:複数人の通話録音から指定した一方の話者の発話全体を正確に抽出し、コンプライアンス検査やサービス評価に活用できます。
スマートホーム音声制御:テレビの騒音や複数人の会話がある家庭環境でも、リモコンを持つ人の音声指示を正確に認識し、誤操作を防ぎます。
アクセシビリティ向け補聴・記録機器:聴覚障害者や記録担当者のために、特定の話者の音声内容を選択的に抽出してリアルタイムに文字化します。騒がしい社交の場でも、聞きたい人の声に集中できます。
© 免責事項:ドメインやリンク先のコンテンツは時間の経過とともに変更される場合があります。AIEZZは第三者のウェブサイトを管理していません。外部コンテンツとリスクはご自身で確認してください。


ユーザーレビュー0