- 월간 방문 수
- 0
- 가격
- 설정되지 않음
- 등록일
- —
- 업데이트됨
- 2026-09-14
01Xiaomi-CocktailASR-1이란
Xiaomi-CocktailASR-1은 샤오미가 오픈 소스로 공개한 타깃 화자 음성 인식 대형 모델입니다. LLM 엔드투엔드 아키텍처를 기반으로 하며, 참조 음성을 화자 음성 특징 프롬프트로 사용해 음성 분리 없이 여러 사람이 섞인 음성에서 타깃 화자의 발화를 정확하게 전사합니다. 이 모델은 다중 화자 벤치마크에서 SOTA 수준을 달성했으며, 단일 화자 환경도 지원합니다. 또한 음성에 타깃 화자가 없을 때 거부하는 능력과 사고 연쇄 기반의 설명 가능한 추론 기능을 갖추고 있으며, Apache 2.0 라이선스로 공개되었습니다.
02Xiaomi-CocktailASR-1의 주요 기능
타깃 화자 음성 인식: 참조 음성과 여러 화자가 섞인 오디오를 입력하면 음성 분리 없이 타깃 화자의 발화 내용만 직접 전사합니다.
단일 화자 호환: 하나의 모델로 단일 화자 환경도 처리하며, 주요 단일 화자 ASR과 비슷한 성능을 제공하므로 모델을 전환할 필요가 없습니다.
부정 샘플 거부: 오디오에 타깃 화자가 없으면 빈 텍스트를 출력해 오작동을 효과적으로 줄입니다.
사고 연쇄 추론: CoT 모드에서는 화자 수, 성별, 화자 음성 특징 유사도 등의 추론 과정을 출력해 설명 가능성과 인식 정확도를 함께 확보합니다.
03Xiaomi-CocktailASR-1의 기술 원리
엔드투엔드 통합 아키텍처: 모델은 Data2Vec2를 개선한 0.6B 오디오 인코더, 경량 선형 Adapter, Qwen3-8B 대규모 언어 모델 백본의 세 부분으로 구성됩니다. 입력은 「참조 음성 + 1초 무음 + 혼합 음성」 순서로 연결됩니다. 인코더가 프레임 단위 특징을 출력하면 Adapter가 이를 LLM의 잠재 공간에 맞추고, 텍스트 Prompt와 함께 LLM에 전달해 타깃 화자의 전사 결과를 생성합니다.
참조 음성을 조건부 프롬프트로 사용: 인코더는 Data2Vec2의 자기 지도 마스크 예측 메커니즘을 사용해 하나의 네트워크 안에서 의미 정보와 화자 정보를 통합하므로 별도의 화자 음성 특징 인코더가 필요하지 않습니다. 참조 음성은 조건부 Prompt로 간주되며, 인코더는 특징을 추출하는 단계에서부터 타깃 화자에 적응적으로 집중하고 방해 음성을 억제합니다. 이를 통해 기존의 「분리+인식」 직렬 시스템에서 발생하는 오류 누적을 근본적으로 방지합니다.
여러 능력의 균형을 맞춘 다단계 학습: 약 100만 시간의 데이터를 배합해 통합 모델의 네 가지 능력을 학습합니다. 약 40만 시간의 다중 화자 데이터로 타깃 화자 추출을 학습하고, 약 60만 시간의 동일 화자 참조-타깃 쌍으로 단일 환경에 대한 과도한 억제를 방지합니다. 약 1만 시간의 불일치 참조 부정 샘플을 통해 거부 능력을 내재화하므로 추론 시 임계값이 필요하지 않습니다. 또한 CoT 데이터로 모델이 먼저 추론 과정을 출력한 뒤 답변하도록 학습합니다.
이중 모드 Prompt와 거부 메커니즘: 표준 모드는 하나의 통합 Prompt로 단일 화자 인식, 다중 화자 타깃 인식, 부정 샘플 거부라는 세 가지 작업을 동시에 처리합니다. 타깃 화자가 없으면 모델은 자연스럽게 빈 텍스트를 출력합니다. CoT 모드는 독립적인 Prompt로 추론 태그를 활성화하고, 화자 수·성별·화자 음성 특징 유사도 등의 중간 단계를 출력한 후 최종 전사 결과를 제시합니다. 이를 통해 설명 가능성을 높이고 WER을 소폭 낮춥니다.
04Xiaomi-CocktailASR-1 사용 방법
의존성 설치: pip install torch torchaudio transformers soundfile을 실행해 필요한 환경을 설치합니다.
모델 다운로드: HuggingFace(Ease3/Xiaomi-CocktailASR-1)에서 모델 가중치 파일을 다운로드합니다.
모델 로드: AutoModel.from_pretrained("Ease3/Xiaomi-CocktailASR-1", trust_remote_code=True, torch_dtype="bfloat16").cuda().eval()을 통해 모델을 로드합니다.
오디오 준비: 16kHz 모노 참조 음성(타깃 화자의 음성 특징)과 인식할 단일 화자 또는 다중 화자 오디오를 준비합니다(16kHz가 아니면 자동으로 리샘플링됩니다).
단일 추론: model("target.wav", "ref_speaker.wav")를 호출하면 타깃 화자의 전사 텍스트가 반환됩니다(부정 샘플이면 자동으로 빈 텍스트를 출력하므로 추가 매개변수가 필요하지 않습니다).
사고 연쇄 추론: cot=True 매개변수를 추가하면 모델이 에 추론 과정을 출력하고 에 최종 결과를 출력합니다.
배치 추론: 데이터를 5개 열의 TSV(utt_id, wav, text, ref_wav, ref_id)로 정리한 뒤 tools/test_batch_scp.py를 실행하고 모델 경로, 입력 TSV, 출력 파일을 지정하면 일괄 전사할 수 있습니다.
05Xiaomi-CocktailASR-1의 핵심 장점
다중 화자 SOTA 성능: AliMeeting, AMI, LibriMix 등 여러 주요 다중 화자 벤치마크에서 최상의 인식 수준을 달성했습니다(예: AliMeeting Far WER 20.63%, 기존 SOTA는 27.5%).
단일·다중 화자 환경 통합: 하나의 모델로 단일 화자 환경에서도 주요 ASR과 비슷한 성능을 제공하므로 화자 수에 따라 모델을 전환할 필요가 없습니다.
부정 샘플 거부 능력: 타깃 화자가 없을 때 빈 텍스트를 출력하며, 거부율은 68%-80%에 달합니다. 반면 Qwen3-ASR, StepAudio 등의 모델 거부율은 0입니다.
사고 연쇄 기반 설명 가능한 추론: CoT 모드에서 화자 수, 성별, 화자 음성 특징 유사도 등의 추론 과정을 출력해 설명 가능성을 높이고 WER도 소폭 낮춥니다.
엔드투엔드 간결한 아키텍처: 참조 음성을 화자 음성 특징 Prompt로 직접 사용해 기존 음성 분리 모듈이 필요 없으며, 직렬 시스템의 오류 누적을 방지합니다.
낮은 사용 진입 장벽: 한 줄의 코드로 호출할 수 있고 자동 리샘플링과 배치 추론을 지원하며, 정·부정 샘플 Demo를 제공해 바로 사용할 수 있습니다.
06Xiaomi-CocktailASR-1 프로젝트 주소
GitHub 저장소:https://github.com/xiaomi-research/xiaomi-cocktailasr-1
HuggingFace 모델 저장소:https://huggingface.co/Ease3/Xiaomi-CocktailASR-1
arXiv 기술 논문:https://arxiv.org/pdf/2609.11274
07Xiaomi-CocktailASR-1의 활용 분야
스마트 회의 선택 전사: 여러 사람이 참여하는 회의에서 지정된 발언자의 내용만 전사하고, 다른 참석자의 끼어들기와 대화를 자동으로 필터링합니다.
음성 비서의 기기 소유자 명령 인식: 스마트폰·스피커·차량 환경에서 기기 소유자의 음성에만 응답해 주변 사람의 음성으로 명령이 잘못 실행되는 것을 방지합니다.
고객 서비스 및 품질 검사 녹음 분석: 다중 화자 통화 녹음에서 지정된 한쪽 화자의 전체 발화를 정확하게 추출해 규정 준수 검사와 서비스 평가에 활용합니다.
스마트 홈 음성 제어: TV 소음과 여러 사람의 대화가 있는 가정 환경에서도 리모컨 사용자의 음성 명령을 정확하게 인식해 오작동을 방지합니다.
접근성 청취 및 기록 장치: 청각 장애인이나 기록 담당자가 특정 화자의 음성 내용을 선택적으로 추출해 실시간으로 문자화할 수 있으며, 소음이 많은 사교 환경에서도 듣고 싶은 사람의 말을 집중해서 들을 수 있습니다.
© 면책 조항: 도메인 및 연결된 콘텐츠는 시간이 지나면서 변경될 수 있습니다. AIEZZ은(는) 제3자 웹사이트를 관리하지 않습니다. 외부 콘텐츠와 위험을 독립적으로 검토하세요.


사용자 리뷰0