모든 AI 도구
AI 음성 인식
AI 음성 인식 분야의 인기 AI 제품을 모아 창작, 처리, 효율 향상 등 다양한 활용 사례를 제공합니다.
Spark-ASR-2.0AI 음성 인식Spark-ASR-2.0은 아이플라이텍이 음성 기반 대규모 모델 Spark-Audio를 기반으로 개발한 최신 세대 음성 인식 대규모 모델입니다. 모델은 '비자기회귀 + LLM 강화 자기회귀' 협력 아키텍처를 적용해 중국어·영어 혼합, 방언, 전문...00
Xiaomi-CocktailASR-1AI 음성 인식Xiaomi-CocktailASR-1은 샤오미가 오픈 소스로 공개한 타깃 화자 음성 인식 대형 모델로, LLM 엔드투엔드 아키텍처를 기반으로 합니다. 참조 음성을 화자 음성 특징 프롬프트로 사용하며, 음성 분리 없이 여러 사람이 섞인 음성에서 타깃 화자의 발화를 정확하게 전사...00
MAI-Transcribe-2AI 음성 인식MAI-Transcribe-2는 Microsoft가 출시한 최고 성능의 AI 음성-텍스트 변환 모델로, 정확도·속도·비용 모든 측면에서 앞서갑니다. 60개 언어를 지원하며 FLEURS 테스트 세트에서 평균 단어 오류율은 5.2%에 불과합니다.00
SmartSub – 오픈 소스 올인원 오디오·비디오 자막 처리 데스크톱 도구AI 음성 인식SmartSub(妙幕)는 오픈 소스 올인원 오디오·비디오 자막 처리 데스크톱 도구입니다. 전체 작업 과정을 하나의 애플리케이션으로 통합했으며, Whisper, FunASR, Qwen3-ASR 등의 로컬 모델을 기반으로 오프라인 음성 인식을 지원합니다. 20가지 이상의 번역 서비스와 다중 화자 AI 더빙을 제공하며, Bilibili, YouTube 등 플랫폼과 호환되는 온라인 동영상 다운로더를 내장하고 있습니다. NVIDIA CUDA, Apple Core ML 등의 하드웨어 가속을 지원하며 Windows, macOS, Linux 세 플랫폼에서 로컬로 실행됩니다.00
Hy ASR 3.0 preview – 텐센트 혼위안이 출시한 차세대 음성 인식 모델AI 음성 인식Hy ASR 3.0 preview – 텐센트 혼위안이 출시한 차세대 음성 인식 모델은 Hy3 대규모 언어 모델을 기반으로 한 차세대 음성 인식 시스템으로, 고정밀 음성 인식과 심층 의미 이해를 결합합니다. 중국어, 영어, 광둥어 및 10개 주요 방언 지역을 지원하며, 문맥 기반 지능형 교정, 핫워드 주입, 고소음·속삭임 등 복잡한 환경에서의 강건성을 갖추고 있습니다. 오픈 소스 평가 세트의 WER은 약 3%로 유지되며, 자체 평가 세트에서는 경쟁 제품을 전반적으로 앞섭니다. 이 모델은 지능형 고객 서비스, 콘텐츠 제작, 음성 검색, 업무 협업 및 스마트 단말기 등의 시나리오에 적합하며, 텐센트 클라우드 API를 통해 연동하거나 텐센트 위안바오에서 무료로 체험할 수 있습니다.00이 카테고리의 모든 도구가 표시됩니다.
