주요 콘텐츠로 건너뛰기
Spark-ASR-2.0

Spark-ASR-2.0 운영 중

Spark-ASR-2.0은 아이플라이텍이 음성 기반 대규모 모델 Spark-Audio를 기반으로 개발한 최신 세대 음성 인식 대규모 모델입니다. 모델은 '비자기회귀 + LLM 강화 자기회귀' 협력 아키텍처를 적용해 중국어·영어 혼합, 방언, 전문...

Spark-ASR-2.0은 아이플라이텍이 음성 기반 대규모 모델 Spark-Audio를 기반으로 개발한 최신 세대 음성 인식 대규모 모델입니다. 모델은 '비자기회귀 + LLM 강화 자기회귀' 협력 아키텍처를 적용해 중국어·영어 혼합, 방언, 전문...

Spark-ASR-2.0
월간 방문 수
0
가격
설정되지 않음
등록일
—
업데이트됨
2026-09-25

01Spark-ASR-2.0이란

Spark-ASR-2.0은 아이플라이텍이 음성 기반 대규모 모델 Spark-Audio를 기반으로 개발한 최신 세대 음성 인식 대규모 모델입니다. 모델은 ”비자기회귀 + LLM 강화 자기회귀” 협력 아키텍처를 적용해 중국어·영어 혼합, 방언, 전문 용어, 고소음·저음량 등 복잡한 환경의 음성을 인식합니다. 업계 최고 수준을 뛰어넘는 성능을 구현하면서도 추론 비용 증가는 10%에 불과합니다. 또한 말버릇을 자동으로 제거하고 문장 부호를 보완하며 표현을 정规范화할 수 있습니다. 현재 아이플라이텍 입력기에 적용되었고 API도 공개되었으며, 향후 AI 안경과 스마트 오피스 기기 등 다양한 단말에 적용될 예정입니다.

02Spark-ASR-2.0의 주요 기능

중국어·영어 혼합 인식: 복잡한 혼합 발화 환경에서도 언어를 전환할 필요 없이 정확하게 인식합니다.
방언 무전환 인식: 중국 전역 202개 도시의 방언을 지원하며, 자연스럽게 말해도 정확하게 변환합니다.
전문 용어 인식: 의학, 화학, 과학기술 등 발음이 까다로운 전문 용어의 인식 능력이 크게 향상되었습니다.
복잡한 음향 환경 인식: 고소음, 저음량, 빠른 말속도, 아동 음성 등의 환경에서 뛰어난 성능을 발휘하며 업계 최고 수준을 능가합니다.
문맥 인식: 인식 기록, 수정 기록 및 사용자 지정 핫워드를 융합해 동음이의어와 의미적 모호성을 해소합니다.
텍스트 유창성 및 규범화: 중복 표현을 자동으로 간소화하고 말버릇을 제거하며 문장 부호를 보완하고 숫자·기호·단위를 표준화해 ”말하는 즉시 완성된 문장”을 구현합니다.

03Spark-ASR-2.0의 기술 원리

비자기회귀 및 LLM 강화 자기회귀 협력 아키텍처: Spark-ASR-1.0의 비자기회귀 방식을 계승해 전체 텍스트 시퀀스를 병렬로 한 번에 출력함으로써 추론 효율을 보장합니다. 동시에 LLM으로 강화된 자기회귀 인식을 도입해 두 방식의 협력으로 전반적인 정확도와 언어 이해 능력을 향상합니다.
중국어·영어 혼합 텍스트 및 음향 공동 강화: 텍스트와 음향을 각각 모델링하고 강화한 뒤 공동 최적화를 수행해 중국어·영어 혼합, 방언, 전문 용어 등 일반적인 인식 환경에서 성능을 크게 향상합니다.
동적 문맥 주입: 인식 과정에서 사용자의 과거 인식 내용, 수정 기록 및 개인화 핫워드 정보를 실시간으로 융합하고 앞뒤 문맥과 결합해 의미를 판단합니다. 이를 통해 혼동하기 쉬운 발음과 유사 명사로 인한 인식 편차를 효과적으로 줄입니다.
음성 기반 대규모 모델 역량 계승: 전체 모델은 Spark-Audio-1.0-Preview 음성 기반 모델을 바탕으로 구축되었으며, 복잡한 음향 환경에서의 인식 강점을 계승했습니다. 이를 기반으로 정확도와 텍스트 규범성을 중점적으로 최적화했습니다.

04Spark-ASR-2.0 사용 방법

방법 1: 온라인 체험
방법 2: 아이플라이텍 입력기
방법 3: API 연동(개발자용)
체험 페이지 열기: https://iflytekresearch.iflytek.com/experience/spark-asr에 접속합니다.
음성 입력 또는 녹음: 페이지에서 직접 말하거나 오디오를 업로드하면 인식 결과를 실시간으로 확인할 수 있습니다.
아이플라이텍 입력기 다운로드: QR 코드를 스캔하거나 앱 스토어에서 최신 버전의 아이플라이텍 입력기를 설치합니다.
음성 입력으로 전환: 입력 화면에서 마이크 아이콘을 누르고 길게 말하면 Spark-ASR-2.0으로 인식할 수 있습니다.
오픈 플랫폼 방문: 아이플라이텍 오픈 플랫폼 https://www.xfyun.cn/services/spark_asr_zh_en_v2.0에 로그인합니다.
애플리케이션 생성 및 키 발급: 애플리케이션을 등록한 후 AppID, APIKey 등의 인증 정보를 발급받습니다.
API 서비스 호출: 인터페이스 문서에 따라 오디오 스트림을 전달하면 자체 애플리케이션에 인식 기능을 통합할 수 있습니다.

05Spark-ASR-2.0의 핵심 강점

업계 선도적 인식 성능: 방언, 고소음, 저음량 등의 환경에서 현재 업계 최고 수준을 능가하며 WER이 크게 감소했습니다.
매우 낮은 추론 비용: 성능이 크게 향상되었음에도 추론 비용은 1.0 대비 10%만 증가했습니다.
효율적인 비자기회귀 아키텍처: 텍스트 시퀀스를 병렬로 한 번에 출력해 높은 정확도와 추론 효율을 모두 확보합니다.
복잡한 환경 전반 지원: 중국어·영어 혼합, 202개 도시 방언 무전환 인식, 전문 용어, 빠른 말속도, 아동 음성을 모두 정확하게 인식합니다.
강력한 문맥 이해: 인식 기록과 핫워드를 동적으로 융합해 의미를 판별하고 동음이의어와 유사 명사를 정확하게 처리합니다.
유창한 문서형 출력: 말버릇을 자동으로 제거하고 문장 부호를 보완하며 숫자와 기호를 표준화해 정돈되고 일관된 공식 텍스트를 바로 출력합니다.

06Spark-ASR-2.0의 적용 분야

모바일 입력: 아이플라이텍 입력기에서 음성으로 입력할 수 있으며, 중국어와 영어를 섞어 말하거나 방언을 사용해도 자동으로 ”말하는 즉시 완성된 문장”으로 변환해 바로 전송할 수 있습니다.
회의 기록: 오피스 기기/아이플라이텍 Tingjian에서 회의 내용을 실시간으로 변환하며, 소음이 큰 회의실에서도 정확하게 인식해 문서 형식으로 정리합니다.
전문 분야 기록: 의학, 화학, 과학기술 분야의 토론과 강의를 음성으로 기록하고 복잡한 전문 용어를 정확하게 받아씁니다.
스마트 하드웨어 상호작용: 아이플라이텍 AI 안경, 번역기 등 기기의 음성 명령과 대화를 인식하며 음량이 낮은 환경에서도 안정적으로 작동합니다.
개발자 업무 통합: 오픈 플랫폼 API를 통해 고객 서비스, 자막 생성, 음성 입력 등 기업 애플리케이션에 높은 정확도와 낮은 비용의 음성 인식 기반 기능을 제공합니다.

© 면책 조항: 도메인 및 연결된 콘텐츠는 시간이 지나면서 변경될 수 있습니다. AIEZZ은(는) 제3자 웹사이트를 관리하지 않습니다. 외부 콘텐츠와 위험을 독립적으로 검토하세요.

사용자 리뷰0