メインコンテンツへ移動
Spark-ASR-2.0

Spark-ASR-2.0 運営中

Spark-ASR-2.0は、科大訊飛が星火音声基盤大規模モデルSpark-Audioを基に開発した最新世代の音声認識大規模モデルです。モデルは「非自己回帰+LLM強化自己回帰」の協調アーキテクチャを採用し、中国語と英語の混在、方言、専門...

Spark-ASR-2.0は、科大訊飛が星火音声基盤大規模モデルSpark-Audioを基に開発した最新世代の音声認識大規模モデルです。モデルは「非自己回帰+LLM強化自己回帰」の協調アーキテクチャを採用し、中国語と英語の混在、方言、専門...

Spark-ASR-2.0
月間訪問数
0
料金
未設定
掲載日
—
更新済み
2026-09-25

01Spark-ASR-2.0とは

Spark-ASR-2.0は、科大訊飛が星火音声基盤大規模モデルSpark-Audioを基に開発した最新世代の音声認識大規模モデルです。モデルは「非自己回帰+LLM強化自己回帰」の協調アーキテクチャを採用し、中国語と英語の混在、方言、専門用語、高ノイズ・小音量などの複雑なシーンにおける認識を実現します。性能は業界最高水準を上回り、推論コストの増加はわずか10%です。モデルは口癖の自動除去、句読点の補完、表現の標準化に対応しており、すでに科大訊飛入力法で提供され、APIも公開されています。今後はAIメガネやスマートノートなどの端末にも展開される予定です。

02Spark-ASR-2.0の主な機能

中国語・英語混在認識:複雑な混在発話を正確に認識し、切り替えは不要です。
方言の切り替え不要認識:全国202都市の方言に対応し、自然に話すだけで正確に変換します。
専門用語認識:医学、化学、科学技術などの難解な専門用語に対する認識能力が大幅に向上しています。
複雑な音響環境での認識:高ノイズ、小音量、高速発話、子どもの音声などで優れた性能を発揮し、業界最高水準を上回ります。
コンテキスト認識:認識履歴、修正履歴、ホットワードを統合し、同音語や意味の曖昧さを解消します。
テキストの流暢化・標準化:冗長表現や口癖を自動的に取り除き、句読点を補完し、数字・記号・単位を標準化して、自然で整った文章として出力します。

03Spark-ASR-2.0の技術原理

非自己回帰とLLM強化自己回帰の協調アーキテクチャ:Spark-ASR-1.0の非自己回帰方式を継承し、テキスト全体を並列に一括出力することで推論効率を確保します。同時に、LLMで強化した自己回帰認識を導入し、両者の協調によって全体的な正確性と言語理解能力を高めています。
中国語・英語混在テキストと音響の共同強化:テキスト面と音響面をそれぞれモデル化・強化したうえで共同最適化を行い、中国語と英語の混在、方言、専門用語などの一般的な認識シーンで性能を大幅に向上させています。
動的コンテキスト注入:認識中にユーザーの過去の認識内容、修正履歴、パーソナライズされたホットワード情報をリアルタイムで統合し、前後の文脈と組み合わせて判断します。これにより、混同しやすい発音や類似した名称による認識の偏りを効果的に解消します。
音声基盤大規模モデルの能力を継承:Spark-Audio-1.0-Preview音声基盤をベースに構築され、複雑な音響環境における認識性能を継承しています。そのうえで、正確性とテキストの標準化に特化した最適化を行っています。

04Spark-ASR-2.0の使い方

方法1:オンライン体験
方法2:科大訊飛入力法
方法3:API連携(開発者向け)
体験ページを開く:https://iflytekresearch.iflytek.com/experience/spark-asr にアクセスします。
音声を入力または録音する:ページ上で直接話すか音声をアップロードすると、認識結果をリアルタイムで確認できます。
科大訊飛入力法をダウンロードする:QRコードをスキャンするか、アプリストアから最新版の科大訊飛入力法をインストールします。
音声入力に切り替える:入力画面でマイクアイコンをタップし、長押しして話すとSpark-ASR-2.0による認識を利用できます。
オープンプラットフォームにアクセスする:科大訊飛オープンプラットフォーム https://www.xfyun.cn/services/spark_asr_zh_en_v2.0 にログインします。
アプリを作成してキーを取得する:アプリを登録すると、AppID、APIKeyなどの認証情報を取得できます。
APIサービスを呼び出す:インターフェース仕様に従って音声ストリームを渡すことで、自分のアプリに認識機能を統合できます。

05Spark-ASR-2.0の主な強み

業界をリードする認識性能:方言、高ノイズ、小音量などのシーンで現在の業界最高水準を上回り、WERを大幅に低減します。
非常に低い推論コスト:性能を大幅に向上させながら、推論コストは1.0と比べてわずか10%の増加に抑えられています。
高効率な非自己回帰アーキテクチャ:テキスト系列を並列に一括出力し、高い正確性と推論効率を両立します。
複雑なシーンを幅広くカバー:中国語と英語の混在、202都市の方言の切り替え不要認識、専門用語、高速発話、子どもの音声を正確に認識できます。
強力なコンテキスト理解:認識履歴とホットワードを動的に統合して曖昧性を解消し、同音語や類似した名称を正確に処理します。
流暢で整った文章を出力:口癖の除去、句読点の補完、数字・記号の標準化を自動で行い、整然とした自然な正式文をそのまま出力します。

06Spark-ASR-2.0の利用シーン

モバイル入力:科大訊飛入力法で音声入力ができ、中国語と英語を混ぜて話したり、方言で自由に話したりしても、自動的に整った文章に変換してそのまま送信できます。
会議記録:スマートノートや科大訊飛聴見で会議内容をリアルタイムに文字起こしし、ノイズの多い会議室でも正確に認識して整った原稿に変換します。
専門分野の記録:医学、化学、科学技術分野の議論や講義を音声記録し、複雑な専門用語も正確に文字起こしします。
スマートハードウェアとの対話:科大訊飛AIメガネや翻訳機などの音声コマンド・対話認識に対応し、小音量の環境でも安定して動作します。
開発者向け業務統合:オープンプラットフォームAPIを通じて、カスタマーサービス、字幕生成、音声入力などの企業アプリケーションに、高精度・低コストの認識基盤を提供します。

© 免責事項:ドメインやリンク先のコンテンツは時間の経過とともに変更される場合があります。AIEZZは第三者のウェブサイトを管理していません。外部コンテンツとリスクはご自身で確認してください。

ユーザーレビュー0