- Lượt truy cập hàng tháng
- 0
- Giá
- Chưa đặt
- Được liệt kê
- —
- Đã cập nhật
- 2026-09-25
01Spark-ASR-2.0 là gì
Spark-ASR-2.0 là mô hình nhận dạng giọng nói thế hệ mới nhất của iFlytek, được phát triển dựa trên mô hình nền tảng giọng nói Spark-Audio. Mô hình sử dụng kiến trúc phối hợp “phi tự hồi quy + tự hồi quy tăng cường bằng LLM”, hỗ trợ nhận dạng tiếng Trung và tiếng Anh kết hợp, phương ngữ, thuật ngữ chuyên ngành, âm thanh nhỏ trong môi trường nhiều tạp âm cùng các tình huống phức tạp khác. Hiệu quả vượt mức tối ưu hiện nay của ngành, trong khi chi phí suy luận chỉ tăng 10%. Mô hình có thể tự động loại bỏ từ đệm, bổ sung dấu câu và chuẩn hóa cách diễn đạt. Hiện mô hình đã được triển khai trên Bàn phím iFlytek và cung cấp API, sau này sẽ được ứng dụng trên kính AI, thiết bị văn phòng cùng các thiết bị đầu cuối khác.
02Các chức năng chính của Spark-ASR-2.0
Nhận dạng tiếng Trung và tiếng Anh kết hợp: Nhận dạng chính xác trong các tình huống nói trộn phức tạp mà không cần chuyển đổi.
Nhận dạng phương ngữ không cần chuyển đổi: Hỗ trợ phương ngữ của 202 thành phố trên toàn quốc, chuyển đổi chính xác theo cách nói tự nhiên.
Nhận dạng thuật ngữ chuyên ngành: Khả năng nhận dạng các thuật ngữ khó đọc trong y học, hóa học, công nghệ và các lĩnh vực khác được cải thiện rõ rệt.
Nhận dạng trong môi trường âm học phức tạp: Hoạt động vượt trội trong môi trường nhiều tạp âm, âm lượng nhỏ, tốc độ nói nhanh và giọng trẻ em, vượt mức tối ưu hiện nay của ngành.
Nhận dạng theo ngữ cảnh: Kết hợp lịch sử nhận dạng, bản ghi chỉnh sửa và từ khóa, giúp loại bỏ các từ đồng âm và sự mơ hồ về ngữ nghĩa.
Chuẩn hóa văn bản mạch lạc: Tự động rút gọn phần dư thừa, loại bỏ từ đệm, bổ sung dấu câu và chuẩn hóa số, ký hiệu, đơn vị, tạo ra văn bản “nói là thành câu”.
03Nguyên lý công nghệ của Spark-ASR-2.0
Kiến trúc phối hợp phi tự hồi quy và tự hồi quy tăng cường bằng LLM: Kế thừa mô hình phi tự hồi quy của Spark-ASR-1.0, xuất đồng thời toàn bộ chuỗi văn bản trong một lần để đảm bảo hiệu suất suy luận; đồng thời đưa vào cơ chế nhận dạng tự hồi quy tăng cường bằng LLM. Hai cơ chế phối hợp giúp nâng cao độ chính xác tổng thể và khả năng hiểu ngôn ngữ.
Tăng cường kết hợp văn bản và âm học tiếng Trung, tiếng Anh: Xây dựng mô hình và tăng cường riêng cho lớp văn bản và lớp âm học, sau đó tối ưu hóa kết hợp, giúp hiệu quả nhận dạng trong các tình huống phổ biến như tiếng Trung và tiếng Anh kết hợp, phương ngữ và thuật ngữ chuyên ngành được cải thiện đáng kể.
Tiêm ngữ cảnh động: Trong quá trình nhận dạng, liên tục kết hợp nội dung nhận dạng trước đây, bản ghi chỉnh sửa và thông tin từ khóa cá nhân hóa của người dùng, đồng thời dựa vào ngữ cảnh câu trước và câu sau để phân tích, qua đó giảm hiệu quả sai lệch nhận dạng do cách phát âm dễ nhầm lẫn và các danh từ tương tự gây ra.
Kế thừa năng lực của mô hình nền tảng giọng nói: Được xây dựng trên nền tảng giọng nói Spark-Audio-1.0-Preview, kế thừa ưu thế nhận dạng trong các môi trường âm học phức tạp, đồng thời tối ưu chuyên biệt về độ chính xác và tính chuẩn hóa của văn bản.
04Cách sử dụng Spark-ASR-2.0
Cách 1: Trải nghiệm trực tuyến
Cách 2: Bàn phím iFlytek
Cách 3: Tích hợp API (dành cho nhà phát triển)
Mở trang trải nghiệm: Truy cập https://iflytekresearch.iflytek.com/experience/spark-asr
Nhập hoặc ghi âm giọng nói: Nói trực tiếp hoặc tải tệp âm thanh lên trang để xem kết quả nhận dạng theo thời gian thực.
Tải Bàn phím iFlytek: Quét mã hoặc cài đặt phiên bản mới nhất của Bàn phím iFlytek từ cửa hàng ứng dụng.
Chuyển sang nhập liệu bằng giọng nói: Nhấn vào biểu tượng micrô trên giao diện nhập liệu, sau đó nhấn giữ để nói và sử dụng Spark-ASR-2.0 để nhận dạng.
Truy cập nền tảng mở: Đăng nhập nền tảng mở iFlytek tại https://www.xfyun.cn/services/spark_asr_zh_en_v2.0
Tạo ứng dụng và lấy khóa: Sau khi đăng ký ứng dụng, lấy AppID, APIKey cùng các thông tin xác thực khác.
Gọi dịch vụ API: Truyền luồng âm thanh theo tài liệu API để tích hợp chức năng nhận dạng vào ứng dụng của bạn.
05Ưu thế cốt lõi của Spark-ASR-2.0
Hiệu quả nhận dạng dẫn đầu ngành: Vượt mức tốt nhất hiện nay trong các tình huống phương ngữ, nhiều tạp âm, âm lượng nhỏ và các tình huống khác; WER giảm rõ rệt.
Chi phí suy luận cực thấp: Trong khi hiệu quả được cải thiện đáng kể, chi phí suy luận chỉ tăng 10% so với phiên bản 1.0.
Kiến trúc phi tự hồi quy hiệu suất cao: Xuất toàn bộ chuỗi văn bản song song trong một lần, cân bằng độ chính xác cao và hiệu suất suy luận.
Bao phủ toàn diện các tình huống phức tạp: Nhận dạng chính xác tiếng Trung và tiếng Anh kết hợp, phương ngữ của 202 thành phố không cần chuyển đổi, thuật ngữ chuyên ngành, tốc độ nói nhanh và giọng trẻ em.
Hiểu ngữ cảnh mạnh mẽ: Kết hợp lịch sử nhận dạng và từ khóa để khử mơ hồ động, xử lý chính xác từ đồng âm và các danh từ tương tự.
Xuất văn bản mạch lạc: Tự động loại bỏ từ đệm, bổ sung dấu câu, chuẩn hóa số và ký hiệu, trực tiếp xuất văn bản chính thức gọn gàng, liền mạch.
06Tình huống ứng dụng của Spark-ASR-2.0
Nhập liệu di động: Gõ bằng giọng nói trên Bàn phím iFlytek, thoải mái nói trộn tiếng Trung và tiếng Anh hoặc nói phương ngữ; hệ thống tự động tạo văn bản mạch lạc để gửi ngay.
Ghi chép cuộc họp: Thiết bị văn phòng/iFlytek Tingjian chuyển biên nội dung cuộc họp theo thời gian thực; ngay cả phòng họp nhiều tạp âm cũng có thể nhận dạng chính xác và chuẩn hóa thành bản ghi.
Ghi chép trong lĩnh vực chuyên ngành: Ghi âm thảo luận và bài giảng trong các lĩnh vực y học, hóa học, công nghệ, với khả năng chuyển biên chính xác các thuật ngữ phức tạp.
Tương tác với phần cứng thông minh: Nhận dạng khẩu lệnh và hội thoại trên kính AI iFlytek, máy phiên dịch cùng các thiết bị khác, hoạt động ổn định trong môi trường âm lượng nhỏ.
Tích hợp vào nghiệp vụ cho nhà phát triển: Thông qua API của nền tảng mở, cung cấp nền tảng nhận dạng độ chính xác cao, chi phí thấp cho các ứng dụng doanh nghiệp như chăm sóc khách hàng, tạo phụ đề và nhập liệu bằng giọng nói.
© Tuyên bố miễn trừ trách nhiệm: tên miền và nội dung được liên kết có thể thay đổi theo thời gian. AIEZZ không kiểm soát các trang web của bên thứ ba. Hãy tự đánh giá nội dung bên ngoài và các rủi ro liên quan.


Đánh giá của người dùng0