Chuyển đến nội dung chính
MAI-Transcribe-2

MAI-Transcribe-2 Đang hoạt động

MAI-Transcribe-2 là mô hình AI chuyển giọng nói thành văn bản mạnh mẽ nhất do Microsoft phát triển, dẫn đầu toàn diện về độ chính xác, tốc độ và chi phí. Mô hình hỗ trợ 60 ngôn ngữ, với tỷ lệ lỗi từ trung bình chỉ 5,2% trên bộ kiểm thử FLEURS.

MAI-Transcribe-2 là mô hình AI chuyển giọng nói thành văn bản mạnh mẽ nhất do Microsoft phát triển, dẫn đầu toàn diện về độ chính xác, tốc độ và chi phí. Mô hình hỗ trợ 60 ngôn ngữ, với tỷ lệ lỗi từ trung bình chỉ 5,2% trên bộ kiểm thử FLEURS.

MAI-Transcribe-2
Lượt truy cập hàng tháng
0
Giá
Chưa đặt
Được liệt kê
—
Đã cập nhật
2026-09-04

01MAI-Transcribe-2 là gì

MAI-Transcribe-2 là mô hình AI chuyển giọng nói thành văn bản mạnh mẽ nhất do Microsoft phát triển, dẫn đầu toàn diện về độ chính xác, tốc độ và chi phí. Mô hình hỗ trợ 60 ngôn ngữ, với tỷ lệ lỗi từ trung bình chỉ 5,2% trên bộ kiểm thử FLEURS. Mô hình bổ sung tính năng phân tách người nói và dấu thời gian theo từng từ, cung cấp hai kiểu chuyển biên verbatim (giữ lại lỗi nói) và clean (xóa từ đệm), đồng thời hỗ trợ tự động nhận diện và chuyển đổi ngôn ngữ.

02Các tính năng chính của MAI-Transcribe-2

Chuyển giọng nói đa ngôn ngữ: Hỗ trợ 60 ngôn ngữ, tự động phát hiện ngôn ngữ của bản ghi âm mà không cần chỉ định trước.
Phân tách người nói: Phân biệt các diễn giả khác nhau trong một bản ghi âm và gán văn bản chuyển biên cho đúng người nói.
Dấu thời gian theo từng từ: Gắn vị trí thời gian chính xác cho mỗi từ, thuận tiện cho việc căn chỉnh phụ đề, tìm kiếm và chỉnh sửa âm thanh.
Kiểu chuyển biên có thể cấu hình: Chế độ verbatim giữ lại từ cảm thán và lỗi nói; chế độ clean xóa từ đệm để tạo văn bản dễ đọc.
Tự động nhận diện và chuyển đổi ngôn ngữ: Hỗ trợ hội thoại sử dụng kết hợp tự nhiên nhiều ngôn ngữ, tự động phát hiện và thích ứng khi ngôn ngữ thay đổi.
Ưu tiên từ khóa: Có thể thiết lập danh sách thuật ngữ chuyên ngành để nâng cao độ chính xác nhận diện các từ cụ thể.
Chuyển biên trong môi trường nhiễu: Duy trì độ chính xác cao khi chuyển biên trong môi trường có tiếng ồn nền.

03Nguyên lý công nghệ của MAI-Transcribe-2

Kiến trúc hợp nhất đầu cuối: Sử dụng một mạng nơ-ron duy nhất để trực tiếp ánh xạ đặc trưng âm thanh thành chuỗi văn bản, tích hợp nhận dạng giọng nói, phân tách người nói, phát hiện ngôn ngữ và các tác vụ khác trong cùng một mô hình. Cách tiếp cận này tránh tích lũy sai số của các hệ thống nhiều tầng truyền thống, đồng thời tối ưu cả tốc độ và độ chính xác.
Huấn luyện liên hợp đa ngôn ngữ: Được huấn luyện liên hợp trên khối lượng lớn dữ liệu giọng nói-văn bản của 60 ngôn ngữ, mô hình học được các biểu diễn âm thanh và quy luật ngôn ngữ dùng chung giữa các ngôn ngữ. Nhờ đó, mô hình không chỉ bao phủ các ngôn ngữ phổ biến mà còn duy trì độ chính xác cao với các ngôn ngữ ít tài nguyên, đồng thời có khả năng phát hiện chuyển đổi ngôn ngữ theo thời gian thực một cách tự nhiên.
Giải mã nhận biết ngữ cảnh: Trong quá trình giải mã, mô hình không chỉ dự đoán dựa trên khung âm thanh hiện tại mà còn kết hợp ngữ nghĩa ngữ cảnh toàn cục và ưu tiên từ khóa bên ngoài để suy luận đồng thời. Mô hình tự động điều chỉnh phân phối xác suất của các từ đầu ra, nâng cao độ chính xác nhận diện thuật ngữ chuyên ngành và hỗ trợ sinh có kiểm soát theo hai kiểu verbatim và clean.

04Cách sử dụng MAI-Transcribe-2

Tạo tài nguyên Azure: Tạo tài nguyên AI Speech trong cổng Azure để lấy khóa API và địa chỉ điểm cuối theo khu vực.
Kết nối Foundry Preview: Truy cập giao diện gọi mô hình qua cổng xem trước công khai Microsoft Foundry tại https://ai.azure.com/catalog/models/MAI-Transcribe-2.
Cấu hình tham số mô hình: Trong yêu cầu API, chỉ định model: "MAI-Transcribe-2" và bật tính năng phân tách người nói, dấu thời gian theo từng từ khi cần.
Tải lên và chuyển biên âm thanh: Gửi tệp âm thanh ở các định dạng như WAV/MP3/MP4; mô hình sẽ tự động phát hiện ngôn ngữ và thực hiện chuyển biên.
Nhận kết quả có cấu trúc: Nhận JSON trả về, bao gồm toàn bộ văn bản, dấu thời gian theo từng từ, nhãn người nói và mã ngôn ngữ được tự động phát hiện.

05Ưu thế cốt lõi của MAI-Transcribe-2

Độ chính xác dẫn đầu toàn cầu: Tỷ lệ lỗi từ trung bình chỉ 5,2% trên 60 ngôn ngữ của FLEURS, thấp tới 4,5% đối với tiếng Trung, vượt trội Gemini 3.1 Pro và Whisper v3-Large trên mọi mặt.
Tốc độ nhanh nhất ngành: Tốc độ xử lý đạt 403,6 lần thời gian thực; hoàn tất khoảng 9 giây cho 1 giờ âm thanh, nhanh hơn GPT-Transcribe 10 lần.
Chi phí thấp nhất ngành: Giá giới hạn trong thời gian nhất định là 0,10 USD/giờ, giảm khoảng 72% so với thế hệ trước.
Tích hợp tính năng gốc: Tích hợp sẵn phân tách người nói, dấu thời gian theo từng từ, tự động nhận diện và chuyển đổi ngôn ngữ, cùng hai kiểu chuyển biên verbatim/clean, không cần hậu xử lý bổ sung.
Phủ đa ngôn ngữ liền mạch: Hỗ trợ 60 ngôn ngữ, tự động phát hiện và thích ứng với hội thoại kết hợp tự nhiên nhiều ngôn ngữ mà không cần chỉ định trước.

06Các kịch bản ứng dụng của MAI-Transcribe-2

Kiểm soát và phân tích chất lượng trung tâm cuộc gọi: Sử dụng tính năng phân tách người nói để phân biệt nhân viên chăm sóc khách hàng và khách hàng, kết hợp dấu thời gian theo từng từ để đo tỷ lệ lời thoại và xác định chính xác các thời điểm quan trọng.
Ghi chép thông minh cuộc họp và phỏng vấn: Chuyển bản ghi âm nhiều người thành văn bản có cấu trúc kèm nhãn người nói, tự động gán các hạng mục hành động và nguồn quyết định.
Chép lời thời gian thực cho tác nhân giọng nói: Đóng vai trò là lớp đầu vào thính giác có độ trễ thấp, kết hợp với MAI-Voice-2 Flash để tạo vòng hội thoại giọng nói-thành-giọng nói theo thời gian thực.
Phụ đề và bản địa hóa nội dung truyền thông: Dấu thời gian theo từng từ giúp giảm đáng kể chi phí căn chỉnh phụ đề; hỗ trợ 60 ngôn ngữ cho hoạt động sản xuất nội dung toàn cầu.
Lưu trữ bằng chứng tuân thủ, pháp lý và quản lý: Tạo bản ghi chính xác có thông tin người nói và dấu thời gian, đáp ứng yêu cầu kiểm toán và thu thập bằng chứng trong các ngành như tài chính và y tế.

© Tuyên bố miễn trừ trách nhiệm: tên miền và nội dung được liên kết có thể thay đổi theo thời gian. AIEZZ không kiểm soát các trang web của bên thứ ba. Hãy tự đánh giá nội dung bên ngoài và các rủi ro liên quan.

Đánh giá của người dùng0