Chuyển đến nội dung chính
Qwen3.8-Omni-Flash

Qwen3.8-Omni-Flash Đang hoạt động

Qwen3.8-Omni-Flash là mô hình đa phương thức nguyên bản do Qwen của Alibaba phát triển, hỗ trợ đầu vào văn bản, hình ảnh, âm thanh, video và ngữ cảnh dài 1M, tập trung vào năng lực Agent “từ hiểu đến bàn giao”, có thể tự hoàn thành biên tập video, sáng tác MV...

Qwen3.8-Omni-Flash là mô hình đa phương thức nguyên bản do Qwen của Alibaba phát triển, hỗ trợ đầu vào văn bản, hình ảnh, âm thanh, video và ngữ cảnh dài 1M, tập trung vào năng lực Agent “từ hiểu đến bàn giao”, có thể tự hoàn thành biên tập video, sáng tác MV...

Qwen3.8-Omni-Flash
Lượt truy cập hàng tháng
0
Giá
Chưa đặt
Được liệt kê
—
Đã cập nhật
2026-09-18

01Qwen3.8-Omni-Flash là gì

Qwen3.8-Omni-Flash là mô hình đa phương thức nguyên bản do Qwen của Alibaba phát triển, hỗ trợ đầu vào văn bản, hình ảnh, âm thanh, video và ngữ cảnh dài 1M, tập trung vào năng lực Agent “từ hiểu đến bàn giao”, có thể tự hoàn thành các quy trình đầu cuối như biên tập video, sáng tác MV, dịch phim ngắn, thuyết minh phim và thực hiện biên bản cuộc họp. So với thế hệ trước, hiệu năng trung bình tăng hơn 25%, giá đầu vào âm thanh qua API giảm hơn 98%, đồng thời mã nguồn mở hai framework đi kèm là Qwen-MM-Plugins và Qwen-Live Harness.

02Các tính năng chính của Qwen3.8-Omni-Flash

Caption âm thanh và video có thể điều khiển: Người dùng có thể tự do chỉ định đối tượng mô tả, khoảng thời gian, mức độ chi tiết thông tin và định dạng đầu ra, để đạt được “người dùng muốn biết gì” thay vì “mô hình đã nhìn thấy gì”.
Hiểu âm thanh và video dài theo hướng Agent: Từ câu hỏi, mô hình tự quyết định cần xem ở đâu và nghe gì, định vị thông tin then chốt qua nhiều vòng thu thập bằng chứng từ khái quát đến chi tiết; độ chính xác tăng trong khi mức tiêu thụ token giảm khoảng 45.7%.
Hiểu và thực thi cuộc họp dài: Hỗ trợ nguyên bản đầu vào âm thanh và video dài một giờ, hoàn thành đầu cuối việc phân tách người nói, chuyển lời nói thành văn bản, đối chiếu danh tính, tạo biên bản và thực hiện các việc cần làm.
Nghiên cứu chuyên sâu về âm thanh và video: Kết hợp nội dung video với nhu cầu người dùng, tự động tìm kiếm tài liệu đa phương thức và tạo báo cáo nghiên cứu lấy video làm trung tâm, kết hợp hình ảnh với văn bản.
Music2MV: Hiểu chi tiết cấu trúc, nhịp điệu và cảm xúc của bài hát, xuất lời bài hát kèm dấu thời gian, bao phủ toàn bộ quy trình sáng tác MV từ hiểu âm nhạc đến kiểm duyệt thành phẩm.
Dịch phim ngắn: Chỉ với một câu lệnh, hoàn thành nhận diện lời thoại nhân vật, dịch khẩu ngữ, lồng tiếng sao chép giọng, phối lại track âm thanh và kiểm duyệt, tự động hóa việc bàn giao bản dịch.
Thuyết minh phim dài: Nhập bộ phim và một yêu cầu ngắn, tự động hoàn thành việc hiểu toàn bộ phim, chắt lọc tình tiết, viết lời thuyết minh, lồng tiếng, phối nhạc, biên tập, kết xuất và kiểm duyệt.
Video2Note: Nén video dài vài giờ thành ghi chú PDF có hình ảnh và văn bản tương ứng, kèm dấu thời gian, đồng thời tự động rà soát, lặp lại và chỉnh sửa.
Omni Skill Creator: Chắt lọc SOP từ phần trình diễn thao tác hoặc bài giảng của chuyên gia, chuyển thành Agent Skill có thể tái sử dụng sau khi kiểm chứng.
Luyện nói theo thời gian thực: Đồng mô hình hóa phát âm và ngữ nghĩa, hiểu sai lệch về giọng và tạo mẫu phát âm chuẩn theo thời gian thực.

03Nguyên lý kỹ thuật của Qwen3.8-Omni-Flash

Theo dõi WeChat và trả lời “开源” để tham gia nhóm trao đổi dự án mã nguồn mở AI
Kiến trúc thống nhất đa phương thức nguyên bản: Mô hình đồng mô hình hóa văn bản, hình ảnh, âm thanh và video trong một kiến trúc duy nhất. Thông qua mã hóa căn chỉnh giữa các phương thức và không gian biểu diễn thống nhất, mô hình thực hiện hiểu liên phương thức, đồng thời duy trì năng lực văn bản tương đương mô hình chỉ xử lý văn bản cùng kích thước; ngữ cảnh dài 1M token cho phép tiếp nhận nguyên bản đầu vào âm thanh và video dài vài giờ, tránh tình trạng thông tin bị phân mảnh do xử lý theo từng đoạn.
Cảm nhận và thu thập bằng chứng theo nhu cầu kiểu Agent: Mô hình trước tiên quét ở mức khái quát để định vị các đoạn tiềm năng, sau đó lấy nội dung hình ảnh và âm thanh liên quan ở mức chi tiết để đối chiếu, hình thành chuỗi thu thập bằng chứng nhiều vòng từ khái quát đến chi tiết, tập trung tài nguyên tính toán và ngân sách token vào những đoạn thực sự liên quan.
Phối hợp giữa âm thanh, video và môi trường Agent: Điểm nghẽn của việc chuyển âm thanh và video dài thành Agent là harness thiếu hỗ trợ âm thanh và video nguyên bản. Vì vậy, đội ngũ phát triển chính thức tiến hóa phối hợp giữa mô hình và chuỗi công cụ: Qwen-MM-Plugins cung cấp khả năng cảm nhận theo nhu cầu, gọi công cụ và thực thi quy trình; tích hợp các framework Agent phổ biến như Claude Code và OpenClaw, kết nối việc hiểu tư liệu, lập kế hoạch tác vụ, thực thi công cụ và bàn giao kết quả thành một chuỗi hoàn chỉnh.
Nhận diện phối hợp hình ảnh và âm thanh của nhiều người nói: Mô hình đồng mô hình hóa luồng hình ảnh và âm thanh, sử dụng thông tin thị giác như sự xuất hiện và trạng thái mở miệng của nhân vật trong khung hình để hỗ trợ giải quyết sự mơ hồ về tham chiếu và thực thể trong âm thanh, hoàn thành đầu cuối việc phân tách người nói, chuyển giọng nói thành văn bản và đối chiếu danh tính. Nhờ đó, các chỉ số nhận diện trong bối cảnh họp có nhiều người phát biểu luân phiên và chồng lấn âm thanh được cải thiện đáng kể.
Kiến trúc tương tác luồng thời gian thực: Qwen3.8-Omni-Flash-Realtime nhận luồng âm thanh và video qua WebSocket/WebRTC, đồng thời thực hiện cảm nhận và phản hồi trong lúc nhận đầu vào. Độ trễ token đầu tiên khoảng 600-980ms, RTF tạo âm thanh khoảng 0.153; việc sửa lỗi nói dựa trên đồng mô hình hóa phát âm và ngữ nghĩa. Khi luồng giọng nói mới đến, mô hình liên tục cập nhật phán đoán để phân biệt lỗi ảnh hưởng đến khả năng hiểu với giọng địa phương tự nhiên.

04Cách sử dụng Qwen3.8-Omni-Flash

Dùng trực tiếp trên web: Mở nền tảng Qwen AI https://www.qianwenai.com/models/qwen3.8-omni-flash, tìm qwen3.8-omni-flash, sau đó tải video/âm thanh/hình ảnh lên để trò chuyện.
Gọi API: Đăng ký API Key của Alibaba Cloud DashScope, gọi qua giao diện tương thích với OpenAI, chỉ cần truyền liên kết hình ảnh, âm thanh, video cùng câu hỏi bằng văn bản.
Cài plugin để giao việc: Cài Qwen-MM-Plugins trong các công cụ như Claude Code và Qwen Code, sau đó chỉ cần nói như đang trò chuyện: “@video.mp4 hãy giúp tôi tạo thành video thuyết minh”, AI sẽ tự động hoàn thành toàn bộ quy trình.

05Ưu thế cốt lõi của Qwen3.8-Omni-Flash

Thống nhất đa phương thức: Một mô hình xử lý toàn bộ văn bản, hình ảnh, âm thanh và video, hỗ trợ ngữ cảnh siêu dài 1M, có thể tiếp nhận nguyên bản video dài một giờ.
Từ hiểu đến bàn giao: Không chỉ “hiểu” âm thanh và video mà còn có thể tự lập kế hoạch, gọi công cụ, tạo thành phẩm và tài liệu, hoàn thành tác vụ đầu cuối.
Năng lực Agent nổi bật: Dẫn đầu đáng kể trong các benchmark Agent âm thanh và video; WildClawBench-MM tăng 36.5 điểm so với thế hệ trước, tác vụ dài đạt 69.6 điểm cao trên UniClawBench.
Năng lực âm thanh vượt Gemini: Nhận diện giọng nói 60 ngôn ngữ, 39 phương ngữ tiếng Trung và nhận diện nhiều người nói đều vượt Gemini 3.8 Flash.
Hiệu quả cao hơn, tiết kiệm hơn: Thu thập bằng chứng theo hướng Agent giúp giảm khoảng 45.7% mức tiêu thụ token khi hiểu video dài, trong khi độ chính xác không giảm mà còn tăng.
Giá giảm mạnh: Giá đầu vào âm thanh qua API giảm hơn 98% mỗi giờ, đầu vào âm thanh và video giảm hơn 93%, giảm đáng kể áp lực chi phí khi sử dụng ở quy mô lớn.
Bộ công cụ mã nguồn mở hoàn chỉnh: Qwen-MM-Plugins và Qwen-Live Harness đều được mở nguồn, tương thích với các framework Agent phổ biến như Claude Code và OpenClaw.

06Địa chỉ dự án Qwen3.8-Omni-Flash

Kho GitHub: Qwen-MM-Plugins: https://github.com/QwenLM/Qwen-MM-Plugins
Qwen-Live Harness: https://github.com/QwenLM/Qwen-Live-Harness

07Các kịch bản ứng dụng của Qwen3.8-Omni-Flash

Sản xuất nội dung video: Nhập một yêu cầu, tự động hoàn thành việc bàn giao đầu cuối cho thuyết minh phim, sản xuất MV và dịch, lồng tiếng phim ngắn.
Công cụ nâng cao hiệu quả cuộc họp: Tải lên video cuộc họp dài một giờ, tự động tạo biên bản và danh sách việc cần làm, thậm chí trực tiếp gửi email và tạo nhiệm vụ.
Tích lũy kiến thức học tập: Tự động nén video hướng dẫn dài vài giờ thành ghi chú PDF có ảnh chụp màn hình và dấu thời gian.
Nghiên cứu chuyên sâu về video: Tự động tìm kiếm tài liệu hình ảnh và văn bản trên toàn mạng dựa trên nội dung video, tạo báo cáo nghiên cứu chuyên sâu kết hợp hình ảnh với văn bản.
Dịch vụ tương tác thời gian thực: Các kịch bản tương tác âm thanh và video có độ trễ thấp như luyện nói theo thời gian thực, chăm sóc khách hàng thông minh và dẫn đường nhận biết vị trí qua âm thanh.

© Tuyên bố miễn trừ trách nhiệm: tên miền và nội dung được liên kết có thể thay đổi theo thời gian. AIEZZ không kiểm soát các trang web của bên thứ ba. Hãy tự đánh giá nội dung bên ngoài và các rủi ro liên quan.

Đánh giá của người dùng0