- Lượt truy cập hàng tháng
- 0
- Giá
- Miễn phí và Trả phí
- Được liệt kê
- 2026-08-05
- Đã cập nhật
- 2026-08-05
01JoyAI-Video-Edit là gì
JoyAI-Video-Edit là mô hình chỉnh sửa video phát trực tuyến theo thời gian thực do JD.com tự nghiên cứu và mã nguồn mở. Dựa trên kiến trúc khuếch tán tự hồi quy với 16B tham số, mô hình đạt tốc độ suy luận 30FPS ở độ phân giải 720P và hỗ trợ chỉnh sửa phát trực tuyến ổn định với video có độ dài bất kỳ. Người dùng có thể dùng lệnh ngôn ngữ tự nhiên để chỉnh sửa nhân vật, bối cảnh, phong cách và vật thể theo thời gian thực trong khi video đang phát mà không cần chờ tạo xong toàn bộ video. Trong đánh giá OpenVE-Bench, mô hình vượt qua tất cả phương pháp chỉnh sửa phát trực tuyến, dẫn đầu toàn diện trên mọi chỉ số, đồng thời cung cấp hướng tổng hợp dữ liệu quy mô lớn cho trí tuệ hiện thân.
02Các tính năng chính của JoyAI-Video-Edit
Chỉnh sửa phát trực tuyến theo thời gian thực: chỉnh sửa ngay khi khung hình video đến, không cần biết trước toàn bộ chuỗi.
Điều khiển bằng lệnh mở: hỗ trợ chuyển đổi phong cách toàn cục, thêm, xóa và sửa đối tượng cục bộ, thay thế nền, điều chỉnh chuyển động và chỉnh sửa theo ảnh tham chiếu.
Xử lý video có độ dài bất kỳ: vượt qua giới hạn theo giây hoặc phút, cho phép chỉnh sửa ổn định liên tục trong khi video phát.
Triển khai thông lượng cao 720P: pipeline đầu cuối đạt 30.19 FPS ở độ phân giải 720×1280.
Khả năng chỉnh sửa đa chiều: bao phủ các tác vụ như thay trang phục nhân vật, chuyển đổi bối cảnh, chuyển đổi phong cách, thay thế vật thể và chỉnh sửa phụ đề.
03Nguyên lý kỹ thuật của JoyAI-Video-Edit
Theo dõi WeChat và trả lời “开源” để tham gia nhóm trao đổi dự án mã nguồn mở AI
Bộ mã hóa điều kiện MLLM: sử dụng mô hình ngôn ngữ lớn đa phương thức để mã hóa lệnh ngôn ngữ tự nhiên thành điều kiện chỉnh sửa, thực hiện điều khiển ngữ nghĩa mở.
VAE video nhân quả: sử dụng bộ mã hóa tự động biến phân có cấu trúc thời gian nhân quả để nén và tái dựng khung hình video, đảm bảo tính nhất quán theo thời gian trong bối cảnh phát trực tuyến.
Backbone MMDiT 16B tham số: lấy Transformer khuếch tán đa phương thức 16B làm cốt lõi, kết hợp đặc trưng văn bản và hình ảnh để thực hiện sinh khuếch tán tự hồi quy.
Chưng cất khớp phân phối tự hồi quy: tăng tốc suy luận thông qua chiến lược chưng cất căn chỉnh phân phối tự hồi quy, giảm đáng kể khác biệt phân phối giữa huấn luyện và suy luận.
Tối ưu miền thời gian dài và suy luận KV có giới hạn: đưa vào tối ưu độ ổn định miền thời gian dài cùng cơ chế bộ nhớ đệm KV có giới hạn, hạn chế hiện tượng trôi theo thời gian tích lũy và duy trì thông lượng cao.
04Cách sử dụng JoyAI-Video-Edit
Chuẩn bị môi trường: tạo môi trường Conda với python=3.10 và cài đặt các phụ thuộc trong requirements.txt.
Tải trọng số: lấy các tệp mô hình từ Hugging Face và đặt checkpoint theo cấu trúc thư mục được chỉ định.
Khởi động dịch vụ: vào thư mục deploy và chạy bash run_server.sh để khởi động máy chủ cục bộ.
Truy cập giao diện: mở http://localhost:8080 trong trình duyệt để vào giao diện chỉnh sửa tương tác.
Chỉnh sửa theo thời gian thực: tải video lên hoặc kết nối luồng camera, sau đó nhập lệnh ngôn ngữ tự nhiên để vừa phát vừa chỉnh sửa.
05Ưu điểm cốt lõi của JoyAI-Video-Edit
Chỉnh sửa phát trực tuyến theo thời gian thực: xử lý ngay khi khung hình video đến, không cần chờ toàn bộ chuỗi, mang lại trải nghiệm tương tác “vừa phát vừa chỉnh sửa” thực sự.
Ưu việt cả về tốc độ và chất lượng: suy luận đầu cuối đạt 30.19 FPS ở độ phân giải 720P, vượt qua tất cả phương pháp chỉnh sửa phát trực tuyến và ngoại tuyến trong đánh giá OpenVE-Bench.
Đầu ra ổn định với video có độ dài bất kỳ: vượt qua giới hạn chỉ hỗ trợ các đoạn video dài vài giây hoặc vài phút của mô hình truyền thống, cho phép chỉnh sửa ổn định liên tục và không bị trôi trong khi video phát.
Điều khiển ngữ nghĩa mở: dựa trên bộ mã hóa điều kiện MLLM, hỗ trợ chỉnh sửa đa chiều bằng lệnh ngôn ngữ tự nhiên, gồm phong cách toàn cục, đối tượng cục bộ, thay thế nền và chỉnh sửa theo ảnh tham chiếu.
Kiến trúc suy luận hiệu quả: Transformer khuếch tán tự hồi quy với 16B tham số kết hợp chưng cất khớp phân phối và bộ nhớ đệm KV có giới hạn, giảm đáng kể khác biệt giữa huấn luyện và suy luận, đồng thời hạn chế sai số thời gian tích lũy.
06Địa chỉ dự án JoyAI-Video-Edit
Kho GitHub:https://github.com/jd-opensource/JoyAI-Video-Edit
Kho mô hình HuggingFace:https://huggingface.co/jdopensource/JoyAI-Video-Edit
Bài báo kỹ thuật arXiv:https://arxiv.org/pdf/2608.03974
07Các kịch bản ứng dụng của JoyAI-Video-Edit
Sáng tạo video ngắn: người sáng tạo có thể thay trang phục nhân vật và điều chỉnh phong cách bối cảnh theo thời gian thực trong khi video phát, nâng cao hiệu quả sản xuất nội dung.
Hiệu ứng thời gian thực cho livestream: người phát trực tiếp có thể vừa phát vừa thay đổi nền hoặc thêm các yếu tố ảo, tạo trải nghiệm tăng cường hình ảnh tương tác.
Thiết kế nhà ở và nội thất: người dùng có thể thay đổi nội thất, chất liệu tường và hiệu ứng ánh sáng theo thời gian thực khi xem video căn phòng, hỗ trợ quyết định cải tạo.
Tiền kỳ hậu kỳ điện ảnh và truyền hình: đạo diễn có thể nhanh chóng thử nghiệm các phong cách hình ảnh và phương án thay thế bối cảnh khác nhau trong giai đoạn dựng, giảm chi phí thử và sai.
Tổng hợp dữ liệu cho trí tuệ hiện thân: chuyển video thao tác bằng tay thành tư liệu thao tác của cánh tay robot, mở rộng quy mô dữ liệu huấn luyện robot với chi phí thấp.
© Tuyên bố miễn trừ trách nhiệm: tên miền và nội dung được liên kết có thể thay đổi theo thời gian. AIEZZ không kiểm soát các trang web của bên thứ ba. Hãy tự đánh giá nội dung bên ngoài và các rủi ro liên quan.


Đánh giá của người dùng0