メインコンテンツへ移動

JoyAI-Video-Edit 運営中

JoyAI-Video-Editは、京東がオープンソース化したリアルタイムストリーミング動画編集モデルです。自然言語の指示に対応し、720Pで30FPSの再生しながら編集を実現します。

JoyAI-Video-Edit – 京東がオープンソース化したリアルタイムストリーミング動画編集モデルは、京東が独自開発しオープンソース化したリアルタイムストリーミング動画編集モデルです。16Bパラメータの自己回帰拡散アーキテクチャを基盤とし、720P解像度で30FPSの推論速度を実現し、任意の長さの動画を安定してストリーミング編集できます。ユーザーは自然言語の指示により、動画の再生中に人物、シーン、スタイル、物体をリアルタイムで変更でき、動画全体の生成を待つ必要がありません。OpenVE-Benchの評価では、すべてのストリーミング編集手法を上回り、各指標で全面的に優れた結果を達成しています。また、具身知能向けの大規模なデータ合成手段も提供します。

JoyAI-Video-Edit 製品インターフェース
月間訪問数
0
料金
無料、有料
掲載日
2026-08-05
更新済み
2026-08-05

01JoyAI-Video-Editとは

JoyAI-Video-Editは、京東が独自開発しオープンソース化したリアルタイムストリーミング動画編集モデルです。16Bパラメータの自己回帰拡散アーキテクチャを基盤とし、720P解像度で30FPSの推論速度を実現し、任意の長さの動画を安定してストリーミング編集できます。ユーザーは自然言語の指示により、動画の再生中に人物、シーン、スタイル、物体をリアルタイムで変更でき、動画全体の生成を待つ必要がありません。OpenVE-Benchの評価では、すべてのストリーミング編集手法を上回り、各指標で全面的に優れた結果を達成しています。また、具身知能向けの大規模なデータ合成手段も提供します。

02JoyAI-Video-Editの主な機能

リアルタイムストリーミング編集:動画フレームの到着時に即時編集を行うため、完全なシーケンスを事前に把握する必要がありません。
オープンな指示制御:全体的なスタイル変換、局所オブジェクトの追加・削除・変更、背景置換、動作調整、参照画像による編集に対応します。
任意の長さに対応:秒単位や分単位の制限を超え、動画の再生に合わせて継続的かつ安定した編集が可能です。
720P高スループット展開:エンドツーエンドのパイプラインで、720×1280解像度において30.19 FPSを実現します。
多次元の編集能力:人物の衣装変更、シーン変換、スタイル変換、物体置換、字幕編集などのタスクをカバーします。

03JoyAI-Video-Editの技術原理

WeChatでフォローして「オープンソース」と返信すると、AIオープンソースプロジェクト交流グループに参加できます。
MLLM条件エンコーダー:マルチモーダル大規模言語モデルで自然言語の指示を編集条件にエンコードし、オープンな意味制御を実現します。
因果動画VAE:因果的な時間構造を持つ変分オートエンコーダーで動画フレームを圧縮・再構成し、ストリーミング環境での時間的一貫性を保証します。
16BパラメータMMDiTバックボーン:16Bのマルチモーダル拡散Transformerを中核に、テキストと視覚の特徴を融合して自己回帰拡散生成を行います。
自己回帰分布マッチング蒸留:自己回帰分布を整合させる蒸留手法により推論を高速化し、学習時と推論時の分布差を大幅に低減します。
長時間領域最適化と有界KV推論:長時間領域の安定性最適化と有界KVキャッシュ機構を導入し、時間的なドリフトの累積を抑制しながら高スループットを維持します。

04JoyAI-Video-Editの使い方

環境準備:Conda環境でpython=3.10を作成し、requirements.txtの依存関係をインストールします。
重みのダウンロード:Hugging Faceからモデルファイルを取得し、指定されたディレクトリ構成に従ってチェックポイントを配置します。
サービスの起動:deployディレクトリに移動し、bash run_server.shを実行してローカルサーバーを起動します。
画面へのアクセス:ブラウザでhttp://localhost:8080を開き、インタラクティブな編集画面にアクセスします。
リアルタイム編集:動画をアップロードするかカメラストリームを接続し、自然言語の指示を入力すると、再生しながら編集できます。

05JoyAI-Video-Editの主な優位性

リアルタイムストリーミング編集:動画フレームの到着と同時に処理するため、完全なシーケンスを待つ必要がなく、本当の「再生しながら編集」体験を実現します。
速度と品質を両立:720P解像度でエンドツーエンド推論30.19 FPSを達成し、OpenVE-Benchの評価ですべてのストリーミングおよびオフライン編集手法を上回ります。
任意の長さで安定出力:従来モデルの秒単位・分単位の制限を超え、動画の再生に合わせてドリフトのない安定した編集を継続できます。
オープンな意味制御:MLLM条件エンコーダーに基づき、自然言語の指示による全体的なスタイル変更、局所オブジェクト編集、背景置換、参照画像による編集など、多次元の編集に対応します。
効率的な推論アーキテクチャ:16Bパラメータの自己回帰拡散Transformerに分布マッチング蒸留と有界KVキャッシュを組み合わせ、学習と推論の差を大幅に低減し、時間的な誤差の累積を抑制します。

06JoyAI-Video-EditのプロジェクトURL

GitHubリポジトリ:https://github.com/jd-opensource/JoyAI-Video-Edit
Hugging Faceモデルリポジトリ:https://huggingface.co/jdopensource/JoyAI-Video-Edit
arXiv技術論文:https://arxiv.org/pdf/2608.03974

07JoyAI-Video-Editの活用シーン

ショート動画制作:動画の再生中に人物の衣装をリアルタイムで変更したり、シーンのスタイルを調整したりでき、コンテンツ制作の効率を高めます。
ライブ配信のリアルタイムエフェクト:配信中に背景を変更したりバーチャル要素を追加したりして、インタラクティブなライブ配信の映像効果を強化します。
住宅・インテリアデザイン:部屋の動画を見ながら家具、壁面素材、照明効果をリアルタイムで変更し、リフォームの意思決定を支援します。
映像制作のポストプロダクション検証:編集段階で異なる映像スタイルやシーン置換を迅速に試し、試行錯誤のコストを削減します。
具身知能のデータ合成:人の手による操作動画をロボットアームの操作素材に変換し、ロボット学習データの規模を低コストで拡大します。

© 免責事項:ドメインやリンク先のコンテンツは時間の経過とともに変更される場合があります。AIEZZは第三者のウェブサイトを管理していません。外部コンテンツとリスクはご自身で確認してください。

ユーザーレビュー0