- 월간 방문 수
- 0
- 가격
- 무료 및 유료
- 등록일
- 2026-08-05
- 업데이트됨
- 2026-08-05
01JoyAI-Video-Edit란 무엇인가
JoyAI-Video-Edit는 징둥이 자체 개발해 오픈 소스로 공개한 실시간 스트리밍 동영상 편집 모델입니다. 16B 파라미터 자기회귀 확산 아키텍처를 기반으로 720P 해상도에서 30FPS 추론 속도를 구현하며, 길이에 제한 없이 안정적인 스트리밍 편집을 지원합니다. 사용자는 자연어 명령을 통해 동영상 재생 중 인물, 장면, 스타일 및 사물을 실시간으로 수정할 수 있어 전체 동영상 생성이 완료될 때까지 기다릴 필요가 없습니다. 이 모델은 OpenVE-Bench 평가에서 모든 스트리밍 편집 방법을 앞서며 전 지표에서 종합적으로 우수한 성능을 보였고, 동시에 체화 지능을 위한 대규모 데이터 합성 경로를 제공할 수 있습니다.
02JoyAI-Video-Edit의 주요 기능
실시간 스트리밍 편집: 동영상 프레임이 도착하는 즉시 편집하므로 전체 시퀀스를 미리 알 필요가 없습니다.
개방형 명령 제어: 전역 스타일 전환, 국소 객체 추가·삭제·수정, 배경 교체, 동작 조정 및 참조 이미지 기반 편집을 지원합니다.
길이 제한 없는 처리: 초 단위 또는 분 단위 제한을 넘어 동영상 재생에 맞춰 안정적으로 편집을 지속할 수 있습니다.
720P 고처리량 배포: 엔드투엔드 pipeline에서 720×1280 해상도 기준 30.19 FPS를 달성합니다.
다차원 편집 기능: 인물 의상 변경, 장면 변환, 스타일 전환, 사물 교체 및 자막 편집 등의 작업을 지원합니다.
03JoyAI-Video-Edit의 기술 원리
WeChat에서 팔로우 후 “开源”에 답장하여 AI 오픈 소스 프로젝트交流群에 참여하세요.
MLLM 조건 인코더: 멀티모달 대규모 언어 모델로 자연어 명령을 편집 조건으로 인코딩하여 개방형 의미 제어를 구현합니다.
인과적 동영상 VAE: 인과적 시간 구조의 변분 오토인코더를 사용해 동영상 프레임을 압축하고 재구성함으로써 스트리밍 환경에서 시간적 일관성을 보장합니다.
16B 파라미터 MMDiT 백본: 16B 멀티모달 확산 Transformer를 핵심으로 텍스트 및 시각적 특징을 융합해 자기회귀 확산 생성을 수행합니다.
자기회귀 분포 매칭 증류: 자기회귀 분포를 정렬하는 증류 전략으로 추론을 가속하고 학습과 추론 간 분포 차이를 크게 줄입니다.
장시간 영역 최적화 및 제한형 KV 추론: 장시간 안정성 최적화와 제한형 KV 캐시 메커니즘을 도입해 누적 시간 드리프트를 억제하고 높은 처리량을 유지합니다.
04JoyAI-Video-Edit 사용 방법
환경 준비: Conda 환경을 python=3.10으로 생성하고 requirements.txt의 종속성을 설치합니다.
가중치 다운로드: Hugging Face에서 모델 파일을 가져와 지정된 디렉터리 구조에 체크포인트를 배치합니다.
서비스 시작: deploy 디렉터리로 이동한 뒤 bash run_server.sh를 실행해 로컬 서버를 시작합니다.
인터페이스 접속: 브라우저에서 http://localhost:8080을 열어 대화형 편집 인터페이스에 접속합니다.
실시간 편집: 동영상을 업로드하거나 카메라 스트림을 연결한 후 자연어 명령을 입력하면 재생하면서 편집할 수 있습니다.
05JoyAI-Video-Edit의 핵심 장점
실시간 스트리밍 편집: 동영상 프레임이 도착하는 즉시 처리하므로 전체 시퀀스를 기다릴 필요 없이 진정한 “재생하면서 편집” 경험을 제공합니다.
속도와 품질을 모두 확보: 720P 해상도에서 엔드투엔드 추론 속도 30.19 FPS를 달성하며, OpenVE-Bench 평가에서 모든 스트리밍 및 오프라인 편집 방법을 앞섭니다.
길이 제한 없는 안정적 출력: 기존 모델의 초 단위 또는 분 단위 클립 지원 한계를 넘어 동영상 재생에 맞춰 드리프트 없이 안정적인 편집을 지속할 수 있습니다.
개방형 의미 제어: MLLM 조건 인코더를 기반으로 자연어 명령을 통한 전역 스타일, 국소 객체, 배경 교체 및 참조 이미지 기반 편집 등 다양한 편집을 지원합니다.
효율적인 추론 아키텍처: 16B 파라미터 자기회귀 확산 Transformer에 분포 매칭 증류와 제한형 KV 캐시를 결합해 학습·추론 차이를 크게 줄이고 시간적 누적 오차를 억제합니다.
06JoyAI-Video-Edit 프로젝트 주소
GitHub 저장소: https://github.com/jd-opensource/JoyAI-Video-Edit
HuggingFace 모델 저장소: https://huggingface.co/jdopensource/JoyAI-Video-Edit
arXiv 기술 논문: https://arxiv.org/pdf/2608.03974
07JoyAI-Video-Edit의 활용 분야
숏폼 동영상 제작: 크리에이터는 동영상 재생 중 인물의 의상을 실시간으로 교체하고 장면 스타일을 조정하여 콘텐츠 제작 효율을 높일 수 있습니다.
라이브 실시간 특수 효과: 스트리머가 방송 중 배경을 변경하거나 가상 요소를 추가해 인터랙티브한 라이브 시각 효과를 구현할 수 있습니다.
홈 인테리어 및 실내 디자인: 사용자는 방 동영상을 보면서 가구, 벽면 소재 및 조명 효과를 실시간으로 변경해 인테리어 의사 결정을 지원할 수 있습니다.
영화·영상 후반 작업 프리비주얼라이제이션: 감독은 편집 단계에서 다양한 시각 스타일과 장면 교체를 빠르게 시도해 시행착오 비용을 줄일 수 있습니다.
체화 지능 데이터 합성: 사람의 손 조작 동영상을 로봇 팔 조작 데이터로 변환해 낮은 비용으로 로봇 학습 데이터 규모를 확장할 수 있습니다.
© 면책 조항: 도메인 및 연결된 콘텐츠는 시간이 지나면서 변경될 수 있습니다. AIEZZ은(는) 제3자 웹사이트를 관리하지 않습니다. 외부 콘텐츠와 위험을 독립적으로 검토하세요.


사용자 리뷰0