- 월간 방문 수
- 0
- 가격
- 설정되지 않음
- 등록일
- —
- 업데이트됨
- 2026-09-18
01Qwen3.8-Omni-Flash란
Qwen3.8-Omni-Flash는 알리바바의 Qwen이 출시한 네이티브 올모달 모델로, 텍스트·이미지·오디오·비디오 입력과 1M 장기 컨텍스트를 지원합니다. ”이해부터 납품까지”의 Agent 역량을 핵심으로 하며, 동영상 편집, MV 제작, 숏폼 드라마 번역, 영화 해설, 회의록 실행 등의 엔드투엔드 워크플로를 자율적으로 완료할 수 있습니다. 이전 세대보다 평균 25% 이상 향상되었고, API 오디오 입력 가격은 98% 이상 인하되었습니다. 또한 Qwen-MM-Plugins와 Qwen-Live Harness라는 두 가지 지원 프레임워크를 오픈소스로 공개했습니다.
02Qwen3.8-Omni-Flash의 주요 기능
제어 가능한 오디오·비디오 Caption: 사용자가 설명 대상, 시간 범위, 정보 세부 수준 및 출력 형식을 자유롭게 지정할 수 있어 ”모델이 무엇을 보았는가”가 아니라 ”사용자가 무엇을 알고 싶어 하는가”를 실현합니다.
Agentic 장시간 오디오·비디오 이해: 질문을 바탕으로 어디를 보고 무엇을 들을지 자율적으로 결정합니다. 거친 분석에서 세밀한 분석으로 이어지는 다중 라운드 증거 수집을 통해 핵심 정보를 찾아내며, 정확도는 향상되고 token 소비는 약 45.7% 감소합니다.
장시간 회의 이해 및 실행: 한 시간 분량의 오디오·비디오 입력을 네이티브로 지원하며, 화자 분리, 전사, 신원 매칭, 회의록 생성 및 할 일 실행을 엔드투엔드로 완료합니다.
오디오·비디오 심층 연구: 비디오 콘텐츠와 사용자 요구를 결합해 멀티모달 자료를 자동으로 검색하고, 비디오 중심의 이미지와 텍스트가 결합된 연구 보고서를 생성합니다.
Music2MV: 노래의 구조, 리듬 및 감정을 세밀하게 이해하고 타임스탬프가 포함된 가사를 출력하여, 음악 이해부터 완성본 품질 검사까지 전체 MV 제작 프로세스를 지원합니다.
숏폼 드라마 번역: 한 문장으로 등장인물 대사 인식, 구어체 번역, 음색 복제 더빙, 오디오 트랙 리믹스 및 품질 검사를 완료하여 더빙 제작의 자동화된 납품을 실현합니다.
장편 영화 해설: 영화와 한 문장의 요구사항을 입력하면 전체 영화 이해, 줄거리 요약, 해설 원고, 더빙과 배경음악, 편집 및 렌더링, 품질 검사를 자동으로 완료합니다.
Video2Note: 수 시간 분량의 비디오를 이미지와 텍스트가 대응되고 타임스탬프가 포함된 PDF 노트로 압축하며, 자동 검토와 반복 수정을 수행합니다.
Omni Skill Creator: 작업 시연 또는 전문가 교육에서 SOP를 추출하여 검증된 재사용 가능 Agent Skill로 변환합니다.
실시간 회화 연습: 발음과 의미를 공동 모델링하고 발음 편차를 이해하여 표준 발음 예시를 실시간으로 생성합니다.
03Qwen3.8-Omni-Flash의 기술 원리
WeChat에서 팔로우 후 “开源”에 답장하여 AI 오픈소스 프로젝트 교류 그룹에 가입하세요.
네이티브 올모달 통합 아키텍처: 하나의 아키텍처 안에서 텍스트, 이미지, 오디오 및 비디오를 공동 모델링합니다. 모달리티 정렬 인코딩과 통합 표현 공간을 통해 모달리티 간 이해를 구현하면서, 동일 규모의 순수 텍스트 모델과 비슷한 텍스트 능력을 유지합니다. 1M token 장기 컨텍스트를 통해 수 시간 분량의 오디오·비디오 입력을 네이티브로 수용할 수 있어, 분할 처리로 인한 정보 단절을 방지합니다.
Agentic 온디맨드 인식 및 증거 수집: 먼저 거친 수준으로 스캔하여 후보 구간을 찾은 뒤, 관련 오디오와 영상 콘텐츠를 세밀하게 불러와 대조합니다. 거친 분석에서 세밀한 분석으로 이어지는 다중 라운드 증거 수집 체계를 형성하여, 계산량과 token 예산을 실제로 관련 있는 구간에 집중합니다.
오디오·비디오와 Agent 환경의 협업: 장시간 오디오·비디오의 Agent화에서 병목은 harness가 네이티브 오디오·비디오 지원을 제공하지 못한다는 점입니다. 따라서 공식은 모델과 도구 체인을 함께 발전시키는 방식을 택했습니다. Qwen-MM-Plugins는 온디맨드 인식, 도구 호출 및 워크플로 실행 기능을 제공하고 Claude Code, OpenClaw 등 주요 Agent 프레임워크와 연동하여 자료 이해, 작업 계획, 도구 실행 및 결과 납품을 하나의 완전한 흐름으로 연결합니다.
다중 화자의 영상·음성 협업 인식: 영상과 오디오 스트림을 공동 모델링하고, 시각 정보(화면 속 인물의 등장 여부와 발화 상태)를 활용해 오디오 속 지시 대상과 개체의 모호성을 해소합니다. 화자 분리, 음성 전사 및 신원 매칭을 엔드투엔드로 완료하여, 여러 사람이 번갈아 발언하거나 목소리가 겹치는 회의 장면의 인식 지표를 크게 개선합니다.
실시간 스트리밍 상호작용 아키텍처: Qwen3.8-Omni-Flash-Realtime은 WebSocket/WebRTC를 통해 오디오·비디오 스트림을 수신하고 입력과 동시에 인식 및 응답을 수행합니다. 첫 token 지연 시간은 약 600-980ms, 오디오 생성 RTF는 약 0.153입니다. 회화 교정은 발음과 의미의 공동 모델링에 의존하며, 새로운 음성이 들어올 때마다 판단을 지속적으로 업데이트하여 이해에 영향을 주는 오류와 자연스러운 억양을 구분합니다.
04Qwen3.8-Omni-Flash 사용 방법
웹에서 바로 사용: Qwen AI 플랫폼 https://www.qianwenai.com/models/qwen3.8-omni-flash을 열고 qwen3.8-omni-flash를 검색한 다음 비디오·오디오·이미지를 업로드하면 대화할 수 있습니다.
API 호출: Alibaba Cloud DashScope의 API Key를 신청하고 OpenAI 호환 인터페이스를 사용해 호출합니다. 이미지, 오디오, 비디오 링크와 텍스트 질문을 함께 전달하면 됩니다.
플러그인을 설치해 작업 수행: Claude Code, Qwen Code 등의 도구에 Qwen-MM-Plugins를 설치한 뒤 ”@비디오.mp4 해설 영상으로 만들어 줘”라고 채팅하듯 말하면 AI가 전체 프로세스를 자동으로 완료합니다.
05Qwen3.8-Omni-Flash의 핵심 장점
올모달 통합: 텍스트, 이미지, 오디오, 비디오를 하나의 모델로 처리하며 1M 초장기 컨텍스트를 지원하고 한 시간 분량의 장시간 비디오를 네이티브로 입력할 수 있습니다.
이해부터 납품까지: 오디오·비디오를 ”이해”하는 데 그치지 않고 자율적으로 계획을 세우고 도구를 호출하며 완성된 영상과 문서를 제작해 엔드투엔드 작업을 완료합니다.
뛰어난 Agent 역량: 오디오·비디오 Agent 벤치마크에서 크게 앞서며, WildClawBench-MM은 이전 세대보다 36.5점 향상되었고 장기 작업에서는 UniClawBench 69.6의 높은 점수를 기록했습니다.
오디오 능력에서 Gemini 추월: 60개 언어 음성 인식, 39종 중국어 방언, 다중 화자 인식 지표에서 전반적으로 Gemini 3.8 Flash보다 우수합니다.
더 높은 효율과 비용 절감: Agentic 증거 수집을 통해 장시간 비디오 이해의 token 소비를 약 45.7% 줄이면서도 정확도는 오히려 향상됩니다.
대폭 낮아진 가격: API 시간당 오디오 입력 가격은 98% 이상, 오디오·비디오 입력 가격은 93% 이상 인하되어 대규모 사용 비용 부담을 크게 줄였습니다.
완비된 오픈소스 생태계: Qwen-MM-Plugins와 Qwen-Live Harness를 모두 오픈소스로 공개했으며 Claude Code, OpenClaw 등 주요 Agent 프레임워크와 호환됩니다.
06Qwen3.8-Omni-Flash 프로젝트 주소
GitHub 저장소: Qwen-MM-Plugins: https://github.com/QwenLM/Qwen-MM-Plugins
Qwen-Live Harness: https://github.com/QwenLM/Qwen-Live-Harness
07Qwen3.8-Omni-Flash의 활용 시나리오
비디오 콘텐츠 제작: 한 문장의 요구사항을 입력하면 영화 해설, MV 제작, 숏폼 드라마 번역 및 더빙을 엔드투엔드로 자동 납품합니다.
회의 효율 도구: 한 시간 분량의 회의 영상을 업로드하면 회의록과 할 일을 자동으로 생성하고, 이메일 발송과 작업 생성까지 직접 수행합니다.
학습 및 지식 축적: 수 시간 분량의 교육 영상을 스크린샷과 타임스탬프가 포함된 PDF 노트로 자동 압축합니다.
비디오 심층 연구: 비디오 콘텐츠를 바탕으로 웹 전체의 이미지·텍스트 자료를 자동 검색하고, 이미지와 텍스트가 결합된 심층 연구 보고서를 생성합니다.
실시간 상호작용 서비스: 실시간 회화 연습, 지능형 고객 서비스, 소리로 방향을 판단하는 내비게이션 등 저지연 오디오·비디오 상호작용 시나리오에 활용할 수 있습니다.
© 면책 조항: 도메인 및 연결된 콘텐츠는 시간이 지나면서 변경될 수 있습니다. AIEZZ은(는) 제3자 웹사이트를 관리하지 않습니다. 외부 콘텐츠와 위험을 독립적으로 검토하세요.


사용자 리뷰0