- 月間訪問数
- 0
- 料金
- 未設定
- 掲載日
- —
- 更新済み
- 2026-09-18
01Qwen3.8-Omni-Flashとは
Qwen3.8-Omni-Flashは阿里ババのQwenが開発したネイティブな全モーダルモデルです。テキスト、画像、音声、動画入力と1Mの長文脈に対応し、「理解から納品まで」のAgent能力を重視しています。動画編集、MV制作、ショートドラマ翻訳、映画解説、会議議事録からのタスク実行など、エンドツーエンドのワークフローを自律的に完了できます。前世代と比べて平均25%以上向上し、APIの音声入力価格は98%以上値下げされました。さらに、Qwen-MM-PluginsとQwen-Live Harnessという2つの関連フレームワークもオープンソース化されています。
02Qwen3.8-Omni-Flashの主な機能
制御可能な音声・動画Caption:ユーザーは説明対象、時間範囲、情報の粒度、出力形式を自由に指定でき、「モデルが何を見たか」ではなく「ユーザーが何を知りたいか」を実現します。
Agentic長時間音声・動画理解:質問を起点に、どこを見るか、何を聞くかを自律的に判断します。粗い確認から詳細な確認へと複数回の証拠収集を行って重要情報を特定し、精度を向上させながらtoken消費を約45.7%削減します。
長時間会議の理解と実行:1時間の音声・動画入力にネイティブ対応し、話者分離、文字起こし、話者情報の照合、議事録生成、タスク実行までをエンドツーエンドで完了します。
音声・動画のディープリサーチ:動画の内容とユーザーのニーズを組み合わせ、マルチモーダル資料を自動検索し、動画を中心とした図版付きの調査レポートを生成します。
Music2MV:曲の構成、リズム、感情を細かく理解し、タイムスタンプ付き歌詞を出力します。音楽理解から完成映像の品質検査まで、MV制作の全工程に対応します。
ショートドラマ翻訳:一言の指示で、登場人物のセリフ認識、口語的な翻訳、声質クローンによる吹き替え、音声トラックのリミックス、品質検査までを完了し、吹き替え制作を自動化します。
長編映画解説:映画と一言の要望を入力すると、全編理解、ストーリー要約、解説原稿、ナレーションとBGM、編集・レンダリング、品質検査を自動的に完了します。
Video2Note:数時間の動画を、画像と本文が対応しタイムスタンプも付いたPDFノートに圧縮し、自動レビューと反復修正も行います。
Omni Skill Creator:操作デモや専門家の講義からSOPを抽出し、検証済みで再利用可能なAgent Skillに変換します。
リアルタイム会話練習:発音と意味を統合してモデル化し、アクセントのずれを理解したうえで、標準発音の手本をリアルタイムに生成します。
03Qwen3.8-Omni-Flashの技術原理
WeChatで「オープンソース」と返信すると、AIオープンソースプロジェクト交流グループに参加できます
ネイティブな全モーダル統合アーキテクチャ:単一のアーキテクチャ内でテキスト、画像、音声、動画を共同モデル化し、モダリティ間で整合されたエンコーディングと統一表現空間によってクロスモーダル理解を実現します。同サイズの純粋なテキストモデルと同等のテキスト能力を維持し、1M tokenの長文脈によって数時間に及ぶ音声・動画をネイティブに取り込めるため、分割処理による情報の分断を避けられます。
Agenticなオンデマンド知覚と証拠収集:まず粗い粒度でスキャンして候補区間を特定し、次に関連する映像・音声を細かく取得して照合します。粗から細へと複数回の証拠収集チェーンを形成し、計算資源とtoken予算を本当に関連する区間へ集中させます。
音声・動画とAgent環境の連携:長時間音声・動画のAgent化におけるボトルネックは、harnessがネイティブな音声・動画対応を欠いていることです。そこで公式はモデルとツールチェーンを協調的に進化させています。Qwen-MM-Pluginsはオンデマンド知覚、ツール呼び出し、ワークフロー実行を提供し、Claude Code、OpenClawなど主要なAgentフレームワークに接続できます。素材理解、タスク計画、ツール実行、成果物の納品を一連の完全な流れにまとめます。
複数話者の映像・音声協調認識:映像と音声ストリームを共同でモデル化し、視覚情報(画面内での人物の登場や発話状態)を利用して、音声に含まれる指示対象やエンティティの曖昧さを解消します。話者分離、音声文字起こし、話者情報の照合をエンドツーエンドで実行し、複数人が交互に発言したり、音声が重なったりする会議シーンの認識性能を大幅に向上させます。
リアルタイムストリーミング対話アーキテクチャ:Qwen3.8-Omni-Flash-RealtimeはWebSocket/WebRTCで音声・動画ストリームを受信し、入力と同時に認識と応答を行います。初回token遅延は約600-980ms、音声生成RTFは約0.153です。会話発音の訂正には発音と意味の統合モデルを用い、新たな音声が届くたびに判断を継続的に更新し、理解に影響する誤りと自然なアクセントを区別します。
04Qwen3.8-Omni-Flashの使い方
Webで直接利用:Qwen AIプラットフォームhttps://www.qianwenai.com/models/qwen3.8-omni-flashを開き、qwen3.8-omni-flashを検索して、動画・音声・画像をアップロードすれば対話できます。
APIで呼び出す:Alibaba Cloud DashScopeのAPI Keyを申請し、OpenAI互換のインターフェースを使って呼び出します。画像、音声、動画のリンクとテキストの質問を送信するだけで利用できます。
プラグインで作業させる:Claude Code、Qwen CodeなどのツールにQwen-MM-Pluginsをインストールし、「@動画.mp4 解説動画にして」のようにチャットで指示すると、AIが全工程を自動的に完了します。
05Qwen3.8-Omni-Flashの主な強み
全モーダル統合:テキスト、画像、音声、動画を1つのモデルで処理し、1Mの超長文脈に対応。一時間の長時間動画もネイティブに入力できます。
理解から納品まで:音声・動画を「理解」するだけでなく、自律的に計画を立て、ツールを呼び出し、完成映像や文書を作成して、エンドツーエンドのタスクを完了します。
優れたAgent能力:音声・動画Agentのベンチマークで大幅にリードし、WildClawBench-MMは前世代より36.5ポイント向上。長期タスクではUniClawBenchで69.6の高スコアを達成しています。
音声性能でGeminiを上回る:60言語の音声認識、39種類の中国語方言、複数話者認識の指標で、Gemini 3.8 Flashを全面的に上回ります。
より高効率で低コスト:Agenticな証拠収集により、長時間動画の理解に必要なtoken消費を約45.7%削減し、精度も向上します。
大幅な価格低下:APIの音声入力は1時間あたり98%以上、音声・動画入力は93%以上値下げされ、大規模利用のコスト負担が大幅に軽減されます。
充実したオープンソース連携:Qwen-MM-PluginsとQwen-Live Harnessをすべてオープンソース化し、Claude Code、OpenClawなど主要なAgentフレームワークと互換性があります。
06Qwen3.8-Omni-FlashのプロジェクトURL
GitHubリポジトリ:Qwen-MM-Plugins: https://github.com/QwenLM/Qwen-MM-Plugins
Qwen-Live Harness: https://github.com/QwenLM/Qwen-Live-Harness
07Qwen3.8-Omni-Flashの活用シーン
動画コンテンツ制作:一言の要望を入力するだけで、映画解説、MV制作、ショートドラマの翻訳・吹き替えをエンドツーエンドで自動納品します。
会議効率化ツール:1時間の会議録画をアップロードすると、議事録やタスクを自動生成し、メール送信やタスク作成まで直接実行できます。
学習知識の蓄積:数時間のチュートリアル動画を、スクリーンショットとタイムスタンプ付きのPDFノートに自動圧縮します。
動画ディープリサーチ:動画の内容に関連するWeb上の図文資料を自動検索し、図版付きの詳細な調査レポートを生成します。
リアルタイム対話サービス:リアルタイム会話練習、スマートカスタマーサービス、音で位置を判別するナビゲーションなど、低遅延の音声・動画対話シーンに対応します。
© 免責事項:ドメインやリンク先のコンテンツは時間の経過とともに変更される場合があります。AIEZZは第三者のウェブサイトを管理していません。外部コンテンツとリスクはご自身で確認してください。


ユーザーレビュー0