মূল কনটেন্টে যান
Qwen3.8-Omni-Flash

Qwen3.8-Omni-Flash চালু আছে

Qwen3.8-Omni-Flash হলো আলিবাবা কিয়েনওয়েনের প্রকাশিত একটি নেটিভ অল-মোডাল মডেল, যা টেক্সট, ছবি, অডিও, ভিডিও ইনপুট এবং 1M দীর্ঘ কনটেক্সট সমর্থন করে। এর মূল লক্ষ্য 'বোঝাপড়া থেকে ডেলিভারি' Agent সক্ষমতা, যা স্বয়ংক্রিয়ভাবে ভিডিও সম্পাদনা, MV... সম্পন্ন করতে পারে।

Qwen3.8-Omni-Flash হলো আলিবাবা কিয়েনওয়েনের প্রকাশিত একটি নেটিভ অল-মোডাল মডেল, যা টেক্সট, ছবি, অডিও, ভিডিও ইনপুট এবং 1M দীর্ঘ কনটেক্সট সমর্থন করে। এর মূল লক্ষ্য 'বোঝাপড়া থেকে ডেলিভারি' Agent সক্ষমতা, যা স্বয়ংক্রিয়ভাবে ভিডিও সম্পাদনা, MV... সম্পন্ন করতে পারে।

Qwen3.8-Omni-Flash
মাসিক ভিজিট
0
মূল্য
সেট করা হয়নি
তালিকাভুক্ত
—
আপডেট করা হয়েছে
2026-09-18

01Qwen3.8-Omni-Flash কী

Qwen3.8-Omni-Flash হলো আলিবাবা কিয়েনওয়েনের প্রকাশিত একটি নেটিভ অল-মোডাল মডেল, যা টেক্সট, ছবি, অডিও, ভিডিও ইনপুট এবং 1M দীর্ঘ কনটেক্সট সমর্থন করে। এর মূল লক্ষ্য ”বোঝাপড়া থেকে ডেলিভারি” Agent সক্ষমতা, যা স্বয়ংক্রিয়ভাবে ভিডিও সম্পাদনা, MV তৈরি, স্বল্পদৈর্ঘ্য নাটক অনুবাদ, চলচ্চিত্র বর্ণনা, সভার কার্যবিবরণী বাস্তবায়নসহ এন্ড-টু-এন্ড ওয়ার্কফ্লো সম্পন্ন করতে পারে। আগের প্রজন্মের তুলনায় গড়ে 25%-এর বেশি উন্নতি হয়েছে, API অডিও ইনপুটের দাম 98%-এর বেশি কমেছে এবং Qwen-MM-Plugins ও Qwen-Live Harness নামে দুটি সহায়ক ফ্রেমওয়ার্ক ওপেন সোর্স করা হয়েছে।

02Qwen3.8-Omni-Flash-এর প্রধান ফিচার

নিয়ন্ত্রণযোগ্য অডিও-ভিডিও Caption: ব্যবহারকারী বর্ণনার বিষয়, সময়সীমা, তথ্যের বিস্তারিত মাত্রা ও আউটপুট ফরম্যাট নির্দিষ্ট করতে পারেন। ফলে ”মডেল কী দেখেছে” নয়, বরং ”ব্যবহারকারী কী জানতে চান” তা অনুযায়ী ফলাফল পাওয়া যায়।
Agentic দীর্ঘ অডিও-ভিডিও বোঝাপড়া: প্রশ্ন থেকে শুরু করে মডেল নিজেই ঠিক করে কোথায় দেখবে ও কী শুনবে। মোটা থেকে সূক্ষ্মভাবে একাধিক দফায় প্রমাণ সংগ্রহ করে গুরুত্বপূর্ণ তথ্য শনাক্ত করে; নির্ভুলতা বাড়ার পাশাপাশি token ব্যবহার প্রায় 45.7% কমে।
দীর্ঘ সভা বোঝা ও বাস্তবায়ন: নেটিভভাবে এক ঘণ্টার অডিও-ভিডিও ইনপুট সমর্থন করে এবং এন্ড-টু-এন্ডভাবে বক্তা বিভাজন, ট্রান্সক্রিপশন, পরিচয় মিলানো, কার্যবিবরণী তৈরি ও করণীয় বাস্তবায়ন সম্পন্ন করে।
অডিও-ভিডিও গভীর গবেষণা: ভিডিওর বিষয়বস্তু ও ব্যবহারকারীর চাহিদা মিলিয়ে স্বয়ংক্রিয়ভাবে মাল্টিমোডাল উপকরণ খুঁজে ভিডিওকেন্দ্রিক, লেখা ও ছবিসমৃদ্ধ গবেষণা প্রতিবেদন তৈরি করে।
Music2MV: গানের কাঠামো, ছন্দ ও আবেগ সূক্ষ্মভাবে বুঝে টাইমস্ট্যাম্পসহ গানের কথা তৈরি করে এবং সংগীত বোঝা থেকে সম্পূর্ণ ভিডিওর মান যাচাই পর্যন্ত পূর্ণাঙ্গ MV তৈরির ওয়ার্কফ্লো সম্পন্ন করে।
স্বল্পদৈর্ঘ্য নাটক অনুবাদ: এক বাক্যেই চরিত্রের সংলাপ শনাক্তকরণ, কথ্য অনুবাদ, কণ্ঠস্বর ক্লোনিং ডাবিং, অডিও ট্র্যাক পুনর্মিশ্রণ ও মান যাচাই সম্পন্ন করে অনুবাদ-প্রযোজনার স্বয়ংক্রিয় ডেলিভারি নিশ্চিত করে।
দীর্ঘ চলচ্চিত্র বর্ণনা: চলচ্চিত্র ও এক বাক্যের চাহিদা ইনপুট দিলে স্বয়ংক্রিয়ভাবে পুরো চলচ্চিত্র বোঝা, কাহিনি সংক্ষেপণ, বর্ণনা স্ক্রিপ্ট, ডাবিং ও সংগীত, সম্পাদনা-রেন্ডারিং এবং মান যাচাই সম্পন্ন করে।
Video2Note: কয়েক ঘণ্টার ভিডিওকে ছবি ও লেখার সামঞ্জস্যপূর্ণ, টাইমস্ট্যাম্পযুক্ত PDF নোটে রূপান্তর করে এবং স্বয়ংক্রিয়ভাবে পর্যালোচনা, পুনরাবৃত্তি ও সংশোধন করে।
Omni Skill Creator: অপারেশন ডেমো বা বিশেষজ্ঞের শিক্ষাদান থেকে SOP বের করে যাচাইকৃত, পুনর্ব্যবহারযোগ্য Agent Skill-এ রূপান্তর করে।
রিয়েল-টাইম কথ্য ভাষা অনুশীলন: উচ্চারণ ও অর্থের যৌথ মডেলিংয়ের মাধ্যমে উচ্চারণের বিচ্যুতি বোঝে এবং তাৎক্ষণিকভাবে প্রমিত উচ্চারণের উদাহরণ তৈরি করে।

03Qwen3.8-Omni-Flash-এর প্রযুক্তিগত নীতি

WeChat-এ ফলো করে “开源” লিখে উত্তর দিন, AI ওপেন সোর্স প্রকল্পের আলোচনা গ্রুপে যোগ দিন
নেটিভ অল-মোডাল ইউনিফায়েড আর্কিটেকচার: একটি একক আর্কিটেকচারের মধ্যে মডেল টেক্সট, ছবি, অডিও ও ভিডিওর যৌথ মডেলিং করে। মোডালিটি অ্যালাইনমেন্টের এনকোডিং ও ইউনিফায়েড রিপ্রেজেন্টেশন স্পেসের মাধ্যমে ক্রস-মোডাল বোঝাপড়া নিশ্চিত করে এবং একই আকারের বিশুদ্ধ টেক্সট মডেলের সমতুল্য টেক্সট সক্ষমতা বজায় রাখে। 1M token দীর্ঘ কনটেক্সট নেটিভভাবে কয়েক ঘণ্টার অডিও-ভিডিও ইনপুট ধারণ করতে পারে, ফলে খণ্ডে খণ্ডে প্রক্রিয়াকরণের কারণে তথ্য বিচ্ছিন্ন হয় না।
Agentic প্রয়োজনভিত্তিক উপলব্ধি ও প্রমাণ সংগ্রহ: মডেল প্রথমে মোটা স্তরে স্ক্যান করে সম্ভাব্য অংশ শনাক্ত করে, তারপর সূক্ষ্ম স্তরে সংশ্লিষ্ট অডিও-ভিজ্যুয়াল কনটেন্ট নিয়ে যাচাই করে। এভাবে মোটা থেকে সূক্ষ্ম বহু-ধাপের প্রমাণ সংগ্রহের শৃঙ্খল তৈরি হয় এবং গণনা ও token বাজেট প্রকৃতপক্ষে প্রাসঙ্গিক অংশে কেন্দ্রীভূত থাকে।
অডিও-ভিডিও ও Agent পরিবেশের সমন্বয়: দীর্ঘ অডিও-ভিডিওকে Agent-এ রূপান্তরের বাধা হলো harness-এ নেটিভ অডিও-ভিডিও সমর্থনের অভাব। তাই অফিসিয়াল দল মডেল ও টুলচেইনের সমন্বিত উন্নয়ন করেছে: Qwen-MM-Plugins প্রয়োজনভিত্তিক উপলব্ধি, টুল কল এবং ওয়ার্কফ্লো বাস্তবায়নের ক্ষমতা দেয়; Claude Code, OpenClaw-এর মতো প্রধান Agent ফ্রেমওয়ার্কে যুক্ত হয়ে উপকরণ বোঝা, কাজের পরিকল্পনা, টুল চালানো ও ফলাফল ডেলিভারিকে একটি পূর্ণাঙ্গ ধারায় সংযুক্ত করে।
একাধিক বক্তার অডিও-ভিজ্যুয়াল সমন্বিত শনাক্তকরণ: মডেল একই সঙ্গে দৃশ্য ও অডিও স্ট্রিমের মডেলিং করে। দৃশ্যগত তথ্য, যেমন ছবিতে ব্যক্তির উপস্থিতি ও কথা বলার অবস্থা, ব্যবহার করে অডিওর নির্দেশনা ও সত্তা-সংক্রান্ত অস্পষ্টতা দূর করে। এন্ড-টু-এন্ডভাবে বক্তা বিভাজন, স্পিচ ট্রান্সক্রিপশন ও পরিচয় মিলানো সম্পন্ন করে, ফলে একাধিক ব্যক্তির পালাক্রমে কথা বলা বা কণ্ঠ ওভারল্যাপ করা সভার দৃশ্যে শনাক্তকরণ সূচক ব্যাপকভাবে উন্নত হয়।
রিয়েল-টাইম স্ট্রিমিং ইন্টার‌্যাকশন আর্কিটেকচার: Qwen3.8-Omni-Flash-Realtime WebSocket/WebRTC-এর মাধ্যমে অডিও-ভিডিও স্ট্রিম গ্রহণ করে এবং ইনপুট চলাকালীনই উপলব্ধি ও প্রতিক্রিয়া সম্পন্ন করে। প্রথম token-এর বিলম্ব প্রায় 600-980ms, অডিও তৈরির RTF প্রায় 0.153। কথ্য ভাষা সংশোধন উচ্চারণ ও অর্থের যৌথ মডেলিংয়ের ওপর নির্ভর করে; নতুন দফার কথা আসার সঙ্গে সঙ্গে মডেল সিদ্ধান্ত আপডেট করে এবং বোঝাপড়ায় প্রভাব ফেলা ভুল ও স্বাভাবিক উচ্চারণের পার্থক্য নির্ণয় করে।

04Qwen3.8-Omni-Flash কীভাবে ব্যবহার করবেন

ওয়েব থেকে সরাসরি ব্যবহার: কিয়েনওয়েন AI প্ল্যাটফর্ম https://www.qianwenai.com/models/qwen3.8-omni-flash খুলে qwen3.8-omni-flash খুঁজুন, তারপর ভিডিও/অডিও/ছবি আপলোড করে কথোপকথন করুন।
API কল: Alibaba Cloud DashScope-এর API Key সংগ্রহ করে OpenAI-সামঞ্জস্যপূর্ণ ইন্টারফেস ব্যবহার করুন। ছবি, অডিও, ভিডিও লিংক এবং টেক্সট প্রশ্ন পাঠালেই হবে।
প্লাগইন ইনস্টল করে কাজ করান: Claude Code, Qwen Code-এর মতো টুলে Qwen-MM-Plugins ইনস্টল করুন, তারপর চ্যাটের মতো বলুন ”@ভিডিও.mp4 এটি দিয়ে আমার জন্য একটি বর্ণনামূলক ভিডিও তৈরি করুন”। AI স্বয়ংক্রিয়ভাবে পুরো প্রক্রিয়া সম্পন্ন করবে।

05Qwen3.8-Omni-Flash-এর মূল সুবিধা

ইউনিফায়েড অল-মোডাল: একটি মডেলেই টেক্সট, ছবি, অডিও ও ভিডিও সামলায়; 1M অতি-দীর্ঘ কনটেক্সট সমর্থন করে এবং এক ঘণ্টার দীর্ঘ ভিডিও নেটিভভাবে ইনপুট নেওয়া যায়।
বোঝাপড়া থেকে ডেলিভারি: শুধু অডিও-ভিডিও ”বুঝতে” পারে না, নিজে পরিকল্পনা করতে, টুল কল করতে, সম্পূর্ণ ভিডিও ও ডকুমেন্ট তৈরি করতে এবং এন্ড-টু-এন্ড কাজ সম্পন্ন করতে পারে।
উন্নত Agent সক্ষমতা: অডিও-ভিডিও Agent বেঞ্চমার্কে ব্যাপকভাবে এগিয়ে। WildClawBench-MM আগের প্রজন্মের তুলনায় 36.5 পয়েন্ট উন্নত হয়েছে, আর দীর্ঘমেয়াদি কাজে UniClawBench-এ 69.6 উচ্চ স্কোর পেয়েছে।
অডিও সক্ষমতায় Gemini-কে ছাড়িয়ে গেছে: 60টি ভাষার স্পিচ শনাক্তকরণ, 39 ধরনের চীনা উপভাষা এবং একাধিক বক্তা শনাক্তকরণ সূচকে Gemini 3.8 Flash-এর তুলনায় সর্বত্র এগিয়ে।
আরও কার্যকর ও সাশ্রয়ী: Agentic প্রমাণ সংগ্রহের মাধ্যমে দীর্ঘ ভিডিও বোঝার token ব্যবহার প্রায় 45.7% কমে, অথচ নির্ভুলতা কমে না, বরং বাড়ে।
দাম ব্যাপকভাবে কমেছে: API-তে প্রতি ঘণ্টার অডিও ইনপুটের দাম 98%-এর বেশি এবং অডিও-ভিডিও ইনপুটের দাম 93%-এর বেশি কমেছে, ফলে বৃহৎ পরিসরে ব্যবহারের খরচ অনেক কমেছে।
সম্পূর্ণ ওপেন সোর্স সহায়তা: Qwen-MM-Plugins ও Qwen-Live Harness উভয়ই ওপেন সোর্স এবং Claude Code, OpenClaw-এর মতো প্রধান Agent ফ্রেমওয়ার্কের সঙ্গে সামঞ্জস্যপূর্ণ।

06Qwen3.8-Omni-Flash-এর প্রকল্প ঠিকানা

GitHub রিপোজিটরি: Qwen-MM-Plugins: https://github.com/QwenLM/Qwen-MM-Plugins
Qwen-Live Harness: https://github.com/QwenLM/Qwen-Live-Harness

07Qwen3.8-Omni-Flash-এর প্রয়োগক্ষেত্র

ভিডিও কনটেন্ট তৈরি: একটি চাহিদা ইনপুট দিলেই চলচ্চিত্র বর্ণনা, MV তৈরি এবং স্বল্পদৈর্ঘ্য নাটকের অনুবাদ ও ডাবিংয়ের এন্ড-টু-এন্ড ডেলিভারি স্বয়ংক্রিয়ভাবে সম্পন্ন করে।
সভা দক্ষতা টুল: এক ঘণ্টার সভার রেকর্ডিং আপলোড করলে স্বয়ংক্রিয়ভাবে কার্যবিবরণী ও করণীয় তৈরি করে, এমনকি সরাসরি ইমেল পাঠানো ও কাজ তৈরি করতেও পারে।
শেখা ও জ্ঞান সংরক্ষণ: কয়েক ঘণ্টার টিউটোরিয়াল ভিডিওকে স্ক্রিনশট ও টাইমস্ট্যাম্পসহ PDF নোটে স্বয়ংক্রিয়ভাবে সংকুচিত করে।
ভিডিও গভীর গবেষণা: ভিডিও কনটেন্টের জন্য স্বয়ংক্রিয়ভাবে সমগ্র ওয়েব থেকে লেখা ও ছবি-ভিত্তিক উপকরণ খুঁজে, লেখা ও ছবিসমৃদ্ধ গভীর গবেষণা প্রতিবেদন তৈরি করে।
রিয়েল-টাইম ইন্টার‌্যাকশন সেবা: রিয়েল-টাইম কথ্য ভাষা অনুশীলন, স্মার্ট কাস্টমার সার্ভিস, শব্দ শুনে দিক শনাক্তকরণ নেভিগেশনসহ কম-বিলম্বের অডিও-ভিডিও ইন্টার‌্যাকশন দৃশ্য।

© দাবিত্যাগ: সময়ের সঙ্গে ডোমেইন ও লিংক করা কনটেন্ট পরিবর্তিত হতে পারে। AIEZZ তৃতীয় পক্ষের ওয়েবসাইট নিয়ন্ত্রণ করে না। বাহ্যিক কনটেন্ট ও ঝুঁকি স্বাধীনভাবে পর্যালোচনা করুন।

ব্যবহারকারীর রিভিউ0