- Ziara za kila mwezi
- 0
- Bei
- Haijawekwa
- Imeorodheshwa
- —
- Imesasishwa
- 2026-09-18
01Qwen3.8-Omni-Flash ni nini
Qwen3.8-Omni-Flash ni modeli asilia ya hali zote kutoka kwa Alibaba Qwen, inayotumia maandishi, picha, sauti, video na muktadha mrefu wa 1M. Inalenga uwezo wa Agent wa ”kutoka uelewaji hadi uwasilishaji”, na inaweza kukamilisha kiotomatiki mtiririko wa kazi wa mwisho hadi mwisho kama vile uhariri wa video, utengenezaji wa MV, utafsiri wa tamthilia fupi, ufafanuzi wa filamu na utekelezaji wa kumbukumbu za mikutano. Ikilinganishwa na kizazi kilichotangulia, utendaji umeongezeka kwa wastani wa zaidi ya 25%, huku bei ya kuingiza sauti kupitia API ikipungua kwa zaidi ya 98%. Pia imefungua msimbo wa mifumo miwili ya ziada, Qwen-MM-Plugins na Qwen-Live Harness.
02Kazi kuu za Qwen3.8-Omni-Flash
Maelezo yanayodhibitika ya sauti na video: Mtumiaji anaweza kubainisha kwa uhuru kitu cha kueleza, kipindi cha muda, kiwango cha maelezo na muundo wa matokeo, ili kupata ”kile mtumiaji anataka kujua” badala ya ”kile modeli imeona”.
Uelewaji wa ki-Agent wa sauti na video ndefu: Huanzia kwenye swali na kuamua yenyewe pa kuangalia na nini cha kusikiliza, kisha hutafuta ushahidi kwa raundi nyingi kutoka uchanganuzi wa jumla hadi wa kina ili kubaini taarifa muhimu. Usahihi huongezeka huku matumizi ya tokeni yakipungua kwa takriban 45.7%.
Uelewaji na utekelezaji wa mikutano mirefu: Inatumia asili ingizo la sauti na video la saa moja, na hukamilisha mwanzo hadi mwisho utenganishaji wa wazungumzaji, unukuzi, ulinganishaji wa utambulisho, utengenezaji wa kumbukumbu na utekelezaji wa majukumu.
Utafiti wa kina wa sauti na video: Huunganisha maudhui ya video na mahitaji ya mtumiaji, hutafuta kiotomatiki nyenzo za hali nyingi na kutengeneza ripoti ya utafiti yenye video kama kitovu, iliyo na maandishi na picha.
Music2MV: Huelewa kwa undani muundo, mdundo na hisia za wimbo, hutoa maneno ya wimbo yenye mihuri ya muda, na kukamilisha mtiririko mzima wa utengenezaji wa MV kuanzia uelewaji wa muziki hadi ukaguzi wa ubora wa video iliyokamilika.
Utafsiri wa tamthilia fupi: Kwa sentensi moja, hutambua mazungumzo ya wahusika, kuyatafsiri kwa lugha ya mazungumzo, kuiga sauti na kurekodi, kuchanganya upya njia za sauti na kufanya ukaguzi wa ubora, hivyo kuwezesha uwasilishaji wa utafsiri kiotomatiki.
Ufafanuzi wa filamu ndefu: Kwa kuingiza filamu na hitaji la sentensi moja, hukamilisha kiotomatiki uelewaji wa filamu nzima, ufupishaji wa matukio, maandishi ya ufafanuzi, urekodi wa sauti na muziki, uhariri, uonyeshaji na ukaguzi wa ubora.
Video2Note: Hubana video ya saa kadhaa kuwa madokezo ya PDF yenye uhusiano wa picha na maandishi pamoja na mihuri ya muda, kisha hukagua na kusahihisha kiotomatiki kwa marudio.
Omni Skill Creator: Hutoa SOP kutoka kwenye maonyesho ya uendeshaji au mafunzo ya wataalamu, na kuyageuza kuwa Agent Skill zinazoweza kutumika tena baada ya kuthibitishwa.
Mazoezi ya mazungumzo kwa wakati halisi: Huunda kwa pamoja modeli ya matamshi na maana, hutambua tofauti za lafudhi na kutoa kwa wakati halisi mfano wa matamshi sanifu.
03Kanuni za kiteknolojia za Qwen3.8-Omni-Flash
Fuata WeChat na ujibu “开源” ili ujiunge na kundi la mawasiliano la miradi huria ya AI
Muundo asilia uliounganishwa wa hali zote: Modeli huunda kwa pamoja maandishi, picha, sauti na video ndani ya muundo mmoja. Kwa usimbaji unaolingana wa hali na nafasi ya uwakilishi iliyounganishwa, huwezesha uelewaji kati ya hali mbalimbali huku ikidumisha uwezo wa maandishi unaolingana na modeli ya maandishi pekee yenye ukubwa sawa. Muktadha mrefu wa tokeni 1M huiwezesha kupokea asili sauti na video za saa kadhaa, na kuepuka mgawanyiko wa taarifa unaosababishwa na uchakataji wa vipande.
Utambuzi na ukusanyaji wa ushahidi kulingana na mahitaji: Modeli kwanza huchanganua kwa kiwango cha jumla ili kubaini vipande vinavyoweza kuwa muhimu, kisha huchukua maudhui yanayohusiana ya picha na sauti kwa kiwango cha kina ili kuyathibitisha. Hivyo huunda mlolongo wa ushahidi wa raundi nyingi kutoka jumla hadi kina, na kuelekeza hesabu na bajeti ya tokeni kwenye vipande vinavyohusiana kweli.
Ushirikiano wa sauti, video na mazingira ya Agent: Kikwazo cha kubadilisha Agent za sauti na video ndefu ni ukosefu wa usaidizi asilia wa sauti na video katika harness. Kwa hiyo, rasmi huendeleza modeli na mnyororo wa zana kwa pamoja: Qwen-MM-Plugins hutoa utambuzi kulingana na mahitaji, mwito wa zana na uwezo wa kutekeleza mtiririko wa kazi. Inaunganishwa na mifumo maarufu ya Agent kama Claude Code na OpenClaw, ikiunganisha uelewaji wa nyenzo, upangaji wa kazi, utekelezaji wa zana na uwasilishaji wa matokeo kuwa mnyororo kamili.
Utambuzi ulioratibiwa wa wazungumzaji wengi na picha-sauti: Modeli huunda kwa pamoja mkondo wa picha na sauti, na hutumia taarifa ya kuona (kuonekana kwa mtu kwenye picha na hali yake ya kufungua kinywa) kusaidia kutatua utata wa marejeo na huluki katika sauti. Hivyo hukamilisha mwanzo hadi mwisho utenganishaji wa wazungumzaji, unukuzi wa sauti na ulinganishaji wa utambulisho, na kuboresha kwa kiasi kikubwa vipimo vya utambuzi katika mikutano yenye zamu za wazungumzaji wengi na sauti zinazopishana.
Muundo wa mwingiliano wa mtiririko wa wakati halisi: Qwen3.8-Omni-Flash-Realtime hupokea mitiririko ya sauti na video kupitia WebSocket/WebRTC, na hutambua pamoja na kujibu wakati wa kuingiza data. Ucheleweshaji wa tokeni ya kwanza ni takriban 600-980ms, huku RTF ya utengenezaji wa sauti ikiwa takriban 0.153. Usahihishaji wa mazungumzo hutegemea uundaji wa pamoja wa matamshi na maana; modeli huendelea kusasisha tathmini inapopokea sauti mpya, na kutofautisha makosa yanayoathiri uelewaji na lafudhi ya asili.
04Jinsi ya kutumia Qwen3.8-Omni-Flash
Tumia moja kwa moja kwenye ukurasa wa wavuti: Fungua jukwaa la Qwen AI https://www.qianwenai.com/models/qwen3.8-omni-flash, tafuta qwen3.8-omni-flash, kisha pakia video/sauti/picha ili kuzungumza nayo.
Matumizi kupitia API: Omba API Key ya Alibaba Cloud DashScope, tumia kiolesura kinachooana na OpenAI, kisha tuma viungo vya picha, sauti na video pamoja na swali la maandishi.
Sakinisha programu-jalizi ili ifanye kazi: Sakinisha Qwen-MM-Plugins kwenye Claude Code, Qwen Code au zana nyingine, kisha sema kama kwenye mazungumzo ”@video.mp4 nitengenezee video ya ufafanuzi”; AI itakamilisha mchakato mzima kiotomatiki.
05Faida kuu za Qwen3.8-Omni-Flash
Muungano wa hali zote: Maandishi, picha, sauti na video hushughulikiwa na modeli moja, ikisaidia muktadha mrefu wa tokeni 1M na ingizo asilia la video ya saa moja.
Kuanzia uelewaji hadi uwasilishaji: Si kuelewa tu sauti na video, bali pia kupanga, kuita zana na kutoa video pamoja na nyaraka, hivyo kukamilisha kazi za mwisho hadi mwisho.
Uwezo bora wa Agent: Inaongoza kwa kiasi kikubwa katika vipimo vya Agent za sauti na video; WildClawBench-MM imeongezeka kwa pointi 36.5 ikilinganishwa na kizazi kilichotangulia, huku kazi za muda mrefu zikifikia alama ya juu ya 69.6 katika UniClawBench.
Uwezo wa sauti wazidi Gemini: Utambuzi wa lugha na sauti 60, lahaja 39 za Kichina na vipimo vya utambuzi wa wazungumzaji wengi vyote ni bora kuliko Gemini 3.8 Flash.
Ufanisi zaidi na gharama ndogo: Ukusanyaji wa ushahidi wa ki-Agent hupunguza matumizi ya tokeni katika uelewaji wa video ndefu kwa takriban 45.7%, huku usahihi ukiongezeka badala ya kupungua.
Bei imepungua kwa kiasi kikubwa: Bei ya ingizo la sauti kwa saa kupitia API imepungua kwa zaidi ya 98%, na ya ingizo la sauti na video kwa zaidi ya 93%, hivyo kupunguza sana gharama ya matumizi kwa kiwango kikubwa.
Mifumo huria ya ziada imekamilika: Qwen-MM-Plugins na Qwen-Live Harness zote zimetolewa kama programu huria, na zinaoana na mifumo maarufu ya Agent kama Claude Code na OpenClaw.
06Anwani za miradi ya Qwen3.8-Omni-Flash
Hifadhi ya GitHub: Qwen-MM-Plugins: https://github.com/QwenLM/Qwen-MM-Plugins
Qwen-Live Harness: https://github.com/QwenLM/Qwen-Live-Harness
07Matukio ya matumizi ya Qwen3.8-Omni-Flash
Uzalishaji wa maudhui ya video: Ingiza hitaji moja, kisha ukamilishe kiotomatiki uwasilishaji wa mwisho hadi mwisho wa ufafanuzi wa filamu, utengenezaji wa MV na utafsiri pamoja na urekodi wa tamthilia fupi.
Zana za kuongeza ufanisi wa mikutano: Pakia rekodi ya mkutano wa saa moja ili kutengeneza kiotomatiki kumbukumbu na majukumu ya kufuatilia, au hata kutuma barua pepe na kuunda kazi moja kwa moja.
Ujifunzaji na kuhifadhi maarifa: Bana kiotomatiki video za mafunzo za saa kadhaa kuwa madokezo ya PDF yenye picha za skrini na mihuri ya muda.
Utafiti wa kina wa video: Tafuta kiotomatiki nyenzo za maandishi na picha kwenye mtandao mzima kulingana na maudhui ya video, kisha tengeneza ripoti ya utafiti wa kina yenye maandishi na picha.
Huduma za mwingiliano wa wakati halisi: Matukio ya mwingiliano wa sauti na video yenye ucheleweshaji mdogo, kama vile mazoezi ya mazungumzo, huduma mahiri kwa wateja na urambazaji unaotambua mwelekeo kupitia sauti.
© Kanusho: vikoa na maudhui yaliyounganishwa vinaweza kubadilika kadiri muda unavyopita. AIEZZ haidhibiti tovuti za wahusika wengine. Kagua maudhui na hatari za nje kwa kujitegemea.


Ukaguzi wa watumiaji0