Ruka hadi maudhui makuu

InstructAV2AV – Muundo wa uhariri wa pamoja wa sauti na video uliotolewa kwa chanzo huria na Zhiyuan pamoja na Chuo Kikuu cha Peking Inafanya kazi

InstructAV2AV ni muundo wa uhariri wa pamoja wa sauti na video uliotengenezwa kwa ushirikiano na kutolewa kwa chanzo huria na Beijing Academy of Artificial Intelligence pamoja na Chuo Kikuu cha Peking.

InstructAV2AV – Muundo wa uhariri wa pamoja wa sauti na video uliotolewa kwa chanzo huria na Zhiyuan pamoja na Chuo Kikuu cha Peking ni muundo uliotengenezwa kwa ushirikiano na Beijing Academy of Artificial Intelligence pamoja na Chuo Kikuu cha Peking. Mtumiaji anahitaji tu kutoa amri moja ya lugha ya kawaida ili kuhariri kwa wakati mmoja picha za video na sauti inayolingana nayo wakati wa mchakato wa utengenezaji wa mwisho hadi mwisho, bila kutumia vinyago vya mikono au uchakataji wa hatua kwa hatua. Muundo huu unaunga mkono urekebishaji wa mazungumzo, ubadilishaji wa wahusika, uingizaji na uondoaji wa vitu, huku ukihifadhi sauti za mandharinyuma na mazingira bila mabadiliko na kudumisha usawazishaji wa muda kati ya sauti na picha. Vipengele vya msingi vinajumuisha urekebishaji wa sauti huku utambulisho ukihifadhiwa, ubadilishaji wa matukio ya sauti na video, uingizaji wa matukio, uondoaji wa matukio na uhariri wa pamoja wa sifa. Inafaa kwa matumizi kama vile uhariri wa baada ya utengenezaji wa filamu na televisheni, utayarishaji wa video fupi, uendeshaji wa binadamu pepe, ubunifu wa matangazo na utengenezaji wa maudhui shirikishi.

InstructAV2AV – Muundo wa uhariri wa pamoja wa sauti na video uliotolewa kwa chanzo huria na Zhiyuan pamoja na Chuo Kikuu cha Peking Kiolesura cha bidhaa
Ziara za kila mwezi
0
Bei
Bure na Inalipiwa
Imeorodheshwa
2026-08-06
Imesasishwa
2026-08-06

01InstructAV2AV ni nini

InstructAV2AV ni muundo wa uhariri wa pamoja wa sauti na video uliotengenezwa kwa ushirikiano na Beijing Academy of Artificial Intelligence pamoja na Chuo Kikuu cha Peking. Mtumiaji anahitaji tu kutoa amri moja ya lugha ya kawaida ili kuhariri kwa wakati mmoja picha za video na sauti inayolingana nayo wakati wa mchakato wa utengenezaji wa mwisho hadi mwisho, bila kutumia vinyago vya mikono au uchakataji wa hatua kwa hatua. Muundo huu unaunga mkono urekebishaji wa mazungumzo, ubadilishaji wa wahusika, uingizaji na uondoaji wa vitu, huku ukihifadhi sauti za mandharinyuma na mazingira bila mabadiliko na kudumisha usawazishaji wa muda kati ya sauti na picha.

02Vipengele vikuu vya InstructAV2AV

Urekebishaji wa sauti huku utambulisho ukihifadhiwa: hubadilisha tu maneno yanayosemwa na mhusika huku mwonekano wake ukibaki vilevile.
Ubadilishaji wa matukio ya sauti na video: hubadilisha mhusika maalum kwenye picha pamoja na sauti na mazungumzo yake.
Uingizaji wa matukio: huongeza kitu kipya kwenye picha na kutengeneza kiotomatiki sauti inayosawazishwa nacho.
Uondoaji wa matukio: huondoa kitu maalum pamoja na sauti yake inayolingana kwenye wimbo wa sauti.
Uhariri wa pamoja wa sifa: mwonekano wa mhusika, maudhui ya hotuba na timbre ya sauti vinaweza kurekebishwa kwa kujitegemea na kuunganishwa kwa uhuru.

03Kanuni ya kiteknolojia ya InstructAV2AV

Mfuate WeChat na ujibu “开源” ili kujiunga na kikundi cha mawasiliano cha miradi ya AI ya chanzo huria
Uunganishaji wa vigezo fiche vya chanzo: huunganisha vigezo fiche vya video na sauti za chanzo pamoja na kelele kwenye mwelekeo wa njia, ili maudhui ya chanzo yawe hali ya kimuundo katika mchakato mzima wa kuondoa kelele. Hii huulazimisha muundo kuhifadhi mandharinyuma, vitu visivyohusika na sauti za mazingira, na kuzuia “kubadilisha lengo moja na kuchora upya ulimwengu mzima”.
SIGA Gated Attention: Source-Instruction Gated Attention huwezesha kila tokeni kuingiliana kwa wakati mmoja na vipengele vya chanzo na vya amri. Kupitia udhibiti laini unaoweza kujifunza, huamua kwa kila nafasi kiasi cha kubadilisha na kiasi cha kuhifadhi, hivyo kufanikisha uwiano wa nguvu kati ya kuhifadhi maudhui na kutekeleza amri.
Muundo wa mwingiliano wa mikondo miwili: kwa kuzingatia Ovi Symmetric Dual-Stream Diffusion Transformer, matawi ya video na sauti hujenga mifano kwa kutumia umakini binafsi, kisha hubadilishana vipengele kupitia umakini wa pande mbili wa kuvuka moduli. Hii huwezesha mwendo wa kuona na matukio ya sauti kulazimishana na kubaki katika usawazishaji.
Mafunzo ya hatua mbili: huzima umakini wa kuvuka moduli ili kufundisha kando uwezo wa uhariri wa kila moduli, kisha kurejesha muundo kamili na kufanya urekebishaji wa pamoja, ili kujifunza uhusiano wa kina kati ya sauti na picha.
Mtiririko wa kiotomatiki wa data: kupitia hatua tatu za kuchuja nyenzo, kuunda malengo ya uhariri, na tathmini ya kiotomatiki ya vipimo vitano pamoja na uhakiki wa binadamu, huunda seti ya data ya InsAVE-80K na kutatua uhaba wa data za mafunzo zilizo katika jozi.

04Jinsi ya kutumia InstructAV2AV

Nakili msimbo: Nakili hazina ya msimbo ya InstructAV2AV kutoka GitHub hadi kwenye kifaa chako.
Sanidi mazingira: Fuata maelekezo ya hazina kusanidi mazingira ya Python na kusakinisha vitegemezi vinavyohitajika.
Pakua uzani: Pakua uzani wa muundo wa InstructAV2AV kutoka Hugging Face.
Andaa nyenzo: Andaa video yenye sauti itakayotumika kama ingizo.
Ingiza amri: Ingiza amri moja ya uhariri kwa lugha ya kawaida inayoeleza unachotaka kubadilisha.
Endesha uelekezaji: Endesha hati ya uelekezaji na usubiri muundo utengeneze video na sauti zilizohaririwa.
Hifadhi matokeo: Kagua matokeo ya ingizo na uhifadhi faili za sauti na video zilizokamilishwa kuhaririwa.

05Anwani za mradi wa InstructAV2AV

Tovuti rasmi ya mradi: https://hjzheng.net/projects/InstructAV2AV/
Hazina ya GitHub: https://github.com/suimuc/InstructAV2AV
Hazina ya muundo kwenye HuggingFace: https://huggingface.co/suimu/InstructAV2AV
Makala ya kiufundi ya arXiv: https://arxiv.org/pdf/2605.18467

06Matukio ya matumizi ya InstructAV2AV

Uhariri wa baada ya utengenezaji wa filamu na televisheni: Wataalamu wa uhariri hutumia kubadilisha mazungumzo ya waigizaji na kusawazisha mwendo wa midomo, hivyo kupunguza gharama za kurekodi upya.
Utayarishaji wa video fupi: Watayarishaji wa video fupi hutumia amri ya sentensi moja kubadilisha wahusika na sauti kwenye nyenzo, na kuongeza ufanisi wa ubunifu.
Binadamu pepe: Timu za uendeshaji wa binadamu pepe hutumia kurekebisha mwonekano, timbre ya sauti na maudhui ya hotuba ya binadamu wa kidijitali.
Ubunifu wa matangazo: Wataalamu wa matangazo hutumia kutengeneza kwa wingi video za matangazo zenye matoleo tofauti ya wahusika na mazungumzo.
Utengenezaji wa maudhui shirikishi: Wataalamu wa michezo na elimu hutumia kutengeneza kwa nguvu nyenzo za multimedia zenye usawazishaji wa sauti na picha.

© Kanusho: vikoa na maudhui yaliyounganishwa vinaweza kubadilika kadiri muda unavyopita. AIEZZ haidhibiti tovuti za wahusika wengine. Kagua maudhui na hatari za nje kwa kujitegemea.

Ukaguzi wa watumiaji0