- Ukuvakashelwa kwanyanga zonke
- 0
- Amanani
- Akusethiwe
- Kufakwe ohlwini
- —
- Kubuyekeziwe
- 2026-09-08
01Iyini i-LLaDA-Image
I-LLaDA-Image iyimodeli ehlanganisiwe yokukhiqiza nokuhlela izithombe enamapharamitha angu-6B, ekhishwe njenge-open source yi-inclusionAI ye-Ant Group. Imodeli isebenzisa indlela entsha yokuqeqesha kuqala ngezithombe kuphela, bese iqondaniswa nolimi, futhi isebenzisa i-architecture egcwele ye-diffusion (i-LLaDA2.0-mini yokuqonda + i-6B DiT yokukhiqiza) ukuze yenze umbhalo ube isithombe, ihlele ngemiyalelo, futhi inikeze umbhalo wesiShayina nowesiNgisi. Uhlobo lwe-Turbo ludinga izinyathelo ezingu-2–4 kuphela ukuze lukhiqize isithombe, futhi luthole indawo yokuqala phakathi kwamamodeli e-open source emikhakheni yesiShayina nesiNgisi ku-Qwen-Image-Bench.
02Imisebenzi eyinhloko ye-LLaDA-Image
Ukukhiqiza umbhalo ube isithombe: Khiqiza izithombe ezisezingeni eliphezulu, ezinemininingwane eminingi nezibukeka njengezithombe zangempela ngokusekelwe encazelweni yolimi lwemvelo.
Ukuhlela izithombe ngemiyalelo: Layisha isithombe esiyisithenjwa bese ufaka umyalo wolimi lwemvelo ukuze uguqule ngokunembile indawo ethile, kuyilapho ezinye izingxenye zihlala zingashintshiwe.
Ukunikezwa kombhalo ngezilimi ezimbili, isiShayina nesiNgisi: Bonisa ngokunembile umbhalo wesiShayina nowesiNgisi ezithombeni ezikhiqiziwe, usekele amaphosta, ukwakheka kombhalo nokwakhiwa kombhalo wobuciko.
Ukukhiqiza okunemibandela ye-VQ: Sebenzisa ama-token e-visual quantization (VQ) njengokufakwayo okunemibandela ukuze kukhiqizwe izithombe ezilawulekayo.
Ukuhlela ngesithombe esiyisithenjwa: Sebenzisa isithombe esilayishiwe njengesithenjwa ukuze wenze ukudlulisa isitayela, ukuguqula okuqukethwe nokunye ukuhlela.
Inference esheshayo ye-Turbo: Imodeli edistiliwe idinga amasampula angu-2–4 kuphela ukuze ikhiqize izithombe ezisezingeni eliphezulu ezingu-1024×1024.
03Isimiso sobuchwepheshe se-LLaDA-Image
Landela i-WeChat, phendula ngokuthi “开源”, bese ujoyina iqembu lokuxhumana lamaphrojekthi e-AI open source
I-architecture ehlanganisiwe egcwele ye-diffusion: Imodeli yakhiwe yimodyuli yokuqonda i-LLaDA2.0-mini (imodeli yolimi ye-diffusion esekelwe ku-MoE) kanye nemodyuli yokukhiqiza i-6B DiT. Kokubili kusebenzisa amamodeli e-diffusion ngemuva, futhi kuxhunywe nge-Connector ukuze kuhlukaniswe ukuqonda incazelo nokukhiqiza amaphikseli.
Isu lokuqeqesha ngezigaba: Ilandela indlela ethi “qala ufunde ukudweba, bese ufunda ukulalela imiyalelo”. Kuqala kwenziwa ukuqeqeshwa kwangaphambili ngezithombe kuphela nokuqeqeshwa kwaphakathi nesigaba ukuze kwakhiwe isisekelo esiqinile sokukhiqiza okubonakalayo, bese kufakwa ukugadwa kombhalo nezithombe ukuze kuqondaniswe ulimi nombono.
Ukwakhiwa kwedatha esezingeni eliphezulu: Ukuqeqeshwa kokukhiqiza kusebenzise cishe amasampula ayizigidi ezingu-220, lapho u-98% kuyizithombe zangempela. Esigabeni sokuqondanisa ulimi, izincazelo zemibhalo nezithombe zikhiqizwa futhi ziqinisekiswe amamodeli amakhulu ochungechunge lwe-Qwen, ukuze kuqinisekiswe ukunemba kokulandela imiyalelo.
Ukuthuthukisa ukuqeqeshwa okusebenzayo: Kulo lonke uchungechunge kusetshenziswa i-RMSNorm engenamapharamitha esikhundleni se-LayerNorm, kanye ne-Muon optimizer, ukuze kuthuthukiswe ukuzinza nokusebenza kahle kokuqeqeshwa ngezinga elikhulu.
Ukudistila okusheshayo kwe-Twin-DMD: Uhlobo lwe-Turbo lusebenzisa ubuchwepheshe bokudistila be-Twin-DMD ukucindezela imodeli ye-Base. Ngamasampula angu-2–4 lungakhiqiza izithombe ezisezingeni eliphezulu ezingu-1024×1024, lilinganise isivinini nekhwalithi.
04Indlela yokusebenzisa i-LLaDA-Image
Ukulungisa imvelo: Faka i-Python 3.11, i-PyTorch 2.8, i-Diffusers 0.39.0 kanye ne-FlashAttention 2.8.3 nezinye izidingo, bese wakhe imvelo yasendaweni ye-inference.
Ukuthola ama-weight: Landa amafayela emodeli ye-LLaDA-Image (inguqulo yekhwalithi ephezulu) noma i-LLaDA-Image-Turbo (inguqulo esheshayo) ku-Hugging Face noma ku-Magic Model ModelScope.
Ukukhiqiza umbhalo ube isithombe: Ngemva kokulayisha imodeli, faka umbhalo ochazayo. Kunguqulo ye-Base setha izinyathelo ezingu-50 ne-guidance scale engu-5.0; kwinguqulo ye-Turbo setha izinyathelo ezingu-2–4 ne-guidance scale engu-1.0, ukuze ukhiqize isithombe esingu-1024×1024.
Ukuhlela isithombe ngemiyalelo: Layisha isithombe esiyisithenjwa bese ufaka umyalo wokuhlela wolimi lwemvelo, njengokuthi “shintsha ingemuva libe lolwandle”. Imodeli izogcina ngokuzenzakalelayo izindawo ezingahlelwanga zingashintshiwe.
Qaphela izindinganiso zosayizi: Osayizi bokufaka bokukhiqiza umbhalo ube isithombe nokukhiqiza okunemibandela ye-VQ kumele babe ukuphindaphindwa kuka-16; imisebenzi yokuhlela kumele ibe ukuphindaphindwa kuka-32.
05Izinzuzo ezibalulekile ze-LLaDA-Image
Ukusebenza okuhamba phambili njenge-open source: Ibe ngowokuqala phakathi kwamamodeli e-open source emikhakheni yesiShayina nesiNgisi ku-Qwen-Image-Bench, futhi amaphuzu ayo ewonke adlula amamodeli amakhulu e-open source afana ne-FLUX.2 Max.
Ukukhiqiza nokuhlela okuhlanganisiwe: Imodeli eyodwa isekela kokubili ukukhiqiza umbhalo ube isithombe sekhwalithi ephezulu nokuhlela izithombe okunembile ngemiyalelo, ngaphandle kokushintsha amamodeli.
Inference esheshayo: Uhlobo lwe-Turbo oludistiliwe ludinga amasampula angu-2–4 kuphela ukuze lukhiqize isithombe esisezingeni eliphezulu esingu-1024×1024, lunciphise kakhulu isikhathi sokulinda.
Ukunikezwa kombhalo wesiShayina nesiNgisi: Lunekhono elihle lokukhiqiza umbhalo wesiShayina nowesiNgisi, futhi lufanele imisebenzi yokuklama efana namaphosta, ukwakheka kombhalo nombhalo wobuciko.
Ukubukeka kwangempela njengezithombe: Ngenxa yedatha yokuqeqeshwa kwangaphambili equkethe u-98% wezithombe zangempela, imiphumela ekhiqiziwe inokukhanya kwemvelo, imininingwane eminingi nobuqiniso obuphezulu.
06Ikheli lephrojekthi ye-LLaDA-Image
Indawo yokugcina ye-GitHub:https://github.com/inclusionAI/LLaDA-Image
Iqoqo lamamodeli e-HuggingFace:https://huggingface.co/collections/inclusionAI/llada-image
Iphepha lobuchwepheshe le-arXiv:https://arxiv.org/pdf/2609.03796
07Izimo zokusetshenziswa kwe-LLaDA-Image
Ukuklama okubukwayo kwe-e-commerce: Khiqiza isithombe esikhulu somkhiqizo ngokuchofoza okukodwa ngokusekelwe encazelweni yomkhiqizo, noma shintsha ingemuva futhi ulungise ukukhanya nezithunzi ngemiyalelo, unciphise izindleko zokuthatha izithombe nokuhlela ngemva kwalokho.
Ukwenza amaphosta okukhangisa: Sebenzisa ikhono elihle lokunikezwa kombhalo wesiShayina nesiNgisi ukuze ukhiqize ngokuqondile amaphosta ezentengiso nemifanekiso yezinkundla zokuxhumana enesiqubulo somkhiqizo kanye nolwazi lomcimbi.
Ukudala okuqukethwe kwezinkundla zokuxhumana: Nikeza ama-blogger nabadali ukukhiqizwa kwezithombe zabantu, izindawo nemisebenzi yokuphila ezibukeka njengezithombe zangempela, usekele ukuhlela ngesitayela nokukhiqiza okusheshayo.
Ukwakha imiqondo yemidlalo namafilimu: Khiqiza ngokushesha imidwebo yemiqondo yabalingiswa nezindawo ngokusekelwe embhalweni, bese uguqula imininingwane ngemiyalelo ukuze kusheshiswe inqubo yokudala yokuqala.
Ukuhlela izithombe komuntu siqu: Layisha isithombe bese usebenzisa imiyalelo yolimi lwemvelo ukususa izinto ezingadingeki, ukushintsha isibhakabhaka nokulungisa umbala, kuyilapho izindawo ezingaguqulwanga zihlala zinjalo, esikhundleni sesofthiwe yokuhlela eyinkimbinkimbi.
© Umshwana wokuzihlangula: izizinda nokuqukethwe okuxhunyiwe kungashintsha ngokuhamba kwesikhathi. I-AIEZZ ayilawuli amawebhusayithi ezinkampani zangaphandle. Buyekeza okuqukethwe nezingozi zangaphandle ngokuzimela.


Izibuyekezo zabasebenzisi0