- Ziara za kila mwezi
- 0
- Bei
- Bure na Inalipiwa
- Imeorodheshwa
- 2026-08-05
- Imesasishwa
- 2026-08-05
01Shieldstral ni nini
Shieldstral ni modeli ya wazi ya Mistral AI ya uainishaji wa usalama wa maudhui ya aina nyingi yenye vigezo bilioni 3, iliyojengwa kwa msingi wa Ministral-3B. Modeli hii inafafanua upya ukaguzi wa maudhui wa kategoria zisizobadilika kuwa kazi ya maswali na majibu ya jozi. Inawezesha kufafanua sera za ukaguzi kwa wakati halisi kupitia maswali ya lugha asilia, bila kuhitaji mafunzo upya ili kuendana na matukio tofauti. Modeli imepata wastani wa F1 wa 84.9% kwenye viwango vya usalama wa maandishi na F1 ya 83.8% kwenye usalama wa maudhui ya aina nyingi, zote zikiwa SOTA. Inaweza kutumwa kwa GPU moja ya 16GB pekee na inaauni lugha 12.
02Vipengele vikuu vya Shieldstral
Ukaguzi unaobadilika kulingana na sera: Ingiza sera za usalama kama maswali ya lugha asilia ili kuwezesha ukaguzi maalum kwa wakati halisi katika matukio tofauti.
Utambuzi wa pamoja wa maudhui ya aina nyingi: Kiolesura kimoja hushughulikia kwa wakati mmoja tathmini ya usalama ya maandishi pekee, picha na maudhui yaliyochanganywa ya maandishi na picha.
Utambuzi wa ukiukaji kwa undani: Inaauni uainishaji wa usalama kutoka uamuzi wa jumla wa jozi hadi kategoria 73 za kiwango cha chini.
Alama za usalama zilizorekebishwa: Hutoa alama endelevu za usalama katika masafa ya 0–1 kupitia urekebishaji wa softmax, huku kizingiti cha 0.5 kikitumika kutambua ukiukaji.
Utumiaji mwepesi kwenye kifaa: Ukubwa wa vigezo bilioni 3 unawezesha uelekezaji wenye ufanisi kwenye GPU moja ya NVIDIA ya 16GB, hivyo kupunguza mahitaji ya maunzi.
03Kanuni ya kiteknolojia ya Shieldstral
Fuata WeChat na ujibu “开源” ili ujiunge na kikundi cha majadiliano ya miradi ya AI ya wazi
Muundo wa maswali na majibu ya jozi: Hubadilisha kazi ya ukaguzi kuwa utabiri wa thamani za kimantiki za tokeni mbili za matokeo, “yes” na “no”, kisha hupata alama endelevu ya usalama kupitia urekebishaji wa softmax.
Muundo wa ingizo wenye sehemu tatu: Hutumia muundo sanifu wa kidokezo unaojumuisha (mazingira ya tathmini na kiwango cha ukali)、(swali la usalama la ndiyo/hapana)、(maudhui ya kukaguliwa).
Mafunzo makubwa ya kulinganisha: Kwa kutumia sampuli milioni 54.1 (maandishi huria milioni 45.2, maandishi ya kulinganisha yaliyosanisishwa milioni 4.4 na maudhui ya aina nyingi milioni 4.5), modeli hufunzwa kwa jozi za kulinganisha zenye maudhui sawa lakini maswali tofauti ili kutofautisha kategoria zinazofanana.
Uongezaji wa data sanisi: Hutumia LLM kuandika upya maandishi salama kuwa matoleo yanayokiuka sera, na huzalisha kiotomatiki jozi za maswali ya kulinganisha kati ya kategoria lengwa na kategoria ndugu, ili kuimarisha utambuzi wa kina.
Urekebishaji wa LoRA + uunganishaji wa SLERP: Hufanya urekebishaji bora wa LoRA kwenye Ministral-3B, kisha huunganisha vituo viwili vya ukaguzi vinavyokamilishana, vilivyofunzwa kwa data ya umma na data sanisi, kwa kutumia uinganishaji wa mstari wa duara.
04Jinsi ya kutumia Shieldstral
Maandalizi ya mazingira: Tumia modeli ya Shieldstral na mfumo wa uelekezaji kwenye GPU moja ya NVIDIA ya 16GB.
Fafanua sera ya ukaguzi: Andika katika uga maelezo ya mazingira ya tathmini, usuli wa kikoa na viwango vya ukali.
Andika swali la usalama: Unda swali la ndiyo/hapana katika uga, kwa mfano “Je, maudhui yanaendeleza ukatili wa kimwili?”.
Ingiza maudhui ya kukaguliwa: Weka maandishi, picha au mchanganyiko wa maandishi na picha katika uga na uyawasilishe kwa modeli.
Pata uamuzi wa usalama: Soma alama endelevu iliyorekebishwa kwa softmax kutoka kwenye matokeo ya modeli, kisha weka kizingiti kulingana na mahitaji ya biashara ili kufanya uamuzi wa jozi kuhusu ukiukaji.
05Faida kuu za Shieldstral
Sera zinazobadilika: Viwango vya ukaguzi hufafanuliwa kwa wakati halisi kwa lugha asilia, bila kuhitaji kufundisha upya modeli kwa matukio mapya.
Utendaji bora: Vigezo bilioni 3 vinafikia SOTA kwenye viwango vya usalama wa maandishi na maudhui ya aina nyingi, ukilinganisha na modeli yenye ukubwa mara 7 zaidi.
Inayofaa kwa maunzi: GPU moja ya 16GB inatosha kuiendesha, hivyo kupunguza kwa kiasi kikubwa kizingiti cha utumiaji wa kibinafsi wa biashara.
Data iliyounganishwa: Huunganisha data mseto milioni 54.1 kwa muundo wa maagizo-maswali-nyaraka, ikijumuisha lugha 12 na matukio mbalimbali.
Maamuzi yanayoelezeka: Hutoa alama endelevu zilizorekebishwa badala ya lebo za uainishaji zisizoelezeka, hivyo kuwawezesha waendeshaji kurekebisha vizingiti kulingana na mahitaji.
06Anwani za mradi wa Shieldstral
Tovuti rasmi ya mradi: https://mistral.ai/news/shieldstral/
Maktaba ya modeli ya HuggingFace: https://huggingface.co/mistralai/Shieldstral-1.0-3B
Karatasi ya kiufundi ya arXiv: https://arxiv.org/pdf/2607.25857
07Matukio ya matumizi ya Shieldstral
Udhibiti wa hatari za maudhui kwenye mitandao ya kijamii: Hukagua kwa wakati halisi machapisho yenye maandishi na picha yanayochapishwa na watumiaji, na kuendana kwa njia inayobadilika na kanuni za uzingatiaji za jumuiya tofauti.
Ulinzi wa usalama wa mazungumzo ya AI: Hutambua mashambulizi ya kuvuka vizuizi katika vidokezo vya watumiaji pamoja na majibu hatari au yenye upendeleo kutoka kwa modeli.
Uzingatiaji wa matangazo na uuzaji: Huchuja kiotomatiki vipengele vya maandishi na picha vinavyokiuka sera katika nyenzo za matangazo, ili kuhakikisha maudhui yanayosambazwa kwenye majukwaa mbalimbali yanatii sheria.
Uchujaji wa maudhui ya elimu mtandaoni: Hutambua taarifa zisizofaa katika nyenzo za kozi na mwingiliano, na kulinda mazingira ya kujifunzia ya watoto.
Ukaguzi wa usalama wa nyaraka za biashara: Hutambua kiotomatiki taarifa nyeti na maudhui yanayokiuka sera katika faili za ndani za lugha nyingi zinazoshirikiwa.
© Kanusho: vikoa na maudhui yaliyounganishwa vinaweza kubadilika kadiri muda unavyopita. AIEZZ haidhibiti tovuti za wahusika wengine. Kagua maudhui na hatari za nje kwa kujitegemea.


Ukaguzi wa watumiaji0