- Oylik tashriflar
- 0
- Narxlar
- bepul va To'lov
- Ro‘yxatga kiritilgan
- 2026-08-05
- Yangilangan
- 2026-08-05
01Shieldstral nima
Shieldstral — Mistral AI tomonidan taqdim etilgan, 3B parametrli ochiq kodli multimodal kontent xavfsizligi klassifikatsiya modeli bo‘lib, Ministral-3B asosida qurilgan. Model an’anaviy, oldindan belgilangan toifalarga asoslangan kontent moderatsiyasini ikkilik savol-javob vazifasi sifatida qayta talqin qiladi. U tabiiy tildagi so‘rovlar orqali moderatsiya siyosatlarini real vaqt rejimida belgilash imkonini beradi va qayta o‘qitishni talab qilmasdan turli vaziyatlarga moslashadi. Model matn xavfsizligi benchmarklarida o‘rtacha F1 bo‘yicha 84.9% va multimodal xavfsizlik F1 bo‘yicha 83.8% natija bilan SOTA darajasiga erishadi. Uni atigi bitta 16GB GPU’da joylashtirish mumkin va u 12 ta tilni qo‘llab-quvvatlaydi.
02Shieldstral’ning asosiy imkoniyatlari
Siyosatga moslashuvchan moderatsiya: xavfsizlik siyosatini tabiiy tildagi savol shaklida kiritib, turli vaziyatlarda real vaqt rejimida moslashtirilgan moderatsiyani amalga oshiradi.
Multimodal yagona aniqlash: yagona interfeys orqali faqat matn, tasvir hamda matn va tasvir aralash kontent xavfsizligini baholaydi.
Qoidabuzarliklarni nozik darajada aniqlash: yirik ikkilik baholashdan tortib 73 ta quyi toifagacha bo‘lgan batafsil xavfsizlik tasnifini qo‘llab-quvvatlaydi.
Kalibrlangan xavfsizlik ballari: softmax normalizatsiyasi orqali 0–1 oralig‘ida uzluksiz xavfsizlik ballarini chiqaradi va 0.5 chegarasi asosida qoidabuzarlikni belgilaydi.
Yengil edge joylashtirish: 3B parametrli model bitta 16GB NVIDIA GPU’da samarali ishlaydi va apparat talablarini kamaytiradi.
03Shieldstral’ning texnik prinsipi
WeChat’da kuzatib boring va “开源” deb javob yuboring, AI ochiq kodli loyihalar guruhiga qo‘shiling
Ikkilik savol-javob arxitekturasi: moderatsiya vazifasini “yes” va “no” ikkita chiqish tokenining mantiqiy qiymatini bashorat qilishga aylantiradi, so‘ng softmax normalizatsiyasi orqali uzluksiz xavfsizlik ballarini oladi.
Uch maydonli strukturalangan kiritish: (baholash vaziyati va qat’iylik darajasi)、(xavfsiz yoki xavfli ekanini so‘rash)、(moderatsiya qilinadigan kontent) standartlashtirilgan prompt formatidan foydalanadi.
Keng ko‘lamli kontrastiv o‘qitish: 5410 万 ta namunaga (4520 万 ta ochiq kodli matn, 440 万 ta sintetik kontrastiv matn, 450 万 ta multimodal namuna) asoslanib, bir xil kontent bo‘yicha turli so‘rovlar bilan kontrastiv juftliklarda o‘qitish orqali modelning o‘xshash toifalarni farqlash qobiliyatini rivojlantiradi.
Sintetik ma’lumotlarni kuchaytirish: LLM yordamida xavfsiz matnlarni qoidabuzar variantlarga aylantiradi hamda maqsadli toifa va unga yaqin toifalar bo‘yicha kontrastiv so‘rov juftliklarini avtomatik yaratib, nozik darajadagi farqlashni kuchaytiradi.
LoRA nozik sozlashi + SLERP birlashtirishi: Ministral-3B modeli LoRA yordamida samarali nozik sozlanadi, keyin umumiy ma’lumotlar to‘plami va sintetik ma’lumotlar asosida o‘qitilgan ikkita to‘ldiruvchi checkpoint sferik chiziqli interpolatsiya orqali birlashtiriladi.
04Shieldstral’dan qanday foydalanish kerak
Muhitni tayyorlash: Shieldstral modeli va inference framework’ini bitta 16GB NVIDIA GPU’da joylashtiring.
Moderatsiya siyosatini belgilash: baholash vaziyati, soha konteksti va qat’iylik mezonlarini tavsiflovchi maydonini to‘ldiring.
Xavfsizlik so‘rovini yozish: maydonida ikkilik ha/yo‘q savolini tuzing, masalan, “Kontent jismoniy zo‘ravonlikni targ‘ib qiladimi?”.
Tekshiriladigan kontentni kiritish: matn, tasvir yoki matn va tasvir kombinatsiyasini maydoniga joylab, modelga yuboring.
Xavfsizlik xulosasini olish: model chiqargan softmax orqali normalizatsiyalangan uzluksiz ballarni o‘qing va biznes talablariga ko‘ra chegarani belgilab, ikkilik qoidabuzarlik xulosasini chiqaring.
05Shieldstral’ning asosiy afzalliklari
Moslashuvchan siyosat: moderatsiya mezonlari tabiiy tilda real vaqt rejimida belgilanadi, yangi vaziyatlar uchun modelni qayta o‘qitish talab qilinmaydi.
Yuqori samaradorlik: 3B parametrli model matn va multimodal xavfsizlik benchmarklarida SOTA darajasiga erishib, o‘zidan 7 baravar katta modellar bilan tenglasha oladi.
Apparatga qulaylik: bitta 16GB GPU’da ishlaydi va korxonalar uchun xususiy joylashtirish to‘sig‘ini sezilarli darajada pasaytiradi.
Yagona ma’lumot formati: instruction-query-document formatida 54.1M xilma-xil ma’lumotni birlashtiradi, 12 ta til va turli vaziyatlarni qamrab oladi.
Izohlanadigan qarorlar: yopiq klassifikatsiya yorliqlari o‘rniga kalibrlangan uzluksiz ballarni chiqaradi, bu operatorlarga chegaralarni ehtiyojga ko‘ra sozlash imkonini beradi.
06Shieldstral loyihasi manzillari
Loyihaning rasmiy sayti: https://mistral.ai/news/shieldstral/
HuggingFace modeli: https://huggingface.co/mistralai/Shieldstral-1.0-3B
arXiv texnik maqolasi: https://arxiv.org/pdf/2607.25857
07Shieldstral’ning qo‘llanish sohalari
Ijtimoiy platformalarda kontent xavfini boshqarish: foydalanuvchilar joylagan matnli va tasvirli postlarni real vaqt rejimida tekshiradi hamda turli hamjamiyatlarning muvofiqlik me’yorlariga moslashadi.
AI dialoglari xavfsizligini ta’minlash: foydalanuvchi promptlaridagi jailbreak hujumlari va model chiqishidagi zararli yoki tarafkash javoblarni aniqlaydi.
Reklama va marketing muvofiqligi: reklama materiallaridagi qoidabuzar matn va tasvir elementlarini avtomatik tekshiradi hamda platformalararo reklama kontentining qonuniyligini ta’minlaydi.
Onlayn ta’lim kontentini filtrlash: o‘quv materiallari va interaktiv muloqotdagi nomaqbul ma’lumotlarni aniqlab, voyaga yetmaganlarning ta’lim muhitini himoya qiladi.
Korporativ hujjatlar xavfsizligi auditi: ichki ulashilgan ko‘p tilli fayllarda maxfiy ma’lumotlar va qoidabuzar kontentni avtomatik aniqlaydi.
© Ogohlantirish: domenlar va havola qilingan kontent vaqt o‘tishi bilan o‘zgarishi mumkin. AIEZZ uchinchi tomon veb-saytlarini nazorat qilmaydi. Tashqi kontent va xatarlarni mustaqil ravishda ko‘rib chiqing.


Foydalanuvchi sharhlari0