Asosiy kontentga o‘tish

Shieldstral Faoliyat yuritmoqda

Shieldstral — Mistral AI tomonidan taqdim etilgan, 3B parametrli ochiq kodli multimodal kontent xavfsizligi klassifikatsiya modeli bo‘lib, moderatsiya siyosatlarini tabiiy tilda belgilashni qo‘llab-quvvatlaydi va kontent xavfsizligi vazifalarida qo‘llanadi.

Shieldstral – Mistral AI’ning ochiq kodli multimodal kontent xavfsizligi klassifikatsiya modeli — Mistral AI tomonidan ishlab chiqilgan, 3B parametrli ochiq kodli multimodal kontent xavfsizligi klassifikatsiya modeli bo‘lib, Ministral-3B asosida qurilgan. Model an’anaviy, oldindan belgilangan toifalarga asoslangan kontent moderatsiyasini ikkilik savol-javob vazifasi sifatida qayta talqin qiladi. U tabiiy tildagi so‘rovlar orqali moderatsiya siyosatlarini real vaqt rejimida belgilash imkonini beradi va qayta o‘qitishni talab qilmasdan turli vaziyatlarga moslashadi. Model matn xavfsizligi benchmarklarida o‘rtacha F1 bo‘yicha 84.9% va multimodal xavfsizlik F1 bo‘yicha 83.8% natija bilan SOTA darajasiga erishadi. Uni atigi bitta 16GB GPU’da joylashtirish mumkin va u 12 ta tilni qo‘llab-quvvatlaydi. Asosiy imkoniyatlari: siyosatga moslashuvchan moderatsiya, multimodal yagona aniqlash, qoidabuzarliklarni nozik darajada aniqlash, kalibrlangan xavfsizlik ballari va yengil edge qurilmalarda joylashtirish. Model ijtimoiy platformalarda kontent xavfini boshqarish, AI dialoglari xavfsizligini ta’minlash, reklama va marketing muvofiqligi, onlayn ta’lim kontentini filtrlash hamda korporativ hujjatlarni xavfsizlik auditi kabi vaziyatlarda qo‘llanadi.

Shieldstral Mahsulot interfeysi
Oylik tashriflar
0
Narxlar
bepul va To'lov
Ro‘yxatga kiritilgan
2026-08-05
Yangilangan
2026-08-05

01Shieldstral nima

Shieldstral — Mistral AI tomonidan taqdim etilgan, 3B parametrli ochiq kodli multimodal kontent xavfsizligi klassifikatsiya modeli bo‘lib, Ministral-3B asosida qurilgan. Model an’anaviy, oldindan belgilangan toifalarga asoslangan kontent moderatsiyasini ikkilik savol-javob vazifasi sifatida qayta talqin qiladi. U tabiiy tildagi so‘rovlar orqali moderatsiya siyosatlarini real vaqt rejimida belgilash imkonini beradi va qayta o‘qitishni talab qilmasdan turli vaziyatlarga moslashadi. Model matn xavfsizligi benchmarklarida o‘rtacha F1 bo‘yicha 84.9% va multimodal xavfsizlik F1 bo‘yicha 83.8% natija bilan SOTA darajasiga erishadi. Uni atigi bitta 16GB GPU’da joylashtirish mumkin va u 12 ta tilni qo‘llab-quvvatlaydi.

02Shieldstral’ning asosiy imkoniyatlari

Siyosatga moslashuvchan moderatsiya: xavfsizlik siyosatini tabiiy tildagi savol shaklida kiritib, turli vaziyatlarda real vaqt rejimida moslashtirilgan moderatsiyani amalga oshiradi.
Multimodal yagona aniqlash: yagona interfeys orqali faqat matn, tasvir hamda matn va tasvir aralash kontent xavfsizligini baholaydi.
Qoidabuzarliklarni nozik darajada aniqlash: yirik ikkilik baholashdan tortib 73 ta quyi toifagacha bo‘lgan batafsil xavfsizlik tasnifini qo‘llab-quvvatlaydi.
Kalibrlangan xavfsizlik ballari: softmax normalizatsiyasi orqali 0–1 oralig‘ida uzluksiz xavfsizlik ballarini chiqaradi va 0.5 chegarasi asosida qoidabuzarlikni belgilaydi.
Yengil edge joylashtirish: 3B parametrli model bitta 16GB NVIDIA GPU’da samarali ishlaydi va apparat talablarini kamaytiradi.

03Shieldstral’ning texnik prinsipi

WeChat’da kuzatib boring va “开源” deb javob yuboring, AI ochiq kodli loyihalar guruhiga qo‘shiling
Ikkilik savol-javob arxitekturasi: moderatsiya vazifasini “yes” va “no” ikkita chiqish tokenining mantiqiy qiymatini bashorat qilishga aylantiradi, so‘ng softmax normalizatsiyasi orqali uzluksiz xavfsizlik ballarini oladi.
Uch maydonli strukturalangan kiritish: (baholash vaziyati va qat’iylik darajasi)、(xavfsiz yoki xavfli ekanini so‘rash)、(moderatsiya qilinadigan kontent) standartlashtirilgan prompt formatidan foydalanadi.
Keng ko‘lamli kontrastiv o‘qitish: 5410 万 ta namunaga (4520 万 ta ochiq kodli matn, 440 万 ta sintetik kontrastiv matn, 450 万 ta multimodal namuna) asoslanib, bir xil kontent bo‘yicha turli so‘rovlar bilan kontrastiv juftliklarda o‘qitish orqali modelning o‘xshash toifalarni farqlash qobiliyatini rivojlantiradi.
Sintetik ma’lumotlarni kuchaytirish: LLM yordamida xavfsiz matnlarni qoidabuzar variantlarga aylantiradi hamda maqsadli toifa va unga yaqin toifalar bo‘yicha kontrastiv so‘rov juftliklarini avtomatik yaratib, nozik darajadagi farqlashni kuchaytiradi.
LoRA nozik sozlashi + SLERP birlashtirishi: Ministral-3B modeli LoRA yordamida samarali nozik sozlanadi, keyin umumiy ma’lumotlar to‘plami va sintetik ma’lumotlar asosida o‘qitilgan ikkita to‘ldiruvchi checkpoint sferik chiziqli interpolatsiya orqali birlashtiriladi.

04Shieldstral’dan qanday foydalanish kerak

Muhitni tayyorlash: Shieldstral modeli va inference framework’ini bitta 16GB NVIDIA GPU’da joylashtiring.
Moderatsiya siyosatini belgilash: baholash vaziyati, soha konteksti va qat’iylik mezonlarini tavsiflovchi maydonini to‘ldiring.
Xavfsizlik so‘rovini yozish: maydonida ikkilik ha/yo‘q savolini tuzing, masalan, “Kontent jismoniy zo‘ravonlikni targ‘ib qiladimi?”.
Tekshiriladigan kontentni kiritish: matn, tasvir yoki matn va tasvir kombinatsiyasini maydoniga joylab, modelga yuboring.
Xavfsizlik xulosasini olish: model chiqargan softmax orqali normalizatsiyalangan uzluksiz ballarni o‘qing va biznes talablariga ko‘ra chegarani belgilab, ikkilik qoidabuzarlik xulosasini chiqaring.

05Shieldstral’ning asosiy afzalliklari

Moslashuvchan siyosat: moderatsiya mezonlari tabiiy tilda real vaqt rejimida belgilanadi, yangi vaziyatlar uchun modelni qayta o‘qitish talab qilinmaydi.
Yuqori samaradorlik: 3B parametrli model matn va multimodal xavfsizlik benchmarklarida SOTA darajasiga erishib, o‘zidan 7 baravar katta modellar bilan tenglasha oladi.
Apparatga qulaylik: bitta 16GB GPU’da ishlaydi va korxonalar uchun xususiy joylashtirish to‘sig‘ini sezilarli darajada pasaytiradi.
Yagona ma’lumot formati: instruction-query-document formatida 54.1M xilma-xil ma’lumotni birlashtiradi, 12 ta til va turli vaziyatlarni qamrab oladi.
Izohlanadigan qarorlar: yopiq klassifikatsiya yorliqlari o‘rniga kalibrlangan uzluksiz ballarni chiqaradi, bu operatorlarga chegaralarni ehtiyojga ko‘ra sozlash imkonini beradi.

06Shieldstral loyihasi manzillari

Loyihaning rasmiy sayti: https://mistral.ai/news/shieldstral/
HuggingFace modeli: https://huggingface.co/mistralai/Shieldstral-1.0-3B
arXiv texnik maqolasi: https://arxiv.org/pdf/2607.25857

07Shieldstral’ning qo‘llanish sohalari

Ijtimoiy platformalarda kontent xavfini boshqarish: foydalanuvchilar joylagan matnli va tasvirli postlarni real vaqt rejimida tekshiradi hamda turli hamjamiyatlarning muvofiqlik me’yorlariga moslashadi.
AI dialoglari xavfsizligini ta’minlash: foydalanuvchi promptlaridagi jailbreak hujumlari va model chiqishidagi zararli yoki tarafkash javoblarni aniqlaydi.
Reklama va marketing muvofiqligi: reklama materiallaridagi qoidabuzar matn va tasvir elementlarini avtomatik tekshiradi hamda platformalararo reklama kontentining qonuniyligini ta’minlaydi.
Onlayn ta’lim kontentini filtrlash: o‘quv materiallari va interaktiv muloqotdagi nomaqbul ma’lumotlarni aniqlab, voyaga yetmaganlarning ta’lim muhitini himoya qiladi.
Korporativ hujjatlar xavfsizligi auditi: ichki ulashilgan ko‘p tilli fayllarda maxfiy ma’lumotlar va qoidabuzar kontentni avtomatik aniqlaydi.

© Ogohlantirish: domenlar va havola qilingan kontent vaqt o‘tishi bilan o‘zgarishi mumkin. AIEZZ uchinchi tomon veb-saytlarini nazorat qilmaydi. Tashqi kontent va xatarlarni mustaqil ravishda ko‘rib chiqing.

Foydalanuvchi sharhlari0