
Mistral AI kecha (4 avgust) e’lon qilib, jami 3B (3 milliard) parametrga ega Shieldstral kontent moderatsiyasi AI modelini taqdim etganini bildirdi. Model ochiq vaznlar asosida ishlab chiqilgan va Apache 2.0 litsenziyasi ostida chiqarilgan.
Model Hugging Face platformasida ishga tushirildi, 12 ta tilni qo‘llab-quvvatlaydi va bitta 16GB GPU’da ishlashi mumkin. Mistral ma’lumotiga ko‘ra, model kontent xavfsizligi bo‘yicha o‘zidan 7 baravar katta ochiq modellarga teng natija ko‘rsatadi hamda multimodal kontent moderatsiyasi sohasida SOTA darajasiga erishgan.

Eslatma: SOTA atamasi state-of-the-art iborasining qisqartmasi bo‘lib, muayyan sun’iy intellekt vazifasi yoki benchmark testida eng yaxshi natija ko‘rsatadigan, eng ilg‘or darajadagi model yoki algoritmlar majmuasini anglatadi. Bu daraja texnologiyalar rivojlanishi va yangi tadqiqotlar e’lon qilinishi bilan doimiy ravishda o‘zgarib boradi.

Mistral ta’kidlashicha, aksariyat himoya modellari zararli kontent toifalari tizimini model vaznlariga singdirib qo‘yadi. Mahsulotdan foydalanish sohasi o‘zgargach, dasturchilar odatda modelni qayta o‘qitishga majbur bo‘ladi.
Shieldstral esa moderatsiya siyosatini kiruvchi kontentga joylashtiradi: operator “ha yoki yo‘q” shaklidagi savolni yozishi, keyin baholash ssenariysi va qat’iylik darajasini ko‘rsatishi mumkin. Shundan so‘ng model bitta chiqish tokeni asosida kalibrlangan xavfsizlik ballini hosil qiladi.
Model har bir moderatsiya vazifasini ikkilik savol-javobga aylantiradi. Kirish ma’lumotlari 3 ta belgilangan maydonni o‘z ichiga oladi:
<Instruct>: baholash ssenariysi va qat’iylik darajasini tushuntiradi.
<Query>: bitta “ha yoki yo‘q” savolini beradi, masalan, “Bu kontent jismoniy zo‘ravonlikni targ‘ib qiladimi?”
<Document>: moderatsiya qilinadigan kontentni taqdim etadi. Bu prompt, javob, prompt va javob kombinatsiyasi yoki ixtiyoriy matn biriktirilgan rasm bo‘lishi mumkin.
Xulosa chiqarish vaqtida model faqat “ha” va “yo‘q” ikki tokenining mantiqiy qiymatlarini o‘qiydi, so‘ng ularni softmax orqali uzluksiz ballga normallashtiradi va 0.5 chegarasi asosida ikkilik xulosa chiqaradi. Ushbu mexanizm promptlarni tasniflash, javoblarni moderatsiya qilish, rad etishni aniqlash va toksiklikni aniqlashni qamrab oladi.

