Asosiy kontentga o‘tish
AI qo‘llanmalari

Xitoycha AI matn detektori qo‘llanmasi: mahalliy inferens, modelni o‘qitish va natijalarni tekshirish

Ushbu qo‘llanmada Chinese Guba AI Detector dasturini o‘rnatish, mahalliy modelni sozlash, CSV matnlarini ommaviy tekshirish, chiqish maydonlarini tushunish hamda qonuniy ma’lumotlar ruxsatini olgandan so‘ng modelni o‘qitish va tekshirish haqida so‘z yuritiladi.

Xitoycha AI matn detektori: mahalliy inferens va modelni o‘qitish

Loyiha haqida

Chinese Guba AI Detector — xitoycha AI matnlarini ikkita toifaga ajratuvchi vosita. Loyiha hfl/chinese-roberta-wwm-ext asosida yaratilgan va C-ReD korpusi yordamida nozik sozlangan; u ilgari fond bozori forumlaridagi matnlarni tadqiqot maqsadida o‘lchashda qo‘llangan. Hozirgi ombor o‘qitish, inferens va test skriptlari hamda tegishli hujjatlarni ochiq taqdim etadi.

Ushbu vosita modelni mahalliy ravishda yuklaydi va tashqi API'larga murojaat qilmaydi. Muhim jihat: omborda hozircha o‘qitilgan og‘irliklar va tokenizator fayllari mavjud emas, shuning uchun foydalanuvchi modelni qonuniy ravishda mustaqil qo‘lga kiritib, belgilangan katalogka joylashtirishi kerak.

Muhim cheklov: bu C-ReD'ning rasmiy modeli emas. Ushbu nozik sozlashda fond bozori forumidagi postlardan foydalanilmagan va moliyaviy forumlar sohasi bo‘yicha inson tomonidan belgilangan test o‘tkazilmagan. Model ballari matnning haqiqiy muallifini isbotlamaydi va shaxsni aniqlash yoki kontentni jazolash uchun yagona asos sifatida ishlatilmasligi kerak.

Asosiy funksiyalar

  • UTF-8 CSV fayllaridagi xitoycha matnlarni AI va inson yozgan matn sifatida ikkita toifaga ajratadi.
  • AI toifasining softmax ballari va chegaraga asoslangan tasniflash natijasini chiqaradi.
  • Standart ravishda 帖子内容文本 maydonini o‘qiydi, shuningdek maxsus matn va aksiya kodi ustunlarini qo‘llab-quvvatlaydi.
  • 股吧代码 qiymatlarini olti xonali matn ko‘rinishiga keltiradi va boshidagi nollarni saqlaydi.
  • Kiritish faylidagi boshqa ustunlarni saqlaydi va ularning matnini o‘zboshimchalik bilan o‘zgartirmaydi.
  • Vaqtinchalik fayl va atomik almashtirish orqali chiqish faylining buzilish xavfini kamaytiradi.
  • Yaxlitlikni tekshirish, ustiga yozib qayta hisoblash va bitta jarayon orqali yozishni himoyalashni qo‘llab-quvvatlaydi.
  • O‘qitish, birlik testlari va ochiq kontent auditi skriptlarini taqdim etadi.

O‘rnatish muhiti

1. Python va PyTorch'ni tayyorlash

Loyiha Python 3.10 muhitida sinovdan o‘tkazilgan. Alohida virtual muhitdan foydalanish tavsiya etiladi. CPU yoki CUDA qurilmangizga qarab, avval PyTorch rasmiy ko‘rsatmalari asosida qurilmaga mos PyTorch 2.5.1 versiyasini o‘rnating.

Windows PowerShell'da omborning ildiz katalogiga o‘ting, so‘ng virtual muhit yarating va uni faollashtiring:

python -m venv .venv
.\.venv\Scripts\Activate.ps1
python -m pip install -r requirements.txt

CPU inferensni bajara oladi, ammo CUDA GPU odatda tezroq ishlaydi. Video xotira yetishmasa, avval --batch-size qiymatini standart yoki kattaroq qiymatdan 8 yoki 4 ga kamaytiring.

2. Mahalliy modelni tayyorlash

Qonuniy ravishda olingan o‘qitilgan modelni models/detector katalogiga joylashtiring. Ushbu katalog quyidagi fayllarni o‘z ichiga olishi kerak:

  • model.safetensors
  • config.json
  • tokenizer.json
  • tokenizer_config.json
  • special_tokens_map.json
  • vocab.txt

Ushbu og‘irliklar va tokenizator fayllari ochiq omborga kiritilmagan. Katalog to‘liq bo‘lmasa, inferens skripti modelni to‘g‘ri yuklay olmaydi.

Birinchi tekshiruvni ishga tushirish

1. Kiritish CSV faylini tayyorlash

Kiritish fayli UTF-8 CSV bo‘lishi kerak. Standart matn ustuni nomi 帖子内容文本, aksiya kodi ustuni nomi esa 股吧代码. Omborda berilgan namunalar to‘qima matnlardan iborat bo‘lib, haqiqiy foydalanuvchilar, postlar yoki inson va AI haqidagi haqiqiy belgilarni o‘z ichiga olmaydi.

2. Ommaviy inferensni bajarish

Model tayyor bo‘lgach, omborning ildiz katalogida quyidagi buyruqni bajaring:

python scripts/predict.py --model-dir models/detector --input examples/synthetic_posts.csv --output outputs/demo.csv --batch-size 32

Buyruq mahalliy modelni models/detector katalogidan yuklaydi, namunaviy CSV faylni o‘qiydi va tekshiruv natijalarini outputs/demo.csv fayliga yozadi. Butun tekshiruv jarayonida tashqi API chaqirilmaydi.

3. Chiqish maydonlarini tushunish

Chiqish faylida asl ustunlar saqlanadi va quyidagi maydonlar qo‘shiladi:

  • 是否AI生成: yaxlitlanmagan model balli chegaraga teng yoki undan katta bo‘lsa 1, aks holda 0 bo‘ladi; bo‘sh matn bo‘shligicha qoladi.
  • AI生成概率: AI toifasining softmax balli. Ushbu ball kalibrlanmagan, shuning uchun uni bevosita haqiqiy ehtimol deb bo‘lmaydi.
  • AI检测模型: ochiq model identifikatori; mahalliy model yo‘li yozilmaydi.
  • AI检测阈值: standart qiymat 0.7. Bu loyiha konfiguratsiyasi bo‘lib, maqolada aniqlangan optimal chegara emas.
  • AI检测状态: ok tekshiruv tugaganini, empty_text esa kiritish matni bo‘shligini bildiradi.

Maxsus CSV ustunlaridan foydalanish

Agar matn ustuni text, aksiya kodi ustuni esa id deb nomlangan bo‘lsa, ularni aniq ko‘rsatish mumkin:

python scripts/predict.py --model-dir models/detector --input input.csv --output outputs/result.csv --text-column text --stock-column id

Agar kiritish faylida aksiya kodi ustuni bo‘lmasa, bo‘sh satr yuboring:

python scripts/predict.py --model-dir models/detector --input input.csv --output outputs/result.csv --text-column text --stock-column ""

Aksiya kodi ustuni mavjud bo‘lsa, dastur uni olti xonali matn ko‘rinishiga keltiradi va boshidagi nollarni saqlaydi. Kiritishdagi boshqa ustunlar matn sifatida o‘z holicha saqlanadi.

Ustiga yozish, tekshirish va parallel qayta ishlash

To‘liq natijani qayta yaratish

Inferens natijasi avval vaqtinchalik faylga yoziladi, muvaffaqiyatli tugagach esa maqsad fayl atomik ravishda almashtiriladi. Xuddi shu buyruq qayta ishga tushirilganda, dastur mavjud natijani faqat kiritish, model, parametrlar va to‘liq chiqish tekshiruv qiymatlari mos kelgandagina o‘tkazib yuboradi.

Mavjud natijani e’tiborsiz qoldirib, to‘liq faylni qayta yaratish uchun --overwrite parametrini qo‘shing:

python scripts/predict.py --model-dir models/detector --input examples/synthetic_posts.csv --output outputs/demo.csv --batch-size 32 --overwrite

Jarayon uzilishi va parallel vazifalar

Jarayon uzilgandan so‘ng dastur mavjud qatorlar soniga ko‘r-ko‘rona tayanib davom etmaydi, balki fayl boshidan qayta hisoblaydi. Bir xil chiqish yo‘liga bir vaqtning o‘zida faqat bitta jarayon yozishi mumkin. Parallel ishlov berish kerak bo‘lsa, har bir jarayonga alohida kiritish va chiqish faylini ajrating.

Uzunlik cheklovi va natijalarni izohlash

Standart holatda har bir matndan ko‘pi bilan 256 ta token kiritiladi, ortiqcha qismi kesiladi. Tokenlar soni xitoycha belgilar soniga teng emas, shuning uchun bu cheklovni 256 ta xitoycha belgi deb tushunmaslik kerak.

Asl tadqiqotdagi ayrim fond bozori forum postlari atigi taxminan 203 belgidan iborat yig‘ilgan parchalardan tashkil topgan. Shu sababli tekshirilayotgan obyekt asl matnning faqat bir qismi bo‘lishi mumkin. Natijalarni izohlashda matnning kesilishi, soha farqlari va kontekst yetishmasligini ham hisobga olish kerak.

AI生成概率 kalibrlanmagan softmax ballidir, standart 0.7 chegarasi esa faqat loyiha sozlamasidir. Chegarani o‘zgartirish ikkilik tasnif natijasini o‘zgartiradi, ammo README hech qanday chegarani maqolada tasdiqlangan optimal qiymat sifatida e’lon qilmagan.

C-ReD ma’lumotlari yordamida modelni o‘qitish

Ruxsat talabi

O‘qitishdan oldin C-ReD ma’lumotlaridan qonuniy foydalanish ruxsatini mustaqil tekshirib, olishingiz shart. Yuqori darajadagi omborda aniq litsenziya topilmagan; maqolaga iqtibos keltirish ma’lumotlardan foydalanish yoki ularni qayta tarqatish huquqini bermaydi. Ushbu loyiha C-ReD ma’lumotlarini ko‘chirmaydi, omborning MIT litsenziyasi esa C-ReD ma’lumotlari va ulardan hosil qilingan og‘irliklarga tatbiq etilmaydi.

O‘qitish bog‘liqliklarini o‘rnatish

python -m pip install -r requirements-train.txt

O‘qitishni boshlash

Qonuniy olingan ma’lumotlar data/C-ReD katalogiga joylashtirilgan deb faraz qilaylik. Quyidagi buyruqni bajarish mumkin:

python scripts/train.py --data-root data/C-ReD --output-dir models/detector --epochs 3 --batch-size 8 --eval-batch-size 16 --no-fp16

O‘qitish dasturi nomida CReD_ mavjud bo‘lgan CSV fayllarni o‘qiydi va ulardagi text hamda label ustunlaridan foydalanadi. Manba ma’lumotlaridagi belgilar 0=AI, 1=inson tarzida berilgan; o‘qitish paytida ular 0=inson, 1=AI ko‘rinishiga o‘zgartiriladi.

O‘qitish protokoli va tarixiy ko‘rsatkichlar MODEL_CARD.md faylida qayd etilgan. Qayta o‘qitishda to‘liq tasodifiy urug‘ bilan ishga tushiriladi, ammo avvalgi o‘qitishda model ishga tushirilishidan oldin global urug‘ aniq o‘rnatilmagan. Shu sababli eski og‘irliklarni bitma-bit takrorlash kafolatlanmaydi.

Test va nashr auditi

Barcha birlik testlarini ishga tushirish:

python -m unittest discover -s tests -v

Birlik testlarida to‘qima ma’lumotlar va taqlid qilingan bashoratlardan foydalaniladi, shuning uchun modelni yuklab olish talab etilmaydi. Haqiqiy modelning tutun testi faqat model yuklanib, inferensni bajara olishini ko‘rsatadi; bashoratlar to‘g‘ri ekanini isbotlamaydi.

Ochiq kontent auditini ishga tushirish:

python scripts/audit_release.py

Ochiq ombor fayllar oq ro‘yxati va maxfiy ma’lumot naqshlari yordamida tekshiriladi. Fond bozori forumlarining asl CSV fayllari, nashriyotchi ID'lari, taxalluslar, IP manzillar, post URL'lari, maqola panellari, tijoriy ma’lumotlar bazalari, kesh, jurnallar, Notebook chiqishlari, o‘qitishning oraliq nazorat nuqtalari va tarixiy Git yozuvlari omborga kiritilmasligi kerak. Aniq anonimlashtirish doirasi PRIVACY.md faylida, nashr jarayoni esa docs/PUBLISHING.md faylida keltirilgan.

Ilg‘or foydalanish bo‘yicha tavsiyalar

  1. Avval to‘qima ma’lumotlar bilan jarayonni tekshiring: o‘z qonuniy ma’lumotlaringizni qayta ishlashdan oldin muhit, ustun nomlari, model katalogi va chiqish yo‘li to‘g‘ri ekanini tasdiqlang.
  2. Video xotira yetishmasa, paket hajmini kamaytiring: avval --batch-size 8 yoki --batch-size 4 ni sinab ko‘ring.
  3. Chiqish yo‘lini ulashishdan saqlaning: parallel vazifalar bitta jarayon orqali yozish cheklovini ishga tushirmaslik uchun turli chiqish fayllaridan foydalanishi kerak.
  4. Ishga tushirish parametrlarini saqlang: model, kiritish, parametrlar va chiqish tekshiruv qiymatlari natijadan qayta foydalanishga ta’sir qiladi; ulardan istalgan biri o‘zgartirilgach, chiqishni qayta tekshiring.
  5. Uzun matnlarni ehtiyotkorlik bilan izohlang: 256 tokendan uzun kontent kesiladi, shuning uchun model oxirgi qismini ko‘rmagan bo‘lishi mumkin.
  6. Ballarni shaxsni tasdiqlovchi dalil deb bilmang: softmax ballari kalibrlanmagan, loyiha esa moliyaviy forumlar sohasi bo‘yicha inson tomonidan belgilangan tekshiruvga ega emas.
  7. Og‘irliklarni nashr etishdan oldin ruxsatni tekshiring: kod va hujjatlar MIT litsenziyasiga, asosiy model Apache-2.0 litsenziyasiga ega, ammo C-ReD ma’lumotlari va ulardan hosil qilingan og‘irliklar uchun alohida ruxsatni tekshirish kerak.

Xulosa

Chinese Guba AI Detector mahalliy ishlaydigan xitoycha AI matnlarini tasniflash jarayonini taqdim etadi. U CSV inferensi, modelni o‘qitish, birlik testlari va nashr auditini qamrab oladi. Amaliy foydalanishda avval model yoki o‘qitish ma’lumotlarini qonuniy ravishda oling va chiqishni matn muallifining shaxsini qat’iy isbotlovchi dalil emas, balki tadqiqotga oid model balli sifatida qabul qiling.