- 월간 방문 수
- 0
- 가격
- 무료 및 유료
- 등록일
- 2026-08-05
- 업데이트됨
- 2026-08-05
01Shieldstral이란
Shieldstral은 Mistral AI가 출시한 30억 개 파라미터의 오픈 소스 멀티모달 콘텐츠 안전 분류 모델로, Ministral-3B를 기반으로 구축되었습니다. 이 모델은 기존의 고정된 카테고리 기반 콘텐츠 심사를 이진 질의응답 작업으로 재정의하며, 자연어 질의를 통해 심사 정책을 실시간으로 정의할 수 있어 재학습 없이도 다양한 시나리오에 적용할 수 있습니다. 텍스트 안전 벤치마크에서 평균 F1 84.9%, 멀티모달 안전 F1 83.8%로 모두 SOTA를 달성했으며, 16GB GPU 한 장만으로 배포할 수 있고 12개 언어를 지원합니다.
02Shieldstral의 주요 기능
정책 적응형 심사: 안전 정책을 자연어 질문 형식으로 입력하여 다양한 시나리오에서 실시간 맞춤형 심사를 수행합니다.
멀티모달 통합 탐지: 단일 인터페이스에서 텍스트, 이미지, 텍스트와 이미지가 결합된 콘텐츠의 안전성을 동시에 평가합니다.
세분화된 위반 식별: 거친 이진 판단부터 73개 리프 카테고리의 정밀한 안전 분류까지 지원합니다.
보정된 안전 점수: softmax 정규화를 통해 0–1 범위의 연속적인 안전 점수를 출력하며, 0.5 임계값으로 위반 여부를 판정합니다.
경량 엣지 배포: 30억 개 파라미터 규모로 16GB NVIDIA GPU 한 장에서 효율적으로 추론할 수 있어 하드웨어 요구 사항을 낮춥니다.
03Shieldstral의 기술 원리
WeChat에서 팔로우 후 “오픈 소스”라고 답장하여 AI 오픈 소스 프로젝트 교류 그룹에 참여하세요.
이진 질의응답 아키텍처: 심사 작업을 “yes”와 “no” 두 출력 토큰의 논리값 예측으로 변환하고, softmax 정규화를 거쳐 연속적인 안전 점수를 얻습니다.
3개 필드 구조화 입력: (평가 시나리오 및 엄격도), (안전 여부 질문), (심사 대상 콘텐츠)로 구성된 표준 프롬프트 형식을 사용합니다.
대규모 대조 학습: 5,410만 개 샘플(오픈 소스 텍스트 4,520만 개, 합성 대조 텍스트 440만 개, 멀티모달 450만 개)을 기반으로, 동일한 콘텐츠에 서로 다른 질의를 적용한 대조 쌍을 학습하여 유사한 카테고리를 구분하는 능력을 강화합니다.
합성 데이터 증강: LLM을 사용해 안전한 텍스트를 위반 변형으로 재작성하고, 대상 카테고리와 형제 카테고리 간 대조 질의 쌍을 자동 생성하여 세분화된 판별 능력을 강화합니다.
LoRA 미세 조정 + SLERP 병합: Ministral-3B에 LoRA 기반 효율적인 미세 조정을 적용한 뒤, 공개 데이터셋과 합성 데이터로 학습한 두 개의 상호 보완적 체크포인트를 구면 선형 보간으로 병합합니다.
04Shieldstral 사용 방법
환경 준비: 16GB NVIDIA GPU 한 장에서 Shieldstral 모델과 추론 프레임워크를 배포합니다.
심사 정책 정의: 필드에 평가 시나리오, 도메인 배경 및 엄격도 기준을 설명하는 내용을 작성합니다.
안전 질의 작성: 필드에 이진 예/아니요 질문을 구성합니다. 예: “콘텐츠가 신체적 폭력을 조장합니까?”
심사 대상 콘텐츠 입력: 텍스트, 이미지 또는 텍스트와 이미지의 조합을 필드에 입력하여 모델에 제출합니다.
안전 판정 확인: 모델이 출력한 softmax 정규화 연속 점수를 읽고, 업무 요구 사항에 따라 임계값을 설정하여 이진 위반 여부를 판정합니다.
05Shieldstral의 핵심 장점
유연한 정책: 심사 기준을 자연어로 실시간 정의할 수 있어 새로운 시나리오에 맞춰 모델을 재학습할 필요가 없습니다.
뛰어난 성능: 30억 개 파라미터로 텍스트 및 멀티모달 안전 벤치마크에서 모두 SOTA를 달성했으며, 규모가 7배인 모델에 필적합니다.
하드웨어 친화적: 16GB GPU 한 장만으로 실행할 수 있어 기업의 프라이빗 배포 진입 장벽을 크게 낮춥니다.
데이터 통합: 지시-질의-문서 형식으로 54.1M개의 이기종 데이터를 통합하며, 12개 언어와 다양한 시나리오를 포괄합니다.
해석 가능한 의사결정: 블랙박스 분류 레이블이 아닌 보정된 연속 점수를 출력하므로 운영 담당자가 필요에 따라 임계값을 조정할 수 있습니다.
06Shieldstral 프로젝트 주소
프로젝트 공식 웹사이트:https://mistral.ai/news/shieldstral/
HuggingFace 모델 저장소:https://huggingface.co/mistralai/Shieldstral-1.0-3B
arXiv 기술 논문:https://arxiv.org/pdf/2607.25857
07Shieldstral의 활용 시나리오
소셜 플랫폼 콘텐츠 위험 관리: 사용자가 게시한 텍스트와 이미지 게시물을 실시간으로 심사하고, 커뮤니티별 규정 준수 기준에 동적으로 대응합니다.
AI 대화 안전 보호: 사용자 프롬프트의 탈옥 공격과 모델 출력에 포함된 유해하거나 편향된 응답을 탐지합니다.
광고 및 마케팅 규정 준수: 광고 소재의 규정 위반 텍스트 및 이미지 요소를 자동으로 검사하여 여러 플랫폼에 게시되는 콘텐츠의 적법성을 보장합니다.
온라인 교육 콘텐츠 필터링: 수업 자료와 상호작용 과정의 부적절한 정보를 식별하여 미성년자의 학습 환경을 보호합니다.
기업 문서 보안 감사: 내부에서 공유되는 다국어 파일을 자동으로 검사하여 민감 정보와 규정 위반 콘텐츠를 탐지합니다.
© 면책 조항: 도메인 및 연결된 콘텐츠는 시간이 지나면서 변경될 수 있습니다. AIEZZ은(는) 제3자 웹사이트를 관리하지 않습니다. 외부 콘텐츠와 위험을 독립적으로 검토하세요.


사용자 리뷰0