주요 콘텐츠로 건너뛰기

Shieldstral 운영 중

Shieldstral은 Mistral AI가 출시한 30억 개 파라미터의 오픈 소스 멀티모달 콘텐츠 안전 분류 모델로, 자연어로 심사 정책을 정의할 수 있으며 콘텐츠 안전 분야에 적합합니다.

Shieldstral – Mistral AI의 오픈 소스 멀티모달 콘텐츠 안전 분류 모델은 Mistral AI가 출시한 30억 개 파라미터의 오픈 소스 멀티모달 콘텐츠 안전 분류 모델로, Ministral-3B를 기반으로 구축되었습니다. 이 모델은 기존의 고정된 카테고리 기반 콘텐츠 심사를 이진 질의응답 작업으로 재정의하며, 자연어 질의를 통해 심사 정책을 실시간으로 정의할 수 있어 재학습 없이도 다양한 시나리오에 적용할 수 있습니다. 텍스트 안전 벤치마크에서 평균 F1 84.9%, 멀티모달 안전 F1 83.8%로 모두 SOTA를 달성했으며, 16GB GPU 한 장만으로 배포할 수 있고 12개 언어를 지원합니다. 핵심 기능으로는 정책 적응형 심사, 멀티모달 통합 탐지, 세분화된 위반 식별, 보정된 안전 점수, 경량 엣드 디바이스 배포가 있으며, 소셜 플랫폼 콘텐츠 위험 관리, AI 대화 안전 보호, 광고 및 마케팅 규정 준수, 온라인 교육 콘텐츠 필터링, 기업 문서 보안 감사 등의 시나리오에 활용할 수 있습니다.

Shieldstral 제품 인터페이스
월간 방문 수
0
가격
무료 및 유료
등록일
2026-08-05
업데이트됨
2026-08-05

01Shieldstral이란

Shieldstral은 Mistral AI가 출시한 30억 개 파라미터의 오픈 소스 멀티모달 콘텐츠 안전 분류 모델로, Ministral-3B를 기반으로 구축되었습니다. 이 모델은 기존의 고정된 카테고리 기반 콘텐츠 심사를 이진 질의응답 작업으로 재정의하며, 자연어 질의를 통해 심사 정책을 실시간으로 정의할 수 있어 재학습 없이도 다양한 시나리오에 적용할 수 있습니다. 텍스트 안전 벤치마크에서 평균 F1 84.9%, 멀티모달 안전 F1 83.8%로 모두 SOTA를 달성했으며, 16GB GPU 한 장만으로 배포할 수 있고 12개 언어를 지원합니다.

02Shieldstral의 주요 기능

정책 적응형 심사: 안전 정책을 자연어 질문 형식으로 입력하여 다양한 시나리오에서 실시간 맞춤형 심사를 수행합니다.
멀티모달 통합 탐지: 단일 인터페이스에서 텍스트, 이미지, 텍스트와 이미지가 결합된 콘텐츠의 안전성을 동시에 평가합니다.
세분화된 위반 식별: 거친 이진 판단부터 73개 리프 카테고리의 정밀한 안전 분류까지 지원합니다.
보정된 안전 점수: softmax 정규화를 통해 0–1 범위의 연속적인 안전 점수를 출력하며, 0.5 임계값으로 위반 여부를 판정합니다.
경량 엣지 배포: 30억 개 파라미터 규모로 16GB NVIDIA GPU 한 장에서 효율적으로 추론할 수 있어 하드웨어 요구 사항을 낮춥니다.

03Shieldstral의 기술 원리

WeChat에서 팔로우 후 “오픈 소스”라고 답장하여 AI 오픈 소스 프로젝트 교류 그룹에 참여하세요.
이진 질의응답 아키텍처: 심사 작업을 “yes”와 “no” 두 출력 토큰의 논리값 예측으로 변환하고, softmax 정규화를 거쳐 연속적인 안전 점수를 얻습니다.
3개 필드 구조화 입력: (평가 시나리오 및 엄격도), (안전 여부 질문), (심사 대상 콘텐츠)로 구성된 표준 프롬프트 형식을 사용합니다.
대규모 대조 학습: 5,410만 개 샘플(오픈 소스 텍스트 4,520만 개, 합성 대조 텍스트 440만 개, 멀티모달 450만 개)을 기반으로, 동일한 콘텐츠에 서로 다른 질의를 적용한 대조 쌍을 학습하여 유사한 카테고리를 구분하는 능력을 강화합니다.
합성 데이터 증강: LLM을 사용해 안전한 텍스트를 위반 변형으로 재작성하고, 대상 카테고리와 형제 카테고리 간 대조 질의 쌍을 자동 생성하여 세분화된 판별 능력을 강화합니다.
LoRA 미세 조정 + SLERP 병합: Ministral-3B에 LoRA 기반 효율적인 미세 조정을 적용한 뒤, 공개 데이터셋과 합성 데이터로 학습한 두 개의 상호 보완적 체크포인트를 구면 선형 보간으로 병합합니다.

04Shieldstral 사용 방법

환경 준비: 16GB NVIDIA GPU 한 장에서 Shieldstral 모델과 추론 프레임워크를 배포합니다.
심사 정책 정의: 필드에 평가 시나리오, 도메인 배경 및 엄격도 기준을 설명하는 내용을 작성합니다.
안전 질의 작성: 필드에 이진 예/아니요 질문을 구성합니다. 예: “콘텐츠가 신체적 폭력을 조장합니까?”
심사 대상 콘텐츠 입력: 텍스트, 이미지 또는 텍스트와 이미지의 조합을 필드에 입력하여 모델에 제출합니다.
안전 판정 확인: 모델이 출력한 softmax 정규화 연속 점수를 읽고, 업무 요구 사항에 따라 임계값을 설정하여 이진 위반 여부를 판정합니다.

05Shieldstral의 핵심 장점

유연한 정책: 심사 기준을 자연어로 실시간 정의할 수 있어 새로운 시나리오에 맞춰 모델을 재학습할 필요가 없습니다.
뛰어난 성능: 30억 개 파라미터로 텍스트 및 멀티모달 안전 벤치마크에서 모두 SOTA를 달성했으며, 규모가 7배인 모델에 필적합니다.
하드웨어 친화적: 16GB GPU 한 장만으로 실행할 수 있어 기업의 프라이빗 배포 진입 장벽을 크게 낮춥니다.
데이터 통합: 지시-질의-문서 형식으로 54.1M개의 이기종 데이터를 통합하며, 12개 언어와 다양한 시나리오를 포괄합니다.
해석 가능한 의사결정: 블랙박스 분류 레이블이 아닌 보정된 연속 점수를 출력하므로 운영 담당자가 필요에 따라 임계값을 조정할 수 있습니다.

06Shieldstral 프로젝트 주소

프로젝트 공식 웹사이트:https://mistral.ai/news/shieldstral/
HuggingFace 모델 저장소:https://huggingface.co/mistralai/Shieldstral-1.0-3B
arXiv 기술 논문:https://arxiv.org/pdf/2607.25857

07Shieldstral의 활용 시나리오

소셜 플랫폼 콘텐츠 위험 관리: 사용자가 게시한 텍스트와 이미지 게시물을 실시간으로 심사하고, 커뮤니티별 규정 준수 기준에 동적으로 대응합니다.
AI 대화 안전 보호: 사용자 프롬프트의 탈옥 공격과 모델 출력에 포함된 유해하거나 편향된 응답을 탐지합니다.
광고 및 마케팅 규정 준수: 광고 소재의 규정 위반 텍스트 및 이미지 요소를 자동으로 검사하여 여러 플랫폼에 게시되는 콘텐츠의 적법성을 보장합니다.
온라인 교육 콘텐츠 필터링: 수업 자료와 상호작용 과정의 부적절한 정보를 식별하여 미성년자의 학습 환경을 보호합니다.
기업 문서 보안 감사: 내부에서 공유되는 다국어 파일을 자동으로 검사하여 민감 정보와 규정 위반 콘텐츠를 탐지합니다.

© 면책 조항: 도메인 및 연결된 콘텐츠는 시간이 지나면서 변경될 수 있습니다. AIEZZ은(는) 제3자 웹사이트를 관리하지 않습니다. 외부 콘텐츠와 위험을 독립적으로 검토하세요.

사용자 리뷰0