メインコンテンツへ移動

Shieldstral 運営中

Shieldstralは、Mistral AIが開発した30億パラメータのオープンソース・マルチモーダルコンテンツ安全分類モデルです。自然言語でモデレーションポリシーを定義でき、コンテンツ安全のさまざまな場面に対応します。

Shieldstral – Mistral AIのオープンソース・マルチモーダルコンテンツ安全分類モデルは、Mistral AIが開発した30億パラメータのオープンソース・マルチモーダルコンテンツ安全分類モデルで、Ministral-3Bをベースに構築されています。従来の固定カテゴリによるコンテンツモデレーションを、二値質問応答タスクとして再定義し、自然言語によるクエリでモデレーションポリシーをリアルタイムに定義できます。再トレーニングなしで異なるシナリオに適応可能です。テキスト安全性ベンチマークで平均F1スコア84.9%、マルチモーダル安全性でF1スコア83.8%を達成し、いずれもSOTAです。16GB GPU 1枚でデプロイでき、12言語をサポートします。主な機能には、ポリシー適応型モデレーション、マルチモーダル統合検出、きめ細かな違反識別、キャリブレーション済み安全スコア、軽量なエッジデバイス展開があり、ソーシャルプラットフォームのコンテンツリスク管理、AI対話の安全保護、広告・マーケティングコンプライアンス、オンライン教育コンテンツのフィルタリング、企業文書のセキュリティ監査などに利用できます。

Shieldstral 製品インターフェース
月間訪問数
0
料金
無料、有料
掲載日
2026-08-05
更新済み
2026-08-05

01Shieldstralとは

Shieldstralは、Mistral AIが開発した30億パラメータのオープンソース・マルチモーダルコンテンツ安全分類モデルで、Ministral-3Bをベースに構築されています。従来の固定カテゴリによるコンテンツモデレーションを、二値質問応答タスクとして再定義し、自然言語によるクエリでモデレーションポリシーをリアルタイムに定義できます。再トレーニングなしで異なるシナリオに適応可能です。テキスト安全性ベンチマークで平均F1スコア84.9%、マルチモーダル安全性でF1スコア83.8%を達成し、いずれもSOTAです。16GB GPU 1枚でデプロイでき、12言語をサポートします。

02Shieldstralの主な機能

ポリシー適応型モデレーション:安全ポリシーを自然言語の質問として入力し、さまざまなシナリオでリアルタイムにカスタマイズされたモデレーションを実現します。
マルチモーダル統合検出:単一のインターフェースで、テキストのみ、画像、テキストと画像の混合コンテンツを同時に安全評価します。
きめ細かな違反識別:粗い二値判定から73のリーフカテゴリによる詳細な安全分類まで対応します。
キャリブレーション済み安全スコア:softmax正規化により0–1の連続的な安全スコアを出力し、0.5をしきい値として違反を判定します。
軽量なエッジデバイス展開:30億パラメータのため、16GB NVIDIA GPU 1枚で効率的に推論でき、ハードウェア要件を抑えられます。

03Shieldstralの技術原理

WeChatでフォローして「オープンソース」と返信すると、AIオープンソースプロジェクト交流グループに参加できます
二値質問応答アーキテクチャ:モデレーションタスクを、「yes」と「no」という2つの出力トークンの論理値予測に変換し、softmax正規化によって連続的な安全スコアを得ます。
3フィールドの構造化入力: (評価シナリオと厳格度)、(安全かどうかを問う質問)、(審査対象コンテンツ)という標準化されたプロンプト形式を採用します。
大規模な対照学習:5410万件のサンプル(オープンソーステキスト4520万件、合成対照テキスト440万件、マルチモーダル450万件)を基に、同一コンテンツに異なるクエリを組み合わせた対照ペアで学習し、類似カテゴリを区別する能力を高めます。
合成データによる拡張:LLMを利用して安全なテキストを違反バリエーションに書き換え、対象カテゴリと兄弟カテゴリの対照クエリペアを自動生成し、細粒度の判別能力を強化します。
LoRA微調整+SLERP統合:Ministral-3BにLoRAによる効率的な微調整を施し、公開データセットと合成データで学習した2つの相補的なチェックポイントを球面線形補間によって統合します。

04Shieldstralの使い方

環境準備:16GB NVIDIA GPU 1枚にShieldstralモデルと推論フレームワークをデプロイします。
モデレーションポリシーの定義:フィールドに評価シナリオ、分野の背景、厳格度の基準を記述します。
安全クエリの作成:フィールドに「コンテンツは身体的暴力を助長しているか?」のような二値のはい/いいえ形式の質問を作成します。
審査対象コンテンツの入力:テキスト、画像、またはテキストと画像の組み合わせをフィールドに入力してモデルに送信します。
安全判定の取得:モデルが出力するsoftmax正規化済みの連続スコアを読み取り、業務要件に応じてしきい値を設定し、二値の違反判定を行います。

05Shieldstralの主な強み

柔軟なポリシー:モデレーション基準を自然言語でリアルタイムに定義でき、新しいシナリオに対応するための再トレーニングが不要です。
優れた性能:30億パラメータでテキストおよびマルチモーダル安全性ベンチマークの双方でSOTAを達成し、7倍規模のモデルに匹敵します。
ハードウェアに優しい:16GB GPU 1枚で動作し、企業のプライベート環境への導入障壁を大幅に下げます。
データの統合:指示・クエリ・ドキュメント形式で54.1M件の異種データを統合し、12言語と多様なシナリオをカバーします。
説明可能な意思決定:ブラックボックスの分類ラベルではなく、キャリブレーション済みの連続スコアを出力するため、運用担当者が必要に応じてしきい値を調整できます。

06ShieldstralのプロジェクトURL

プロジェクト公式サイト:https://mistral.ai/news/shieldstral/
HuggingFaceモデルリポジトリ:https://huggingface.co/mistralai/Shieldstral-1.0-3B
arXiv技術論文:https://arxiv.org/pdf/2607.25857

07Shieldstralの活用シーン

ソーシャルプラットフォームのコンテンツリスク管理:ユーザーが投稿する画像・テキストの投稿をリアルタイムに審査し、各コミュニティの異なるコンプライアンス基準に動的に適応します。
AI対話の安全保護:ユーザーのプロンプトに含まれる脱獄攻撃や、モデルが出力する有害・偏見を含む回答を検出します。
広告・マーケティングコンプライアンス:広告素材に含まれる違反画像・テキスト要素を自動的に検査し、複数プラットフォームで配信するコンテンツの適法性を確保します。
オンライン教育コンテンツのフィルタリング:教材やインタラクションに含まれる不適切な情報を識別し、未成年者の学習環境を保護します。
企業文書のセキュリティ監査:社内で共有される多言語ファイルを対象に、機密情報や違反コンテンツを自動検出します。

© 免責事項:ドメインやリンク先のコンテンツは時間の経過とともに変更される場合があります。AIEZZは第三者のウェブサイトを管理していません。外部コンテンツとリスクはご自身で確認してください。

ユーザーレビュー0