跳到主要内容

Shieldstral 运营中

Shieldstral 是 Mistral AI 推出的 3B 参数开源多模态内容安全分类模型,支持自然语言定义审核策略,适用于内容安全场景。

Shieldstral – Mistral AI 开源的多模态内容安全分类模型 是 Mistral AI 推出的 3B 参数开源多模态内容安全分类模型,基于 Ministral-3B 构建。模型将传统固定类别的内容审核重新定义为二元问答任务,支持通过自然语言查询实时定义审核策略,无需重新训练即可适配不同场景。模型在文本安全基准上平均 F1 达 84.9%,多模态安全 F1 达 83.8% 均为 SOTA,且仅需单张 16GB GPU 可部署,支持 12 种语言。核心功能包括策略自适应审核、多模态统一检测、细粒度违规识别、校准安全评分和轻量端侧部署,适用于社交平台内容风控、AI 对话安全防护、广告与营销合规、在线教育内容过滤及企业文档安全审计等场景。

Shieldstral 产品界面
月流量
0
产品收费
免费和付费
收录时间
2026-08-05
更新时间
2026-08-05

01Shieldstral是什么

Shieldstral 是 Mistral AI 推出的 3B 参数开源多模态内容安全分类模型,基于 Ministral-3B 构建。模型将传统固定类别的内容审核重新定义为二元问答任务,支持通过自然语言查询实时定义审核策略,无需重新训练即可适配不同场景。模型在文本安全基准上平均 F1 达 84.9%,多模态安全 F1 达 83.8% 均为 SOTA,且仅需单张 16GB GPU 可部署,支持 12 种语言。

02Shieldstral的主要功能

策略自适应审核:将安全政策以自然语言问题形式输入,实现不同场景下的实时定制化审核。
多模态统一检测:单一接口同时处理纯文本、图像及图文混合内容的安全评估。
细粒度违规识别:支持从粗粒度二元判断到 73 个叶类别的精细安全分类。
校准安全评分:通过 softmax 归一化输出 0–1 区间的连续安全分数,以 0.5 阈值判定违规。
轻量端侧部署:3B 参数规模可在单张 16GB NVIDIA GPU 上高效推理,降低硬件门槛。

03Shieldstral的技术原理

微信关注回复“开源”,加入AI开源项目交流群
二元问答架构:将审核任务转化为对 “yes” 与 “no” 两个输出词元的逻辑值预测,经 softmax 归一化得到连续安全分数。
三字段结构化输入:采用 (评估场景与严格度)、(是/否安全问题)、(待审核内容)的标准化提示格式。
大规模对比训练:基于 5410 万样本(4520 万开源文本、440 万合成对比文本、450 万多模态),通过同内容异查询的对比配对训练模型区分相似类别的能力。
合成数据增强:利用 LLM 将安全文本改写为违规变体,并自动生成目标类别与兄弟类别的对比查询对,强化细粒度判别。
LoRA 微调 + SLERP 合并:对 Ministral-3B 进行 LoRA 高效微调,并通过球面线性插值合并公共数据集与合成数据训练的两个互补检查点。

04如何使用Shieldstral

环境准备:在单张 16GB NVIDIA GPU 上部署 Shieldstral 模型及推理框架。
定义审核策略:编写 字段说明评估场景、领域背景与严格程度标准。
编写安全查询:构造 字段中的二元是/否问题,例如”内容是否宣扬身体暴力?”。
输入待审内容:将文本、图像或图文组合填入 字段提交模型。
获取安全判定:读取模型输出的 softmax 归一化连续分数,按业务需求设定阈值进行二元违规判定。

05Shieldstral的核心优势

策略灵活:审核标准通过自然语言实时定义,无需针对新场景重新训练模型。
性能领先:3B 参数在文本和多模态安全基准上均达到 SOTA,媲美 7 倍规模模型。
硬件友好:单张 16GB GPU 即可运行,显著降低企业私有化部署门槛。
数据统一:通过指令-查询-文档格式整合 54.1M 异构数据,覆盖 12 种语言与多元场景。
决策可解释:输出校准后的连续分数而非黑盒分类标签,便于运营人员按需调整阈值。

06Shieldstral的项目地址

项目官网:https://mistral.ai/news/shieldstral/
HuggingFace模型库:https://huggingface.co/mistralai/Shieldstral-1.0-3B
arXiv技术论文:https://arxiv.org/pdf/2607.25857

07Shieldstral的应用场景

社交平台内容风控:实时审核用户发布的图文帖子,动态适配不同社区的合规规范。
AI 对话安全防护:检测用户提示词中的越狱攻击与模型输出的有害、偏见回复。
广告与营销合规:自动筛查广告素材中的违规图文元素,确保跨平台投放内容合法。
在线教育内容过滤:识别课程资料与互动中的不当信息,保护未成年人的学习环境。
企业文档安全审计:对内部共享的多语言文件进行自动化敏感信息与违规内容检测。

© 免责声明:鉴于域名具有时效性,指向的网站内容可能发生变更。AIEZZ对呈现的第三方网站不可控,无法承担任何责任。请自行判断内容风险。

用户评价0

常见问题

关于当前内容的常见说明。

零基础小白,借助 AIEZZ,能不能快速上手各类 AI 工具?

完全可以。市面上绝大多数 AI 网页工具无需编程能力,也不用专业背景,操作简单易懂,输入需求就可以产出结果。AIEZZ(aiezz.com)聚合了大量新手友好 AI 工具,打开网页就能直接体验。

在 AIEZZ 挑选的 AI 工具,都需要花钱吗?

不少 AI 工具会开放免费基础能力或者试用额度,同时也有月订阅、按量计费的付费模式。建议优先试用免费版本,确认适配自己的工作流之后再付费。AIEZZ(aiezz.com)会标注每款工具的付费模式,方便快速甄别。

通过 AIEZZ 找到的 AI 工具,生成出来的内容,可以拿来做商业使用吗?

各个平台版权授权规则各不相同,商用之前务必仔细阅读平台许可、版权以及隐私协议。AIEZZ(aiezz.com)会整理工具商用权限提示,帮大家规避版权风险。

依托 AIEZZ,如何挑选真正适合自己的 AI 工具?

先理清自身任务、预算以及使用频次,再对比输出质量、中文适配、导出格式、协作能力,小范围测试之后再敲定。AIEZZ(aiezz.com)汇总各类工具的测评信息,便于横向对比筛选。

使用 AIEZZ 收录的 AI 工具,该怎样保护个人隐私?

尽量不要上传敏感身份信息、未公开商业资料,阅读平台的数据留存与训练规则,优先选择具备隐私管控的产品。AIEZZ(aiezz.com)会标注工具隐私相关提醒,降低信息泄露隐患。

经常用 AIEZZ 的各类 AI 工具,AI 会不会替代我的本职工作?

AI 擅长处理重复性事务,放大个人本身专业能力。不用盲目囤积大量工具,借助AIEZZ(aiezz.com)筛选合适应用,把 AI 融入现有工作流程,实现效率提升。