- Lượt truy cập hàng tháng
- 0
- Giá
- Miễn phí và Trả phí
- Được liệt kê
- 2026-08-05
- Đã cập nhật
- 2026-08-05
01Shieldstral là gì
Shieldstral là mô hình phân loại an toàn nội dung đa phương thức mã nguồn mở với 3 tỷ tham số do Mistral AI phát triển, được xây dựng trên Ministral-3B. Mô hình định nghĩa lại hoạt động kiểm duyệt nội dung truyền thống dựa trên các danh mục cố định thành một nhiệm vụ hỏi đáp nhị phân, cho phép xác định chính sách kiểm duyệt theo thời gian thực bằng truy vấn ngôn ngữ tự nhiên và thích ứng với các tình huống khác nhau mà không cần huấn luyện lại. Mô hình đạt F1 trung bình 84.9% trên các bộ đánh giá an toàn văn bản và F1 an toàn đa phương thức 83.8%, đều đạt SOTA; có thể triển khai chỉ với một GPU 16GB và hỗ trợ 12 ngôn ngữ.
02Các tính năng chính của Shieldstral
Kiểm duyệt thích ứng theo chính sách: Nhập chính sách an toàn dưới dạng câu hỏi ngôn ngữ tự nhiên để thực hiện kiểm duyệt tùy chỉnh theo thời gian thực trong các tình huống khác nhau.
Phát hiện thống nhất đa phương thức: Một giao diện duy nhất đồng thời đánh giá an toàn của văn bản thuần túy, hình ảnh và nội dung kết hợp văn bản-hình ảnh.
Nhận diện vi phạm chi tiết: Hỗ trợ phân loại an toàn từ phán đoán nhị phân ở cấp độ tổng quát đến 73 danh mục lá chi tiết.
Điểm an toàn được hiệu chuẩn: Xuất điểm an toàn liên tục trong khoảng 0–1 thông qua chuẩn hóa softmax, sử dụng ngưỡng 0.5 để xác định vi phạm.
Triển khai nhẹ ở thiết bị biên: Quy mô 3 tỷ tham số cho phép suy luận hiệu quả trên một GPU NVIDIA 16GB, giảm yêu cầu phần cứng.
03Nguyên lý kỹ thuật của Shieldstral
Theo dõi WeChat và trả lời “开源” để tham gia nhóm trao đổi dự án AI mã nguồn mở
Kiến trúc hỏi đáp nhị phân: Chuyển nhiệm vụ kiểm duyệt thành dự đoán giá trị logic của hai token đầu ra “yes” và “no”, sau đó chuẩn hóa softmax để thu được điểm an toàn liên tục.
Đầu vào có cấu trúc ba trường: Sử dụng định dạng lời nhắc chuẩn hóa gồm (bối cảnh và mức độ nghiêm ngặt của đánh giá)、(câu hỏi an toàn có/không)、(nội dung cần kiểm duyệt).
Huấn luyện đối chiếu quy mô lớn: Dựa trên 54.1 triệu mẫu(45.2 triệu văn bản mã nguồn mở、4.4 triệu văn bản đối chiếu tổng hợp、4.5 triệu dữ liệu đa phương thức), mô hình được huấn luyện bằng các cặp đối chiếu cùng nội dung với truy vấn khác nhau để phân biệt các danh mục tương tự.
Tăng cường dữ liệu tổng hợp: Sử dụng LLM để viết lại văn bản an toàn thành các biến thể vi phạm, đồng thời tự động tạo các cặp truy vấn đối chiếu giữa danh mục mục tiêu và các danh mục cùng cấp, qua đó tăng cường khả năng phân biệt chi tiết.
Tinh chỉnh LoRA + hợp nhất SLERP: Tinh chỉnh hiệu quả Ministral-3B bằng LoRA, sau đó hợp nhất hai checkpoint bổ trợ được huấn luyện trên tập dữ liệu công khai và dữ liệu tổng hợp bằng nội suy tuyến tính trên mặt cầu.
04Cách sử dụng Shieldstral
Chuẩn bị môi trường: Triển khai mô hình Shieldstral và framework suy luận trên một GPU NVIDIA 16GB.
Định nghĩa chính sách kiểm duyệt: Viết trường để mô tả bối cảnh đánh giá, nền tảng lĩnh vực và tiêu chuẩn về mức độ nghiêm ngặt.
Viết truy vấn an toàn: Tạo câu hỏi có/không trong trường , ví dụ “Nội dung có cổ xúy bạo lực thân thể không?”.
Nhập nội dung cần kiểm duyệt: Điền văn bản, hình ảnh hoặc tổ hợp văn bản-hình ảnh vào trường và gửi cho mô hình.
Nhận kết quả đánh giá an toàn: Đọc điểm liên tục đã được chuẩn hóa softmax từ đầu ra của mô hình, sau đó đặt ngưỡng theo nhu cầu nghiệp vụ để xác định vi phạm nhị phân.
05Ưu thế cốt lõi của Shieldstral
Chính sách linh hoạt: Tiêu chuẩn kiểm duyệt được định nghĩa theo thời gian thực bằng ngôn ngữ tự nhiên, không cần huấn luyện lại mô hình cho tình huống mới.
Hiệu năng dẫn đầu: Mô hình 3 tỷ tham số đạt SOTA trên cả các bộ đánh giá an toàn văn bản và đa phương thức, sánh ngang các mô hình có quy mô lớn gấp 7 lần.
Thân thiện với phần cứng: Có thể chạy chỉ với một GPU 16GB, giảm đáng kể rào cản triển khai riêng tư trong doanh nghiệp.
Dữ liệu thống nhất: Tích hợp 54.1M dữ liệu không đồng nhất theo định dạng chỉ dẫn-truy vấn-tài liệu, bao phủ 12 ngôn ngữ và nhiều tình huống.
Quyết định có thể giải thích: Xuất điểm liên tục đã được hiệu chuẩn thay vì nhãn phân loại dạng hộp đen, giúp nhân viên vận hành dễ dàng điều chỉnh ngưỡng theo nhu cầu.
06Địa chỉ dự án Shieldstral
Trang web dự án:https://mistral.ai/news/shieldstral/
Kho mô hình HuggingFace:https://huggingface.co/mistralai/Shieldstral-1.0-3B
Bài báo kỹ thuật arXiv:https://arxiv.org/pdf/2607.25857
07Các tình huống ứng dụng của Shieldstral
Kiểm soát rủi ro nội dung trên nền tảng mạng xã hội: Kiểm duyệt theo thời gian thực các bài đăng chứa văn bản và hình ảnh do người dùng tạo, đồng thời thích ứng linh hoạt với quy định tuân thủ của từng cộng đồng.
Bảo vệ an toàn hội thoại AI: Phát hiện các cuộc tấn công jailbreak trong prompt của người dùng và các phản hồi có hại, thiên kiến từ mô hình.
Tuân thủ quảng cáo và tiếp thị: Tự động sàng lọc các yếu tố hình ảnh và văn bản vi phạm trong tài liệu quảng cáo, bảo đảm nội dung phát hành đa nền tảng hợp pháp.
Lọc nội dung giáo dục trực tuyến: Nhận diện thông tin không phù hợp trong tài liệu khóa học và hoạt động tương tác, bảo vệ môi trường học tập của trẻ vị thành niên.
Kiểm toán an toàn tài liệu doanh nghiệp: Tự động phát hiện thông tin nhạy cảm và nội dung vi phạm trong các tệp đa ngôn ngữ được chia sẻ nội bộ.
© Tuyên bố miễn trừ trách nhiệm: tên miền và nội dung được liên kết có thể thay đổi theo thời gian. AIEZZ không kiểm soát các trang web của bên thứ ba. Hãy tự đánh giá nội dung bên ngoài và các rủi ro liên quan.


Đánh giá của người dùng0