Что такое Shieldstral

Mistral AI представила Shieldstral — компактный классификатор безопасности с открытыми весами, который меняет подход к модерации контента. Shieldstral — это 3B open-weights мультимодальный safety classifier (классификатор безопасности), превосходящий модели до 7 раз большего размера за счёт формулировки задачи модерации как policy-adaptive question-answering (адаптивного ответа на вопросы по политике).

В отличие от традиционных guardrail-моделей (защитных моделей), Shieldstral принимает правила модерации в виде обычных текстовых вопросов прямо во время инференса, объединяя оценку безопасности текста и изображений без переобучения. Модель распространяется под лицензией Apache 2.0 и может работать на одном GPU с 16 ГБ VRAM.


Как это работает

Shieldstral формулирует модерацию контента как бинарную задачу ответа на вопросы (да/нет). Это простое решение объединяет разнородные задачи модерации в единую схему и позволяет консолидировать датасеты с различными таксономиями безопасности под одним фреймворком обучения.

ℹ Как задаётся политика модерации
Вместо жёстко зашитых категорий вы просто задаёте модели вопрос на естественном языке, например: «Пропагандирует ли этот контент насилие в отношении защищённой группы?» или «Безопасно ли это изображение для показа несовершеннолетним?». Shieldstral возвращает калиброванный числовой балл.

Shieldstral построен на базе Ministral-3B-Base-2512 из семейства Mistral-3 с нативной мультимодальной поддержкой через vision encoder (визуальный энкодер) Pixtral. Дообучение выполнено с помощью LoRA (метод эффективного дообучения) с потерей кросс-энтропии на единственном выходном токене.

Для обучения была подготовлена выборка из приблизительно 54,1 млн примеров с детальным набором для оценки адаптивности политики.


graph TD
    A[Входной контент\nтекст / изображение] --> B[Политика модерации\nв виде вопроса]
    B --> C[Shieldstral 3B]
    C --> D{Калиброванный балл}
    D -->|Безопасно| E[✅ Пропустить]
    D -->|Нарушение| F[🚫 Заблокировать]


Возможности модели

Shieldstral — компактная мультимодальная модель, поддерживающая модерацию промптов, ответов, пар «промпт–ответ», детекцию отказов (refusal detection) и фильтрацию по безопасности для текстовых и визуальных входных данных.

ХарактеристикаЗначение
Размер3B параметров
ЛицензияApache 2.0
Требования к GPU1× NVIDIA 16 ГБ VRAM
МодальностиТекст + изображения
Метод дообученияLoRA
Объём обучающей выборки~54,1 млн примеров
Интерфейс политикиNatural language (естественный язык)
💡 Для кого это важно
Shieldstral особенно интересен небольшим платформам и self-hoster’ам (тем, кто разворачивает модели самостоятельно): модель достаточно компактна, чтобы работать как sidecar-процесс на том же GPU, что и основная языковая модель, не требуя отдельного инфраструктурного контура модерации.

Производительность

По заявлению Mistral, Shieldstral превосходит open-guard модели до 7× большего размера сразу по нескольким направлениям: text safety (безопасность текста), refusal detection (детекция отказов), policy adaptability (адаптивность к политике) и мультимодальным бенчмаркам.

«Это шаг к модерации, которая адаптируется к контексту, а не загоняет каждый продукт в единую замороженную таксономию» — Mistral AI

3B — принципиальная цифра: модель достаточно мала, чтобы работать как sidecar на том же GPU, который уже обслуживает основную модель, вместо того чтобы требовать отдельного пайплайна модерации.


Значение для отрасли

В индустрии долго господствовало предположение, что safety classifier должен быть примерно того же размера, что и модель, которую он контролирует. Shieldstral опровергает этот тезис.

Если Shieldstral станет широко доступен, экономика размещения тяжёлых фильтров безопасности перед каждым LLM-запросом кардинально изменится для небольших платформ и self-hoster’ов — даже если модель останется внутренней, это сигнал: следующая гонка эффективности разворачивается именно в области trust-and-safety инфраструктуры.

⚠ Что ещё предстоит улучшить
Mistral продолжает работать над многоязычным охватом, устойчивостью к длинным документам и более широкой мультимодальной безопасностью. Текущая версия 1.0 — отправная точка, а не финальный продукт.

Модель уже доступна на Hugging Face и через API Mistral под лицензией Apache 2.0, что позволяет свободно использовать её в коммерческих продуктах.