Mistral выпустила Shieldstral — модерация за 3B параметров
Mistral открыла Shieldstral — 3B мультимодальный классификатор безопасности под Apache 2.0, превосходящий модели в 7 раз крупнее.
Что такое Shieldstral
Mistral AI представила Shieldstral — компактный классификатор безопасности с открытыми весами, который меняет подход к модерации контента. Shieldstral — это 3B open-weights мультимодальный safety classifier (классификатор безопасности), превосходящий модели до 7 раз большего размера за счёт формулировки задачи модерации как policy-adaptive question-answering (адаптивного ответа на вопросы по политике).
В отличие от традиционных guardrail-моделей (защитных моделей), Shieldstral принимает правила модерации в виде обычных текстовых вопросов прямо во время инференса, объединяя оценку безопасности текста и изображений без переобучения. Модель распространяется под лицензией Apache 2.0 и может работать на одном GPU с 16 ГБ VRAM.
Как это работает
Shieldstral формулирует модерацию контента как бинарную задачу ответа на вопросы (да/нет). Это простое решение объединяет разнородные задачи модерации в единую схему и позволяет консолидировать датасеты с различными таксономиями безопасности под одним фреймворком обучения.
Shieldstral построен на базе Ministral-3B-Base-2512 из семейства Mistral-3 с нативной мультимодальной поддержкой через vision encoder (визуальный энкодер) Pixtral. Дообучение выполнено с помощью LoRA (метод эффективного дообучения) с потерей кросс-энтропии на единственном выходном токене.
Для обучения была подготовлена выборка из приблизительно 54,1 млн примеров с детальным набором для оценки адаптивности политики.
graph TD
A[Входной контент\nтекст / изображение] --> B[Политика модерации\nв виде вопроса]
B --> C[Shieldstral 3B]
C --> D{Калиброванный балл}
D -->|Безопасно| E[✅ Пропустить]
D -->|Нарушение| F[🚫 Заблокировать]
Возможности модели
Shieldstral — компактная мультимодальная модель, поддерживающая модерацию промптов, ответов, пар «промпт–ответ», детекцию отказов (refusal detection) и фильтрацию по безопасности для текстовых и визуальных входных данных.
| Характеристика | Значение |
|---|---|
| Размер | 3B параметров |
| Лицензия | Apache 2.0 |
| Требования к GPU | 1× NVIDIA 16 ГБ VRAM |
| Модальности | Текст + изображения |
| Метод дообучения | LoRA |
| Объём обучающей выборки | ~54,1 млн примеров |
| Интерфейс политики | Natural language (естественный язык) |
Производительность
По заявлению Mistral, Shieldstral превосходит open-guard модели до 7× большего размера сразу по нескольким направлениям: text safety (безопасность текста), refusal detection (детекция отказов), policy adaptability (адаптивность к политике) и мультимодальным бенчмаркам.
«Это шаг к модерации, которая адаптируется к контексту, а не загоняет каждый продукт в единую замороженную таксономию» — Mistral AI
3B — принципиальная цифра: модель достаточно мала, чтобы работать как sidecar на том же GPU, который уже обслуживает основную модель, вместо того чтобы требовать отдельного пайплайна модерации.
Значение для отрасли
В индустрии долго господствовало предположение, что safety classifier должен быть примерно того же размера, что и модель, которую он контролирует. Shieldstral опровергает этот тезис.
Если Shieldstral станет широко доступен, экономика размещения тяжёлых фильтров безопасности перед каждым LLM-запросом кардинально изменится для небольших платформ и self-hoster’ов — даже если модель останется внутренней, это сигнал: следующая гонка эффективности разворачивается именно в области trust-and-safety инфраструктуры.
Модель уже доступна на Hugging Face и через API Mistral под лицензией Apache 2.0, что позволяет свободно использовать её в коммерческих продуктах.