
Mistral представила Shieldstral — мультимодальную модель с 3 миллиардами параметров для модерации безопасности текста и изображений. Модель получает политику модерации в виде запроса на естественном языке и оценивает вероятность ответов «да» и «нет». При этом фиксированный список категорий не требуется.
Mistral выпустила веса Shieldstral под лицензией Apache 2.0. По информации компании, для функционирования модели достаточно одной видеокарты NVIDIA с 16 ГБ памяти. При этом Shieldstral демонстрирует результаты на уровне открытых защитных моделей, которые могут быть в семь раз больше. Подробнее в материале Postium.
Читайте также: ТОП-20 ии-агентов для работы
Shieldstral — как работает модель
Запрос к ИИ состоит из трех компонентов: инструкции с контекстом и строгим уровнем проверки, вопроса о нарушении политики и самого материала. На проверку можно отправить промпт, ответ модели, пару «промпт — ответ», отдельное изображение или изображение с текстовым сопровождением.
Shieldstral обрабатывает запрос как вопрос с двумя вариантами ответа и выдает один токен — «да» или «нет». Программное обеспечение извлекает вероятности для обоих вариантов, нормализует их и получает непрерывный балл. Этот балл указывает на уверенность модели в ответе «да».
В одном формате Shieldstral классифицирует промпты, проверяет ответы, распознает отказы модели и оценивает токсичность текста или изображений.
Mistral провела тестирование Shieldstral по четырем направлениям: безопасность текста, распознавание отказов, адаптация к новой политике и мультимодальная модерация. Результаты представлены в техническом отчете компании.
Чтобы загрузить и установить Shieldstral, откройте страницу модели на сайте Mistral и перейдите по ссылке для скачивания открытых весов. Запустить модель можно через vLLM, llama.cpp, SGLang или Transformers.

Почему это важно? Защитные модели обычно обучаются на заранее определенной таксономии рисков. В случае с Shieldstral правило указывается прямо в запросе. Сервис или команда могут изменять формулировку политики для конкретной проверки без необходимости переобучения отдельного классификатора.
Итог: Shieldstral проверяет текст и изображения согласно правилам, указанным в запросе. Веса модели доступны по открытой лицензии.


