Французский стартап Mistral 4 августа выпустил Shieldstrali — мультимодальный классификатор безопасности контента на 3 млрд параметров с открытыми весами. В отличие от обычных guardrail-моделей (типа Llama Guard), где таксономия вреда зашита прямо в веса и для смены категорий нужен дообучение, Shieldstral переносит политику модерации в системный промпт: критерии задаются текстом, а не переобучением.
Модель не генерирует текст, а работает как бинарный классификатор да/нет по заданному вопросу, что делает её быстрой и универсальной — один и тот же чекпоинт можно использовать и для детского приложения, и для пентест-инструмента, просто переписав вопрос.
3 млрд параметровразмер модели Shieldstral
54,1M сэмпловобъём обучающего датасета
в 7 раз крупнеево столько раз Shieldstral превосходит конкурентов по размеру
- Архитектура запроса состоит из трёх блоков: <Instruct> (контекст оценки и строгость), <Query> (один вопрос да/нет, например «этот текст пропагандирует насилие?») и <Document> (сам контент — промпт, ответ модели, пара промпт-ответ или картинка)
- Модель не генерит ответ: берёт логиты токенов yes и no, применяет софтмакс и выдаёт непрерывный скор за один форвард-пасс без декодирования; порог отсечения настраивается пользователем
- Обучающий датасет — 54,1 млн сэмплов, собранных из множества публичных датасетов с несовместимыми таксономиями и приведённых к единому формату; формулировки вопросов специально варьировались, чтобы модель не переобучилась на один стиль
- Для обучения различать смысл политик (а не запоминать их) использовались контрастные пары: LLM переписывала безопасный текст так, чтобы он нарушал одну политику, но не соседнюю по смыслу — это помогает модели работать с политиками, которых не было в тренировке
- Для мультимодальной части небезопасные изображения не синтезировались, а собирались как негативы из обычных датасетов и отфильтровывались VLM-реранкером
- Финальная модель получена через LoRA-дообучение и мердж трёх чекпоинтов методом SLERPi (калибровка + дискриминация + базовый instruct)
- По заявлению разработчиков, 3B-модель превосходит guard-модели, крупнее её в 7 раз, на текстовой безопасности и показывает SOTA-результат на мультимодальных задачах, при этом помещается на одной видеокарте с 16GB
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖