← к ленте

Mistral выпустили Shieldstral: мультимодальный классификатор безопасности

т@techn0danyaAI-инженер
3 нед

Обзор Shieldstral от Mistral AI — 3B модели для гибкой модерации контента, а также анализ стратегии компании на фоне конкурентов.

Новый подход к безопасности ИИ позволяет гибко настраивать фильтры без переобучения моделей.

  • Shieldstral позволяет менять правила модерации через промпт, а не через дообучение весов.
  • Модель эффективна для мультимодальных задач и требует всего 16GB видеопамяти.
  • Mistral AI меняет фокус с создания самых мощных LLM на специализированные прикладные решения.
🐈 Еще один день без Le Chaton Fat Пока все ждут от Mistral локального убийцу GPT и Claude, контора по великой европейкой традиции делает то, что ЕС делает лучше всего — фильтрование базара 4 августа зарелизили Shieldstral — 3B мультимодальный классификатор безопасности с открытыми весами Обычные guardrail-модели (Llama Guard и ко) зашивают таксономию вреда прямо в веса. Хочешь свои категории — иди дообучай. Проблема в том, что «небезопасно» для детского приложения и для пентест-тулзы — это два очень разных множества, и универсально правильного списка категорий просто не существует. Shieldstral переформулировал модерацию как бинарный QA. На вход три блока: — <Instruct> — контекст оценки и строгость — <Query> — один вопрос да/нет («этот текст пропагандирует насилие?») — <Document> — сам контент: промпт, ответ модели, пара промпт-ответ или картинка На выходе модель ничего не генерит. Она берёт логиты токенов yes и no, софтмаксит их и отдаёт непрерывный скор. Один форвард-пасс, ноль декодирования, порог крутишь сам. Политика живёт в промпте, а не в весах — поменялись требования, переписал вопрос, файнтюн не нужен. 🧠 Как учили? 1. 54.1M сэмплов, склеенных из кучи публичных датасетов с несовместимыми таксономиями. Всё конвертнули в единый формат и специально варьировали формулировки вопросов, чтобы модель не переобучилась на один стиль. 2. Чтобы модель училась различать политики, а не запоминать их: брали пары похожих-но-разных политик и просили LLM переписать безопасный текст так, чтобы он нарушал одну и НЕ нарушал соседнюю. Contrastive-пары по смыслу политик — и это переносится на политики, которых в трейне не было вообще. 3. Небезопасные картинки не насинтезируешь, как текст. Поэтому добивали негативами из обычных датасетов и фильтровали VLM-реранкером. 4. LoRA + мердж трёх чекпоинтов через SLERP (калибровка + дискриминация + base instruct). Итог: 3B бьёт guard-модели в 7 раз крупнее себя на текстовой безопасности, SOTA на мультимодалке, влезает в одну 16GB карту. 😐 А чем вообще сейчас занимается Mistral? Быстрый прогон по релизам Mistral за год: Mistral 3, Devstral 2, OCR 3 и 4, Voxtral Transcribe/TTS, Small 4, Medium 3.5, Leanstral (Lean-пруверы), Robostral Navigate (навигация для роботов), Forge, физические AI-модели после покупки Emmi, ребренд Le Chat в Vibe. Пахали как черти. Заметил закономерность? Голос, зрение, документы, домен-специфика, мелкие модели, гардрейлы. Всё, кроме фронтир-LLM. Это не случайность, это признал сам Arthur Mensch (сооснователь и CEO Mistral AI,) в июле: «у нас пока нет лучших языковых моделей, но в доменах, которые меньше упираются в компьют — голос, зрение, обработка документов — у нас SOTA». Цифры: Mистраль поднял за всю жизнь ~$4B, сейчас закрывает раунд по оценке ~€20B, ARR ~$400M с прицелом на миллиард. Anthropic — ~$30B run-rate. OpenAI жжёт больше за квартал, чем Mistral поднял за три года. €4B в дата-центры Франции и Швеции — это очень много для Европы и примерно ничто по меркам гонки, где целятся в гигаватты. Плюс структурная штука: у OpenAI есть Microsoft (но у них там сложные отношения), у AnthropicGoogle и Amazon, у MistralASML с 11% и Nvidia в друзьях. ASML прекрасен, но это не тот кэш-флоу, который позволяет спалить пару миллиардов на один трейн-ран и пожать плечами. Учитывая текущие обстоятельства и тот факт, что китайские лабы дисраптят юнит-экономику, то появляется подозрение, что Mistral хочет быть полонценной компанией, которая не разойдется по швам в случае взрыва какого-нибудь пузыря (вряд ли он есть в индустрии, правда?). Судя по всему путь выбрали подобный Palantir и уже нанимают кучу forward-deployed инженеров. #AI @techn0danya
Mistral выпустили Shieldstral: мультимодальный классификатор безопасности

Кратко (AI)

Mistral AI представили Shieldstral — 3B мультимодальную модель для модерации контента, которая использует бинарный QA вместо жестко зашитых правил. Автор анализирует технические особенности модели и стратегию Mistral, которая фокусируется на прикладных доменах, а не на гонке фронтирных LLM.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖