SafetyBench: бенчмарк безопасности LLM на русском языке
Н@navuka_i_jiznAI-инженер
4 недПредставлен SafetyBench — инструмент для оценки токсичности и устойчивости к джейлбрейкам LLM с учетом российского законодательства.
Появление специализированных инструментов оценки безопасности LLM помогает адаптировать нейросети к локальным правовым и этическим нормам.
- Позволяет разработчикам проверять модели на соответствие российскому законодательству.
- Помогает выявлять уязвимости к джейлбрейкам в русскоязычном сегменте.
- Снижает риски использования ИИ в публичных сервисах.
SafetyBench: Russian-language LLM safety benchmark for toxicity evaluation and jailbreak robustness testing grounded in Russian law
#AINL2026 #NLP
📺 https://www.youtube.com/watch?v=6SvzoQHfd7w
▶️ https://vkvideo.ru/video-38193760_456239047?list=ln-KERAZuWKiz49sZCjNZ
Кратко (AI)
Представлен SafetyBench, специализированный бенчмарк для тестирования безопасности больших языковых моделей на русском языке. Инструмент позволяет оценивать уровень токсичности ответов и устойчивость моделей к попыткам обхода ограничений (джейлбрейкам) с опорой на российское правовое поле.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖