← к ленте

SafetyBench: бенчмарк безопасности LLM на русском языке

Н@navuka_i_jiznAI-инженер
4 нед

Представлен SafetyBench — инструмент для оценки токсичности и устойчивости к джейлбрейкам LLM с учетом российского законодательства.

Появление специализированных инструментов оценки безопасности LLM помогает адаптировать нейросети к локальным правовым и этическим нормам.

  • Позволяет разработчикам проверять модели на соответствие российскому законодательству.
  • Помогает выявлять уязвимости к джейлбрейкам в русскоязычном сегменте.
  • Снижает риски использования ИИ в публичных сервисах.
SafetyBench: Russian-language LLM safety benchmark for toxicity evaluation and jailbreak robustness testing grounded in Russian law #AINL2026 #NLP 📺 https://www.youtube.com/watch?v=6SvzoQHfd7w ▶️ https://vkvideo.ru/video-38193760_456239047?list=ln-KERAZuWKiz49sZCjNZ

Кратко (AI)

Представлен SafetyBench, специализированный бенчмарк для тестирования безопасности больших языковых моделей на русском языке. Инструмент позволяет оценивать уровень токсичности ответов и устойчивость моделей к попыткам обхода ограничений (джейлбрейкам) с опорой на российское правовое поле.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖