← к ленте

Проблемы сертификации LLM на соответствие культурным ценностям

D@dealerAIAI-инженер
2 нед

Анализ сложности проверки языковых моделей на соответствие национальным культурным кодам из-за особенностей их обучения и доминирования англоязычных данных.

Сертификация ИИ на соответствие культурным нормам технически труднореализуема.

  • Модели обучаются преимущественно на англоязычных данных, что формирует их базовое мировоззрение.
  • Существующие методы защиты (фильтры, дообучение) не гарантируют полную устойчивость к нестандартным запросам.
  • Риск публичных скандалов при обнаружении несоответствий в ответах моделей остается высоким.
Про культурный код моделей и соответствие каким-то ценностям LLM. Мне много стали присылать в лс такую новость. 😬 Тлдр. Модели AI будут проверять на соответствие культурным ценностям, для получения звания национальных или суверенных. 😐 Я очень много писал о том, почему такие проверки сделать непросто. Вот пример. 🦻 Если коротко, на просторах сети мало русских текстов в отношении доли к английским. И тк модели учатся в тч на этих текстах, их доля там привалирует, ну иначе, вам не обучить модель на 700B параметров только на ру базе, это будет не оптимально. Да есть синта, соглашусь, но синта не даёт такой буст, как мультилингв данные. Таким образом, на этапе уже предобучения у вас лежит возможность сгенерировать не то, что соответствует культурном коду вашей страны. Особенно если перейти на запрос на английском или китайском языках. Что же с ру LLM? А теперь если посмотреть на все модели в ру сегменте, то это или Qwen-like модели, с инициализацией с весов (а значит часть информации уже лежало там с претрена китайцами), или модели, где 65%+ не ру дата в претрене. Отсюда остаётся вопросы: Как пройти проверку? Какие эксперты, на каких сетах и на каком языке будут проверять соответствие? В целом, тк уже на уровне языков в обучении можно пробить модель на чужой культурный код, то остаются только методы: - гвардов сверху и спец логики рядом (если обстрел по апи) - sft и RL элаймент модели под нужное поведение под сеты оценки, а я не уверен, что методология и сеты оценки будут закрыты от оцениваемых. И оба способа НЕ идеальны, тк и в гардах и sft/RL есть понятие OOV примеров, те запросов, которые модель никогда не видела и даже не смогла на уровне "эмерджентности" аппроксимировать. Те вас рано или поздно пробьют всеравно. А ещё есть галлюцинации... 🚬 Таким образом, пройти проверку можно, есть и хаки, и честные способы, но и есть понятные причины рисков. И будет жутко интересно, особенно, когда какая-то модель пройдёт тесты, а потом в какой-то соц сети её пробьют, выложат скрины и скажут, ну как так. Что уже не раз бывало. 👍

Кратко (AI)

Автор анализирует инициативу по проверке ИИ-моделей на соответствие национальным культурным ценностям. Указывается, что из-за нехватки русскоязычных данных и доминирования иностранных текстов в обучающих выборках, модели неизбежно впитывают чужой культурный код, что делает полноценную сертификацию крайне сложной задачей.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖