Почему ML-модели ошибаются: роль контекстных признаков
K@kantor_aiмедиа / агрегатор
4 недРазбор ошибок ML-классификаторов на примере спам-фильтров и определения пола через дату рождения.
Понимание контекста критически важно для точности алгоритмов.
- Алгоритмы часто ошибаются, если не учитывают внешние факторы, такие как праздники.
- Недостаток специфических признаков приводит к ложным срабатываниям спам-фильтров.
- Качество работы ML-модели напрямую зависит от репрезентативности данных и учета аномалий.
Про признак «у пользователя день рождения» в ML
В этом году на день рождения (он был уже давно, сейчас просто вспомнил историю) я получил очень много поздравлений, и что-то меня побудило всем поздравившим ответить в тот же день.
В итоге больше половины моих ответов телеграм удалил, решив, что я спамер. Даже были прецеденты, когда мы с человеком попереписывались, а на следующий день его реплики есть, а мои все потерли.
В этом нашелся и позитивный момент, я до сих пор случайно нахожу диалоги с поздравлениями и снова радуюсь им, но конечно основное, что меня позабавило, это что в классификаторе спама либо нет признака «у пользователя ДР», либо он не работает. И это, кстати, частый недостаток ML моделей в B2C сервисах.
Например, в одной компании, где я работал, два моих коллеги мужского пола постоянно определялись внутренним классификатором пола как женщины, а один из них на этот счет даже неплохо плевался желчью. Причина тому была очень простой: у них день рождения 8 марта, и они получают аномально высокое для мужчины количество звонков в этот день. Среди тысяч сотрудников оказалось достаточно мужчин, родившихся 8 марта, чтобы баг исправился сам собой, когда для модели сделали нормальные признаки.
Общий же рецепт довольно простой: при разработке модели хорошо бы подумать, почему она может ошибаться на каких-то примерах, и что сделать, чтобы не ошибалась. Как правило первые ответы на этот вопрос будут касаться наличия и актуальности нужных признаков, корректности собранного таргета, баланса классов и в целом репрезентативности выборки.

Кратко (AI)
Автор рассуждает о важности учета контекстных признаков в ML-моделях на примере работы спам-фильтров и классификаторов пола. Ошибки моделей часто возникают из-за отсутствия специфических данных, таких как дата рождения, что приводит к ложным срабатываниям в B2C-сервисах.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖