← к ленте

Почему ML-модели ошибаются: роль контекстных признаков

K@kantor_aiмедиа / агрегатор
4 нед

Разбор ошибок ML-классификаторов на примере спам-фильтров и определения пола через дату рождения.

Понимание контекста критически важно для точности алгоритмов.

  • Алгоритмы часто ошибаются, если не учитывают внешние факторы, такие как праздники.
  • Недостаток специфических признаков приводит к ложным срабатываниям спам-фильтров.
  • Качество работы ML-модели напрямую зависит от репрезентативности данных и учета аномалий.
Про признак «у пользователя день рождения» в ML В этом году на день рождения (он был уже давно, сейчас просто вспомнил историю) я получил очень много поздравлений, и что-то меня побудило всем поздравившим ответить в тот же день. В итоге больше половины моих ответов телеграм удалил, решив, что я спамер. Даже были прецеденты, когда мы с человеком попереписывались, а на следующий день его реплики есть, а мои все потерли. В этом нашелся и позитивный момент, я до сих пор случайно нахожу диалоги с поздравлениями и снова радуюсь им, но конечно основное, что меня позабавило, это что в классификаторе спама либо нет признака «у пользователя ДР», либо он не работает. И это, кстати, частый недостаток ML моделей в B2C сервисах. Например, в одной компании, где я работал, два моих коллеги мужского пола постоянно определялись внутренним классификатором пола как женщины, а один из них на этот счет даже неплохо плевался желчью. Причина тому была очень простой: у них день рождения 8 марта, и они получают аномально высокое для мужчины количество звонков в этот день. Среди тысяч сотрудников оказалось достаточно мужчин, родившихся 8 марта, чтобы баг исправился сам собой, когда для модели сделали нормальные признаки. Общий же рецепт довольно простой: при разработке модели хорошо бы подумать, почему она может ошибаться на каких-то примерах, и что сделать, чтобы не ошибалась. Как правило первые ответы на этот вопрос будут касаться наличия и актуальности нужных признаков, корректности собранного таргета, баланса классов и в целом репрезентативности выборки.
Почему ML-модели ошибаются: роль контекстных признаков

Кратко (AI)

Автор рассуждает о важности учета контекстных признаков в ML-моделях на примере работы спам-фильтров и классификаторов пола. Ошибки моделей часто возникают из-за отсутствия специфических данных, таких как дата рождения, что приводит к ложным срабатываниям в B2C-сервисах.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖