Проблема занижения оценки внутренней размерности облака точек
Т@tech_priestessAI-инженер
1 недАнализ систематической ошибки алгоритмов оценки внутренней размерности (PHD, TwoNN, MLE) при работе с высокоразмерными данными.
Популярные методы анализа данных могут давать критически неверные результаты при работе с многомерными структурами.
- Алгоритмы оценки размерности (PHD, TwoNN, MLE) теряют точность при росте размерности данных.
- Для высокоразмерных пространств текущие методы требуют экспоненциального роста объема выборки для корректной оценки.
- Исследователям стоит учитывать риск систематического занижения размерности при анализе сложных наборов данных.
Подписчик в комментариях указал на важную проблему популярных алгоритмов оценки внутренней размерности облака точек, за что ему большое спасибо!
Выяснилось, что при большой истинной размерности облака они дают систематически заниженную оценку этой размерности. При чем чем больше настоящая размерность, тем сильнее занижается оценка.
Я решила проверить это и навайбкодила ноутбук, в котором генерируются облака точек, равномерно заполняющие n-мерные шары:
https://colab.research.google.com/drive/1kIRin8sBBNQDFvruXWITU3i5kL7x7Zww?usp=sharing
Краткие результаты:
- При размерности такого шара 10 и количестве точек 2000, три алгоритма оценки размерности (PHD, TwoNN и MLE) дают что-то между 8.5 и 9, то есть занижают незначительно. А вот при размерности 100, PHD уже даёт оценку в 64, а TwoNN и MLE и вовсе около 50, то есть оценка занижена в целых два раза (см. рис. 1).
- Увеличение количества точек в шаре может помочь подтянуть оценку к истинной, но, похоже, что для этого увеличивать их количество нужно экспоненциально с ростом размерности.
Интересные выводы, и вообще даже странно, что раньше я не знала о таком явлении. Или знала, но забыла? 😅 Честно говоря, мозг от вайбкодинга уже совсем потек, так что ничего не могу сказать с уверенностью 😅
В любом случае, надеюсь, что эта инфа будет полезна всем, кто интересуется внутренней размерностью и т.д.
P S В случае любых ошибок в ноутбуке - все претензии к Клоду 😍
#эксперимент #наука

Кратко (AI)
Автор провела эксперимент, подтверждающий, что популярные алгоритмы оценки внутренней размерности (PHD, TwoNN, MLE) систематически занижают результат при работе с высокоразмерными данными. Исследование показало, что при размерности 100 оценка может быть занижена в два раза, а для корректной работы алгоритмов требуется экспоненциальное увеличение количества точек.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖