Кризис методологии в современных AI-бенчмарках
Б@boris_againAI-инженер
1 недРазмышление о деградации стандартов оценки AI-моделей: от строгих научных протоколов к субъективным блог-постам и «хайповым» экспериментам.
Понимание того, почему результаты тестов AI-моделей часто не отражают реальную эффективность.
- Разделение маркетинговых тестов и строгих научных исследований.
- Осознание рисков предвзятости при оценке возможностей нейросетей.
- Критический взгляд на популярные бенчмарки, которые могут быть манипулятивными.
Вообще забавно, что бенчмарки теперь бывают двух видов:
1. Научная статья, датасет и протокол для сравнения методов. Пир ревью, методология и всё такое.
2. Мы прикольно запромптили модели больших лаб и что-то получилось, вот блог-пост.
Второй тип мне по вайбу напоминает социальные науки в 90-х. Например, как знаменитый Стенфордский эксперимент Милграма: мы сделали одних людей надзирателями, вторых заключенными, и ВЫ НЕ ПОВЕРИТЕ ЧТО БЫЛО ДАЛЬШЕ. Опускается, что Милграм показывал надзирателям как лучше бить заключенных дубинкой для большей драматичности. Или множество исследований типа "мы задали три вопроса пяти студентам в коридоре нашего универа и вот что мы узнали про психику людей..." В общем всё то, что привело к кризису репликации. И позволило многим сделать целые карьеры занимаясь какой-то веселой херней.
Короче это изначально не про науку и от бенчмарков одно название
Кратко (AI)
Автор критикует современные подходы к тестированию AI-моделей, сравнивая их с псевдонаучными экспериментами 90-х годов. По мнению автора, многие текущие бенчмарки лишены научной строгости и превратились в маркетинговые инструменты, что ведет к кризису доверия к результатам тестирования.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖