← к ленте

Кризис методологии в современных AI-бенчмарках

Б@boris_againAI-инженер
1 нед

Размышление о деградации стандартов оценки AI-моделей: от строгих научных протоколов к субъективным блог-постам и «хайповым» экспериментам.

Понимание того, почему результаты тестов AI-моделей часто не отражают реальную эффективность.

  • Разделение маркетинговых тестов и строгих научных исследований.
  • Осознание рисков предвзятости при оценке возможностей нейросетей.
  • Критический взгляд на популярные бенчмарки, которые могут быть манипулятивными.
Вообще забавно, что бенчмарки теперь бывают двух видов: 1. Научная статья, датасет и протокол для сравнения методов. Пир ревью, методология и всё такое. 2. Мы прикольно запромптили модели больших лаб и что-то получилось, вот блог-пост. Второй тип мне по вайбу напоминает социальные науки в 90-х. Например, как знаменитый Стенфордский эксперимент Милграма: мы сделали одних людей надзирателями, вторых заключенными, и ВЫ НЕ ПОВЕРИТЕ ЧТО БЫЛО ДАЛЬШЕ. Опускается, что Милграм показывал надзирателям как лучше бить заключенных дубинкой для большей драматичности. Или множество исследований типа "мы задали три вопроса пяти студентам в коридоре нашего универа и вот что мы узнали про психику людей..." В общем всё то, что привело к кризису репликации. И позволило многим сделать целые карьеры занимаясь какой-то веселой херней. Короче это изначально не про науку и от бенчмарков одно название

Кратко (AI)

Автор критикует современные подходы к тестированию AI-моделей, сравнивая их с псевдонаучными экспериментами 90-х годов. По мнению автора, многие текущие бенчмарки лишены научной строгости и превратились в маркетинговые инструменты, что ведет к кризису доверия к результатам тестирования.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖