← к ленте

Проверка ИИ-моделей на «пеликанмаксинг»

Х@habr_comмедиа / агрегатор
3 нед

Анализ того, подгоняют ли разработчики ИИ-модели под популярный бенчмарк с пеликаном на велосипеде от Саймона Уиллисона.

Это исследование показывает, как сообщество проверяет честность разработчиков ИИ.

  • Помогает понять, насколько объективны популярные тесты нейросетей.
  • Демонстрирует метод проверки моделей на «подгонку» под конкретные запросы.
  • Развенчивает миф о предвзятости моделей в пользу известных интернет-мемов.
Занимаются ли разработчики ИИ-моделей пеликанмаксингом? Несколько лет Саймон Уиллисон встречает каждый крупный релиз одним промптом про SVG с пеликаном на велосипеде, и картинка стала неформальным бенчмарком, который обсуждает весь Hacker News. Когда на кону триллионы, велик соблазн втихую натаскать модель именно на этот сюжет. Кто-то решил это проверить и сгенерировал 1008 картинок по сетке из восьми животных и шести видов транспорта в семи передовых моделях. Логика простая. Если лаборатории тренируют модели под бенчмарк, пеликаны должны быть наверху рейтинга. Пеликан оказался шестым из восьми, его обошли кошка, кит, енот, цапля и антилопа, а связка пеликан на велосипеде встала на 42-е место из 48. Похоже на закрытое дело, только дальше в ход идут регрессия с поправкой на сложность и один-единственный результат, который выбился из статистического шума. Выясним, устоял ли вывод об отсутствии пеликанмаксинга под строгой проверкой.
Проверка ИИ-моделей на «пеликанмаксинг»
КонтекстAI
Саймон Уиллисон — известный разработчик и блогер, который использует промпт «пеликан на велосипеде» для тестирования новых моделей генерации изображений. Этот тест стал неофициальным, но популярным бенчмарком в сообществе Hacker News, вызывая дискуссии о том, не включают ли разработчики подобные примеры в обучающие выборки для улучшения результатов на тестах.

Кратко (AI)

Автор анализирует гипотезу о том, что разработчики ИИ-моделей специально обучают их на популярном в сообществе Hacker News промпте с пеликаном на велосипеде. Исследование 1008 изображений, сгенерированных семью моделями, показало, что пеликан не имеет статистического преимущества, что опровергает теорию «пеликанмаксинга».

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖