← к ленте

ИИ-модели успешно справляются с кейсами MBA

М@theworldisnoteasyAI-инженер
1 мес

Исследование BusinessCaseBench показывает, что современные ИИ-модели решают 88,4% задач MBA-программ, ставя под угрозу традиционную карьерную модель.

Собирающимся учиться на MBA: ваша карьерная лестница обваливается Лучшая ИИ-модель уже закрывает 88,4% ожидаемого анализа в реальных кейсах бизнес-школ – по финансам, стратегии, переговорам, HR и деловой этике. Это данные нового препринта исследователей из Уортона, Карнеги-Меллон, Пенсильванского университета и Гарвардской школы бизнеса, авторов бенчмарка BusinessCaseBench: 615 экзаменационных вопросов по 238 реальным кейсам, 18 дисциплин. О вытеснении ИИ младших программистов и математиков говорят давно – но здесь речь о материале, на котором десятилетиями строится подготовка MBA. Задачи в тесте не про факты и не про арифметику. •  Одной модели дают написать судебное заключение Верховного суда США по патентному спору фармкомпаний и вывести из него правовую норму для судов ниже. •  Другой – решить за главного врача больницы, стоит ли повышать заведующего отделением, чья клиническая репутация конфликтует с корпоративной культурой. •  Третьей – разобрать этическую позицию дата-сайентиста, которого просят встроить в HR-алгоритм оценку вероятности беременности соискательниц. Каждый ответ сверяют по чек-листу критериев с решением, которое для этого кейса написал преподаватель; саму оценку выставляет ИИ-судья, а ее надежность проверили вручную три эксперта с опытом преподавания на MBA-программах. GPT-5.4 берет 87,2%, Gemini 3 Flash Preview – 81,6%. Если по каждому вопросу брать лучший результат из трех моделей, показатель поднимается до 92,8%, а полностью провалить вопрос – так, чтобы ни одна из них не преодолела даже 70% – удается лишь в 7% случаев. Нужные знания и ход рассуждения почти всегда есть хотя бы у одной модели, а слепые пятна одной закрывает другая.   Есть и отрезвляющая цифра. Если считать не долю правильных пунктов, а долю вопросов, где модель без единого пропуска закрыла весь чек-лист, картина куда скромнее: 49,6% у Claude Sonnet 4.6, 47,6% у GPT-5.4, 32,0% у Gemini. Лучшая модель дает исчерпывающий ответ без единого пропуска лишь в половине случаев. Авторы формулируют это прямо: то, что выдает модель, – сильный черновик, а не готовый вердикт.   Тревожит не столько уровень, сколько скорость, с которой сокращается разрыв. Внутри одного семейства моделей OpenAI – от GPT-4 Turbo до GPT-5.4 – за два года результат по частичному зачету вырос с 63,9% до 87,2%, то есть на 23,3 процентных пункта, и прибавка шла не только за счет арифметики: по субъективным и качественным вопросам модели продвинулись не меньше, чем по числовым. Прогресс идет широким фронтом, а не латает одну конкретную слабость.   Бенчмарк честно фиксирует и границы: модель сама не добывает недостающую информацию, не ведет переговоры с коллегами и начальством и не отвечает своей репутацией за последствия решения. Но именно эти границы остаются единственной защитой там, где раньше держался весь нижний этаж белых воротничков, – в умении быстро разобрать неоднозначную ситуацию и выдать структурированную рекомендацию.   Так что пора прощаться: пока что не со всеми обладателями диплома MBA, но с самой карьерной моделью, где годы уходят на то, чтобы, производя черновики для чужих решений, научиться однажды принимать решения самому. Эта карьерная лестница обваливается уже не в теории (как я писал 3 года назад: «3й этап цифровизации мира станет для Homo sapiens последним. Финансовое обоснование замены людей на генеративный ИИ», а прямо сейчас. P.S. Написанное касается и поступающих на МВА, и тех, кто MBA уже получил, да и вообще всех, кто идет по традиционному карьерному пути от "готовить черновики решений для других" к «принимать решения, подготовленные другими».   #ГенИИ  #Бизнес

Кратко (AI)

Новое исследование BusinessCaseBench показало, что современные языковые модели способны решать до 88,4% задач из реальных кейсов бизнес-школ. Это ставит под вопрос традиционный карьерный путь выпускников MBA, так как ИИ уже сейчас эффективно справляется с анализом стратегий, финансов и этических дилемм.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖