← к ленте

Сравнение производительности Anthropic Fable до и после обновлений

L@llm_under_hoodAI-инженер
1 мес

Анализ падения эффективности модели Anthropic Fable в бизнес-задачах после введения ограничений и сравнение с GPT-5.5.

Бенчмарк Anthropic Fable на бизнес задачах после лоботомии @AigizK успел сделать бенчмарк Anthropic Fable до того, как его закрыли. Тем интереснее стало сравнить на том же бенчмарке новую экспортную версию после открытия заново. И там получается грустная картинка. Новый Anthropic Fable урезали настолько, что модель упала с 12 места на 39ое в нашем бенчмарке. Основная причина - 15 пустых ответов с stop_reason=“refusal” там, где раньше были ответы. Просели тщательно подобранные, но совершенно безопасные задачи на кодинг и интеграцию. В общем, с такими параметрами и стоимостью, особого смысла использовать Antropic Fable - нет. GPT-5.5 сильно лучше и куда дешевле. Ваш, @llm_under_hood 🤗

Кратко (AI)

Автор провел сравнительный анализ модели Anthropic Fable до и после обновления, отметив значительное снижение качества ответов. Модель опустилась в рейтинге из-за частых отказов в выполнении безопасных задач, что делает её использование менее целесообразным по сравнению с GPT-5.5.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖