Предрелизный обзор нового LLM бенчмарка
L@llm_under_hoodAI-инженер
1 месАвтор анонсирует скорый выход нового бенчмарка для LLM и делится предварительными результатами моделей до выхода ChatGPT 5.6.
Я почти закончил делать первую версию нового LLM бенчмарка, вместе с отчетом. Скоро все будет. Но пока вот картинка для исторических целей про то, как выглядела картина до выхода ChatGPT 5.6.
Там очень много антропика!
Sonnet 5 (high) на 4м месте, а low - на 6м, Opus 4.8 на 8м, Sonnet 4.6 на 10м.
DeepSeek v4 Pro на 7 месте
Fable легко мог бы занять топовое место, если бы не паниковал и не бросал трубку на каждую угрозу, вместо отрабатывания штатно.
Ваш, @llm_under_hood 🤗
Кратко (AI)
Автор канала @llm_under_hood готовит к выпуску новый бенчмарк для оценки больших языковых моделей. В качестве тизера представлены текущие позиции популярных моделей, включая Sonnet 5, DeepSeek v4 Pro и Opus 4.8, зафиксированные до выхода ChatGPT 5.6.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖