← к ленте

Предрелизный обзор нового LLM бенчмарка

L@llm_under_hoodAI-инженер
1 мес

Автор анонсирует скорый выход нового бенчмарка для LLM и делится предварительными результатами моделей до выхода ChatGPT 5.6.

Я почти закончил делать первую версию нового LLM бенчмарка, вместе с отчетом. Скоро все будет. Но пока вот картинка для исторических целей про то, как выглядела картина до выхода ChatGPT 5.6. Там очень много антропика! Sonnet 5 (high) на 4м месте, а low - на 6м, Opus 4.8 на 8м, Sonnet 4.6 на 10м. DeepSeek v4 Pro на 7 месте Fable легко мог бы занять топовое место, если бы не паниковал и не бросал трубку на каждую угрозу, вместо отрабатывания штатно. Ваш, @llm_under_hood 🤗

Кратко (AI)

Автор канала @llm_under_hood готовит к выпуску новый бенчмарк для оценки больших языковых моделей. В качестве тизера представлены текущие позиции популярных моделей, включая Sonnet 5, DeepSeek v4 Pro и Opus 4.8, зафиксированные до выхода ChatGPT 5.6.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖