Бенчмарк моделей GPT-5.6 Sol/Terra/Luna
D@datastorieslanguagesAI-инженер
1 месОбзор производительности новых моделей GPT-5.6 Sol, Terra и Luna на агентском бенчмарке, демонстрирующий сдвиг Парето-фронтира.
Бенчмарк GPT-5.6 Sol/Terra/Luna - двигают фронтир
Это тест новых моделей OpenAI на нашем новом агентском бенчмарке. Под капотом бенчмарка - паттерны из топовых харнесов с BitGN соревнований, которые мы разобрали и заново прогнали через ECOM1 под трейсом с лупой, анализируя точки возникновения ошибок. А самые уязвимые места самых сильных архитектур (когда они путаются, пропускают нарушения границ, забывают про политики итп) собрали в бенчмарк.
И получается, что лайтовые модели GPT-5.6 (есть еще pro версии, которые протестирую попозже) настолько хороши, что они двигают Парето-фронтир как по комбинации качество-скорость, так и по комбинации качество-цена. Смотрите сами на графики справа. Это делает их дефолтным выбором в новых проектах.
Отчет на сайте выложим попозже, а пока картинка с хорошим качеством - в комментариях.
Ваш, @llm_under_hood 🤗
Кратко (AI)
Автор представляет результаты тестирования новых моделей GPT-5.6 (Sol, Terra, Luna) на собственном агентском бенчмарке. Модели показывают значительное улучшение соотношения качества, скорости и цены, что делает их перспективным выбором для новых проектов.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖