← к ленте

Бенчмарк моделей GPT-5.6: производительность и эффективность

L@llm_under_hoodAI-инженер
1 мес

Анализ производительности новых моделей GPT-5.6 Sol/Terra/Luna на агентском бенчмарке, демонстрирующий сдвиг Парето-фронтира по качеству, скорости и цене.

Бенчмарк GPT-5.6 Sol/Terra/Luna - двигают фронтир Это тест новых моделей OpenAI на нашем новом агентском бенчмарке. Под капотом бенчмарка - паттерны из топовых харнесов с BitGN соревнований, которые мы разобрали и заново прогнали через ECOM1 под трейсом с лупой, анализируя точки возникновения ошибок. А самые уязвимые места самых сильных архитектур (когда они путаются, пропускают нарушения границ, забывают про политики итп) собрали в бенчмарк. И получается, что лайтовые модели GPT-5.6 (есть еще pro версии, которые протестирую попозже) настолько хороши, что они двигают Парето-фронтир как по комбинации качество-скорость, так и по комбинации качество-цена. Смотрите сами на графики справа. Это делает их дефолтным выбором в новых проектах. Отчет на сайте выложим попозже, а пока картинка с хорошим качеством - в комментариях. Ваш, @llm_under_hood 🤗

Кратко (AI)

Автор представляет результаты тестирования новых моделей GPT-5.6 (Sol, Terra, Luna) на собственном агентском бенчмарке, основанном на данных соревнований BitGN. Модели показывают значительное улучшение соотношения качества, скорости и цены, что делает их перспективным выбором для новых проектов.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖