Вышла большая статья-обзор, сравнивающая две новые LLM — GPT-5.6i и Fablei. Автор тестировал инструмент Sol на протяжении 2 месяцев и потратил на это 25 миллиардов токенов, собрав таблицы и сравнения по обеим моделям.
По его оценке, GPT-5.6 субъективно в 2-3 раза быстрее предыдущих моделей линейки, генерирует код быстрее и точнее, затрагивая меньше кода — это лучшая модель в серии GPT-5, вероятно завершающая её. Fable, напротив, представляет собой первую модель нового этапа обучения: она делает ошибки новичка, но имеет больший потенциал роста. Отдельно, по данным другого источника, Fable протестирован на лидербордiе безопасности: модель показала абсолютную защиту от уязвимостей, но заняла лишь 11-е место из-за рекордного числа отказов работать.
- Автор обзора использовал инструмент Sol для тестирования моделей в течение 2 месяцев, сожгя 25 миллиардов токенов
- Цитата автора: «GPT-5.6 кажется мне примерно в 2-3 раза быстрее... GPT-5.6 — невероятная модель, безусловно, лучшая в линейке GPT-5»
- Аналогия из статьи: GPT-5.6 — «спортсмен на пике карьеры», достигший потолка своего тренировочного этапа; Fable — «новичок, выбранный в первом раунде драфта», обладающий природным талантом, но совершающий ошибки неопытного игрока
- По данным @llm_under_hood, Fable (от Anthropic) на лидерборде безопасности показал наивысший уровень защиты — ни одна уязвимость не прошла
- При этом Fable зафиксировал 9 отказов работать при малейшей опасности — это рекордный показатель для лидерборда
- Из-за большого числа отказов Fable занял лишь 11-е место в рейтинге, хотя по защите — лучший результат
- Автор источника @llm_under_hood предполагает, что при возвращении старой версии модели Fable мог бы побороться за первые места рейтинга
- Полный текст обзора GPT-5.6 доступен по ссылке signals.forwardfuture.com/gpt-5-6-review/
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖