Производительность моделей gpt-oss-120B и gemma-4-31b на железе Cerebras
L@llm_under_hoodAI-инженер
1 месАнализ производительности моделей gpt-oss-120B и gemma-4-31b на ускорителе Cerebras, особенности квантования и ограничения публичного API.
Новые LLM на фронтире бенчмарка - просто добавь Cerebras
Помните, совсем недавно Gemma 4 31B пододвинула фронтир скорости на нашем бенчмарке LLM после запуска на Cerebras?
Я попробовал запустить gpt-oss-120B на нем же, перебирая разные варианты reasoning. И выяснилось, что все три версии - high reasoning, medium и low попадают на speed frontier, двигая его вперед. А medium reasoning при этом еще и оказывается на cost фронтире по эффективности.
Удивительно, насколько хороша и сбалансирована эта, казалось бы, старая модель.
А еще, казалось бы, запускай любые модели на Wafer Scale Engine ускорителе Cerebras и радуйся. Но тут есть пара нюансов:
(1) Cerebras на публичном API поддерживает inference только трех моделей, которые они тщательно отобрали: gemma-4-31b, zai-glm-4.7, gpt-oss-120b. Да и то GLM-4.7 уберут через месяц
(2) Модели используют хитрую квантизацию для сжатия под свое железо (selective weight-only quantization), поэтому их поведение может немного отличаться от стандартных версий.
В общем, создание фронтир решений требует аккуратной балансировки между кучей разных ограничений, и эти ребята умудряются делать это. Не удивительно, что команды, которые нынче строят near-realtime AI решения, используют gpt-oss-120B на Cerebras и изучают переезд на более свежую gemma-4-31b
Ваш, @llm_under_hood 🤗
Кратко (AI)
Автор анализирует работу моделей gpt-oss-120B и gemma-4-31b на аппаратном обеспечении Cerebras, отмечая их высокую скорость и эффективность. Указывается, что использование специфической квантизации и ограниченный список поддерживаемых моделей в API Cerebras накладывают определенные рамки на разработку AI-решений.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖