← к умной ленте

Gemma 4 31B и gpt-oss-120B на чипах Cerebras вышли на фронтир скорости LLM-бенчмарка

Автор канала @llm_under_hood (по совету @AigizK) протестировал модель Gemma 4 31B, запущенную на специализированных чипах Cerebrasi, на агентском бенчмарке под бизнес-задачи. С выключенным reasoning (он тормозит и спотыкается о structured outputs) модель сдвинула фронтир скорости бенчмарка и оказалась совсем рядом с GPT-5.4 mini по качеству и цене — при этом её, в отличие от закрытой GPT-5.4 mini, можно скачать и запускать локально.

Через два дня выяснилось, что эффект не ограничивается одной моделью: запуск gpt-oss-120B на том же железе Cerebras во всех трёх режимах reasoning (high, medium, low) тоже выводит её на speed frontier, а medium-режим дополнительно попадает на cost-фронтир по эффективности. Вывод автора — дело не столько в конкретной модели, сколько в самом железе Cerebras, которое команды уже используют для near-realtime AI-решений.

31Bразмер параметров Gemma 4
120Bразмер параметров gpt-oss
50во сколько раз чип Cerebras крупнее GPU
  • Cerebras выпускает wafer-scale enginesi — чипы, которые примерно в 50 раз крупнее самых больших GPU, что делает железо дорогим и специализированным, но позволяет запускать небольшие модели на очень высоких скоростях
  • OpenAI, по словам автора, гоняет некоторые модели GPT-5 именно на железе Cerebras
  • Публичный API Cerebras поддерживает inference только трёх тщательно отобранных моделей: gemma-4-31b, zai-glm-4.7 и gpt-oss-120b; zai-glm-4.7 будет убрана из линейки через месяц
  • Модели на Cerebras используют selective weight-only quantizationi для сжатия под железо, из-за чего их поведение может немного отличаться от стандартных версий
  • Gemma 4 31B можно запускать локально и в ускоренном режиме на выделенном железе TT-QuietBox 2 (Blackhole) от Tenstorrent
  • Автор обычно предпочитает модели OpenAI как наиболее способные в бизнес-задачах, поэтому появление конкурентов на фронтире отмечает как позитив
Что дальше

Команды, строящие near-realtime AI-решения, уже используют gpt-oss-120B на Cerebras и изучают переезд на более свежую gemma-4-31b; при этом zai-glm-4.7 будет снята с публичного API Cerebras через месяц.

Здесь появится ссылка, когда это произойдёт.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖