← к ленте

Обзор локальной модели Muse Glimmer 30B и гайд по запуску LLM

т@techn0danyaAI-инженер
2 нед

Автор тестирует новую модель Muse Glimmer 30B от Meta на MacBook Air M5 и делится опытом запуска локальных LLM, включая разбор форматов и производительности.

Практический опыт запуска тяжелых нейросетей на потребительском железе помогает понять реальные ограничения локального ИИ.

  • Демонстрация производительности модели Muse Glimmer 30B на актуальном оборудовании Apple.
  • Разбор технических нюансов (квантование, пропускная способность памяти), влияющих на скорость генерации.
  • Базовый ликбез по запуску локальных LLM для начинающих пользователей.
💫 Как Даня в мир локальных моделей ходил Meta вчера выложила Muse Glimmer 30B — агентную мультимодалку под Apache 2.0, специально заточенную под локальный запуск. Я потратил на неё весь день. MacBook Air M5, 32 гига. Не Pro, не Max — там вентилятора вообще нет. Что получилось: → Прогнал 7 квантизаций. Кривая линейная: скорость упирается ровно в размер файла. 7.6 t/s на Q4_K_XL, 8.5 на IQ3_M. → DFlash — их спекулятивный декодер, который обещает 3.1x на 5090 и 1.8x на M5 Max — выдал у меня −60%. Не ускорение. Замедление. И я разобрался почему: всё упирается в отношение флопсов к пропускной способности памяти, и на базовом M5 блок из 16 токенов уже за порогом окупаемости. → Нашёл пол по размеру: IQ3_XXS (13.1 ГБ) оказался медленнее, чем IQ3_M (14.1 ГБ). Файл меньше — скорость ниже. Модель «всё решает пропускная способность» на этом ломается. Заодно написал большой текст про локальные LLM вообще — всё то, что мне никто не объяснил на старте: - почему одна и та же модель лежит в пяти репозиториях - что значит UD-IQ3_XXS и зачем там четырнадцать файлов - чем GGUF отличается от safetensors — и почему из-за этого пришлось собирать llama.cpp из исходников - dense vs MoE, и почему для мака это главный вопрос при выборе модели - почему 32 гигов достаточно, а разговоры про 128 только отпугивают людей В конце — гайд: поднять модель и подключить к OpenCode. Копипастой. Мне будет очень приятно, если отпишите комменты на хабре типо "да, круто, давай-давай" или что-то в этом духе. Ссылка на Хабр 👇 #AI @techn0danya
Обзор локальной модели Muse Glimmer 30B и гайд по запуску LLM

Кратко (AI)

Автор протестировал новую мультимодальную модель Muse Glimmer 30B от Meta на MacBook Air M5, проанализировав влияние квантования и спекулятивного декодера DFlash на скорость работы. Помимо тестов, в посте представлен подробный гайд по основам запуска локальных LLM, включая объяснение форматов GGUF, safetensors и различий между архитектурами dense и MoE.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖