Обзор локальной модели Muse Glimmer 30B и гайд по запуску LLM
т@techn0danyaAI-инженер
2 недАвтор тестирует новую модель Muse Glimmer 30B от Meta на MacBook Air M5 и делится опытом запуска локальных LLM, включая разбор форматов и производительности.
Практический опыт запуска тяжелых нейросетей на потребительском железе помогает понять реальные ограничения локального ИИ.
- Демонстрация производительности модели Muse Glimmer 30B на актуальном оборудовании Apple.
- Разбор технических нюансов (квантование, пропускная способность памяти), влияющих на скорость генерации.
- Базовый ликбез по запуску локальных LLM для начинающих пользователей.
💫 Как Даня в мир локальных моделей ходил
Meta вчера выложила Muse Glimmer 30B — агентную мультимодалку под Apache 2.0, специально заточенную под локальный запуск.
Я потратил на неё весь день. MacBook Air M5, 32 гига. Не Pro, не Max — там вентилятора вообще нет.
Что получилось:
→ Прогнал 7 квантизаций. Кривая линейная: скорость упирается ровно в размер файла. 7.6 t/s на Q4_K_XL, 8.5 на IQ3_M.
→ DFlash — их спекулятивный декодер, который обещает 3.1x на 5090 и 1.8x на M5 Max — выдал у меня −60%. Не ускорение. Замедление. И я разобрался почему: всё упирается в отношение флопсов к пропускной способности памяти, и на базовом M5 блок из 16 токенов уже за порогом окупаемости.
→ Нашёл пол по размеру: IQ3_XXS (13.1 ГБ) оказался медленнее, чем IQ3_M (14.1 ГБ). Файл меньше — скорость ниже. Модель «всё решает пропускная способность» на этом ломается.
Заодно написал большой текст про локальные LLM вообще — всё то, что мне никто не объяснил на старте:
- почему одна и та же модель лежит в пяти репозиториях
- что значит UD-IQ3_XXS и зачем там четырнадцать файлов
- чем GGUF отличается от safetensors — и почему из-за этого пришлось собирать llama.cpp из исходников
- dense vs MoE, и почему для мака это главный вопрос при выборе модели
- почему 32 гигов достаточно, а разговоры про 128 только отпугивают людей
В конце — гайд: поднять модель и подключить к OpenCode. Копипастой.
Мне будет очень приятно, если отпишите комменты на хабре типо "да, круто, давай-давай" или что-то в этом духе.
Ссылка на Хабр 👇
#AI
@techn0danya

Кратко (AI)
Автор протестировал новую мультимодальную модель Muse Glimmer 30B от Meta на MacBook Air M5, проанализировав влияние квантования и спекулятивного декодера DFlash на скорость работы. Помимо тестов, в посте представлен подробный гайд по основам запуска локальных LLM, включая объяснение форматов GGUF, safetensors и различий между архитектурами dense и MoE.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖