llamacppСбросить фильтр ×

DFlash 2: новый метод спекулятивного декодирования ускоряет LLM в разы

Вышло второе поколение DFlash — техники спекулятивного декодирования для ускорения инференса больших языковых моделей. Первое поколение DFlash уже стало отраслевым стандартом, набрав 3,5 млн загрузок на Hugging Face. Суть подхода: маленькая модель быстро предсказывает кусок текста, а большая проверяет его одним проходом вместо того, чтобы генерировать по слову — итоговый текст полностью идентичен оригиналу, но выдаётся быстрее.

На практике это уже проверили с моделью Qwen3.8-27B: на ноутбуке она выдаёт 70 токенов/с вместо обычных ~15–20, а ускорение достигает 2.7–4.6 раз в зависимости от модели и настроек.

3.5 млнзагрузок DFlash 1 на Hugging Face
70 токенов/сскорость Qwen3.8-27B на ноутбуке с DFlash 2
2.7–4.6 разадиапазон ускорения инференса

Полный разбор →

Тестирование производительности моделей Qwen 3.8 на локальном железе

D@derplearningAI-инженер
6 дн

Meta выпустила открытую агентную модель Muse Glimmer 30B

AI-редакция
19 источников · показать все· свернуть
CodeCampMeta выпустила Muse Glimmer: 30B модель для локального запускаKali NovskayaMeta Superintelligence Labs выпустила открытую LLM Muse Glimmer 30BНавука и моя жизнбMeta Superintelligence Labs выпустила открытую LLM Muse Glimmer 30BНавука и моя жизнбВыход модели Muse и сравнение с LlamaLove. Death. Transformers.Meta Superintelligence Labs выпускает открытую LLM Muse Glimmer 30BБлоGнотMeta выпустила открытую модель Muse Glimmer на 30 млрд параметровэйай ньюзMeta выпустила мультимодальную модель Muse Glimmer 30BMashkka про Data ScienceMeta Superintelligence Labs выпускает открытую LLM Muse Glimmer 30BData, Stories and LanguagesMeta Superintelligence Labs выпускает открытую LLM Muse Glimmer 30BKali NovskayaРелиз Muse Glimmer на Hugging Facevc.ruMeta представила открытую агентную модель Muse GlimmerKali NovskayaРелиз квантованных версий модели Muse-Glimmer-30BGPT/ChatGPT/AI Central Александра ГорногоMeta выпустила локальную агентную модель Muse GlimmerKali NovskayaРесурсы для запуска модели Muse Glimmer 30BтехноданяMeta Superintelligence Lab выпустили открытую модель Muse GlimmerMachinelearningMeta представила Muse Glimmer — 30B модель для агентных системНейронавт | Нейросети в творчествеMuse Glimmer: 30B опенсорсная агентная модель от Meta Superintelligence LabsХайтек+Meta выпустила открытую ИИ-модель Muse GlimmerтехноданяОбзор локальной модели Muse Glimmer 30B и гайд по запуску LLM
хайп · 19обновлено 2 нед назад

Meta Superintelligence Labs представила Muse Glimmer — открытую dense-модель на 30 млрд параметров (точнее 29.6B), дистиллированную из более крупной закрытой Muse Spark. Модель заточена под локальных ИИ-агентов: работает с инструментами, пишет код, понимает изображения и видео, восстанавливается после ошибок инструментов, поддерживает более 100 языков и контекст 131К токенов. Веса выложены на Hugging Face под лицензией Apache 2.0, доступны официальные квантизации, GGUFi, MLX и ExecuTorch-версии.

Главная фишка — модель реально помещается на потребительское железо: при 4-битном квантовании она весит меньше 20 ГБ и работает на одной видеокарте (RTX 5090, Mac с M4/M5 Max) с 24–32 ГБ памяти. По заявленным бенчмаркам Glimmer обходит Qwen 3.6 27B и Gemma 4 31B в своём классе. Это первый заметный открытый релиз LLM от Meta с апреля 2025 года и первая модель такого размерного класса с Code Llama 34B (август 2023).

30 млрдпараметров модели
233 токена/секскорость на RTX 5090
меньше 20 ГБразмер весов при 4-бит квантовании

Полный разбор →

Эффективность локальных LLM для разработки: стоит ли игра свеч?

D@datastorieslanguagesAI-инженер
1 мес

Это всё на сейчас.