Тестирование производительности моделей Qwen 3.8 на локальном железе
Liquid AI представила метод Quantization-Aware Distillation для 4-битных моделей

Вопрос о производительности квантованных моделей и шине PCI-E

Метод квантования моделей через диагональное разложение Гессиана
QUASAR: улучшение Quantization-Aware Training через учет кривизны

Влияние квантования на качество моделей до 9B

Cactus Compute выпустил Needle 2 — модель на 14 МБ для вызова функций на edge-устройствах
Стартап Cactus Compute представил Needle 2 — открытую модель с 45M параметров, заточенную под tool callingi (вызов функций) и извлечение структурированных данных в формате JSON. Чекпоинт весит всего 14 МБ и требует около 28 МБ RAM на всю сессию, что делает модель пригодной для IoT, носимых устройств и голосового управления даже на слабом или старом оборудовании.
По заявленным бенчмаркам Needle 2 идёт вровень с FunctionGemma 270M, LFM 2.5 230M и Apple FM, при этом будучи в 5–70 раз меньше их по размеру. Модель уже используется в реальном продукте: Pebble гоняет её локально в приложении для своего кольца без экрана.
Локальный инференс LLM: почему обещания «запустить триллионы параметров на слабом GPU» не работают
Авторы каналов «Data, Stories and Languages» и «Сиолошная» разобрали популярные советы по запуску больших языковых моделей на локальном железе и показали, что все предлагаемые методы имеют серьёзные ограничения. Квантизацияi моделей до 1b заметно ухудшает качество, а использование более мелких моделей само по себе снижает результат.
Особое внимание уделено «хитрому стримингу» — методу, который якобы позволяет запускать гигантские модели на слабых видеокартах. На практике такой подход оказывается неюзабельным из-за экстремально низкой скорости.
Методика оценки качества квантованных моделей

Вопрос о целесообразности использования LLM-as-a-judge для оценки квантованных моделей

Gemma 4 31B и gpt-oss-120B на чипах Cerebras вышли на фронтир скорости LLM-бенчмарка
Автор канала @llm_under_hood (по совету @AigizK) протестировал модель Gemma 4 31B, запущенную на специализированных чипах Cerebrasi, на агентском бенчмарке под бизнес-задачи. С выключенным reasoning (он тормозит и спотыкается о structured outputs) модель сдвинула фронтир скорости бенчмарка и оказалась совсем рядом с GPT-5.4 mini по качеству и цене — при этом её, в отличие от закрытой GPT-5.4 mini, можно скачать и запускать локально.
Через два дня выяснилось, что эффект не ограничивается одной моделью: запуск gpt-oss-120B на том же железе Cerebras во всех трёх режимах reasoning (high, medium, low) тоже выводит её на speed frontier, а medium-режим дополнительно попадает на cost-фронтир по эффективности. Вывод автора — дело не столько в конкретной модели, сколько в самом железе Cerebras, которое команды уже используют для near-realtime AI-решений.
ВыводCerebras выпускает wafer-scale engines — чипы, которые примерно в 50 раз крупнее самых больших GPU, что делает железо дорогим и специализированным, но позволяет запускать небольшие модели на очень высоких скоростях
Обзор фреймворка Humming от InclusionAI
Bonsai: запуск 1-битной модели Qwen 27B на iPhone
Влияние квантования на логические способности моделей
Использование FP4 квантования в продакшене
PrismML выпустила Bonsai 27B — локальную LLM на 27 млрд параметров, работающую на iPhone
Стартап PrismML представил Bonsai 27B — мультимодальную языковую модель на базе Qwen3.6-27B, сжатую до размера, который помещается на смартфон. Обычно модель такого масштаба в 16-битном виде занимает около 54 ГБ, а даже после 4-битного квантования — порядка 18 ГБ, что всё равно не влезает на телефон. PrismML использовала технику Quantization-Aware Trainingi (QAT), при которой веса заранее обучаются адаптироваться к дискретным значениям, а не просто округляются постфактум — это позволило сжать модель в 9–14 раз при потере лишь 5–11% качества.
Вышло две версии: 1-битная на 3,9 ГБ (около 90% качества оригинала) и тернарнаяi (веса −1, 0, +1) на 5,9 ГБ (до 95% качества). Обе поддерживают мультимодальность, рассуждения, кодинг, вызов инструментов (tool calling) и агентные сценарии — то есть это не просто чат-бот, а основа для локальных ИИ-агентов на устройстве.
Проблема утечки данных в тестах квантованных моделей
Как измерить «отупение» модели после квантования — вопрос без ответа
Автор канала The ExtremeCode Times поднял проблему: стандартные метрики (perplexityi, MMLUi) показывают лишь небольшую просадку у квантованных моделей по сравнению с оригинальными весами, но это плохо соотносится с реальным ощущением деградации при ручном тестировании. Методика, которая работает для выбора лучшей модели среди нескольких кандидатов (прогнать через бенчмарк и взять максимум баллов), не подходит для оценки, насколько именно «поглупела» модель после квантования.