Стартап PrismML представил Bonsai 27B — мультимодальную языковую модель на базе Qwen3.6-27B, сжатую до размера, который помещается на смартфон. Обычно модель такого масштаба в 16-битном виде занимает около 54 ГБ, а даже после 4-битного квантования — порядка 18 ГБ, что всё равно не влезает на телефон. PrismML использовала технику Quantization-Aware Trainingi (QAT), при которой веса заранее обучаются адаптироваться к дискретным значениям, а не просто округляются постфактум — это позволило сжать модель в 9–14 раз при потере лишь 5–11% качества.
Вышло две версии: 1-битная на 3,9 ГБ (около 90% качества оригинала) и тернарнаяi (веса −1, 0, +1) на 5,9 ГБ (до 95% качества). Обе поддерживают мультимодальность, рассуждения, кодинг, вызов инструментов (tool calling) и агентные сценарии — то есть это не просто чат-бот, а основа для локальных ИИ-агентов на устройстве.
- 1-битная версия весит 3,9 ГБ и работает на iPhone 17 Pro со скоростью 11 токенов/с
- Контекстное окно модели — 262K токенов
- Модель распространяется опенсорс по лицензии Apache 2.0, веса опубликованы на Hugging Face (коллекция prism-ml/bonsai-27b)
- Для Bonsai сделали демо на WebGPUi, позволяющее запускать модель прямо в браузере через кастомные kernel'ы; по словам Xenova, часть WebGPU-кода помогали писать Fable 5 и GPT 5.6 Sol
- CEO PrismML заявил, что ведёт переговоры с Apple об использовании технологии стартапа в устройствах компании
- По данным Data Secrets, сохранение 89–95% качества достигнуто за счёт QAT: на прямом проходе веса округляются до дискретных значений, а на обратном проходе градиенты считаются как без округления, что даёт модели осмысленный сигнал для обучения даже при дискретных весах
PrismML ведёт переговоры с Apple о возможном использовании технологии сжатия в устройствах компании; сообщество уже тестирует WebGPU-демо и локальный запуск модели на смартфонах, ноутбуках и в браузере.
Это произошло: Bonsai: запуск 1-битной модели Qwen 27B на iPhone →
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖