← к умной ленте

Cactus Compute выпустил Needle 2 — модель на 14 МБ для вызова функций на edge-устройствах

AI-редакция
2 источника · показать все· свернуть
собирается · 2обновлено 2 нед назад

Стартап Cactus Compute представил Needle 2 — открытую модель с 45M параметров, заточенную под tool callingi (вызов функций) и извлечение структурированных данных в формате JSON. Чекпоинт весит всего 14 МБ и требует около 28 МБ RAM на всю сессию, что делает модель пригодной для IoT, носимых устройств и голосового управления даже на слабом или старом оборудовании.

По заявленным бенчмаркам Needle 2 идёт вровень с FunctionGemma 270M, LFM 2.5 230M и Apple FM, при этом будучи в 5–70 раз меньше их по размеру. Модель уже используется в реальном продукте: Pebble гоняет её локально в приложении для своего кольца без экрана.

14 МБразмер бинарника/чекпоинта модели
45Mчисло параметров модели
500 ток/сскорость декода на Raspberry Pi 5
  • Модель квантована по проприетарной технике CQ-2biti, причём квантизация получается прямо в процессе обучения (Quantization Aware Trainingi), а не применяется постфактум
  • Скорость: 800+ ток/с на префилле и 500+ ток/с на декоде на Raspberry Pi 5; на старых телефонах — 300–700 ток/с
  • Архитектура основана на собственной разработке Cactus Compute — Simple Attention Network, с элементами mHC, Engram, Hadamard MLP (веса параметризованы как произведение диагональной и Адамаровой матрицы), а также GQA + Sliding Attention + «синки» для тулов
  • На предобучение потрачено 115B токенов, на посттрейн — 38B токенов, что на порядки меньше объёмов, использованных для LFM
  • Оценка проводилась на бенчмарках Mobile Actions, Droid Call, Seal-Tools и BFCL v4
  • По мнению автора первого источника, LFM2.5 230M всё же «поумнее» и больше подходит для среднего компьютера, чем Needle 2
  • Модель распространяется по лицензии Apache 2.0, веса опубликованы на Hugging Face, доступен файнтюнинг под конкретные задачи

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖