← к ленте

Cactus Compute представили модель Needle 2 для edge-устройств

К@quant_prune_distillAI-инженер
2 нед

Стартап Cactus Compute выпустил Needle 2 — компактную модель весом 14 Мб для tool calling на edge-устройствах с высокой скоростью генерации.

Появление сверхлегких моделей позволяет запускать сложные ИИ-функции прямо на смартфонах и IoT-устройствах без интернета.

  • Модель весом 14 Мб может работать локально на устройствах с ограниченными ресурсами.
  • Высокая скорость генерации (500+ tok/s) делает возможным мгновенное выполнение команд.
  • Технология позволяет эффективно использовать ИИ для управления приложениями и устройствами без облачных вычислений.
📄 Блогпост 🌵 Стартап Cactus Compute выпустил крохотную модель Needle 2 с весом чекпоинта всего 14 Mb для tool calling и работы со структурированными входа для edge устройств. Исходная модель имеет 45M параметров, поверх нее применяется CQ-2bit квантизация (некая проприетарная техника). Квантизация получается в процессе обучения (Quantization Aware Training). ⚡ Скорость На префилле скорость 800+ tok/s, и 500+ tok/s на декоде на Raspberry Pi 5. Еще оно якобы быстро генерит на VR устройствах и Samsung-ах. 🏗️ Архитектура Архитектура основана на ихней же работе Simple Attention Network. Там немало архитектурных прибамбасов: • mHC • Engram • Hadamard MLP. Дабы сэкономить на параметры, параметризуют веса как произведение диагональной на Адамарову матрицу. • GQA + Sliding Attention + синки для тулов Needle 2 производит меньше операций на токен против традиционной трансформерной архитектуры. 📚 Обучение На обучение потратили 115B токенов из проприетарных токенов и 38B на посттрейн, что на порядки меньше, чем у LFM. 📊 Бенчмарки Модель оценивают на бенчмарках: • Mobile Actions • Droid Call • Seal-Tools • BFCL v4 🎯 Оно выходит по качеству близко к Function Gemma 270M, LFM 2.5 230M, Apple FM, будучи при этом гораздо меньше.

Кратко (AI)

Стартап Cactus Compute представил модель Needle 2 весом 14 Мб, предназначенную для работы с инструментами на edge-устройствах. Модель использует архитектуру Simple Attention Network и метод квантования CQ-2bit, что позволяет достичь высокой скорости генерации на Raspberry Pi 5 и других компактных устройствах.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖