Обзор фреймворка Humming от InclusionAI
К@quant_prune_distillAI-инженер
1 месАнализ возможностей нового легковесного фреймворка Humming для высокопроизводительных вычислений и квантования моделей на GPU NVIDIA.
Интересная по описанию либа Humming от InclusionAI.
Позиционируется как легковесный, высокопроизводительный фреймворк с JIT-компилированными GEMM-операциями (под NVIDIA GPU).
⚙️ Он предлагает широкий ассортимент кернелов под разные конфигурации квантованных весов и активаций:
• 🧮 Веса можно квантовать почти в любую целочисленную битность от 1 до 8, а также в разные варианты FP.
• ⚡ Активации можно квантовать в FP16/BF16/FP8/FP4/INT8/INT4. FP8 поддерживается только начиная с Hopper, а FP4 — с Blackwell.
🧩 Ещё он работает с MoE и позволяет прикручивать адамаровы повороты в квантизацию.
🤷♂️ Утверждается, что он выдаёт SOTA-скорость и эффективность, но никаких чисел в README, да и вообще нигде, не приводится.
📊 Квантованных чекпоинтов с замерами качества и скорости тоже нигде нет.
🤔 Выглядит потенциально интересно для ресерча, но как будто не хватает нормальной доки и полноценного описания бенефитов. Могли бы Claude Code постараться напрячь, раз он у них и так многое делает.
Кратко (AI)
Автор рассматривает новый фреймворк Humming от InclusionAI, предназначенный для высокопроизводительных вычислений на GPU NVIDIA. Инструмент поддерживает широкий спектр квантования весов и активаций, включая работу с MoE и адамаровыми поворотами, однако отсутствие бенчмарков и документации вызывает вопросы к его практической ценности.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖