Ограничения локального инференса LLM
D@datastorieslanguagesAI-инженер
3 недРазбор проблем локального запуска LLM: квантование, размер моделей и нереалистичные обещания по запуску гигантских нейросетей на слабом железе.
Локальный запуск нейросетей требует серьезных компромиссов между качеством ответов и скоростью работы.
- Квантование моделей для экономии памяти снижает точность их работы.
- Использование маленьких моделей ограничивает интеллектуальные способности ИИ.
- Методы запуска огромных моделей на слабом железе часто делают их непригодными для реальных задач из-за крайне низкой скорости генерации.
О локальном инференсе LLM
Регулярно встречаю блогпосты и призывы инференсить LLM на локальном железе.
Но это всегда имеет ограничения. Одни предлагают квантизировать модели в 1b, другие хитро стримить, третьи советуют брать модели поменьне.
Но квантизация заметно ухудшает качество. Мелкие модели тоже похуже
А "хитрый стриминг"...
Вот увидел я пост на медиуме: "Unbelievable! Run Kimi K3–2.8 Trillion Parameters — on a Single 4GB GPU". Думаю - не верю.
Открываю... "This is not fast. Roughly five minutes per token." - не юзабельно
#llm #ai
Кратко (AI)
Автор критикует тренд на локальный запуск LLM, указывая на неизбежные компромиссы в виде потери качества при квантовании или использовании маленьких моделей. Также отмечается непрактичность методов, обещающих запуск огромных моделей на потребительском железе, так как скорость генерации становится неприемлемой для реального использования.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖