← к ленте

Ограничения локального инференса LLM

С@seeallochnayaAI-инженер
3 нед

Разбор проблем локального запуска LLM: квантование, размер моделей и нереалистичные обещания по запуску гигантских нейросетей на слабом железе.

Локальный запуск нейросетей требует серьезных компромиссов между качеством ответов и скоростью работы.

  • Квантование моделей для экономии памяти снижает точность их работы.
  • Использование маленьких моделей ограничивает интеллектуальные способности ИИ.
  • Методы запуска огромных моделей на слабом железе часто делают их непригодными для реальных задач из-за крайне низкой скорости генерации.
О локальном инференсе LLM Регулярно встречаю блогпосты и призывы инференсить LLM на локальном железе. Но это всегда имеет ограничения. Одни предлагают квантизировать модели в 1b, другие хитро стримить, третьи советуют брать модели поменьне. Но квантизация заметно ухудшает качество. Мелкие модели тоже похуже А "хитрый стриминг"... Вот увидел я пост на медиуме: "Unbelievable! Run Kimi K3–2.8 Trillion Parameters — on a Single 4GB GPU". Думаю - не верю. Открываю... "This is not fast. Roughly five minutes per token." - не юзабельно #llm #ai

Кратко (AI)

Автор критикует тренд на локальный запуск LLM, указывая на неизбежные компромиссы в виде потери качества при квантовании или использовании маленьких моделей. Также отмечается непрактичность методов, обещающих запуск огромных моделей на потребительском железе, так как скорость генерации становится неприемлемой для реального использования.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖