← к умной ленте

Локальный инференс LLM: почему обещания «запустить триллионы параметров на слабом GPU» не работают

AI-редакция
2 источника · показать все· свернуть
собирается · 2обновлено 3 нед назад

Авторы каналов «Data, Stories and Languages» и «Сиолошная» разобрали популярные советы по запуску больших языковых моделей на локальном железе и показали, что все предлагаемые методы имеют серьёзные ограничения. Квантизацияi моделей до 1b заметно ухудшает качество, а использование более мелких моделей само по себе снижает результат.

Особое внимание уделено «хитрому стримингу» — методу, который якобы позволяет запускать гигантские модели на слабых видеокартах. На практике такой подход оказывается неюзабельным из-за экстремально низкой скорости.

2.8 триллионазаявленное число параметров модели Kimi K3
4GBобъём памяти GPU в заявлении
пять минут на токенреальная скорость инференса
  • Автор нашёл на Medium пост с заголовком «Unbelievable! Run Kimi K3i–2.8 Trillion Parameters — on a Single 4GB GPU», обещающий запуск модели с 2.8 триллиона параметров на GPU с 4GB памяти
  • При проверке оказалось, что скорость инференсiа — примерно пять минут на один токен («Roughly five minutes per token»)
  • Автор делает вывод: «не юзабельно»
  • Квантизация моделей (например, до 1b) заметно ухудшает качество генерации
  • Использование меньших моделей вместо крупных также ведёт к снижению качества

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖