← к ленте

Тестирование производительности моделей Qwen 3.8 на локальном железе

D@derplearningAI-инженер
6 дн

Обзор запуска квантованных моделей Qwen 3.8-27b и Qwen 3.8-9b через llama.cpp с замерами скорости генерации и настройками контекста.

Практические данные по запуску современных LLM на домашнем ПК.

  • Демонстрация возможности запуска моделей с большим контекстом на 16 ГБ ОЗУ.
  • Сравнение производительности (t/s) для разных конфигураций квантования.
  • Оценка применимости локальных моделей для задач программирования через инструменты вроде aider.
Наконец дошли руки поковырять Qwen 3.8-27b Как говорится, мое увожение. На мои 16гб комфортно влез Qwen3.8-27B-UD-Q3_K_XL от unsloth --ctx-size 100535 -ngl 99 -fa on --cache-type-k q4_0 --cache-type-v q4_0 --jinja --reasoning-effort medium --no-context-shift --cache-reuse 256 --spec-type draft-mtp --spec-draft-n-max 1 -b 2048 -ub 512 --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0 --tools all выдает 36.77 t/s с контекстом 100535 Еще есть интересный дистилл Qwen3.8-2.4T-A95B -> Qwen 3.5 9b С Qwen3.8-9B-Q8_0 и конфигом --ctx-size 262144 -ngl 99 -fa on --cache-type-k q8_0 --cache-type-v q8_0 --jinja --reasoning-effort low --no-context-shift --cache-reuse 256 --spec-type draft-mtp --spec-draft-n-max 3 -b 2048 -ub 512 --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0 --tools all выдает 85+ t/s с контекстом 262144 В llama.cpp ui / aider ваншотят игры вроде scorched earth, но 9b модель чаще спотыкается. Можно гонять и через claude code/codex, но codex использует новый более сырой апи и одним своим системным промтом сжирает 20к+ токенов :D llama.cpp тут

Кратко (AI)

Автор делится опытом запуска квантованных моделей серии Qwen 3.8 на локальном оборудовании с использованием llama.cpp. Приводятся конкретные параметры запуска для моделей 27b и 9b, а также замеры скорости генерации токенов при больших контекстных окнах.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖