Обзор запуска квантованных моделей Qwen 3.8-27b и Qwen 3.8-9b через llama.cpp с замерами скорости генерации и настройками контекста.
Наконец дошли руки поковырять Qwen 3.8-27b
Как говорится, мое увожение.
На мои 16гб комфортно влез
Qwen3.8-27B-UD-Q3_K_XL от unsloth
--ctx-size 100535 -ngl 99 -fa on --cache-type-k q4_0 --cache-type-v q4_0 --jinja --reasoning-effort medium --no-context-shift --cache-reuse 256 --spec-type draft-mtp --spec-draft-n-max 1 -b 2048 -ub 512 --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0 --tools all
выдает 36.77 t/s с контекстом 100535
Еще есть интересный дистилл Qwen3.8-2.4T-A95B -> Qwen 3.5 9b
С
Qwen3.8-9B-Q8_0 и конфигом
--ctx-size 262144 -ngl 99 -fa on --cache-type-k q8_0 --cache-type-v q8_0 --jinja --reasoning-effort low --no-context-shift --cache-reuse 256 --spec-type draft-mtp --spec-draft-n-max 3 -b 2048 -ub 512 --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0 --tools all
выдает 85+ t/s с контекстом 262144
В llama.cpp ui / aider ваншотят игры вроде scorched earth, но 9b модель чаще спотыкается.
Можно гонять и через claude code/codex, но codex использует новый более сырой апи и одним своим системным промтом сжирает 20к+ токенов :D
llama.cpp
тутКратко (AI)
Автор делится опытом запуска квантованных моделей серии Qwen 3.8 на локальном оборудовании с использованием llama.cpp. Приводятся конкретные параметры запуска для моделей 27b и 9b, а также замеры скорости генерации токенов при больших контекстных окнах.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖