Тестирование производительности Qwen 3.8 27B на разных конфигурациях GPU
Г@gmorevaAI-инженер
1 недСравнительный тест запуска модели Qwen 3.8 27B на RTX 2080, 3090 и 4090 с использованием llama.cpp, GGUF и vLLM.
Понимание реальной производительности LLM на потребительском железе помогает сэкономить на покупке оборудования.
- Сравнение эффективности связки из двух карт против одной флагманской модели.
- Оценка применимости старых видеокарт (RTX 2080) для современных задач ИИ.
- Практические данные по скорости работы моделей в форматах GGUF и FP8.
Запуск Qwen 3.8 27B локально: 2080 vs 2×3090 vs 4090 48GB — llama.cpp, GGUF, vLLM, FP8
Несколько дней активной работы с Qwen 3.8 — и я понял, что эта модель заслуживает нескольких роликов. Выкладываю первый, посвященный именно запуску этой модели.
Показываю ВСЕ варианты запуска на трёх физических серверах: 2×RTX 2080 (22 ГБ), 2×RTX 3090 и RTX 4090 (48 ГБ). GGUF через llama.cpp (Q4_K_M и Q8_0) и FP8 через vLLM. Замеряем скорость чтения и генерации, объём влезающего контекста и реальные цены на видеокарты — чтобы вы могли принять взвешенное решение, что покупать, а что нет.
Спойлер: 2×3090 оказались круче, чем одна 4090 на 48 ГБ. И по чтению, и по генерации. А 2080 на FP8 через vLLM — это боль.
Ссылки на видео на всех площадках:
📹 YouTube | VK | Rutube | Dzen 📹
Кратко (AI)
Автор проводит сравнительный тест производительности модели Qwen 3.8 27B на различных конфигурациях видеокарт: 2×RTX 2080, 2×RTX 3090 и RTX 4090. В видео анализируются скорость генерации и чтения при использовании форматов GGUF и FP8 через инструменты llama.cpp и vLLM.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖