← к ленте

Тестирование производительности Qwen 3.8 27B на разных конфигурациях GPU

Г@gmorevaAI-инженер
1 нед

Сравнительный тест запуска модели Qwen 3.8 27B на RTX 2080, 3090 и 4090 с использованием llama.cpp, GGUF и vLLM.

Понимание реальной производительности LLM на потребительском железе помогает сэкономить на покупке оборудования.

  • Сравнение эффективности связки из двух карт против одной флагманской модели.
  • Оценка применимости старых видеокарт (RTX 2080) для современных задач ИИ.
  • Практические данные по скорости работы моделей в форматах GGUF и FP8.
Запуск Qwen 3.8 27B локально: 2080 vs 2×3090 vs 4090 48GB — llama.cpp, GGUF, vLLM, FP8 Несколько дней активной работы с Qwen 3.8 — и я понял, что эта модель заслуживает нескольких роликов. Выкладываю первый, посвященный именно запуску этой модели. Показываю ВСЕ варианты запуска на трёх физических серверах: 2×RTX 2080 (22 ГБ), 2×RTX 3090 и RTX 4090 (48 ГБ). GGUF через llama.cpp (Q4_K_M и Q8_0) и FP8 через vLLM. Замеряем скорость чтения и генерации, объём влезающего контекста и реальные цены на видеокарты — чтобы вы могли принять взвешенное решение, что покупать, а что нет. Спойлер: 2×3090 оказались круче, чем одна 4090 на 48 ГБ. И по чтению, и по генерации. А 2080 на FP8 через vLLM — это боль. Ссылки на видео на всех площадках: 📹 YouTube | VK | Rutube | Dzen 📹

Кратко (AI)

Автор проводит сравнительный тест производительности модели Qwen 3.8 27B на различных конфигурациях видеокарт: 2×RTX 2080, 2×RTX 3090 и RTX 4090. В видео анализируются скорость генерации и чтения при использовании форматов GGUF и FP8 через инструменты llama.cpp и vLLM.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖