Команда Qwen (Alibaba) представила Qwen3.8-Flash — мультимодальную MoEi-модель, а также открыла веса Qwen3.8-Flash-Next, ранней версии архитектуры, которую компания исследует для будущей Qwen4. Модель насчитывает 125B параметров плюс 51B «N-gram»-эмбеддингов, но активирует на токен всего 6B — за счёт этого обучение обошлось примерно в 9 раз дешевле, чем у Qwen3.7-Plus.
По заявленным бенчмаркам модель обходит Qwen3.8-27B и DeepSeek-V4-Flash, а по данным Data Secrets — превосходит Claude Opus 4.6 Max на 8 из 9 тестов. Благодаря компактному числу активных параметров и поддержке GGUF-квантизации модель можно запускать локально на машинах с 128 ГБ памяти (DGX Spark, Mac Studio, Strix Halo), что делает её заметным событием для локального инференса топового уровня качества.
- Архитектура включает четыре новшества: N-gram эмбеддингиi (таблица-lookup вместо матричного умножения, дающая «дешёвую память»), гибридное внимание Gated DeltaNet (GDN) + Qwen Sparse Attention (QSA), Gated Residual connections и оптимизатор Muon вместо Adam
- Нативный контекст — 262K токенов, расширяется до 1M через YaRN; на контексте 1M prefill ускорился в 7,6 раза, decode — в 4,9 раза (по данным Data Secrets)
- Бенчмарки: DeepSWE 1.1 — 58.7, SWE-bench Pro — 62.5, CoWorkBench — 73.9, AndroidWorld — 84.5, MathVision — 95.7
- Продакшен-версия доступна в QwenCloud по цене $0.16 за 1M входных токенов и $0.47 за 1M выходных; модель также появилась на OpenRouter (qwen/qwen3.8-flash)
- Локальный запуск обеспечивают GGUF-веса от Unsloth — модель работает на ~75 ГБ RAM, поддерживает CPU RAM и unified memory, а инференс поддержан vLLM и SGLang
- 3DNews отмечает, что Alibaba позиционирует Qwen3.8-Flash как более доступную версию, которая должна помочь активнее внедрять флагманскую модель компании
- Источники расходятся в терминологии: Machinelearning и PRO Hi-Tech называют мультимодальной MoE-моделью именно Qwen3.8-Flash, а Qwen3.8-Flash-Next — отдельным превью архитектуры Qwen4; остальные каналы (эйай ньюз, Data Secrets, Derp Learning) используют название Qwen3.8-Flash-Next как основное для той же модели 125B+51B/A6B
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖