Alibaba выпустила Qwen3.8-Flash-Next — мультимодальную модель с открытыми весами, которая служит ранним предпросмотром архитектуры будущего Qwen4. Модель понимает текст, изображения и видео, при 125 млрд основных параметров активирует лишь 6 млрд на токен, а контекст доведён до 262 144 токенов нативно и почти до 1M через YaRNi.
По словам источников, обучение обошлось примерно в 9 раз дешевле, чем у Qwen3.7-Plus, при этом новая модель обгоняет и Qwen3.7-Plus, и DeepSeek-V4-Flash по большинству бенчмарков — особенно в программировании и офисных задачах. Схема повторяет ход Alibaba с Qwen3-Next перед релизом Qwen3.5: сначала показывают архитектурные новшества, потом строят на них весь модельный ряд.
- Помимо 125B основных параметров и 6B активных на токен, модель несёт 51B параметров в виде n-gram embeddingsi (таблица из 20 млн би- и триграмм на втором слое) и 4B MTP; архитектура — 48 слоёв, hidden 2560, 512 экспертов, из которых активируются 10 routed + 1 shared
- N-gram-таблицу можно асинхронно оффлоадить в хостовую память (пока только на Nvidia), поэтому эти 51B параметров почти не нагружают VRAM
- Внимание построено на паре GDN (Gated DeltaNet, сжимает историю) + QSA (Qwen Sparse Attention, точный long-range ретрив по микроблокам, а не отдельным токенам); на 4 слоя приходится 3 GDN и 1 QSA, бюджет QSA — 512 блоков / 2048 токенов
- Добавлен Gated Residual: четыре ветки с data-dependent read-гейтом и скалярным write-гейтом на ветку — для большей выразительности между слоями без потери стабильности обучения
- Бенчмарки от вендора: SWE-bench Multilingual 81.0, SWE-bench Pro 62.5, LiveCodeBench v6 91.9, GPQA Diamond 91.7; модель отстаёт на NL2Repo-Bench (48.1 против 54.2 у DeepSeek-V4-Flash) и HLE (35.9 против 40.0 у Opus 4.6)
- К методологии есть вопросы: на DeepSWE берут лучший результат из двух харнессов, HLE судит GPT-4o, а CoWorkBench и RecreationBench — инхаус-бенчи Alibaba
- Цена API: $0.16 за миллион входных токенов и $0.47 за миллион выходных; GGUF-квантизации от Unsloth уже доступны, есть техотчёт на GitHub (QwenLM/Qwen3.8-Flash-Next)
Сообщество ждёт независимых прогонов бенчмарков, поскольку часть цифр — от вендора и на инхаус-тестах. По аналогии с прошлым циклом (Qwen3-Next → Qwen3.5) ожидается, что на этой архитектуре Alibaba построит полноценную линейку моделей Qwen4.
Это произошло: Qwen выпустила Qwen3.8-Flash и открыла веса Qwen3.8-Flash-Next — превью архитектуры Qwen4 →
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖