Релиз архитектуры Qwen 4 от Alibaba
т@techn0danyaAI-инженер
2 днОбзор новой архитектуры Qwen 4: 125B параметров, инновации в Gated DeltaNet, QSA и асинхронный оффлоад эмбеддингов для локального запуска.
Новая архитектура позволяет запускать мощные ИИ-модели на обычном домашнем компьютере.
- Технология оффлоада эмбеддингов снижает требования к видеопамяти (VRAM).
- Оптимизация внимания (QSA) ускоряет обработку длинных текстов.
- Появление GGUF-версий от Unsloth делает модель доступной для энтузиастов сразу после релиза.
🎁 Каждый день как праздник
Только две недели назад Alibaba релизнули абсолютно прорывной Qwen-3.8-27B, который заставляет задумать об оплате ИИ подписок, при наличии достаточно мощного железа, а тут уже новый релиз на архитектуре Qwen 4.
Ход тот же, что был с Qwen3-Next перед Qwen3.5: сначала показываем архитектурные изменения, потом на них строим весь модельный ряд.
125B параметров основной модели, 6B активных на токен, плюс 51B n-gram эмбеддингов и 4B MTP. 48 слоёв, hidden 2560, 512 экспертов — активируются 10 routed + 1 shared. Контекст 262 144 нативно, до 1M через YaRN. Мультимодалка — картинки и видео на входе.
😒 А что собственно говоря нового?
Внимание. Пара Gated DeltaNet + Gated Attention превратилась в GDN + QSA (Qwen Sparse Attention). Три слоя из четырёх — Gated DeltaNet, который сжимает историю, четвёртый — QSA для точного long-range ретрива. Ключевой момент: QSA отбирает не отдельные токены, а микроблоки — и это заметно срезает латентность на длинном контексте. Бюджет — 512 блоков / 2048 токенов.
Residual. Gated Residual: четыре ветки, data-dependent поэлементный read-гейт и скалярный write-гейт на ветку. Больше выразительности между слоями без потери стабильности обучения.
Эмбеддинги. 20 миллионов би- и триграмм на втором слое, 51B параметров лукап-таблицы — и вот это самое интересное для локалок: таблицу можно асинхронно оффлоадить в хостовую память (пока только на Nvidia). То есть ёмкость растёт, а VRAM — нет.
По бенчам (все — от вендора): SWE-bench Multilingual 81.0, SWE-bench Pro 62.5, LiveCodeBench v6 91.9, GPQA Diamond 91.7. Отстаёт на NL2Repo-Bench (48.1 против 54.2 у DeepSeek-V4-Flash) и HLE (35.9 против 40.0 у Opus 4.6).
К методологии есть вопросы: на DeepSWE берут лучший результат из двух харнессов, HLE судит GPT-4o, CoWorkBench и RecreationBench — вообще инхаус-бенчи. Так что ждём независимых прогонов.
GGUF от Unsloth уже лежат.
То есть как будто бы и да, и вот сейчас с пацанами запустим аналог Claude 4.6 у себя дома даже без мегасуперпупер видяхи. Самое интересно конечно это дело с FastToken затестить, можем даже соревноваться в комментариях.
#AI
@techn0danya

Кратко (AI)
Alibaba представила архитектуру Qwen 4, включающую 125B параметров и инновационные механизмы Gated DeltaNet и Qwen Sparse Attention для оптимизации работы с длинным контекстом. Одной из ключевых особенностей стала возможность асинхронного оффлоада эмбеддингов в хостовую память, что позволяет запускать модель на потребительском железе. Автор отмечает необходимость независимых тестов, так как текущие бенчмарки предоставлены самим вендором.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖