← к ленте

Релиз архитектуры Qwen 4 от Alibaba

т@techn0danyaAI-инженер
2 дн

Обзор новой архитектуры Qwen 4: 125B параметров, инновации в Gated DeltaNet, QSA и асинхронный оффлоад эмбеддингов для локального запуска.

Новая архитектура позволяет запускать мощные ИИ-модели на обычном домашнем компьютере.

  • Технология оффлоада эмбеддингов снижает требования к видеопамяти (VRAM).
  • Оптимизация внимания (QSA) ускоряет обработку длинных текстов.
  • Появление GGUF-версий от Unsloth делает модель доступной для энтузиастов сразу после релиза.
🎁 Каждый день как праздник Только две недели назад Alibaba релизнули абсолютно прорывной Qwen-3.8-27B, который заставляет задумать об оплате ИИ подписок, при наличии достаточно мощного железа, а тут уже новый релиз на архитектуре Qwen 4. Ход тот же, что был с Qwen3-Next перед Qwen3.5: сначала показываем архитектурные изменения, потом на них строим весь модельный ряд. 125B параметров основной модели, 6B активных на токен, плюс 51B n-gram эмбеддингов и 4B MTP. 48 слоёв, hidden 2560, 512 экспертов — активируются 10 routed + 1 shared. Контекст 262 144 нативно, до 1M через YaRN. Мультимодалка — картинки и видео на входе. 😒 А что собственно говоря нового? Внимание. Пара Gated DeltaNet + Gated Attention превратилась в GDN + QSA (Qwen Sparse Attention). Три слоя из четырёх — Gated DeltaNet, который сжимает историю, четвёртый — QSA для точного long-range ретрива. Ключевой момент: QSA отбирает не отдельные токены, а микроблоки — и это заметно срезает латентность на длинном контексте. Бюджет — 512 блоков / 2048 токенов. Residual. Gated Residual: четыре ветки, data-dependent поэлементный read-гейт и скалярный write-гейт на ветку. Больше выразительности между слоями без потери стабильности обучения. Эмбеддинги. 20 миллионов би- и триграмм на втором слое, 51B параметров лукап-таблицы — и вот это самое интересное для локалок: таблицу можно асинхронно оффлоадить в хостовую память (пока только на Nvidia). То есть ёмкость растёт, а VRAM — нет. По бенчам (все — от вендора): SWE-bench Multilingual 81.0, SWE-bench Pro 62.5, LiveCodeBench v6 91.9, GPQA Diamond 91.7. Отстаёт на NL2Repo-Bench (48.1 против 54.2 у DeepSeek-V4-Flash) и HLE (35.9 против 40.0 у Opus 4.6). К методологии есть вопросы: на DeepSWE берут лучший результат из двух харнессов, HLE судит GPT-4o, CoWorkBench и RecreationBench — вообще инхаус-бенчи. Так что ждём независимых прогонов. GGUF от Unsloth уже лежат. То есть как будто бы и да, и вот сейчас с пацанами запустим аналог Claude 4.6 у себя дома даже без мегасуперпупер видяхи. Самое интересно конечно это дело с FastToken затестить, можем даже соревноваться в комментариях. #AI @techn0danya
Релиз архитектуры Qwen 4 от Alibaba

Кратко (AI)

Alibaba представила архитектуру Qwen 4, включающую 125B параметров и инновационные механизмы Gated DeltaNet и Qwen Sparse Attention для оптимизации работы с длинным контекстом. Одной из ключевых особенностей стала возможность асинхронного оффлоада эмбеддингов в хостовую память, что позволяет запускать модель на потребительском железе. Автор отмечает необходимость независимых тестов, так как текущие бенчмарки предоставлены самим вендором.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖