← к ленте

Выход модели Qwen-3.8 Flash-Next

D@data_secretsAI-инженер
2 дн

Анонс новой модели Qwen-3.8 Flash-Next: архитектура MoE, использование N-gram эмбеддингов и оптимизатора Muon для повышения эффективности.

Новая модель Qwen-3.8 Flash-Next показывает, как можно радикально снизить стоимость обучения ИИ при сохранении высокой производительности.

  • Использование N-gram эмбеддингов позволяет модели запоминать частые последовательности токенов без лишних вычислений.
  • Оптимизатор Muon и архитектурные улучшения снизили стоимость обучения в 9 раз по сравнению с предыдущими версиями.
  • Улучшенная работа с длинным контекстом (1М токенов) делает модель эффективнее для анализа больших документов.
Вышел Qwen-3.8 Flash-Next Это MoE 125B + 51B N-gram таблица (но активных всего 6B), которая бьет Opus 4.6 Max на 8 из 9 бенчмарков! Также превосходит Qwen3.8-27B и DeepSeek-V4-Flash. При этом обучение стоило в 9 раз дешевле, чем Qwen3.7-Plus. Немного про архитектуру. Ключевых новшества всего четыре: 1. Те самые N-gram эмбеддинги aka дешевая память. Это таблица, которая индексируется не по одному токену, а по коротким последовательностям. Модель как бы запоминает типичные локальные комбинации токенов напрямую в виде векторов, а не выучивает их заново на каждом шаге. Потом происходит обычный lookup вместо матричного умножения, поэтому такие эмбеддинги почти не добавляют вычислений на токен, зато сильно увеличивают общую емкость модели. 2. Gated DeltaNet + Qwen Sparse Attention для скорости на длинных контекстах. Модель не запоминает весь контекст целиком, а выбирает небольшие релевантные блоки и работает только с ними. Gated DeltaNet – линейный механизм внимания с гейтами, которые как раз управляют тем, что модель запоминает, а что забывает. Результат: на 1М контекста prefill стал в 7.6 раз быстрее, а decode – в 4.9 раз. 3. Gated Residual connections. Обычные residual-связи просто прокидывают информацию между слоями, а здесь добавлены гейты, которые решают, сколько именно информации пропустить дальше. 4. Оптимизатор Muon вместо классического Adam. Как раз один из факторов, давших 9-кратную экономию на обучении. В итоге обучение дешевле, параметров больше, а вычислений на токен меньше. Очередное достижение китайского опенсорса. Модель | Репорт | Блог
Выход модели Qwen-3.8 Flash-Next

Кратко (AI)

Представлена новая языковая модель Qwen-3.8 Flash-Next, использующая архитектуру MoE с 6B активных параметров. Модель демонстрирует превосходство над конкурентами в бенчмарках при значительном снижении стоимости обучения благодаря внедрению N-gram эмбеддингов, Gated DeltaNet и оптимизатора Muon.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖