Анонс архитектуры Qwen4: мультимодальная модель с 125B параметров
Н@GreenNeuralRobotsAI-инженер
2 днПредставлен ранний предпросмотр архитектуры Qwen4: мультимодальная модель с 125B параметров, 6B активных на токен и нативным контекстом 262K.
Выход новой мощной модели Qwen4 задает новые стандарты эффективности для больших языковых моделей.
- Модель сочетает высокую производительность с низкими затратами на вычисления благодаря архитектуре с 6B активных параметров.
- Поддержка видео и изображений расширяет возможности применения модели в мультимодальных задачах.
- Увеличенный контекст до 1M токенов позволяет обрабатывать значительно более объемные документы и данные.
Qwen3.8-Flash-Next
Ранний предпросмотр архитектуры Qwen4 с открытыми весами
Скорость Flash при размере большой модели. Плюс 51B n-gram эмбеддингов, которые добавляют параметров почти бесплатно по памяти
- Мультимодальная: понимает текст, изображения и видео
- 6B активных на токен из 125B - быстро и экономично
- Контекст 262K нативно, до 1M через YaRN
- Обходит Qwen3.7-Plus и DeepSeek-V4-Flash по большинству бенчмарков при куда меньших затратах
Гитхаб
HF
Квантизации
Демо
API
#multimodal #agent
VK | MAX

Кратко (AI)
Представлен ранний предпросмотр архитектуры Qwen4, которая является мультимодальной моделью с 125B параметров. Модель использует 6B активных параметров на токен, поддерживает нативный контекст 262K и превосходит Qwen3.7-Plus и DeepSeek-V4-Flash в большинстве бенчмарков.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖