← к ленте

Анонс архитектуры Qwen4: мультимодальная модель с 125B параметров

Н@GreenNeuralRobotsAI-инженер
2 дн

Представлен ранний предпросмотр архитектуры Qwen4: мультимодальная модель с 125B параметров, 6B активных на токен и нативным контекстом 262K.

Выход новой мощной модели Qwen4 задает новые стандарты эффективности для больших языковых моделей.

  • Модель сочетает высокую производительность с низкими затратами на вычисления благодаря архитектуре с 6B активных параметров.
  • Поддержка видео и изображений расширяет возможности применения модели в мультимодальных задачах.
  • Увеличенный контекст до 1M токенов позволяет обрабатывать значительно более объемные документы и данные.
Qwen3.8-Flash-Next Ранний предпросмотр архитектуры Qwen4 с открытыми весами Скорость Flash при размере большой модели. Плюс 51B n-gram эмбеддингов, которые добавляют параметров почти бесплатно по памяти - Мультимодальная: понимает текст, изображения и видео - 6B активных на токен из 125B - быстро и экономично - Контекст 262K нативно, до 1M через YaRN - Обходит Qwen3.7-Plus и DeepSeek-V4-Flash по большинству бенчмарков при куда меньших затратах Гитхаб HF Квантизации Демо API #multimodal #agent VK | MAX
Анонс архитектуры Qwen4: мультимодальная модель с 125B параметров

Кратко (AI)

Представлен ранний предпросмотр архитектуры Qwen4, которая является мультимодальной моделью с 125B параметров. Модель использует 6B активных параметров на токен, поддерживает нативный контекст 262K и превосходит Qwen3.7-Plus и DeepSeek-V4-Flash в большинстве бенчмарков.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖