← к ленте

Tencent выпустила MoE-модель Hy3

1 мес

Tencent представила Hy3, MoE-модель на 295B параметров с поддержкой контекста 256K и лицензией Apache 2.0.

Tencent выложила Hy3 Это MoE-модель на 295B параметров, но активируется около 21B на токен. Контекст - до 256K. В blind tests модель обходит GLM-5.1, при этом использует меньше активных параметров, чем модели, с которыми конкурирует. 295B MoE, 21B active, 256K context. И всё это на обычном GQA. Без sparse attention, без MLA. Это значит, что эффективность пока не вытянута архитектурными трюками до предела. Там ещё остаётся запас. Модель можно запускать через vLLM и SGLang, есть FP8-версия, лицензия - Apache 2.0. https://huggingface.co/tencent/Hy3 @ai_machinelearning_big_data

Кратко (AI)

Компания Tencent представила новую MoE-модель Hy3, содержащую 295 миллиардов параметров при 21 миллиарде активных на токен. Модель поддерживает контекстное окно до 256 тысяч токенов, распространяется под лицензией Apache 2.0 и совместима с vLLM и SGLang.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖