Tencent выпустила MoE-модель Hy3
M@ai_machinelearning_big_dataAI-инженер
1 месTencent представила Hy3, MoE-модель на 295B параметров с поддержкой контекста 256K и лицензией Apache 2.0.
Tencent выложила Hy3
Это MoE-модель на 295B параметров, но активируется около 21B на токен. Контекст - до 256K.
В blind tests модель обходит GLM-5.1, при этом использует меньше активных параметров, чем модели, с которыми конкурирует.
295B MoE, 21B active, 256K context. И всё это на обычном GQA. Без sparse attention, без MLA.
Это значит, что эффективность пока не вытянута архитектурными трюками до предела. Там ещё остаётся запас.
Модель можно запускать через vLLM и SGLang, есть FP8-версия, лицензия - Apache 2.0.
https://huggingface.co/tencent/Hy3
@ai_machinelearning_big_data
Кратко (AI)
Компания Tencent представила новую MoE-модель Hy3, содержащую 295 миллиардов параметров при 21 миллиарде активных на токен. Модель поддерживает контекстное окно до 256 тысяч токенов, распространяется под лицензией Apache 2.0 и совместима с vLLM и SGLang.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖