scalinglawsСбросить фильтр ×

Основатель Zhipu AI Тан Цзе описал новую эру scaling laws — GLM-5.3 как доказательство

AI-редакция
2 источника · показать все· свернуть
собирается · 2обновлено 6 дн назад

Основатель Zhipu AI (и профессор Tsinghua) Тан Цзе выступил с тезисом, который уже называют «манифестом новой эры масштабирования»: наращивание числа параметров модели больше не главный источник прироста качества. Вместо одной «ручки» (параметры) у scaling теперь как минимум четыре независимых рычага — параметры, объём и качество данных, compute на forward pass, и post-trainingi/RL.

Практическим подтверждением стала GLM-5.3: модель с той же базовой архитектурой и тем же числом параметров, что у GLM-5.2, но с дополнительным месяцем long-horizon environments и RL, — по данным источников, она обогнала все открытые аналоги и вплотную приблизилась к закрытым флагманам.

290токенов на параметр у Llama-2-7B
889токенов на параметр у Gemma-2-9B
~20оптимальных токенов на параметр по Chinchilla

Полный разбор →

Это всё на сейчас.