Основатель Zhipu AI (и профессор Tsinghua) Тан Цзе выступил с тезисом, который уже называют «манифестом новой эры масштабирования»: наращивание числа параметров модели больше не главный источник прироста качества. Вместо одной «ручки» (параметры) у scaling теперь как минимум четыре независимых рычага — параметры, объём и качество данных, compute на forward pass, и post-trainingi/RL.
Практическим подтверждением стала GLM-5.3: модель с той же базовой архитектурой и тем же числом параметров, что у GLM-5.2, но с дополнительным месяцем long-horizon environments и RL, — по данным источников, она обогнала все открытые аналоги и вплотную приблизилась к закрытым флагманам.
290токенов на параметр у Llama-2-7B
889токенов на параметр у Gemma-2-9B
~20оптимальных токенов на параметр по Chinchilla
- Тан Цзе: общий размер модели важен лишь до порога, пока хватает ёмкости «держать мир в себе», дальше выгоднее наращивать эффективную глубину вычисления и post-training
- Историческая эволюция scaling lawis: сначала гипотеза Kaplan (OpenAI, 2020) — параметры должны расти быстрее данных, что породило гонку за триллион параметров (GPT-3, Gopher, MT-NLG)
- Затем Chinchilla (DeepMind, 2022) показала, что оптимально ~20 токенов на параметр и параметры с данными нужно растить примерно одинаково
- Сегодня из-за миллиардов ежедневных вызовов моделей inference cost стал важнее cost тренировки, что породило тренд deliberately over-trained моделей: Llama-2-7B обучена на 290 токенов на параметр, Gemma-2-9B — на 889
- В архитектурах MoEi total-параметры отвечают за объём знаний, а активируемые параметры — за глубину рассуждений
- Тан Цзе ссылается на статью Roberts et al. (2025) как на научное обоснование тезиса
- По данным Dealer.AI, GLM-5.3 также «спасла HF (Hugging Face) от взломов»
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖