← к умной ленте

Основатель Zhipu AI Тан Цзе описал новую эру scaling laws — GLM-5.3 как доказательство

AI-редакция
2 источника · показать все· свернуть
собирается · 2обновлено 6 дн назад

Основатель Zhipu AI (и профессор Tsinghua) Тан Цзе выступил с тезисом, который уже называют «манифестом новой эры масштабирования»: наращивание числа параметров модели больше не главный источник прироста качества. Вместо одной «ручки» (параметры) у scaling теперь как минимум четыре независимых рычага — параметры, объём и качество данных, compute на forward pass, и post-trainingi/RL.

Практическим подтверждением стала GLM-5.3: модель с той же базовой архитектурой и тем же числом параметров, что у GLM-5.2, но с дополнительным месяцем long-horizon environments и RL, — по данным источников, она обогнала все открытые аналоги и вплотную приблизилась к закрытым флагманам.

290токенов на параметр у Llama-2-7B
889токенов на параметр у Gemma-2-9B
~20оптимальных токенов на параметр по Chinchilla
  • Тан Цзе: общий размер модели важен лишь до порога, пока хватает ёмкости «держать мир в себе», дальше выгоднее наращивать эффективную глубину вычисления и post-training
  • Историческая эволюция scaling lawis: сначала гипотеза Kaplan (OpenAI, 2020) — параметры должны расти быстрее данных, что породило гонку за триллион параметров (GPT-3, Gopher, MT-NLG)
  • Затем Chinchilla (DeepMind, 2022) показала, что оптимально ~20 токенов на параметр и параметры с данными нужно растить примерно одинаково
  • Сегодня из-за миллиардов ежедневных вызовов моделей inference cost стал важнее cost тренировки, что породило тренд deliberately over-trained моделей: Llama-2-7B обучена на 290 токенов на параметр, Gemma-2-9B — на 889
  • В архитектурах MoEi total-параметры отвечают за объём знаний, а активируемые параметры — за глубину рассуждений
  • Тан Цзе ссылается на статью Roberts et al. (2025) как на научное обоснование тезиса
  • По данным Dealer.AI, GLM-5.3 также «спасла HF (Hugging Face) от взломов»

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖