Scaling Law умер? Нет, он просто стал сложнее (с).Я очень много говорил о том, что недостаточно тупо скейлить веса. Также описывал возможные комбо текущих подходов, и тем самым, как делать прорывы, на примере DeepSeek Moment. И вот на прошлой неделе основатель Zhipu AI Тан Цзе (он же профессор Tsinghua) опубликовал в X пост (кстати ссылку не нашёл, но скрин остался), который уже называют "манифестом новой эры масштабирования". А следом вышла GLM‑5.3 – модель, которая без увеличения параметров обогнала все открытые аналоги и вплотную приблизилась к закрытым флагманам. Да ещё и спасла HF от взломов. Как такое возможно? И почему "добавить ещё параметров" больше не работает? Да ещё раз. Разбираемся по пунктам. 😎 1. Главный тезис: у scaling теперь несколько ручек. Тан Цзе говорит прямо - вопрос "сколько у модели параметров?" потерял смысл без трёх других: • сколько у вас данных и какие они? • сколько compute вы готовы потратить на один forward pass? • как вы делаете пост‑тренировку и RL? Раньше все крутили одну ручку – параметры. Теперь их как минимум четыре, и каждая даёт свой прирост. 2. Как индустрия пришла к этому. Сначала все верили Kaplan (OpenAI, 2020): параметры должны расти быстрее данных. Родилась гонка за триллион – GPT‑3, Gopher, MT‑NLG. Потом пришла Chinchilla (DeepMind, 2022) и перевернула всё: оптимально ~20 токенов на параметр, расти нужно примерно одинаково. Но и это оказалось не финалом. Сегодня модели вызываются миллиарды раз в день – inference cost стал важнее тренировочного. Новый тренд: deliberately over-trained модели. Пример: Llama‑2‑7B с 290 токенов на параметр, Gemma‑2‑9B с 889. А с MoE картина стала ещё сложнее: total параметры отвечают за знания, активируемые – за глубину рассуждений. Логично, ведь по сути веса модели это сильно нелинейная "структура знаний", деревья рядом не стоят. 3. Научное обоснование - статья Roberts et al. (2025) Тан Цзе ссылается на "свежее" исследование: • Запоминание (знания) - оптимально иметь больше параметров. • Рассуждение (логика, кодинг) - оптимально иметь больше данных (чистых в тч) и меньше параметров. • При фиксированном TPP увеличение total параметров ухудшает reasoning, а активация большего числа экспертов - улучшает. Иными словами, если вы тренируете модель для программирования - наращивать параметры бессмысленно, лучше дать ей больше примеров цепочек кодинга и больше времени на пост‑тренировку. По проще скажу так, чем больше вариантов исходов цепочек рассуждений видит модель, тем лучше она сходится. Это очень логично, ведь модели учатся по методу макс правдоподобия - что чаще видим в контексте+ответ на обучении то и выдаем. Те все эти темы с промптингом, контекст инженерей и test time scaling следуют одной цели - сделать такой контекст который сузит окно вероятных ответов. А с глубокими цепочками исход почти предопределен, что должно быть в итоге. 4. Эксперимент GLM‑5.3, как доказательство автора. Zhipu взяла GLM‑5.2 и GLM‑5.3 с абсолютно одинаковой архитектурой: • 753B total параметров • 40B activated • одинаковый претрен Единственное отличие, что GLM‑5.3 получила месяц дополнительной пост‑тренировки - long‑horizon environments + RL. Результаты говорят сами за себя: • AA Intelligence Index: 53 → 60 (+7 пунктов) • Terminal‑Bench 3.0: 4.6% → 28.3% (рост в 6 раз!) • DeepSWE: 46.2% → 66.9% • CyberGym (восстановление уязвимостей): 84.5%, а это уровень Anthropic • ExploitBench (использование уязвимостей): 24.4% → 54.4% (более чем вдвое) Модель вышла на один уровень с Claude Fable 5 и GPT‑5.6 Sol, а среди открытых - первое место вместе с Kimi K3. 5. Бонус - неожиданный поворот с безопасностью. GLM‑5.3 оказалась настолько сильной в кибербезопасности, что Zhipu отложила открытие весов на две недели, чтобы оценить риски. Ирония: месяцем ранее именно открытая GLM‑5.2 помогла Hugging Face отразить атаку OpenAI, когда американские закрытые модели отказались помогать. Теперь же сами разработчики столкнулись с дилеммой "too capable to open‑source". 6. Что это значит для всей индустрии. • Гонка триллионов параметров - это был объездной путь. Индустрия коллективно ошиблась, экстраполируя ранние Scaling Law за пределы их применимости. • Scaling не умер – он стал многомерным. Теперь прорывы будут идти не от увеличения модели, а от умных стратегий пост‑тренировки, deeper reasoning во время инференса, эффективного использования MoE. • Главная метрика будущего - «интеллект на доллар». В тч писал об этом тут, но для инференса, а почему бы и не быть метрикой для эффективности обучения. 👍 Итого, GLM‑5.3 достигла топ‑уровня с наименьшей стоимостью за задачу среди всех frontier‑моделей. Открытым остаётся вопрос: существует ли "Chinchilla для RL" ? Когда мы узнаем оптимальное соотношение для пост‑тренировки – это станет следующим большим открытием. Мое мнение. Это не просто новость о китайской модели. Это открытое заявление о смене парадигмы, которую все ждали. Раньше мы сравнивали модели по количеству параметров, как мегапиксели в фотоаппаратах. Теперь это бессмысленно. Важно, как вы используете compute - на претрен, на RL, на инференс. Zhipu показала, что можно догнать лидеров, не увеличивая модель, а просто лучше её дообучая. И это открывает дорогу для многих игроков с ограниченными бюджетами. К сожалению мы видим, как некоторые игроки на рынке играют в большие веса, но по качеству на деле не лучше GPT 120b oss или китайских моделей до 100B. При этом они имеют размер несколько раз больше... Но проблема там не только в этом... Однако об этом, мы тоже уже говорили тут в канале и в моих выступлениях. Важно, какие выводы будут сделаны сегодня, иначе завтра топ модели очень быстро убегут от вас за счёт: процессов разработки и рнд, политики внутри компании, инженерии, данных и петли самоулучшения.
Эволюция Scaling Laws: почему рост параметров больше не главное
D@dealerAIAI-инженер
6 днАнализ смены парадигмы в обучении LLM: почему пост-тренировка и RL стали важнее простого увеличения количества параметров на примере GLM-5.3.
Разработчики ИИ меняют подход к созданию мощных моделей, фокусируясь на качестве обучения, а не только на их размере.
- Эффективность моделей теперь важнее их размера, что снижает порог входа для новых игроков.
- Пост-тренировка и RL становятся ключевыми факторами для достижения высокого уровня интеллекта.
- Индустрия переходит от гонки за количеством параметров к оптимизации 'интеллекта на доллар'.
Скейлить веса недостаточно. Теперь не только слова от 📦
Кратко (AI)
Автор анализирует отход индустрии от простого увеличения параметров моделей в пользу многомерного масштабирования, включающего качество данных, вычислительные затраты на инференс и методы пост-тренировки. На примере модели GLM-5.3 от Zhipu AI показано, что интенсивное дообучение и RL позволяют достичь уровня флагманских моделей без изменения архитектуры.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖