Эволюция подходов к масштабированию AI
M@machinelearning_interviewAI-инженер
1 недОснователь Zhipu Тан Цзе о смене парадигмы масштабирования моделей: от простого увеличения параметров к эффективности post-training и RL.
Разработчики AI меняют стратегию создания моделей, делая их умнее без бесконечного увеличения размера.
- Эффективность моделей теперь зависит не только от их размера, но и от качества обучения после основной фазы.
- Компании могут создавать более мощные системы, не требуя колоссальных вычислительных мощностей для запуска.
- Это позволяет улучшать качество ответов AI без необходимости постоянно увеличивать требования к «железу».
Scaling AI уже не сводится к «давайте добавим ещё параметров»
Основатель Zhipu Тан Цзе хорошо сформулировал, куда движется масштабирование моделей.
Вопрос «сколько параметров?» становится всё менее полезным сам по себе.
Теперь у scaling есть несколько независимых рычагов:
— число параметров
— объём данных
— compute на один forward pass
— post-training и RL
И следующий прирост качества может выгоднее получить не увеличением модели, а, например, более долгим post-training.
По мысли Тан Цзе, общий размер модели важен до определённого порога — условно, пока ей хватает ёмкости «держать мир». Дальше больше пользы может давать увеличение эффективной глубины вычисления и особенно post-training.
GLM-5.3 — практический пример этой идеи: та же базовая архитектура и те же параметры, что у GLM-5.2, но ещё месяц long-horizon environments и RL.

Кратко (AI)
Основатель компании Zhipu Тан Цзе утверждает, что простое увеличение количества параметров моделей больше не является единственным путем развития AI. Вместо этого акцент смещается на оптимизацию вычислений, качество данных и интенсивный post-training с использованием RL, что наглядно демонстрирует модель GLM-5.3.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖