← к ленте

Эволюция подходов к масштабированию AI

1 нед

Основатель Zhipu Тан Цзе о смене парадигмы масштабирования моделей: от простого увеличения параметров к эффективности post-training и RL.

Разработчики AI меняют стратегию создания моделей, делая их умнее без бесконечного увеличения размера.

  • Эффективность моделей теперь зависит не только от их размера, но и от качества обучения после основной фазы.
  • Компании могут создавать более мощные системы, не требуя колоссальных вычислительных мощностей для запуска.
  • Это позволяет улучшать качество ответов AI без необходимости постоянно увеличивать требования к «железу».
Scaling AI уже не сводится к «давайте добавим ещё параметров» Основатель Zhipu Тан Цзе хорошо сформулировал, куда движется масштабирование моделей. Вопрос «сколько параметров?» становится всё менее полезным сам по себе. Теперь у scaling есть несколько независимых рычагов: — число параметров — объём данных — compute на один forward pass — post-training и RL И следующий прирост качества может выгоднее получить не увеличением модели, а, например, более долгим post-training. По мысли Тан Цзе, общий размер модели важен до определённого порога — условно, пока ей хватает ёмкости «держать мир». Дальше больше пользы может давать увеличение эффективной глубины вычисления и особенно post-training. GLM-5.3 — практический пример этой идеи: та же базовая архитектура и те же параметры, что у GLM-5.2, но ещё месяц long-horizon environments и RL.
Эволюция подходов к масштабированию AI

Кратко (AI)

Основатель компании Zhipu Тан Цзе утверждает, что простое увеличение количества параметров моделей больше не является единственным путем развития AI. Вместо этого акцент смещается на оптимизацию вычислений, качество данных и интенсивный post-training с использованием RL, что наглядно демонстрирует модель GLM-5.3.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖