machinelearningСбросить фильтр ×

Основатель Zhipu AI Тан Цзе описал новую эру scaling laws — GLM-5.3 как доказательство

AI-редакция
2 источника · показать все· свернуть
собирается · 2обновлено 1 нед назад

Основатель Zhipu AI (и профессор Tsinghua) Тан Цзе выступил с тезисом, который уже называют «манифестом новой эры масштабирования»: наращивание числа параметров модели больше не главный источник прироста качества. Вместо одной «ручки» (параметры) у scaling теперь как минимум четыре независимых рычага — параметры, объём и качество данных, compute на forward pass, и post-trainingi/RL.

Практическим подтверждением стала GLM-5.3: модель с той же базовой архитектурой и тем же числом параметров, что у GLM-5.2, но с дополнительным месяцем long-horizon environments и RL, — по данным источников, она обогнала все открытые аналоги и вплотную приблизилась к закрытым флагманам.

290токенов на параметр у Llama-2-7B
889токенов на параметр у Gemma-2-9B
~20оптимальных токенов на параметр по Chinchilla

Полный разбор →

STARM: маленькая рекурсивная модель обошла LLM в тысячи раз крупнее

Разработчики (по данным канала Сергея Маркова и Mashkka про Data Science) представили STARMi — фреймворк для обучения специализированных рекурсивных reasoning-моделей. Вместо увеличения размера модели, данных и времени обучения, крошечная сеть десятки раз возвращается к собственному черновику ответа и переписывает его, пока решение не сойдётся — принцип «думать дольше, а не знать больше».

В результате модель с 13M параметров решает алгоритмические задачи, на которых ошибаются LLM в тысячи раз крупнее, при этом запускается на одной видеокарте или даже на CPU. Подход применим к любым тьюринг-полным задачам с формальной постановкой — там, где обычные декодерные трансформеры, включая работающие в режиме ризонинга, справляются плохо.

13Mпараметров у модели STARM

Полный разбор →

Оптимизация рекомендательных систем через Reinforcement Learning

2 нед
Оптимизация рекомендательных систем через Reinforcement Learning

MidSteer: оптимальный аффинный фреймворк для управления генеративными моделями

D@dl_storiesAI-инженер
1 мес

Model stitching: как объединять нейросети

L@lovedeathtransformersAI-инженер
1 мес

Это всё на сейчас.