Разработчики (по данным канала Сергея Маркова и Mashkka про Data Science) представили STARMi — фреймворк для обучения специализированных рекурсивных reasoning-моделей. Вместо увеличения размера модели, данных и времени обучения, крошечная сеть десятки раз возвращается к собственному черновику ответа и переписывает его, пока решение не сойдётся — принцип «думать дольше, а не знать больше».
В результате модель с 13M параметров решает алгоритмические задачи, на которых ошибаются LLM в тысячи раз крупнее, при этом запускается на одной видеокарте или даже на CPU. Подход применим к любым тьюринг-полным задачам с формальной постановкой — там, где обычные декодерные трансформеры, включая работающие в режиме ризонинга, справляются плохо.
13Mпараметров у модели STARM
- Авторы нашли оптимальную архитектуру и рецепт обучения, показавший SOTA-результат относительно оригинальных архитектур HRM, TRM и URM и методов их обучения
- Стабилизировали рекурсивные модели, решив основную проблему таких архитектур, и доработали фреймворк для воспроизводимого обучения
- Расширили набор доменов, добавив более сложные классы алгоритмических задач для проверки обобщаемости
- Модели сравнили со специализированными трансформерами под задачу, open-source LLM и моделями аналогичного семейства, а также протестировали способность к test-time scalingi
- По данным Mashkka: рекурсивные reasoning-модели плохо масштабируются на многозадачное обучение, хотя на алгоритмических задачах конкурируют с крупными моделями
- Ключевые находки: большой реальный batch дал заметный прирост качества, длинный путь градиента улучшил обобщение, а второй рекурсивный модуль и увеличение глубины модели выигрыша не дали
- Возможное применение: внешний инструмент-солвер для агентных систем или примитив в составе системы-оркестра моделей
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖