← к умной ленте

STARM: маленькая рекурсивная модель обошла LLM в тысячи раз крупнее

Разработчики (по данным канала Сергея Маркова и Mashkka про Data Science) представили STARMi — фреймворк для обучения специализированных рекурсивных reasoning-моделей. Вместо увеличения размера модели, данных и времени обучения, крошечная сеть десятки раз возвращается к собственному черновику ответа и переписывает его, пока решение не сойдётся — принцип «думать дольше, а не знать больше».

В результате модель с 13M параметров решает алгоритмические задачи, на которых ошибаются LLM в тысячи раз крупнее, при этом запускается на одной видеокарте или даже на CPU. Подход применим к любым тьюринг-полным задачам с формальной постановкой — там, где обычные декодерные трансформеры, включая работающие в режиме ризонинга, справляются плохо.

13Mпараметров у модели STARM
  • Авторы нашли оптимальную архитектуру и рецепт обучения, показавший SOTA-результат относительно оригинальных архитектур HRM, TRM и URM и методов их обучения
  • Стабилизировали рекурсивные модели, решив основную проблему таких архитектур, и доработали фреймворк для воспроизводимого обучения
  • Расширили набор доменов, добавив более сложные классы алгоритмических задач для проверки обобщаемости
  • Модели сравнили со специализированными трансформерами под задачу, open-source LLM и моделями аналогичного семейства, а также протестировали способность к test-time scalingi
  • По данным Mashkka: рекурсивные reasoning-модели плохо масштабируются на многозадачное обучение, хотя на алгоритмических задачах конкурируют с крупными моделями
  • Ключевые находки: большой реальный batch дал заметный прирост качества, длинный путь градиента улучшил обобщение, а второй рекурсивный модуль и увеличение глубины модели выигрыша не дали
  • Возможное применение: внешний инструмент-солвер для агентных систем или примитив в составе системы-оркестра моделей

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖