STARM: фреймворк для рекурсивных рассуждающих моделей
С@oulenspiegel_channelAI-инженер
1 недПредставлен STARM — фреймворк для обучения компактных рекурсивных моделей, способных решать сложные алгоритмические задачи за счет итеративного мышления.
Новый подход к ИИ позволяет компактным моделям решать сложные задачи, которые раньше требовали огромных вычислительных мощностей.
- Модели на 13M параметров могут конкурировать с гигантскими LLM в решении алгоритмических задач.
- Экономия ресурсов: модели можно запускать на обычных видеокартах или даже CPU.
- Принцип «думать дольше» вместо «знать больше» открывает путь к более эффективным агентным системам.
Если вы любите принципиально новые нейросетевые архитектуры, то у меня для вас хорошая новость.
Я, тскзть, прнс
STARM: фреймворк построения специализированных рекурсивных рассуждающих моделей.
Когда такие модели востребованы? Уже сегодня это хорошо работает для решения любых тьюринг-полных задач с формальной постановкой. То, что обычные декодерные трансформеры обычно могут плохо даже в режиме ризонинга.
Зачем это нужно? Чтобы модель решала задачи сложнее, её обычно делают больше: больше параметров, больше данных, дольше обучение. Рекурсивные же модели идут другим путём — крошечная сеть десятки раз возвращается к собственному черновику ответа и переписывает его, пока решение не сойдётся. Не «знать больше», а «думать дольше». В итоге модель на 13M параметров решает задачи, на которых ошибаются LLM в тысячи раз крупнее, и запускается на одной видеокарте или даже CPU.
Чем это отличается от других специальных солверов? В сравнении с специальными алгоритмами-солверами рекурсивные модели в разы более универсальны и относительно легко переносятся на других типы алгоритмических задач.
Как и где такие модели можно использовать? Как внешний инструмент-солвер для агентных систем или как примитив в составе системы-оркестра моделей.
Что мы сделали?
1) Нашли лучшую архитектуру и получили SOTA-результат. Сформировали оптимальный рецепт обучения, дающий максимальный прирост относительно оригинальных архитектур HRM, TRM и URM и методов их обучения.
2) Стабилизировали рекурсивные модели. Адресовали основную проблему таких архитектур и доработали фреймворк для воспроизводимого и стабильного обучения.
3) Расширили набор доменов. Добавили новые, более сложные классы алгоритмических задач, позволяющие проверить обобщаемость.
4) Сравнили полученные модели со специализированными трансформерами, обученными под задачу, open-source LLM и моделями аналогичного семейства.
5) Протестировали способности моделей к test-time scaling и обучили единую архитектуру для всех задач.
Ссылки:
Хабр: https://habr.com/ru/companies/sberbank/articles/1069794/
Github: https://github.com/ai-forever/STARM

Кратко (AI)
Команда ai-forever представила STARM — фреймворк для создания рекурсивных моделей, которые решают сложные задачи не за счет увеличения размера, а за счет многократной итерации над ответом. Модели на 13M параметров показывают высокую эффективность в алгоритмических задачах, превосходя значительно более крупные LLM.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖