← к ленте

STARM: фреймворк для рекурсивных рассуждающих моделей

С@oulenspiegel_channelAI-инженер
1 нед

Представлен STARM — фреймворк для обучения компактных рекурсивных моделей, способных решать сложные алгоритмические задачи за счет итеративного мышления.

Новый подход к ИИ позволяет компактным моделям решать сложные задачи, которые раньше требовали огромных вычислительных мощностей.

  • Модели на 13M параметров могут конкурировать с гигантскими LLM в решении алгоритмических задач.
  • Экономия ресурсов: модели можно запускать на обычных видеокартах или даже CPU.
  • Принцип «думать дольше» вместо «знать больше» открывает путь к более эффективным агентным системам.
Если вы любите принципиально новые нейросетевые архитектуры, то у меня для вас хорошая новость. Я, тскзть, прнс STARM: фреймворк построения специализированных рекурсивных рассуждающих моделей. Когда такие модели востребованы? Уже сегодня это хорошо работает для решения любых тьюринг-полных задач с формальной постановкой. То, что обычные декодерные трансформеры обычно могут плохо даже в режиме ризонинга. Зачем это нужно? Чтобы модель решала задачи сложнее, её обычно делают больше: больше параметров, больше данных, дольше обучение. Рекурсивные же модели идут другим путём — крошечная сеть десятки раз возвращается к собственному черновику ответа и переписывает его, пока решение не сойдётся. Не «знать больше», а «думать дольше». В итоге модель на 13M параметров решает задачи, на которых ошибаются LLM в тысячи раз крупнее, и запускается на одной видеокарте или даже CPU. Чем это отличается от других специальных солверов? В сравнении с специальными алгоритмами-солверами рекурсивные модели в разы более универсальны и относительно легко переносятся на других типы алгоритмических задач. Как и где такие модели можно использовать? Как внешний инструмент-солвер для агентных систем или как примитив в составе системы-оркестра моделей. Что мы сделали? 1) Нашли лучшую архитектуру и получили SOTA-результат. Сформировали оптимальный рецепт обучения, дающий максимальный прирост относительно оригинальных архитектур HRM, TRM и URM и методов их обучения. 2) Стабилизировали рекурсивные модели. Адресовали основную проблему таких архитектур и доработали фреймворк для воспроизводимого и стабильного обучения. 3) Расширили набор доменов. Добавили новые, более сложные классы алгоритмических задач, позволяющие проверить обобщаемость. 4) Сравнили полученные модели со специализированными трансформерами, обученными под задачу, open-source LLM и моделями аналогичного семейства. 5) Протестировали способности моделей к test-time scaling и обучили единую архитектуру для всех задач. Ссылки: Хабр: https://habr.com/ru/companies/sberbank/articles/1069794/ Github: https://github.com/ai-forever/STARM
STARM: фреймворк для рекурсивных рассуждающих моделей

Кратко (AI)

Команда ai-forever представила STARM — фреймворк для создания рекурсивных моделей, которые решают сложные задачи не за счет увеличения размера, а за счет многократной итерации над ответом. Модели на 13M параметров показывают высокую эффективность в алгоритмических задачах, превосходя значительно более крупные LLM.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖