starmСбросить фильтр ×

STARM: маленькая рекурсивная модель обошла LLM в тысячи раз крупнее

Разработчики (по данным канала Сергея Маркова и Mashkka про Data Science) представили STARMi — фреймворк для обучения специализированных рекурсивных reasoning-моделей. Вместо увеличения размера модели, данных и времени обучения, крошечная сеть десятки раз возвращается к собственному черновику ответа и переписывает его, пока решение не сойдётся — принцип «думать дольше, а не знать больше».

В результате модель с 13M параметров решает алгоритмические задачи, на которых ошибаются LLM в тысячи раз крупнее, при этом запускается на одной видеокарте или даже на CPU. Подход применим к любым тьюринг-полным задачам с формальной постановкой — там, где обычные декодерные трансформеры, включая работающие в режиме ризонинга, справляются плохо.

13Mпараметров у модели STARM

Полный разбор →

STARM превосходит GPT 5.6 Sol в задачах поиска пути

С@oulenspiegel_channelAI-инженер
1 нед
GPT 5.6 Sol и поиск пути в лабиринте. Большой топовой модели даже в режиме ризонинга найти решение не под силу. А STARM справляется с этим, причём всё решение e2e находит нейронка, без генерации кода и сложных харнесов. Первая картинка — задача, вторая — решение STARM, третья — решение от ChatGPT
STARM превосходит GPT 5.6 Sol в задачах поиска пути

Это всё на сейчас.