← к ленте

STARM: фреймворк для обучения рекурсивных reasoning-моделей

M@mashkka_dsAI-инженер
1 нед

Обзор фреймворка STARM, который позволяет небольшим моделям конкурировать с крупными LLM в алгоритмических задачах за счет рекурсивного обучения.

Исследование доказывает, что эффективность ИИ-моделей зависит не только от их размера, но и от методов обучения.

  • Малые модели могут решать сложные алгоритмические задачи на уровне крупных LLM.
  • Размер батча и длина пути градиента критически важны для качества обучения.
  • Увеличение глубины модели или добавление дополнительных модулей не всегда дает прирост производительности.
🧠 Можно ли маленькой моделью обойти большую LLM? Если кратко: да. Коллеги проверили это и разработали STARM — фреймворк для обучения рекурсивных reasoning-моделей Какие результаты оказались самыми интересными? ✔️ Небольшая рекурсивная модель действительно может конкурировать с гораздо более крупными моделями на алгоритмических задачах, при этом рекурсивные reasoning-модели плохо масштабируются на многозадачное обучение. ✔️ Для качества оказался важнее не размер модели, а то, как именно она обучается: большой реальный batch дал заметный прирост, а длинный путь градиента улучшил обобщение. ✔️ Многие интуитивно привлекательные идеи не сработали. Например, второй рекурсивный модуль оказался не нужен, а увеличение глубины модели не дало выигрыша. Почему так происходит и какие именно эксперименты привели к результатам — читайте в статье коллег на Хабр. #ai #reasoning #research #machinelearning
STARM: фреймворк для обучения рекурсивных reasoning-моделей

Кратко (AI)

Авторы статьи на Хабре представили фреймворк STARM для обучения рекурсивных моделей рассуждения. Исследование показало, что небольшие модели могут превосходить крупные LLM в алгоритмических задачах, если использовать правильные методы обучения, такие как большие батчи и длинные пути градиента.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖