← к ленте

Исследование методов обучения reasoning-моделей

1 мес

Обзор научной работы о том, как качество и структура данных влияют на эффективность обучения reasoning-моделей.

Вышла полезная работа про то, почему reasoning-модели становятся сильнее после обучения. Авторы пишут, что дело не только в размере датасета. Для reasoning важнее другое: есть ли у модели понятная проверка, где она справилась, где ошиблась и почему. Обычная пара «вопрос → ответ» даёт мало сигнала. Она показывает результат, но не показывает процесс: какой шаг был неверным, какой вызов инструмента помог, где модель восстановилась после ошибки, какой judge подтвердил решение. Поэтому хороший обучающий пример для reasoning должен хранить больше контекста: саму задачу, действия модели, проверку результата и метаданные о том, откуда взялся пример. Проверка бывает разной. В математике и коде можно использовать точные тесты. У агентов можно смотреть, справился ли он в окружении. В более размытых задачах приходится подключать людей или model-judge. Отдельно авторы предупреждают о популярных ошибках. Длинная цепочка рассуждений не всегда полезна. Сложные задачи не всегда улучшают конкретную модель. Большой датасет может выглядеть внушительно, но всё равно плохо покрывать нужные навыки. Для agent data особенно важно сохранять всю «грязную» траекторию: неудачные действия, повторные попытки, исправления, изменения состояния и финальную проверку. Часто именно там лежит самый ценный обучающий сигнал. Итоговый подход такой- обучать reasoning-модель не на красивых ответах, а на проверяемых попытках, где видно, что сработало, что сломалось и почему это можно использовать для обучения. Paper: A Primer in Post-Training Reasoning Data: What They Know About How It Works https://arxiv.org/abs/2606.02113

Кратко (AI)

Авторы статьи анализируют, почему reasoning-модели становятся эффективнее, подчеркивая важность наличия верифицируемых данных с полным процессом рассуждений. Вместо простых пар «вопрос-ответ» предлагается использовать траектории с промежуточными шагами, проверками и метаданными. Исследование указывает на то, что качество обучающего сигнала важнее объема данных.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖