Исследователи лаборатории научных исследований «Т-Технологий» показали на ICML 2026, что многие заявленные преимущества алгоритмов дообучения языковых моделей на парах ответов на самом деле не подтверждаются при корректном сравнении. Ключевым фактором качества оказался не сам алгоритм, а тип ранжирования ответов — попарный (pairwisei) или поточечный (pointwisei).
Для честного сравнения авторы привели разные методы дообучения к единому протоколу оценки и ввели дополнительный параметр βi, регулирующий силу обучения на человеческих предпочтениях. Это позволило устранить влияние настроек эксперимента, объёма данных и этапов обучения на результаты сравнения.
- Работа представлена на конференции ICML 2026, статья доступна по ссылке arxiv.org/pdf/2502.01237
- Руководитель лаборатории Даниил Гаврилов: «Мы доказали, что такие сравнения не всегда корректны, и результат может зависеть в том числе от настроек эксперимента, объема данных или этапов обучения»
- Методы с попарным ранжированием (pairwise), где модель сравнивает два ответа напрямую, чаще показывают более высокий результат на задачах средней сложности, чем поточечные (pointwise) подходы
- В экспериментах использовались модели Llama 3.2 3B, Llama 3.1 8B, Mistral 7B, Qwen 2.5 7B и Qwen 2.5 14B
- Обучение проводилось на данных Reddit TL;DR, UltraChat и UltraFeedback
- Качество оценивалось на бенчмарках AlpacaEval 2, ArenaHard, попарных сравнениях ответов с помощью более сильной модели-судьи и на математических бенчмарках
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖