Исследователи лаборатории научных исследований «Т-Технологий» показали на ICML 2026, что многие заявленные преимущества алгоритмов дообучения языковых моделей на парах ответов на самом деле не подтверждаются при корректном сравнении. Ключевым фактором качества оказался не сам алгоритм, а тип ранжирования ответов — попарный (pairwisei) или поточечный (pointwisei).
Для честного сравнения авторы привели разные методы дообучения к единому протоколу оценки и ввели дополнительный параметр βi, регулирующий силу обучения на человеческих предпочтениях. Это позволило устранить влияние настроек эксперимента, объёма данных и этапов обучения на результаты сравнения.
ВыводРабота представлена на конференции ICML 2026, статья доступна по ссылке arxiv.org/pdf/2502.01237