дообучениеСбросить фильтр ×

Т-Технологии представили единый протокол сравнения методов дообучения LLM

Исследователи лаборатории научных исследований «Т-Технологий» показали на ICML 2026, что многие заявленные преимущества алгоритмов дообучения языковых моделей на парах ответов на самом деле не подтверждаются при корректном сравнении. Ключевым фактором качества оказался не сам алгоритм, а тип ранжирования ответов — попарный (pairwisei) или поточечный (pointwisei).

Для честного сравнения авторы привели разные методы дообучения к единому протоколу оценки и ввели дополнительный параметр βi, регулирующий силу обучения на человеческих предпочтениях. Это позволило устранить влияние настроек эксперимента, объёма данных и этапов обучения на результаты сравнения.

ВыводРабота представлена на конференции ICML 2026, статья доступна по ссылке arxiv.org/pdf/2502.01237

Полный разбор →

Это всё на сейчас.