← к умной ленте

Т-Технологии представили единый протокол сравнения методов дообучения LLM

Исследователи лаборатории научных исследований «Т-Технологий» показали на ICML 2026, что многие заявленные преимущества алгоритмов дообучения языковых моделей на парах ответов на самом деле не подтверждаются при корректном сравнении. Ключевым фактором качества оказался не сам алгоритм, а тип ранжирования ответов — попарный (pairwisei) или поточечный (pointwisei).

Для честного сравнения авторы привели разные методы дообучения к единому протоколу оценки и ввели дополнительный параметр βi, регулирующий силу обучения на человеческих предпочтениях. Это позволило устранить влияние настроек эксперимента, объёма данных и этапов обучения на результаты сравнения.

  • Работа представлена на конференции ICML 2026, статья доступна по ссылке arxiv.org/pdf/2502.01237
  • Руководитель лаборатории Даниил Гаврилов: «Мы доказали, что такие сравнения не всегда корректны, и результат может зависеть в том числе от настроек эксперимента, объема данных или этапов обучения»
  • Методы с попарным ранжированием (pairwise), где модель сравнивает два ответа напрямую, чаще показывают более высокий результат на задачах средней сложности, чем поточечные (pointwise) подходы
  • В экспериментах использовались модели Llama 3.2 3B, Llama 3.1 8B, Mistral 7B, Qwen 2.5 7B и Qwen 2.5 14B
  • Обучение проводилось на данных Reddit TL;DR, UltraChat и UltraFeedback
  • Качество оценивалось на бенчмарках AlpacaEval 2, ArenaHard, попарных сравнениях ответов с помощью более сильной модели-судьи и на математических бенчмарках

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖