← к ленте

hh.ru о разработке корпоративного LLM-судьи для оценки резюме

1 мес

hh.ru раскрыл детали создания LLM-судьи для анализа резюме: отказ от общей шкалы, использование рубрик и подход RIFT для минимизации галлюцинаций.

hh показал, что находится под капотом у корпоративного LLM-судьи для нейроразбора резюме и как он оценивает ошибки и галлюцинации. LLM-судья — это модель, проверяющая другие модели. «Наивные» судьи могут галлюцинировать оценки, поэтому для качественного вердикта от общей шкалы отказались в пользу чётких критериев — рубрик. Чтобы сформировать каждую из них, понадобились десятки позитивных и негативных примеров. «Грамотный» судья способен хорошо различать не только очевидные попадания и промахи, но и пограничные случаи. Из деталей — отказ от общей шкалы, около сотни положительных и отрицательных примеров для каждой рубрики, отдельная таксономия ошибок и вывод: маленькой модели иногда достаточно, если критерии хорошо разложены. Чтобы выявить дефекты рубрик, использовали подход RIFT — таксономию типичных ошибок в критериях оценки. Финальный продукт работает в четыре этапа: валидация входных данных, извлечение доказательств, вердикты по рубрикам и расчёт итогового скора. Последний этап вынесли в код: финальную оценку даёт не модель. О разработке LLM-судьи и вынесенных уроках вышла статья в блоге hh на Хабре.

Кратко (AI)

Компания hh.ru поделилась опытом разработки LLM-судьи для автоматического анализа резюме. Чтобы избежать галлюцинаций, разработчики отказались от общей шкалы оценок в пользу детальных рубрик и внедрили подход RIFT для выявления ошибок в критериях.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖