← к умной ленте

Как правильно тестировать AI-агентов: от роутинга до траекторий

В отличие от RAGi-систем, где оценка строится вокруг четырёх измерений (данные, кандидатогенератор, реранкер, ответ LLM), тестирование AI-агентов сложнее из-за недетерминированности их поведения. Разбор статьи инженера Postgres AI Hybrid Manager описывает поэтапный подход к эвалюации агентов — от простой проверки маршрутизации запросов до анализа полных траекторий действий.

Автор статьи прошёл путь от простых проверок к сложной системе тестирования и поделился граблями: обычные REST-подходы (статус-коды, JSON-схемы) не работают, поскольку LLM может решить задачу «другим путём» или красиво ответить, упустив суть.

0.7–0.85порог прохождения теста TCR
  • Этап 1 — Роутинг: проверка попадания запроса в нужный скилл/инструмент через детерминированное сравнение строк (ожидаемый инструмент = фактический); ловит критичные баги, но не гарантирует правильность ответа
  • Этап 2 — TCR (Task Completion Rate)i: используется подход LLM as Judgei — другая LLM оценивает финальный ответ по написанной на естественном языке рубрике, обычно по шкале 0–1, порог прохождения теста — 0.7–0.85
  • Этап 3 — Многошаговые диалоги: тесты учатся поддерживать сессию, склеивать историю и оценивать не только итог, но и корректность уточняющих вопросов
  • Этап 4 — Траектории: проверяется порядок вызовов инструментов, переданные параметры и изменения состояния системы, что позволяет поймать случаи, когда финальный ответ хорош, но агент нарушил внутреннюю логику или политики безопасности
  • Этапы 3 и 4 проводятся так же, как ранее оценивались обычные диалоговые ассистенты

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖