Чек-лист, что должен проверять продакт в AI-продуктах и чатах в частности
1.
Правило 5–10 кейсов.
Составь базвый золотой датасет из 5–10 эталонных юзкейсов (например, для AI-саппорта: возврат денег, смена адреса, жалоба на хамовитого курьера) и автоматизируй их проверку.
2.
Один скорер = одно измерение.
Главная ошибка PM - оценивать ответ модели одной общей метрикой «хорошо/плохо». Для кейса с возвратом денег разбей оценку на три отдельных скорера:
•
Точность (Accuracy): нашел ли бот правильную транзакцию?
•
Тон (Tone): вежлив ли бот, выразил ли эмпатию?
•
Безопасность (Policy): не пообещал ли бот возврат денег в обход регламента?
3.
Human Review нельзя убирать.
Автоматический код легко проверит, сделал ли бот запрос к базам данных. Но оценить, не звучит ли ответ как бездушный робот, пока может только человек.
4.
Разрыв между топом и медианой.
Команды с авто-эвалами видят, что новое обновление модели сделало бота супер-вежливым, но снизило точность поиска заказов на 10% и откатывают деплой. Команды без эвалов выкатывают регресс в прод и ловят волну негатива от клиентов.
5.
3 фазы внедрения на примере AI-саппорта:
•
Инкубация: собираем золотой датасет частых вопросов клиентов.
•
Шлифовка: weekly-демо, жесткие критерии (*«бот должен прикрепить ссылку на форму возврата, но не закрывать тикет сам»*) и просмотр цепочки рассуждений бота (Debug Mode).
•
Масштабирование: авто-тесты перед каждым деплоем и Slack-канал, куда автоматически падают все «дизлайки» от пользователей с логами беседы.
6.
Чек-лист: как внедрить Evals за 5 шагов:
• Собери реальные логи чатов, где бот ошибся.
• Сформируй из них точечный датасет на 10–50 примеров.
• Сравни две версии промпта side-by-side на одном и том же датасете.
• Настрой автоматический ночной прогон тестов (Nightly Evals).
• Настрой алерты на дизлайки пользователей прямо из продакшена.
7.
Метрики качества AI-бота:
•
Accuracy: % корректно решенных вопросов без эскалации на оператора.
•
Tone & Brand Alignment: соответствие гайдлайнам компании.
•
Schema Compliance: отдаёт ли бот корректный JSON для API вызовов.
•
Latency & Cost: задержка ответа (в сек) и стоимость токенов на диалог.
Источник:
https://www.braintrust.dev/blog/evals-for-pms](https://www.braintrust.dev/blog/evals-for-pms
#PG_education