Коротко: что значит «протестировать»
Тест ИИ-агента — это не «поговорили пять минут, вроде отвечает». Это прогон по заранее составленному набору вопросов, где на каждый известно правильное поведение, включая честное «не знаю» и передачу менеджеру. Такой набор собирается один раз и потом используется после каждого обновления базы знаний.
Без него запуск превращается в эксперимент на живых клиентах, а любая правка может тихо сломать то, что работало.
Откуда брать вопросы для теста
Не выдумывайте — возьмите реальные. Лучший источник: переписки менеджеров за последний месяц. Выпишите 20–30 обращений, включая неудобные, и добавьте к ним специально сконструированные проверки.
- Частые вопросы. Цена, сроки, наличие, как работаете, где находитесь.
- Формулировки не по шаблону. С опечатками, сленгом, без знаков препинания, в две строки подряд.
- Вопросы без ответа в базе. Проверяем, признаёт ли агент незнание.
- Ложные предпосылки. «У вас же есть рассрочка на 24 месяца?» — агент не должен подтверждать несуществующее.
- Рискованные точки. Индивидуальная скидка, юридический вопрос, претензия — должна срабатывать передача человеку.
- Попытки увести в сторону. Разговоры не по теме, провокации, грубость.
Что именно проверяем в ответе
| Проверка | Правильное поведение |
|---|---|
| Фактическая точность | Ответ совпадает с базой знаний, без домысла |
| Реакция на пробел в данных | Честное «уточню» и передача менеджеру |
| Соблюдение стоп-тем | Не отвечает там, где запрещено |
| Действия в CRM | Сделка создана, поля заполнены верно |
| Тон общения | Соответствует принятому в компании |
| Длина ответа | По делу, без простыней текста |
| Работа с контекстом | Не переспрашивает то, что клиент уже сказал |
Отдельная категория — выдумка. Как её ловить и чем лечить, разобрано в материале про галлюцинации ИИ-агента.
Кто должен тестировать
Обязательно тот, кто реально общается с клиентами. Разработчик проверит, что система работает; менеджер увидит, что ответ формально верный, но клиента он не устроит.
Оптимально в три пары глаз: подрядчик прогоняет технические сценарии, менеджер — содержательные, руководитель — рискованные точки, где цена ошибки высокая. Кто за что отвечает дальше, описано в разборе поддержки после запуска.
Пилот на части трафика
Даже после успешного прогона не стоит включать агента сразу везде. Рабочая схема: запустить на одном канале или в определённые часы, две-три недели смотреть логи, и только потом расширять.
Что смотреть в этот период: доля диалогов, закрытых без человека, причины эскалаций, повторные обращения по одному вопросу. Подробно — метрики ИИ-агента.
Критерии готовности к полному запуску
- На контрольном наборе нет фактических ошибок.
- На вопросы без данных агент отвечает честно, а не выдумывает.
- Передача менеджеру срабатывает во всех рискованных точках.
- Данные корректно попадают в CRM, ничего не теряется.
- Менеджеры не переделывают за агентом одно и то же.
Эти же пункты имеет смысл зафиксировать как критерии приёмки ещё в техзадании — как его составить.
Регресс после каждой правки
Главное правило эксплуатации: любое изменение базы знаний или сценария — повод заново прогнать контрольный набор. Правка, которая улучшила один ответ, регулярно ломает соседний, и заметить это без прогона невозможно.
Тестирование входит в стандартное внедрение под ключ — от 49 990 ₽, 14–21 день, вместе с настройкой логики, каналами и интеграцией с CRM.
Хотите потренироваться на живом агенте? Демо в Telegram — попробуйте задать ему вопрос с ложной предпосылкой и посмотрите, подтвердит ли он несуществующее.
FAQ
Сколько вопросов нужно для теста?
Для типового проекта достаточно 20–30 контрольных вопросов, покрывающих частые обращения, пробелы в данных и рискованные точки.
Можно ли автоматизировать прогон?
Да, набор вопросов можно прогонять автоматически и сравнивать ответы с эталонным поведением. Но глазами менеджера итог всё равно стоит просматривать.
Сколько длится пилот?
Обычно две-три недели на одном канале — этого хватает, чтобы накопилась статистика и прошла первая волна правок.
Что делать, если агент провалил часть тестов?
Смотреть причину: чаще всего это пробел в базе знаний, а не проблема модели. Правится добавлением данных и уточнением инструкции.