ИИ для бизнеса

Как протестировать ИИ-агента перед запуском: чек-лист

31 июля 2026 г. · 3 мин чтения

Коротко: что значит «протестировать»

Тест ИИ-агента — это не «поговорили пять минут, вроде отвечает». Это прогон по заранее составленному набору вопросов, где на каждый известно правильное поведение, включая честное «не знаю» и передачу менеджеру. Такой набор собирается один раз и потом используется после каждого обновления базы знаний.

Без него запуск превращается в эксперимент на живых клиентах, а любая правка может тихо сломать то, что работало.

Откуда брать вопросы для теста

Не выдумывайте — возьмите реальные. Лучший источник: переписки менеджеров за последний месяц. Выпишите 20–30 обращений, включая неудобные, и добавьте к ним специально сконструированные проверки.

  • Частые вопросы. Цена, сроки, наличие, как работаете, где находитесь.
  • Формулировки не по шаблону. С опечатками, сленгом, без знаков препинания, в две строки подряд.
  • Вопросы без ответа в базе. Проверяем, признаёт ли агент незнание.
  • Ложные предпосылки. «У вас же есть рассрочка на 24 месяца?» — агент не должен подтверждать несуществующее.
  • Рискованные точки. Индивидуальная скидка, юридический вопрос, претензия — должна срабатывать передача человеку.
  • Попытки увести в сторону. Разговоры не по теме, провокации, грубость.

Что именно проверяем в ответе

ПроверкаПравильное поведение
Фактическая точностьОтвет совпадает с базой знаний, без домысла
Реакция на пробел в данныхЧестное «уточню» и передача менеджеру
Соблюдение стоп-темНе отвечает там, где запрещено
Действия в CRMСделка создана, поля заполнены верно
Тон общенияСоответствует принятому в компании
Длина ответаПо делу, без простыней текста
Работа с контекстомНе переспрашивает то, что клиент уже сказал

Отдельная категория — выдумка. Как её ловить и чем лечить, разобрано в материале про галлюцинации ИИ-агента.

Кто должен тестировать

Обязательно тот, кто реально общается с клиентами. Разработчик проверит, что система работает; менеджер увидит, что ответ формально верный, но клиента он не устроит.

Оптимально в три пары глаз: подрядчик прогоняет технические сценарии, менеджер — содержательные, руководитель — рискованные точки, где цена ошибки высокая. Кто за что отвечает дальше, описано в разборе поддержки после запуска.

Пилот на части трафика

Даже после успешного прогона не стоит включать агента сразу везде. Рабочая схема: запустить на одном канале или в определённые часы, две-три недели смотреть логи, и только потом расширять.

Что смотреть в этот период: доля диалогов, закрытых без человека, причины эскалаций, повторные обращения по одному вопросу. Подробно — метрики ИИ-агента.

Критерии готовности к полному запуску

  • На контрольном наборе нет фактических ошибок.
  • На вопросы без данных агент отвечает честно, а не выдумывает.
  • Передача менеджеру срабатывает во всех рискованных точках.
  • Данные корректно попадают в CRM, ничего не теряется.
  • Менеджеры не переделывают за агентом одно и то же.

Эти же пункты имеет смысл зафиксировать как критерии приёмки ещё в техзадании — как его составить.

Регресс после каждой правки

Главное правило эксплуатации: любое изменение базы знаний или сценария — повод заново прогнать контрольный набор. Правка, которая улучшила один ответ, регулярно ломает соседний, и заметить это без прогона невозможно.

Тестирование входит в стандартное внедрение под ключ — от 49 990 ₽, 14–21 день, вместе с настройкой логики, каналами и интеграцией с CRM.

Хотите потренироваться на живом агенте? Демо в Telegram — попробуйте задать ему вопрос с ложной предпосылкой и посмотрите, подтвердит ли он несуществующее.

FAQ

Сколько вопросов нужно для теста?

Для типового проекта достаточно 20–30 контрольных вопросов, покрывающих частые обращения, пробелы в данных и рискованные точки.

Можно ли автоматизировать прогон?

Да, набор вопросов можно прогонять автоматически и сравнивать ответы с эталонным поведением. Но глазами менеджера итог всё равно стоит просматривать.

Сколько длится пилот?

Обычно две-три недели на одном канале — этого хватает, чтобы накопилась статистика и прошла первая волна правок.

Что делать, если агент провалил часть тестов?

Смотреть причину: чаще всего это пробел в базе знаний, а не проблема модели. Правится добавлением данных и уточнением инструкции.

Похожие статьи

Автоматизируйте первую линию продаж

ИИ-менеджер отвечает за 0 секунд 24/7 и дожимает лидов. Внедрение под ключ за 7–14 дней.