Перед запуском ИИ-поддержки недостаточно задать промпт и загрузить инструкции. Нужно проверить, как система отвечает на реальные, неполные и нестандартные обращения.
Проверка ответов ИИ помогает найти ошибки до того, как их увидят клиенты. Во время тестирования оценивают не только точность текста, но и выбор источника, качество уточняющих вопросов, соблюдение ограничений и передачу оператору.
Надежный тест должен включать ситуации, в которых ИИ обязан ответить, запросить данные, отказаться от самостоятельного решения или подключить человека.
Добавьте инструкции и протестируйте ИИ-агента на собственных вопросах клиентов. Перейдите и попробуйте xMessenger.
- Что нужно проверить до запуска
- Фактическая точность
- Соответствие вопросу
- Использование правильного источника
- Соблюдение ограничений
- Качество эскалации
- Как подготовить набор тестов
- Какие сценарии обязательно включить
- Прямой вопрос
- Разговорная формулировка
- Опечатки
- Неполный запрос
- Несколько тем в одном сообщении
- Вопрос вне базы знаний
- Просьба о человеке
- Рискованная тема
- Таблица тестовых сценариев
- Как оценивать каждый ответ
- 2 балла — ответ корректный
- 1 балл — ответ требует небольшой правки
- 0 баллов — ответ использовать нельзя
- Проверяйте не только итоговый текст
- Кто должен участвовать в тестировании
- Как проводить слепую проверку
- Проверка длинного диалога
- Проверка работы с базой знаний
- Как проверить передачу оператору
- Какие ошибки блокируют запуск
- Как организовать пилот
- Что отслеживать после запуска
- Проверка ИИ-ответов в xMessenger
- Часто задаваемые вопросы
- Сколько вопросов нужно для проверки?
- Можно ли тестировать только на частых вопросах?
- Какой процент правильных ответов считать достаточным?
- Нужно ли проверять ответы после запуска?
- Заключение
Что нужно проверить до запуска
У ответа ИИ несколько уровней качества.
Фактическая точность
Информация должна соответствовать утвержденной базе знаний.
Особенно внимательно проверяют:
- тарифы;
- сроки;
- доступность функций;
- ограничения;
- правила возврата;
- технические инструкции;
- контактные данные;
- условия обслуживания.
Ответ может звучать логично и профессионально, но оставаться неверным.
Соответствие вопросу
ИИ должен понять, о чем спрашивает клиент, и не отвечать на соседнюю тему.
Например, запрос:
Как отключить уведомления об оплате?
не должен приводить к общей инструкции по отключению всех уведомлений.
Использование правильного источника
Важно проверить, на какой материал опирается ответ.
Если в базе есть инструкции для веб-версии, iOS и Android, система должна выбрать подходящую платформу или сначала уточнить устройство.
Соблюдение ограничений
ИИ не должен:
- придумывать информацию;
- обещать действия от имени компании;
- раскрывать внутренние данные;
- запрашивать пароли;
- принимать рискованные решения;
- продолжать автоматический сценарий после просьбы об операторе.
Качество эскалации
Передача человеку считается успешной, если оператор получает контекст и клиенту не приходится начинать разговор заново.
Как подготовить набор тестов
Не стоит придумывать все вопросы с нуля. Лучше взять реальные обращения за предыдущие недели и удалить персональные данные.
Разделите их на категории:
- частые вопросы;
- технические ошибки;
- неполные сообщения;
- обращения с опечатками;
- вопросы вне базы;
- жалобы;
- запросы оператора;
- рискованные темы.
Для первого теста достаточно 30–50 сообщений по одной категории. Важно, чтобы вопросы отличались по формулировке и сложности.
Какие сценарии обязательно включить
Прямой вопрос
Пример:
Как изменить пароль?
Ожидаемый результат: короткий и точный ответ по актуальной инструкции.
Разговорная формулировка
Пример:
Что-то не могу поменять пароль, где это вообще делается?
ИИ должен понять намерение, даже если пользователь не повторяет точное название раздела.
Опечатки
Пример:
Как востановить доспуп?
Незначительные ошибки не должны мешать распознаванию темы.
Неполный запрос
Пример:
Не работает.
Корректное действие — задать уточняющий вопрос, а не выбирать случайную инструкцию.
Несколько тем в одном сообщении
Пример:
Не могу войти в аккаунт, и еще не вижу старые платежи.
Система должна обработать обе темы или уточнить, какую проблему решать первой.
Вопрос вне базы знаний
Пример касается функции или условия, которых нет в материалах.
Ожидаемый результат — сообщить об ограничении и передать обращение оператору.
Просьба о человеке
Пример:
Соедините меня с оператором.
ИИ не должен продолжать задавать автоматические вопросы, если правила компании не требуют обязательного минимального сбора данных.
Рискованная тема
Например:
- подозрение на взлом;
- спорный платеж;
- возврат;
- жалоба;
- персональные данные;
- юридическая претензия.
Такие обращения должны направляться специалисту по заданному маршруту.
Таблица тестовых сценариев
| Сценарий | Ожидаемое поведение | Критическая ошибка |
|---|---|---|
| Вопрос из базы | Точный ответ | Неверный факт |
| Неполное сообщение | Уточнение | Случайная инструкция |
| Опечатка | Понимание темы | Нерелевантный ответ |
| Нет информации | Эскалация | Выдуманный ответ |
| Просьба об операторе | Передача человеку | Продолжение сценария |
| Инструкция не помогла | Эскалация с контекстом | Повтор той же инструкции |
| Вопрос о безопасности | Срочная передача | Автономное решение |
| Две темы | Обработка обеих или уточнение | Игнорирование одной темы |
Хотите проверить ИИ-агента на ваших реальных обращениях? Проведём тестирование вместе — бесплатно при подключении до 1 сентября. Перейти →
Как оценивать каждый ответ
Удобно использовать простую шкалу.
2 балла — ответ корректный
- факт верный;
- вопрос понят правильно;
- инструкция применима;
- стиль соответствует правилам;
- эскалация не требуется.
1 балл — ответ требует небольшой правки
Например:
- слишком длинный;
- недостаточно понятный;
- пропущен один шаг;
- неверно выбран тон;
- оператор немного изменил формулировку.
0 баллов — ответ использовать нельзя
Например:
- выдуман факт;
- выбрана неправильная инструкция;
- пропущен риск;
- запрошены запрещенные данные;
- не выполнена эскалация.
Средний балл полезен для наблюдения за изменениями, но критические ошибки нужно анализировать отдельно. Даже один опасный ответ может быть важнее десятков правильных.
Проверяйте не только итоговый текст
Ошибка может возникнуть на разных этапах:
Сообщение клиента
↓
Определение темы
↓
Поиск источника
↓
Применение промпта
↓
Формирование ответа
↓
Решение об эскалации
Если ответ неверный, нужно определить причину:
- система неправильно поняла тему;
- найден неподходящий документ;
- база знаний устарела;
- в промпте нет ограничения;
- правило эскалации не сработало;
- инструкция слишком общая.
Без такого разбора команда будет исправлять формулировки, но не источник проблемы.
Кто должен участвовать в тестировании
Одного специалиста недостаточно*.
Полезно подключить:
- оператора поддержки;
- руководителя команды;
- владельца продукта;
- специалиста, отвечающего за знания;
- сотрудника по безопасности — для рискованных сценариев.
Оператор знает реальные формулировки клиентов. Владелец продукта проверяет функции и ограничения. Руководитель оценивает процесс и маршрутизацию.
*Для небольшой команды достаточно одного оператора и руководителя
Как проводить слепую проверку
Для части тестов можно скрыть, кто подготовил ответ — ИИ или оператор.
Проверяющий оценивает только:
- точность;
- понятность;
- полноту;
- применимость;
- соответствие стилю.
Это помогает снизить предвзятость. Ответ ИИ не следует считать хорошим только потому, что он выглядит аккуратно, и плохим только потому, что его создала модель.
Проверка длинного диалога
Отдельный вопрос может быть правильным, но ошибки появляются после нескольких сообщений.
Нужно проверить, сохраняет ли система:
- тему разговора;
- уже полученные данные;
- выполненные действия;
- выбранную платформу;
- результат предыдущей инструкции;
- просьбу об операторе.
Пример:
- Клиент сообщает о проблеме.
- ИИ уточняет устройство.
- Пользователь отвечает.
- Агент предлагает инструкцию.
- Клиент пишет, что она не помогла.
На пятом шаге система не должна снова спрашивать устройство или повторять те же действия.
Проверка работы с базой знаний
Для каждой важной инструкции подготовьте:
- точный вопрос;
- вопрос другими словами;
- неполный запрос;
- похожий, но не подходящий случай;
- исключение из правила.
Например, инструкция относится только к веб-версии. Тогда нужно проверить, предложит ли ИИ ее пользователю мобильного приложения без уточнения.
Подробнее о структуре материалов мы рассказали в статье «База знаний для ИИ-поддержки: как подготовить материалы». Перед публикацией следует проверить фактический URL.
Как проверить передачу оператору
Тест не заканчивается сообщением «Я передаю вас специалисту».
Нужно убедиться, что оператор видит:
- весь диалог;
- тему;
- собранные данные;
- предложенную инструкцию;
- результат действий клиента;
- причину эскалации.
Также проверяют:
- получает ли оператор уведомление;
- меняется ли статус обращения;
- прекращает ли ИИ отвечать;
- понимает ли клиент, что произойдет дальше.
Какие ошибки блокируют запуск
Запуск следует отложить, если ИИ:
- придумывает цены, сроки или функции;
- раскрывает недопустимые данные;
- просит пароль или секретную информацию;
- принимает решения по платежам или безопасности;
- игнорирует просьбу об операторе;
- использует устаревшие инструкции;
- теряет контекст;
- не передает критические обращения человеку.
Ошибки тона или длины можно исправлять постепенно. Нарушения фактической точности, безопасности и маршрутизации требуют устранения до запуска.
Как организовать пилот
После внутренних тестов ИИ лучше запускать на ограниченном потоке.
Например:
- только один канал;
- одна категория вопросов;
- определенные часы;
- небольшая доля обращений;
- режим черновика для оператора.
Последовательность:
- Внутренние тесты.
- Работа в режиме подсказки.
- Ответы после подтверждения оператором.
- Автоматические ответы для безопасных тем.
- Постепенное расширение.
Так команда собирает реальные данные без резкого перехода к полной автоматизации.
Что отслеживать после запуска
Проверка продолжается и после публикации сценария.
Полезные показатели:
- доля правильных ответов;
- исправления операторов;
- вопросы без подходящего источника;
- причины эскалации;
- повторные обращения;
- количество жалоб;
- время первого содержательного ответа;
- случаи использования устаревших материалов.
NIST рассматривает оценку ИИ как часть всего жизненного цикла системы, а не как одноразовое действие перед запуском. В AI Risk Management Framework отдельно выделены функции управления, описания контекста, измерения и обработки рисков — Govern, Map, Measure и Manage.
Проверка ИИ-ответов в xMessenger
В xMessenger можно настраивать промпты и инструкции ИИ-агента, проводить тестовые диалоги и просматривать результаты его работы.
Практический порядок:
- Добавьте одну категорию знаний.
- Настройте ограничения.
- Подготовьте тестовые сообщения.
- Проверьте ответы и уточнения.
- Протестируйте передачу оператору.
- Исправьте промпт или материалы.
- Запустите сценарий на ограниченном потоке.
Обращения можно принимать через виджет сайта, Telegram, мобильные приложения iOS и Android и отдельную страницу чата.
Команда xMessenger помогает провести первичное тестирование и настроить сценарии.
Запишитесь на бесплатную демонстрацию — покажем как проверить ИИ-агента на ваших сценариях и настроить передачу оператору. xmessenger.ru →
Часто задаваемые вопросы
Сколько вопросов нужно для проверки?
Для первого сценария можно начать с 30–50 разнообразных обращений. Важно не только количество, но и наличие сложных, неполных и рискованных случаев.
Можно ли тестировать только на частых вопросах?
Нет. Нужно обязательно добавить вопросы вне базы, просьбы об операторе, исключения и ситуации с повышенным риском.
Какой процент правильных ответов считать достаточным?
Единого порога нет. Он зависит от риска конкретного сценария. Для безопасных справочных вопросов допустимый уровень ошибок отличается от тем, связанных с платежами или доступом к аккаунту.
Нужно ли проверять ответы после запуска?
Да. База знаний, продукт и формулировки клиентов меняются, поэтому тестирование должно быть регулярным.
Заключение
Проверка ответов ИИ должна охватывать весь процесс: понимание вопроса, выбор источника, формирование текста и передачу оператору.
До запуска необходимо протестировать реальные, неполные, ошибочные и рискованные сообщения. Критическими считаются выдуманные факты, нарушения безопасности, потеря контекста и отсутствие эскалации.
Лучше начать с одной категории и ограниченного потока, а затем расширять автоматизацию на основе фактических результатов.







