Skip to content
Все статьи

Как проверить, что ИИ-агент, за которого вы заплатили, ещё работает

Агент не падает, он тихо начинает отвечать неправильно. Тестовый набор, таблица критериев приёмки для договора, процедура shadow mode и метрики на проде.

12 мин чтения
Как проверить, что ИИ-агент, за которого вы заплатили, ещё работает

ИИ-агент почти никогда не ломается так, чтобы это было видно. Нет ошибки 500, виджет открывается, бот отвечает вежливо и быстро. Просто третью неделю он называет цены из прошлого прайса, а половина заявок не доезжает до CRM, потому что кто-то переименовал одно поле в форме.

В этом вся проблема: сломанный агент выглядит как работающий. Ниже - оценка и мониторинг, тестовый набор, критерии приёмки для договора, продовые метрики и стоимость поддержки.

Сломанный агент выглядит как обычная работа

В 2026 году сообщество MLOps опубликовало исследование 143 корпоративных внедрений RAG, то есть агентов, отвечающих по базе знаний компании. 73% из них словили как минимум один критический сбой в первом квартале работы на проде, а 41% этих сбоев не обнаружили стандартные наборы тестов.

Вторая цифра важнее первой. У компаний были тесты, тесты проходили, а система всё равно выдавала людям неверные ответы. Агент ломается не так, как обычный софт: он не бросает исключение, а вызывает правильный инструмент с неправильными параметрами. Записывает лид в CRM с пустым телефоном. Корректно отвечает на вопрос о цене, цитируя документ годичной давности, потому что новый PDF залили в другую папку.

Общий фон такой же трезвый: Gartner оценивает, что 89% пилотов с агентами не доходят до продакшена, а S&P Global Market Intelligence зафиксировала 42% компаний, свернувших большинство своих ИИ-инициатив в 2025 году против 17% в 2024-м. Часть из этого - плохие идеи. Заметная часть - нормальные внедрения, за которыми никто не следил после подписания акта.

Оценка отвечает, может ли работать. Мониторинг - работает ли сейчас

Это разделение снимает большинство споров между заказчиком и подрядчиком.

Оценка качества (evaluation) - фиксированный набор вопросов с заранее известными правильными ответами, который прогоняют по требованию. Отвечает на вопрос: справляется ли эта версия агента с тем, что мы способны себе представить. Прогоняется до запуска и после каждого изменения промпта, базы знаний или модели.

Мониторинг - наблюдение за реальным трафиком: что агент отвечает сегодня, сколько раз вызвал инструмент, сколько обращений закончилось передачей человеку. Отвечает на вопрос: работает ли он на том, чего никто не предусмотрел.

Нужны оба, потому что они ловят разные ошибки. В тестовом наборе никогда нет вопроса, который клиент ещё не задавал, а мониторинг не скажет, лучше ли новая версия промпта старой, пока вы не выпустите её на живых людей.

Масштаб пробела посчитан: в отчёте OWASP за 2026 год среднее покрытие мониторингом агентных систем на проде составляет 52%. За каждым вторым работающим агентом не следит никто.

Тестовый набор: 50 реальных кейсов, собранных до запуска

Это единственное, что заказчик обязан сделать сам. Тестовый набор - файл с настоящими вопросами и эталонными ответами. Подрядчик его не напишет, потому что напишет вопросы, на которые его агент уже отвечает хорошо. Как собрать за два вечера:

  • Возьмите последние 200 диалогов из чата, почты или с телефона. Не выбирайте красивые, берите подряд.
  • Отберите 50: примерно 30 типовых, 10 пограничных (нестандартный случай, два вопроса сразу, клиент пишет на другом языке), 5 таких, где агент обязан отказать или передать человеку, и 5 недобросовестных (выбить скидку, спросить данные другого клиента, вставленная фраза «игнорируй предыдущие инструкции»).
  • К каждому допишите одной строкой, какой ответ считается правильным и откуда он берётся. Это занимает больше всего времени, и в этом ценность.
  • Заморозьте файл. Тестовый набор меняется раз в квартал, а не по ходу правок агента.

Пятьдесят - не цифра из исследований, а рабочий минимум: меньше, и результат скачет на каждом прогоне, больше, и никто не оценит это руками. Как такой проект выглядит целиком, я разбирал в тексте о том, как внедрить чат-бота на сайт пошагово.

Критерии приёмки, которые должны быть в договоре

Самая частая формулировка в договоре на ИИ-агента звучит как «агент отвечает на вопросы клиентов». Её нельзя ни принять, ни оспорить. Ниже таблица, которую я кладу в состав работ: каждая строка проверяется за один вечер, и у каждой есть ответственный человек.

МетрикаКак измеряетсяПорог приёмкиКто проверяет
Точность ответов50 кейсов из замороженного набора, ручная оценка: хорошо / доработать / неверноминимум 90% оценок «хорошо», ноль неверных по ценам и обязательствампредметный человек со стороны заказчика
Выдуманные фактыкаждый ответ с числом, ценой или сроком сверяется с источником0 из 50 кейсовзаказчик, а не подрядчик
Корректность вызовов инструментовлоги вызовов: попали ли в CRM те поля, которые назвал клиент100% совпадение полей на 20 кейсах с записью данныхподрядчик, логи открыты заказчику
Передача человекусценарии, где агент обязан сдаться: жалоба, угроза, прямая просьба о человеке100% передач, контакт с человеком быстрее 2 минут в рабочее времязаказчик, вживую
Время ответамедиана и 95-й перцентиль по логам за неделюмедиана меньше 4 секунд, p95 меньше 12 секундавтоматический отчёт
Стоимость задачирасходы на модель и API, делённые на число закрытых обращенийсогласованная сумма за обращение, зафиксированная до стартаподрядчик, ежемесячный отчёт
Раскрытие ИИпервое сообщение в каждом канале, подпись в виджете, первая фраза голосового звонкапредупреждение при первом контакте во всех каналахзаказчик

Последняя строка не косметика. С 2 августа 2026 года статья 50 европейского AI Act требует сообщать человеку, что он общается с системой ИИ, и отвечает за это компания, которая использует агента под своим именем.

Вне таблицы остаются два пункта: у кого есть доступ к логам (у заказчика должен быть) и что происходит, если порог не достигнут (правки в рамках цены внедрения, со сроком).

Shadow mode: две недели параллельно с человеком

Shadow mode - это запуск агента на реальном трафике без выпуска его к клиентам. Агент видит обращение и готовит ответ, человек по-прежнему отвечает сам. Никто ничем не рискует, а данные настоящие. Процедура, которой я пользуюсь:

  1. День 0. Агент подключён к живому каналу в режиме только на чтение. Каждое входящее уходит и к нему, его ответ падает в отдельный тред в Slack или в таблицу. Клиент не видит ничего.
  2. Дни 1-10. Человек, который и так ведёт этот канал, оценивает черновики агента одним кликом: отправил бы / поправил бы / не отправил бы никогда. Это добавляет секунд десять на обращение.
  3. День 5. Первый разбор. Все «не отправил бы никогда» уходят в тестовый набор как новые кейсы. Правки делаются только на их основании.
  4. Дни 11-14. Конфигурацию не трогаем. Это измерение, а не настройка. Правка промпта в последнюю неделю обнуляет результат.
  5. Приёмка. Считаете долю «отправил бы» за последние четыре дня. Ниже 85% агент к клиентам не выходит, а возвращается на доработку.
  6. Запуск с ручником. Первая рабочая неделя: один канал, только рабочие часы, видимая кнопка перехода на человека, ежедневное чтение диалогов.

При потоке меньше 20 обращений в день нужно три-четыре недели, чтобы набрать осмысленную выборку. У голосового агента параллельно звонить нельзя: там записывают звонки и прогоняют расшифровки через агента, о чём я писал в разборе голосового ИИ-агента для звонков.

Что мерить, когда агент уже общается с клиентами

Четыре числа на одном экране, просматриваемые раз в неделю, ловят большинство проблем до того, как из них получится история с клиентом.

  • Доля закрытых без человека. Значит направление, а не уровень: падение на 10 пунктов неделя к неделе означает, что изменились данные, модель или вопросы клиентов.
  • Эскалации с разбивкой по причинам. Отдельно «клиент попросил человека», отдельно «агент не знал», отдельно «агент ошибся, и человек это исправлял». Больно по-настоящему только от последней категории.
  • Стоимость задачи. Расходы на модель и API, делённые на количество закрытых обращений. Это число позволяет говорить о внедрении в терминах возврата, а не веры. Арифметику экономии я расписал в тексте о том, сколько реально экономит ИИ-бот в поддержке.
  • Задержка, медиана и p95. Растущая медиана обычно означает, что поставщик что-то поменял у себя. Растущий хвост p95 означает, что один из инструментов начал подвисать.

И привычка, которая заменяет половину инструментов: каждый понедельник кто-то читает десять случайных диалогов за прошлую неделю. Не худшие, не пожаловавшиеся, а случайные. Вылавливает то, чего не покажет ни одна метрика.

Что ломается само, без чьей-либо вины

Агент - не проект, который заканчивается. Почва под ним двигается, даже если никто ничего не трогает.

Что меняетсяЧто видит клиентСигнал в данных
Поставщик выводит версию моделиответы становятся длиннее и расплывчатеедлина ответа и стоимость задачи прыгают в одну и ту же неделю
Изменилось API CRM или поле формыагент «работает», но записи не появляютсяпадают успешные вызовы инструмента при ровном трафике
Новый прайс залили в другое местобот называет старые ценырастёт доля диалогов, которые правит человек
Промпт разросся после десятка правокагент забывает ранние правилападает точность на старых кейсах из тестового набора
Сезонный сдвиг в вопросахбольше «не знаю»растут эскалации с причиной «агент не знал»
Внедрённая инструкция во внешнем текстеагент выполняет команду из чужого письма или PDF-анетипичные вызовы инструментов вне обычного суточного графика

Последняя строка растёт быстрее всех: в отчёте OWASP за 2026 год зафиксирован рост числа атак через внедрение инструкций на 340% год к году. Агент, читающий внешние тексты, не должен иметь права записи без подтверждения человеком. Самая дешёвая защита от всей этой таблицы стоит ноль: прогоняйте тестовый набор после каждого изменения и раз в месяц просто так.

Сколько стоит поддержка и что должно быть в абонементе

Польские подрядчики публикуют сопровождение в районе 15-25% стоимости внедрения в год либо абонементы 120-580 € (500-2 500 zł) в месяц, а расходы на модель и API, обычно 45-115 € (200-500 zł) в месяц, считаются отдельно. Англоязычные студии называют 15-30% цены разработки в год. Это чужие прайсы, не мои.

Абонемент оправдан, когда в нём лежат вещи из этой статьи, а не слово «поддержка»:

  • ежемесячный прогон тестового набора с отчётом и сравнением с прошлым месяцем,
  • четыре продовые метрики в одном месте, доступные заказчику без запроса,
  • реакция на смену версии модели у поставщика, включая тестирование новой,
  • правки промпта и базы знаний в оговорённом лимите часов,
  • ежеквартальное пополнение тестового набора кейсами из живых диалогов.

Когда его брать не надо: если агент обрабатывает десяток обращений в месяц, если он отвечает только по закрытому документу или если у него нет права записи ни в одну систему. Там достаточно ревизии раз в квартал, и я говорю это клиентам прямо.

Если агент у вас уже работает

Самая быстрая проверка занимает один вечер. Соберите 20 настоящих вопросов за последний месяц, задайте их агенту, сверьте ответы с источником и посчитайте, сколько заявок доехало до CRM целиком. Если хуже, чем в день приёмки, ответ у вас есть.

Если хочется, чтобы это сделал кто-то снаружи и письменно, аудит ИИ у меня устроен так: тестовый набор на ваших данных, разбор логов, таблица критериев приёмки с реальными результатами и список правок по стоимости. Старт от 1 150 € (4 900 zł), а при внедрении у меня это часть работ. Напишите на странице контактов, что у вас запущено, и я скажу, есть ли тут что аудировать.

FAQ

Как проверить, что ИИ-агент всё ещё отвечает правильно? Возьмите 20-50 настоящих клиентских вопросов за последний месяц, задайте их агенту и сверьте каждый ответ с источником: прайсом, условиями, карточкой товара. Отдельно проверьте, что данные дошли до CRM со всеми полями, потому что агент умеет ответить верно и записать мусор. Один и тот же набор, прогоняемый ежемесячно, показывает направление, а разовый тест - состояние на сегодня. Тревожный порог - падение точности больше чем на 10 процентных пунктов относительно дня приёмки.

Чем отличается оценка качества от мониторинга ИИ-агента? Оценка проверяет, может ли агент работать: вы прогоняете фиксированный набор вопросов с известными правильными ответами и считаете попадания. Мониторинг проверяет, работает ли он прямо сейчас: живой трафик, вызовы инструментов, эскалации, стоимость и время ответа. Оценка ловит регресс после правки промпта или смены модели, мониторинг - то, чего никто не предусмотрел при написании тестов. Нужны оба: они закрывают разные типы ошибок.

Какие критерии приёмки ИИ-агента прописать в договоре? Каждому критерию нужны четыре части: метрика, способ измерения, числовой порог и конкретный человек, который проверяет. Минимальный набор: точность ответов на замороженном тестовом наборе, ноль выдуманных чисел и цен, совпадение полей при записи в CRM, стопроцентная передача человеку в оговорённых сценариях, медиана и p95 времени ответа, стоимость закрытого обращения и раскрытие ИИ во всех каналах. Плюс доступ заказчика к логам и пункт о том, что происходит при недостижении порога.

Что такое shadow mode и сколько он должен длиться? Shadow mode - это работа агента на реальном трафике без показа его ответов клиентам: агент готовит черновик, человек всё равно отвечает сам, а каждый черновик оценивается одним кликом. Стандарт - две недели, при потоке меньше 20 обращений в день нужно три-четыре, чтобы выборка была осмысленной. В последнюю неделю конфигурацию не меняют, потому что это измерение, а не настройка. Разумный порог выхода к клиентам - минимум 85% черновиков с оценкой «отправил бы без правок».

Сколько стоит поддержка ИИ-агента после запуска? Польские подрядчики публикуют 15-25% стоимости внедрения в год либо абонементы 120-580 € (500-2 500 zł) в месяц, а расходы на модель и API, обычно 45-115 € (200-500 zł) в месяц, считаются отдельно. Англоязычные студии называют 15-30% цены разработки в год. Абонемент оправдан, если включает ежемесячный прогон тестового набора, доступ заказчика к метрикам, реакцию на смену версии модели и лимит часов на правки.

Почему агент перестаёт работать, хотя никто ничего не менял? Потому что меняется окружение. Поставщик выводит версию модели, и ответы становятся длиннее и расплывчатее; кто-то переименовал поле формы, и заявки перестали записываться; новый прайс залили в другую папку, и бот называет старые цены. Исследование 143 корпоративных внедрений RAG, опубликованное сообществом MLOps в 2026 году, показало: 73% из них словили критический сбой в первом квартале на проде, а 41% этих сбоев не увидели стандартные наборы тестов.

Нужно ли покупать инструмент мониторинга агентов? При одном агенте в небольшой компании обычно нет. Четыре числа раз в неделю - доля закрытых без человека, эскалации по причинам, стоимость задачи и медиана с p95 времени ответа - помещаются в таблицу, подключённую к логам. Платные инструменты вроде LangSmith или Arize Phoenix начинают окупаться при нескольких агентах и команде, которой нужно видеть одну картину. Важнее инструмента то, чтобы кто-то каждый понедельник читал десять случайных диалогов.

Понравилось - обсудим ваш проект?

30 минут на discovery-звонок. Без продажного питча.

Поговорим