ИИ-агент почти никогда не ломается так, чтобы это было видно. Нет ошибки 500, виджет открывается, бот отвечает вежливо и быстро. Просто третью неделю он называет цены из прошлого прайса, а половина заявок не доезжает до CRM, потому что кто-то переименовал одно поле в форме.
В этом вся проблема: сломанный агент выглядит как работающий. Ниже - оценка и мониторинг, тестовый набор, критерии приёмки для договора, продовые метрики и стоимость поддержки.
Сломанный агент выглядит как обычная работа
В 2026 году сообщество MLOps опубликовало исследование 143 корпоративных внедрений RAG, то есть агентов, отвечающих по базе знаний компании. 73% из них словили как минимум один критический сбой в первом квартале работы на проде, а 41% этих сбоев не обнаружили стандартные наборы тестов.
Вторая цифра важнее первой. У компаний были тесты, тесты проходили, а система всё равно выдавала людям неверные ответы. Агент ломается не так, как обычный софт: он не бросает исключение, а вызывает правильный инструмент с неправильными параметрами. Записывает лид в CRM с пустым телефоном. Корректно отвечает на вопрос о цене, цитируя документ годичной давности, потому что новый PDF залили в другую папку.
Общий фон такой же трезвый: Gartner оценивает, что 89% пилотов с агентами не доходят до продакшена, а S&P Global Market Intelligence зафиксировала 42% компаний, свернувших большинство своих ИИ-инициатив в 2025 году против 17% в 2024-м. Часть из этого - плохие идеи. Заметная часть - нормальные внедрения, за которыми никто не следил после подписания акта.
Оценка отвечает, может ли работать. Мониторинг - работает ли сейчас
Это разделение снимает большинство споров между заказчиком и подрядчиком.
Оценка качества (evaluation) - фиксированный набор вопросов с заранее известными правильными ответами, который прогоняют по требованию. Отвечает на вопрос: справляется ли эта версия агента с тем, что мы способны себе представить. Прогоняется до запуска и после каждого изменения промпта, базы знаний или модели.
Мониторинг - наблюдение за реальным трафиком: что агент отвечает сегодня, сколько раз вызвал инструмент, сколько обращений закончилось передачей человеку. Отвечает на вопрос: работает ли он на том, чего никто не предусмотрел.
Нужны оба, потому что они ловят разные ошибки. В тестовом наборе никогда нет вопроса, который клиент ещё не задавал, а мониторинг не скажет, лучше ли новая версия промпта старой, пока вы не выпустите её на живых людей.
Масштаб пробела посчитан: в отчёте OWASP за 2026 год среднее покрытие мониторингом агентных систем на проде составляет 52%. За каждым вторым работающим агентом не следит никто.
Тестовый набор: 50 реальных кейсов, собранных до запуска
Это единственное, что заказчик обязан сделать сам. Тестовый набор - файл с настоящими вопросами и эталонными ответами. Подрядчик его не напишет, потому что напишет вопросы, на которые его агент уже отвечает хорошо. Как собрать за два вечера:
- Возьмите последние 200 диалогов из чата, почты или с телефона. Не выбирайте красивые, берите подряд.
- Отберите 50: примерно 30 типовых, 10 пограничных (нестандартный случай, два вопроса сразу, клиент пишет на другом языке), 5 таких, где агент обязан отказать или передать человеку, и 5 недобросовестных (выбить скидку, спросить данные другого клиента, вставленная фраза «игнорируй предыдущие инструкции»).
- К каждому допишите одной строкой, какой ответ считается правильным и откуда он берётся. Это занимает больше всего времени, и в этом ценность.
- Заморозьте файл. Тестовый набор меняется раз в квартал, а не по ходу правок агента.
Пятьдесят - не цифра из исследований, а рабочий минимум: меньше, и результат скачет на каждом прогоне, больше, и никто не оценит это руками. Как такой проект выглядит целиком, я разбирал в тексте о том, как внедрить чат-бота на сайт пошагово.
Критерии приёмки, которые должны быть в договоре
Самая частая формулировка в договоре на ИИ-агента звучит как «агент отвечает на вопросы клиентов». Её нельзя ни принять, ни оспорить. Ниже таблица, которую я кладу в состав работ: каждая строка проверяется за один вечер, и у каждой есть ответственный человек.
| Метрика | Как измеряется | Порог приёмки | Кто проверяет |
|---|---|---|---|
| Точность ответов | 50 кейсов из замороженного набора, ручная оценка: хорошо / доработать / неверно | минимум 90% оценок «хорошо», ноль неверных по ценам и обязательствам | предметный человек со стороны заказчика |
| Выдуманные факты | каждый ответ с числом, ценой или сроком сверяется с источником | 0 из 50 кейсов | заказчик, а не подрядчик |
| Корректность вызовов инструментов | логи вызовов: попали ли в CRM те поля, которые назвал клиент | 100% совпадение полей на 20 кейсах с записью данных | подрядчик, логи открыты заказчику |
| Передача человеку | сценарии, где агент обязан сдаться: жалоба, угроза, прямая просьба о человеке | 100% передач, контакт с человеком быстрее 2 минут в рабочее время | заказчик, вживую |
| Время ответа | медиана и 95-й перцентиль по логам за неделю | медиана меньше 4 секунд, p95 меньше 12 секунд | автоматический отчёт |
| Стоимость задачи | расходы на модель и API, делённые на число закрытых обращений | согласованная сумма за обращение, зафиксированная до старта | подрядчик, ежемесячный отчёт |
| Раскрытие ИИ | первое сообщение в каждом канале, подпись в виджете, первая фраза голосового звонка | предупреждение при первом контакте во всех каналах | заказчик |
Последняя строка не косметика. С 2 августа 2026 года статья 50 европейского AI Act требует сообщать человеку, что он общается с системой ИИ, и отвечает за это компания, которая использует агента под своим именем.
Вне таблицы остаются два пункта: у кого есть доступ к логам (у заказчика должен быть) и что происходит, если порог не достигнут (правки в рамках цены внедрения, со сроком).
Shadow mode: две недели параллельно с человеком
Shadow mode - это запуск агента на реальном трафике без выпуска его к клиентам. Агент видит обращение и готовит ответ, человек по-прежнему отвечает сам. Никто ничем не рискует, а данные настоящие. Процедура, которой я пользуюсь:
- День 0. Агент подключён к живому каналу в режиме только на чтение. Каждое входящее уходит и к нему, его ответ падает в отдельный тред в Slack или в таблицу. Клиент не видит ничего.
- Дни 1-10. Человек, который и так ведёт этот канал, оценивает черновики агента одним кликом: отправил бы / поправил бы / не отправил бы никогда. Это добавляет секунд десять на обращение.
- День 5. Первый разбор. Все «не отправил бы никогда» уходят в тестовый набор как новые кейсы. Правки делаются только на их основании.
- Дни 11-14. Конфигурацию не трогаем. Это измерение, а не настройка. Правка промпта в последнюю неделю обнуляет результат.
- Приёмка. Считаете долю «отправил бы» за последние четыре дня. Ниже 85% агент к клиентам не выходит, а возвращается на доработку.
- Запуск с ручником. Первая рабочая неделя: один канал, только рабочие часы, видимая кнопка перехода на человека, ежедневное чтение диалогов.
При потоке меньше 20 обращений в день нужно три-четыре недели, чтобы набрать осмысленную выборку. У голосового агента параллельно звонить нельзя: там записывают звонки и прогоняют расшифровки через агента, о чём я писал в разборе голосового ИИ-агента для звонков.
Что мерить, когда агент уже общается с клиентами
Четыре числа на одном экране, просматриваемые раз в неделю, ловят большинство проблем до того, как из них получится история с клиентом.
- Доля закрытых без человека. Значит направление, а не уровень: падение на 10 пунктов неделя к неделе означает, что изменились данные, модель или вопросы клиентов.
- Эскалации с разбивкой по причинам. Отдельно «клиент попросил человека», отдельно «агент не знал», отдельно «агент ошибся, и человек это исправлял». Больно по-настоящему только от последней категории.
- Стоимость задачи. Расходы на модель и API, делённые на количество закрытых обращений. Это число позволяет говорить о внедрении в терминах возврата, а не веры. Арифметику экономии я расписал в тексте о том, сколько реально экономит ИИ-бот в поддержке.
- Задержка, медиана и p95. Растущая медиана обычно означает, что поставщик что-то поменял у себя. Растущий хвост p95 означает, что один из инструментов начал подвисать.
И привычка, которая заменяет половину инструментов: каждый понедельник кто-то читает десять случайных диалогов за прошлую неделю. Не худшие, не пожаловавшиеся, а случайные. Вылавливает то, чего не покажет ни одна метрика.
Что ломается само, без чьей-либо вины
Агент - не проект, который заканчивается. Почва под ним двигается, даже если никто ничего не трогает.
| Что меняется | Что видит клиент | Сигнал в данных |
|---|---|---|
| Поставщик выводит версию модели | ответы становятся длиннее и расплывчатее | длина ответа и стоимость задачи прыгают в одну и ту же неделю |
| Изменилось API CRM или поле формы | агент «работает», но записи не появляются | падают успешные вызовы инструмента при ровном трафике |
| Новый прайс залили в другое место | бот называет старые цены | растёт доля диалогов, которые правит человек |
| Промпт разросся после десятка правок | агент забывает ранние правила | падает точность на старых кейсах из тестового набора |
| Сезонный сдвиг в вопросах | больше «не знаю» | растут эскалации с причиной «агент не знал» |
| Внедрённая инструкция во внешнем тексте | агент выполняет команду из чужого письма или PDF-а | нетипичные вызовы инструментов вне обычного суточного графика |
Последняя строка растёт быстрее всех: в отчёте OWASP за 2026 год зафиксирован рост числа атак через внедрение инструкций на 340% год к году. Агент, читающий внешние тексты, не должен иметь права записи без подтверждения человеком. Самая дешёвая защита от всей этой таблицы стоит ноль: прогоняйте тестовый набор после каждого изменения и раз в месяц просто так.
Сколько стоит поддержка и что должно быть в абонементе
Польские подрядчики публикуют сопровождение в районе 15-25% стоимости внедрения в год либо абонементы 120-580 € (500-2 500 zł) в месяц, а расходы на модель и API, обычно 45-115 € (200-500 zł) в месяц, считаются отдельно. Англоязычные студии называют 15-30% цены разработки в год. Это чужие прайсы, не мои.
Абонемент оправдан, когда в нём лежат вещи из этой статьи, а не слово «поддержка»:
- ежемесячный прогон тестового набора с отчётом и сравнением с прошлым месяцем,
- четыре продовые метрики в одном месте, доступные заказчику без запроса,
- реакция на смену версии модели у поставщика, включая тестирование новой,
- правки промпта и базы знаний в оговорённом лимите часов,
- ежеквартальное пополнение тестового набора кейсами из живых диалогов.
Когда его брать не надо: если агент обрабатывает десяток обращений в месяц, если он отвечает только по закрытому документу или если у него нет права записи ни в одну систему. Там достаточно ревизии раз в квартал, и я говорю это клиентам прямо.
Если агент у вас уже работает
Самая быстрая проверка занимает один вечер. Соберите 20 настоящих вопросов за последний месяц, задайте их агенту, сверьте ответы с источником и посчитайте, сколько заявок доехало до CRM целиком. Если хуже, чем в день приёмки, ответ у вас есть.
Если хочется, чтобы это сделал кто-то снаружи и письменно, аудит ИИ у меня устроен так: тестовый набор на ваших данных, разбор логов, таблица критериев приёмки с реальными результатами и список правок по стоимости. Старт от 1 150 € (4 900 zł), а при внедрении у меня это часть работ. Напишите на странице контактов, что у вас запущено, и я скажу, есть ли тут что аудировать.
FAQ
Как проверить, что ИИ-агент всё ещё отвечает правильно? Возьмите 20-50 настоящих клиентских вопросов за последний месяц, задайте их агенту и сверьте каждый ответ с источником: прайсом, условиями, карточкой товара. Отдельно проверьте, что данные дошли до CRM со всеми полями, потому что агент умеет ответить верно и записать мусор. Один и тот же набор, прогоняемый ежемесячно, показывает направление, а разовый тест - состояние на сегодня. Тревожный порог - падение точности больше чем на 10 процентных пунктов относительно дня приёмки.
Чем отличается оценка качества от мониторинга ИИ-агента? Оценка проверяет, может ли агент работать: вы прогоняете фиксированный набор вопросов с известными правильными ответами и считаете попадания. Мониторинг проверяет, работает ли он прямо сейчас: живой трафик, вызовы инструментов, эскалации, стоимость и время ответа. Оценка ловит регресс после правки промпта или смены модели, мониторинг - то, чего никто не предусмотрел при написании тестов. Нужны оба: они закрывают разные типы ошибок.
Какие критерии приёмки ИИ-агента прописать в договоре? Каждому критерию нужны четыре части: метрика, способ измерения, числовой порог и конкретный человек, который проверяет. Минимальный набор: точность ответов на замороженном тестовом наборе, ноль выдуманных чисел и цен, совпадение полей при записи в CRM, стопроцентная передача человеку в оговорённых сценариях, медиана и p95 времени ответа, стоимость закрытого обращения и раскрытие ИИ во всех каналах. Плюс доступ заказчика к логам и пункт о том, что происходит при недостижении порога.
Что такое shadow mode и сколько он должен длиться? Shadow mode - это работа агента на реальном трафике без показа его ответов клиентам: агент готовит черновик, человек всё равно отвечает сам, а каждый черновик оценивается одним кликом. Стандарт - две недели, при потоке меньше 20 обращений в день нужно три-четыре, чтобы выборка была осмысленной. В последнюю неделю конфигурацию не меняют, потому что это измерение, а не настройка. Разумный порог выхода к клиентам - минимум 85% черновиков с оценкой «отправил бы без правок».
Сколько стоит поддержка ИИ-агента после запуска? Польские подрядчики публикуют 15-25% стоимости внедрения в год либо абонементы 120-580 € (500-2 500 zł) в месяц, а расходы на модель и API, обычно 45-115 € (200-500 zł) в месяц, считаются отдельно. Англоязычные студии называют 15-30% цены разработки в год. Абонемент оправдан, если включает ежемесячный прогон тестового набора, доступ заказчика к метрикам, реакцию на смену версии модели и лимит часов на правки.
Почему агент перестаёт работать, хотя никто ничего не менял? Потому что меняется окружение. Поставщик выводит версию модели, и ответы становятся длиннее и расплывчатее; кто-то переименовал поле формы, и заявки перестали записываться; новый прайс залили в другую папку, и бот называет старые цены. Исследование 143 корпоративных внедрений RAG, опубликованное сообществом MLOps в 2026 году, показало: 73% из них словили критический сбой в первом квартале на проде, а 41% этих сбоев не увидели стандартные наборы тестов.
Нужно ли покупать инструмент мониторинга агентов? При одном агенте в небольшой компании обычно нет. Четыре числа раз в неделю - доля закрытых без человека, эскалации по причинам, стоимость задачи и медиана с p95 времени ответа - помещаются в таблицу, подключённую к логам. Платные инструменты вроде LangSmith или Arize Phoenix начинают окупаться при нескольких агентах и команде, которой нужно видеть одну картину. Важнее инструмента то, чтобы кто-то каждый понедельник читал десять случайных диалогов.




