Skip to content
Усі статті

Як перевірити, що ШІ-агент, за якого ви заплатили, ще працює

Агент не падає, він тихо починає відповідати неправильно. Тестовий набір, таблиця критеріїв приймання для договору, процедура shadow mode і метрики на проді.

12 хв читання
Як перевірити, що ШІ-агент, за якого ви заплатили, ще працює

ШІ-агент майже ніколи не ламається так, щоб це було видно. Немає помилки 500, віджет відкривається, бот відповідає ввічливо і швидко. Просто третій тиждень він називає ціни з попереднього прайсу, а половина заявок не доїжджає до CRM, бо хтось перейменував одне поле у формі.

У цьому і полягає проблема: зламаний агент виглядає як робочий. Нижче - оцінка і моніторинг, тестовий набір, критерії приймання для договору, продові метрики і вартість супроводу.

Зламаний агент виглядає як звичайна робота

У 2026 році спільнота MLOps опублікувала дослідження 143 корпоративних впроваджень RAG, тобто агентів, які відповідають за базою знань компанії. 73% з них зловили щонайменше один критичний збій у першому кварталі роботи на проді, а 41% цих збоїв не виявили стандартні набори тестів.

Друга цифра важливіша за першу. Тести в компаній були, тести проходили, а система все одно видавала людям хибні відповіді. Агент ламається не так, як звичайний софт: він не кидає виняток, а викликає правильний інструмент із хибними параметрами. Записує лід у CRM з порожнім телефоном. Коректно відповідає на питання про ціну, цитуючи документ річної давності, бо новий PDF залили в іншу папку.

Загальне тло таке саме тверезе: Gartner оцінює, що 89% пілотів з агентами не доходять до продакшену, а S&P Global Market Intelligence зафіксувала 42% компаній, які згорнули більшість своїх ШІ-ініціатив у 2025 році проти 17% у 2024-му. Частина цього - погані ідеї. Помітна частина - нормальні впровадження, за якими ніхто не стежив після підписання акта.

Оцінка каже, чи може працювати. Моніторинг - чи працює зараз

Цей поділ знімає більшість суперечок між замовником і підрядником.

Оцінка якості (evaluation) - фіксований набір запитань із заздалегідь відомими правильними відповідями, який проганяють на вимогу. Відповідає на питання: чи справляється ця версія агента з тим, що ми здатні уявити. Прогін роблять до запуску і після кожної зміни промпту, бази знань або моделі.

Моніторинг - спостереження за реальним трафіком: що агент відповідає сьогодні, скільки разів викликав інструмент, скільки звернень закінчилися передачею людині. Відповідає на питання: чи працює він на тому, чого ніхто не передбачив.

Потрібні обидва, бо вони ловлять різні помилки. У тестовому наборі ніколи немає запитання, якого клієнт ще не ставив, а моніторинг не скаже, чи нова версія промпту краща за стару, доки ви не випустите її на живих людей.

Масштаб прогалини порахований: у звіті OWASP за 2026 рік середнє покриття моніторингом агентних систем на проді становить 52%. За кожним другим робочим агентом не стежить ніхто.

Тестовий набір: 50 реальних кейсів, зібраних до запуску

Це єдине, що замовник мусить зробити сам. Тестовий набір - файл зі справжніми запитаннями та еталонними відповідями. Підрядник його не напише, бо напише запитання, на які його агент уже відповідає добре. Як зібрати за два вечори:

  • Візьміть останні 200 діалогів із чату, пошти або з телефону. Не вибирайте гарні, беріть підряд.
  • Відберіть 50: приблизно 30 типових, 10 межових (нестандартний випадок, два питання одразу, клієнт пише іншою мовою), 5 таких, де агент зобовʼязаний відмовити або передати людині, і 5 недобросовісних (вибити знижку, спитати дані іншого клієнта, вставлена фраза «ігноруй попередні інструкції»).
  • До кожного допишіть одним рядком, яка відповідь вважається правильною і звідки вона береться. Це забирає найбільше часу, і в цьому цінність.
  • Заморозьте файл. Тестовий набір змінюється раз на квартал, а не між правками агента.

Пʼятдесят - не цифра з досліджень, а робочий мінімум: менше, і результат стрибає на кожному прогоні, більше, і ніхто не оцінить це руками. Як такий проєкт виглядає повністю, я розбирав у тексті про те, як впровадити чат-бот на сайт крок за кроком.

Критерії приймання, які мають бути в договорі

Найчастіше формулювання в договорі на ШІ-агента звучить як «агент відповідає на питання клієнтів». Його неможливо ні прийняти, ні оскаржити. Нижче таблиця, яку я кладу до складу робіт: кожен рядок перевіряється за один вечір, і в кожного є відповідальна людина.

МетрикаЯк вимірюєтьсяПоріг прийманняХто перевіряє
Точність відповідей50 кейсів із замороженого набору, ручна оцінка: добре / доопрацювати / хибнощонайменше 90% оцінок «добре», нуль хибних щодо цін і зобовʼязаньпредметна людина з боку замовника
Вигадані фактикожна відповідь із числом, ціною або терміном звіряється з джерелом0 із 50 кейсівзамовник, а не підрядник
Коректність викликів інструментівлоги викликів: чи потрапили в CRM ті поля, які назвав клієнт100% збігу полів на 20 кейсах із записом данихпідрядник, логи відкриті замовнику
Передача людинісценарії, де агент мусить здатися: скарга, погроза, пряме прохання про людину100% передач, контакт із людиною швидше ніж за 2 хвилини в робочий часзамовник, наживо
Час відповідімедіана і 95-й перцентиль за логами за тижденьмедіана менше 4 секунд, p95 менше 12 секундавтоматичний звіт
Вартість задачівитрати на модель і API, поділені на кількість закритих зверненьузгоджена сума за звернення, зафіксована до стартупідрядник, щомісячний звіт
Розкриття ШІперше повідомлення в кожному каналі, підпис у віджеті, перша фраза голосового дзвінкапопередження при першому контакті в усіх каналахзамовник

Останній рядок не косметика. Від 2 серпня 2026 року стаття 50 європейського AI Act вимагає повідомляти людину, що вона спілкується із системою ШІ, і відповідає за це компанія, яка використовує агента під власним іменем.

Поза таблицею лишаються два пункти: у кого є доступ до логів (у замовника має бути) і що відбувається, якщо поріг не досягнуто (правки в межах ціни впровадження, з терміном).

Shadow mode: два тижні паралельно з людиною

Shadow mode - це запуск агента на реальному трафіку без випуску його до клієнтів. Агент бачить звернення і готує відповідь, людина й далі відповідає сама. Ніхто нічим не ризикує, а дані справжні. Процедура, якою я користуюся:

  1. День 0. Агент підключений до живого каналу в режимі лише для читання. Кожне вхідне йде і до нього, його відповідь падає в окремий тред у Slack або в таблицю. Клієнт не бачить нічого.
  2. Дні 1-10. Людина, яка й так веде цей канал, оцінює чернетки агента одним кліком: надіслав би / виправив би / не надіслав би ніколи. Це додає секунд десять на звернення.
  3. День 5. Перший розбір. Усі «не надіслав би ніколи» йдуть у тестовий набір як нові кейси. Правки роблять лише на цій підставі.
  4. Дні 11-14. Конфігурацію не чіпаємо. Це вимірювання, а не налаштування. Правка промпту в останній тиждень обнуляє результат.
  5. Приймання. Рахуєте частку «надіслав би» за останні чотири дні. Нижче 85% агент до клієнтів не виходить, а повертається на доопрацювання.
  6. Запуск із ручником. Перший робочий тиждень: один канал, лише робочі години, видима кнопка переходу на людину, щоденне читання діалогів.

За потоку менше ніж 20 звернень на день потрібно три-чотири тижні, щоб набрати осмислену вибірку. У голосового агента паралельно дзвонити не можна: там записують дзвінки і проганяють розшифровки через агента, про що я писав у розборі голосового ШІ-агента для дзвінків.

Що міряти, коли агент уже спілкується з клієнтами

Чотири числа на одному екрані, які переглядають раз на тиждень, ловлять більшість проблем до того, як з них вийде історія з клієнтом.

  • Частка закритих без людини. Означає напрямок, а не рівень: падіння на 10 пунктів тиждень до тижня означає, що змінилися дані, модель або питання клієнтів.
  • Ескалації з розбивкою за причинами. Окремо «клієнт попросив людину», окремо «агент не знав», окремо «агент помилився, і людина це виправляла». По-справжньому болить лише остання категорія.
  • Вартість задачі. Витрати на модель і API, поділені на кількість закритих звернень. Це число дозволяє говорити про впровадження в термінах повернення, а не віри. Арифметику економії я розписав у тексті про те, скільки насправді заощаджує ШІ-чатбот у підтримці.
  • Затримка, медіана і p95. Зростання медіани зазвичай означає, що постачальник щось змінив у себе. Зростання хвоста p95 означає, що якийсь інструмент почав підвисати.

І звичка, яка замінює половину інструментів: щопонеділка хтось читає десять випадкових діалогів за минулий тиждень. Не найгірші, не ті, на які поскаржилися, а випадкові. Виловлює те, чого не покаже жодна метрика.

Що ламається саме, без чиєїсь провини

Агент - не проєкт, який закінчується. Ґрунт під ним рухається, навіть якщо ніхто нічого не чіпає.

Що змінюєтьсяЩо бачить клієнтСигнал у даних
Постачальник виводить версію моделівідповіді стають довшими і розпливчастішимидовжина відповіді і вартість задачі стрибають того самого тижня
Змінилося API CRM або поле формиагент «працює», але записи не зʼявляютьсяпадають успішні виклики інструмента за рівного трафіку
Новий прайс залили в інше місцебот називає старі цінизростає частка діалогів, які виправляє людина
Промпт розрісся після десятка правокагент забуває ранні правилападає точність на старих кейсах із тестового набору
Сезонний зсув у питанняхбільше «не знаю»зростають ескалації з причиною «агент не знав»
Вбудована інструкція у зовнішньому текстіагент виконує команду з чужого листа або PDF-анетипові виклики інструментів поза звичайним добовим графіком

Останній рядок зростає найшвидше: у звіті OWASP за 2026 рік зафіксовано зростання кількості атак через вбудовування інструкцій на 340% рік до року. Агент, який читає зовнішні тексти, не повинен мати права запису без підтвердження людиною. Найдешевший захист від усієї цієї таблиці коштує нуль: проганяйте тестовий набір після кожної зміни і раз на місяць просто так.

Скільки коштує супровід і що має бути в абонементі

Польські підрядники публікують супровід у районі 15-25% вартості впровадження на рік або абонементи 120-580 € (500-2 500 zł) на місяць, а витрати на модель і API, зазвичай 45-115 € (200-500 zł) на місяць, рахуються окремо. Англомовні студії називають 15-30% ціни розробки на рік. Це чужі прайси, не мої.

Абонемент виправданий, коли в ньому лежать речі з цієї статті, а не слово «підтримка»:

  • щомісячний прогін тестового набору зі звітом і порівнянням з минулим місяцем,
  • чотири продові метрики в одному місці, доступні замовнику без запиту,
  • реакція на зміну версії моделі в постачальника, включно з тестуванням нової,
  • правки промпту і бази знань у обумовленому ліміті годин,
  • щоквартальне поповнення тестового набору кейсами з живих діалогів.

Коли його брати не треба: якщо агент обробляє десяток звернень на місяць, якщо він відповідає лише за закритим документом або якщо в нього немає права запису в жодну систему. Там достатньо ревізії раз на квартал, і я кажу це клієнтам прямо.

Якщо агент у вас уже працює

Найшвидша перевірка займає один вечір. Зберіть 20 справжніх запитань за останній місяць, поставте їх агенту, звірте відповіді з джерелом і порахуйте, скільки заявок доїхало до CRM цілком. Якщо гірше, ніж у день приймання, відповідь у вас є.

Якщо хочеться, щоб це зробив хтось ззовні і письмово, аудит ШІ у мене влаштований так: тестовий набір на ваших даних, розбір логів, таблиця критеріїв приймання з реальними результатами і список правок за вартістю. Старт від 1 150 € (4 900 zł), а при впровадженні в мене це частина робіт. Напишіть на сторінці контактів, що у вас запущено, і я скажу, чи є тут що аудитувати.

FAQ

Як перевірити, що ШІ-агент усе ще відповідає правильно? Візьміть 20-50 справжніх клієнтських запитань за останній місяць, поставте їх агенту і звірте кожну відповідь із джерелом: прайсом, умовами, карткою товару. Окремо перевірте, що дані дійшли до CRM з усіма полями, бо агент уміє відповісти правильно і записати сміття. Один і той самий набір запитань, який проганяють щомісяця, показує напрямок, а разовий тест - лише стан на сьогодні. Тривожний поріг - падіння точності більш ніж на 10 відсоткових пунктів відносно дня приймання.

Чим оцінка якості відрізняється від моніторингу ШІ-агента? Оцінка перевіряє, чи може агент працювати: ви проганяєте фіксований набір запитань із відомими правильними відповідями і рахуєте влучання. Моніторинг перевіряє, чи він працює просто зараз: живий трафік, виклики інструментів, ескалації, вартість і час відповіді. Оцінка ловить регрес після правки промпту чи зміни моделі, моніторинг - те, чого ніхто не передбачив під час написання тестів. Потрібні обидва: вони закривають різні типи помилок.

Які критерії приймання ШІ-агента прописати в договорі? Кожному критерію потрібні чотири частини: метрика, спосіб вимірювання, числовий поріг і конкретна людина, яка перевіряє. Мінімальний набір: точність відповідей на замороженому тестовому наборі, нуль вигаданих чисел і цін, збіг полів при записі в CRM, стовідсоткова передача людині в обумовлених сценаріях, медіана і p95 часу відповіді, вартість закритого звернення і розкриття ШІ в усіх каналах. Плюс доступ замовника до логів і пункт про те, що відбувається, якщо поріг не досягнуто.

Що таке shadow mode і скільки він має тривати? Shadow mode - це робота агента на реальному трафіку без показу його відповідей клієнтам: агент готує чернетку, людина все одно відповідає сама, а кожну чернетку оцінюють одним кліком. Стандарт - два тижні, за потоку менше ніж 20 звернень на день потрібно три-чотири, щоб вибірка була осмисленою. В останній тиждень конфігурацію не змінюють, бо це вимірювання, а не налаштування. Розумний поріг виходу до клієнтів - щонайменше 85% чернеток з оцінкою «надіслав би без правок».

Скільки коштує супровід ШІ-агента після запуску? Польські підрядники публікують 15-25% вартості впровадження на рік або абонементи 120-580 € (500-2 500 zł) на місяць, а витрати на модель і API, зазвичай 45-115 € (200-500 zł) на місяць, рахуються окремо. Англомовні студії називають 15-30% ціни розробки на рік. Абонемент виправданий, якщо включає щомісячний прогін тестового набору, доступ замовника до метрик, реакцію на зміну версії моделі і ліміт годин на правки.

Чому агент перестає працювати, хоча ніхто нічого не змінював? Бо змінюється оточення. Постачальник виводить версію моделі, і відповіді стають довшими та розпливчастішими; хтось перейменував поле форми, і заявки перестали записуватися; новий прайс залили в іншу папку, і бот називає старі ціни. Дослідження 143 корпоративних впроваджень RAG, опубліковане спільнотою MLOps у 2026 році, показало: 73% з них зловили критичний збій у першому кварталі на проді, а 41% цих збоїв не побачили стандартні набори тестів.

Чи потрібно купувати інструмент моніторингу агентів? За одного агента в невеликій компанії зазвичай ні. Чотири числа раз на тиждень - частка закритих без людини, ескалації за причинами, вартість задачі та медіана з p95 часу відповіді - вміщуються в таблицю, підключену до логів. Платні інструменти на кшталт LangSmith чи Arize Phoenix починають окуповуватися за кількох агентів і команди, якій треба бачити одну картину. Важливіше за інструмент те, щоб хтось щопонеділка читав десять випадкових діалогів.

Сподобалося? Поговорімо про ваш проєкт.

30 хвилин на discovery-дзвінок. Без продажного пітчу.

Поговорімо