ШІ-агент майже ніколи не ламається так, щоб це було видно. Немає помилки 500, віджет відкривається, бот відповідає ввічливо і швидко. Просто третій тиждень він називає ціни з попереднього прайсу, а половина заявок не доїжджає до CRM, бо хтось перейменував одне поле у формі.
У цьому і полягає проблема: зламаний агент виглядає як робочий. Нижче - оцінка і моніторинг, тестовий набір, критерії приймання для договору, продові метрики і вартість супроводу.
Зламаний агент виглядає як звичайна робота
У 2026 році спільнота MLOps опублікувала дослідження 143 корпоративних впроваджень RAG, тобто агентів, які відповідають за базою знань компанії. 73% з них зловили щонайменше один критичний збій у першому кварталі роботи на проді, а 41% цих збоїв не виявили стандартні набори тестів.
Друга цифра важливіша за першу. Тести в компаній були, тести проходили, а система все одно видавала людям хибні відповіді. Агент ламається не так, як звичайний софт: він не кидає виняток, а викликає правильний інструмент із хибними параметрами. Записує лід у CRM з порожнім телефоном. Коректно відповідає на питання про ціну, цитуючи документ річної давності, бо новий PDF залили в іншу папку.
Загальне тло таке саме тверезе: Gartner оцінює, що 89% пілотів з агентами не доходять до продакшену, а S&P Global Market Intelligence зафіксувала 42% компаній, які згорнули більшість своїх ШІ-ініціатив у 2025 році проти 17% у 2024-му. Частина цього - погані ідеї. Помітна частина - нормальні впровадження, за якими ніхто не стежив після підписання акта.
Оцінка каже, чи може працювати. Моніторинг - чи працює зараз
Цей поділ знімає більшість суперечок між замовником і підрядником.
Оцінка якості (evaluation) - фіксований набір запитань із заздалегідь відомими правильними відповідями, який проганяють на вимогу. Відповідає на питання: чи справляється ця версія агента з тим, що ми здатні уявити. Прогін роблять до запуску і після кожної зміни промпту, бази знань або моделі.
Моніторинг - спостереження за реальним трафіком: що агент відповідає сьогодні, скільки разів викликав інструмент, скільки звернень закінчилися передачею людині. Відповідає на питання: чи працює він на тому, чого ніхто не передбачив.
Потрібні обидва, бо вони ловлять різні помилки. У тестовому наборі ніколи немає запитання, якого клієнт ще не ставив, а моніторинг не скаже, чи нова версія промпту краща за стару, доки ви не випустите її на живих людей.
Масштаб прогалини порахований: у звіті OWASP за 2026 рік середнє покриття моніторингом агентних систем на проді становить 52%. За кожним другим робочим агентом не стежить ніхто.
Тестовий набір: 50 реальних кейсів, зібраних до запуску
Це єдине, що замовник мусить зробити сам. Тестовий набір - файл зі справжніми запитаннями та еталонними відповідями. Підрядник його не напише, бо напише запитання, на які його агент уже відповідає добре. Як зібрати за два вечори:
- Візьміть останні 200 діалогів із чату, пошти або з телефону. Не вибирайте гарні, беріть підряд.
- Відберіть 50: приблизно 30 типових, 10 межових (нестандартний випадок, два питання одразу, клієнт пише іншою мовою), 5 таких, де агент зобовʼязаний відмовити або передати людині, і 5 недобросовісних (вибити знижку, спитати дані іншого клієнта, вставлена фраза «ігноруй попередні інструкції»).
- До кожного допишіть одним рядком, яка відповідь вважається правильною і звідки вона береться. Це забирає найбільше часу, і в цьому цінність.
- Заморозьте файл. Тестовий набір змінюється раз на квартал, а не між правками агента.
Пʼятдесят - не цифра з досліджень, а робочий мінімум: менше, і результат стрибає на кожному прогоні, більше, і ніхто не оцінить це руками. Як такий проєкт виглядає повністю, я розбирав у тексті про те, як впровадити чат-бот на сайт крок за кроком.
Критерії приймання, які мають бути в договорі
Найчастіше формулювання в договорі на ШІ-агента звучить як «агент відповідає на питання клієнтів». Його неможливо ні прийняти, ні оскаржити. Нижче таблиця, яку я кладу до складу робіт: кожен рядок перевіряється за один вечір, і в кожного є відповідальна людина.
| Метрика | Як вимірюється | Поріг приймання | Хто перевіряє |
|---|---|---|---|
| Точність відповідей | 50 кейсів із замороженого набору, ручна оцінка: добре / доопрацювати / хибно | щонайменше 90% оцінок «добре», нуль хибних щодо цін і зобовʼязань | предметна людина з боку замовника |
| Вигадані факти | кожна відповідь із числом, ціною або терміном звіряється з джерелом | 0 із 50 кейсів | замовник, а не підрядник |
| Коректність викликів інструментів | логи викликів: чи потрапили в CRM ті поля, які назвав клієнт | 100% збігу полів на 20 кейсах із записом даних | підрядник, логи відкриті замовнику |
| Передача людині | сценарії, де агент мусить здатися: скарга, погроза, пряме прохання про людину | 100% передач, контакт із людиною швидше ніж за 2 хвилини в робочий час | замовник, наживо |
| Час відповіді | медіана і 95-й перцентиль за логами за тиждень | медіана менше 4 секунд, p95 менше 12 секунд | автоматичний звіт |
| Вартість задачі | витрати на модель і API, поділені на кількість закритих звернень | узгоджена сума за звернення, зафіксована до старту | підрядник, щомісячний звіт |
| Розкриття ШІ | перше повідомлення в кожному каналі, підпис у віджеті, перша фраза голосового дзвінка | попередження при першому контакті в усіх каналах | замовник |
Останній рядок не косметика. Від 2 серпня 2026 року стаття 50 європейського AI Act вимагає повідомляти людину, що вона спілкується із системою ШІ, і відповідає за це компанія, яка використовує агента під власним іменем.
Поза таблицею лишаються два пункти: у кого є доступ до логів (у замовника має бути) і що відбувається, якщо поріг не досягнуто (правки в межах ціни впровадження, з терміном).
Shadow mode: два тижні паралельно з людиною
Shadow mode - це запуск агента на реальному трафіку без випуску його до клієнтів. Агент бачить звернення і готує відповідь, людина й далі відповідає сама. Ніхто нічим не ризикує, а дані справжні. Процедура, якою я користуюся:
- День 0. Агент підключений до живого каналу в режимі лише для читання. Кожне вхідне йде і до нього, його відповідь падає в окремий тред у Slack або в таблицю. Клієнт не бачить нічого.
- Дні 1-10. Людина, яка й так веде цей канал, оцінює чернетки агента одним кліком: надіслав би / виправив би / не надіслав би ніколи. Це додає секунд десять на звернення.
- День 5. Перший розбір. Усі «не надіслав би ніколи» йдуть у тестовий набір як нові кейси. Правки роблять лише на цій підставі.
- Дні 11-14. Конфігурацію не чіпаємо. Це вимірювання, а не налаштування. Правка промпту в останній тиждень обнуляє результат.
- Приймання. Рахуєте частку «надіслав би» за останні чотири дні. Нижче 85% агент до клієнтів не виходить, а повертається на доопрацювання.
- Запуск із ручником. Перший робочий тиждень: один канал, лише робочі години, видима кнопка переходу на людину, щоденне читання діалогів.
За потоку менше ніж 20 звернень на день потрібно три-чотири тижні, щоб набрати осмислену вибірку. У голосового агента паралельно дзвонити не можна: там записують дзвінки і проганяють розшифровки через агента, про що я писав у розборі голосового ШІ-агента для дзвінків.
Що міряти, коли агент уже спілкується з клієнтами
Чотири числа на одному екрані, які переглядають раз на тиждень, ловлять більшість проблем до того, як з них вийде історія з клієнтом.
- Частка закритих без людини. Означає напрямок, а не рівень: падіння на 10 пунктів тиждень до тижня означає, що змінилися дані, модель або питання клієнтів.
- Ескалації з розбивкою за причинами. Окремо «клієнт попросив людину», окремо «агент не знав», окремо «агент помилився, і людина це виправляла». По-справжньому болить лише остання категорія.
- Вартість задачі. Витрати на модель і API, поділені на кількість закритих звернень. Це число дозволяє говорити про впровадження в термінах повернення, а не віри. Арифметику економії я розписав у тексті про те, скільки насправді заощаджує ШІ-чатбот у підтримці.
- Затримка, медіана і p95. Зростання медіани зазвичай означає, що постачальник щось змінив у себе. Зростання хвоста p95 означає, що якийсь інструмент почав підвисати.
І звичка, яка замінює половину інструментів: щопонеділка хтось читає десять випадкових діалогів за минулий тиждень. Не найгірші, не ті, на які поскаржилися, а випадкові. Виловлює те, чого не покаже жодна метрика.
Що ламається саме, без чиєїсь провини
Агент - не проєкт, який закінчується. Ґрунт під ним рухається, навіть якщо ніхто нічого не чіпає.
| Що змінюється | Що бачить клієнт | Сигнал у даних |
|---|---|---|
| Постачальник виводить версію моделі | відповіді стають довшими і розпливчастішими | довжина відповіді і вартість задачі стрибають того самого тижня |
| Змінилося API CRM або поле форми | агент «працює», але записи не зʼявляються | падають успішні виклики інструмента за рівного трафіку |
| Новий прайс залили в інше місце | бот називає старі ціни | зростає частка діалогів, які виправляє людина |
| Промпт розрісся після десятка правок | агент забуває ранні правила | падає точність на старих кейсах із тестового набору |
| Сезонний зсув у питаннях | більше «не знаю» | зростають ескалації з причиною «агент не знав» |
| Вбудована інструкція у зовнішньому тексті | агент виконує команду з чужого листа або PDF-а | нетипові виклики інструментів поза звичайним добовим графіком |
Останній рядок зростає найшвидше: у звіті OWASP за 2026 рік зафіксовано зростання кількості атак через вбудовування інструкцій на 340% рік до року. Агент, який читає зовнішні тексти, не повинен мати права запису без підтвердження людиною. Найдешевший захист від усієї цієї таблиці коштує нуль: проганяйте тестовий набір після кожної зміни і раз на місяць просто так.
Скільки коштує супровід і що має бути в абонементі
Польські підрядники публікують супровід у районі 15-25% вартості впровадження на рік або абонементи 120-580 € (500-2 500 zł) на місяць, а витрати на модель і API, зазвичай 45-115 € (200-500 zł) на місяць, рахуються окремо. Англомовні студії називають 15-30% ціни розробки на рік. Це чужі прайси, не мої.
Абонемент виправданий, коли в ньому лежать речі з цієї статті, а не слово «підтримка»:
- щомісячний прогін тестового набору зі звітом і порівнянням з минулим місяцем,
- чотири продові метрики в одному місці, доступні замовнику без запиту,
- реакція на зміну версії моделі в постачальника, включно з тестуванням нової,
- правки промпту і бази знань у обумовленому ліміті годин,
- щоквартальне поповнення тестового набору кейсами з живих діалогів.
Коли його брати не треба: якщо агент обробляє десяток звернень на місяць, якщо він відповідає лише за закритим документом або якщо в нього немає права запису в жодну систему. Там достатньо ревізії раз на квартал, і я кажу це клієнтам прямо.
Якщо агент у вас уже працює
Найшвидша перевірка займає один вечір. Зберіть 20 справжніх запитань за останній місяць, поставте їх агенту, звірте відповіді з джерелом і порахуйте, скільки заявок доїхало до CRM цілком. Якщо гірше, ніж у день приймання, відповідь у вас є.
Якщо хочеться, щоб це зробив хтось ззовні і письмово, аудит ШІ у мене влаштований так: тестовий набір на ваших даних, розбір логів, таблиця критеріїв приймання з реальними результатами і список правок за вартістю. Старт від 1 150 € (4 900 zł), а при впровадженні в мене це частина робіт. Напишіть на сторінці контактів, що у вас запущено, і я скажу, чи є тут що аудитувати.
FAQ
Як перевірити, що ШІ-агент усе ще відповідає правильно? Візьміть 20-50 справжніх клієнтських запитань за останній місяць, поставте їх агенту і звірте кожну відповідь із джерелом: прайсом, умовами, карткою товару. Окремо перевірте, що дані дійшли до CRM з усіма полями, бо агент уміє відповісти правильно і записати сміття. Один і той самий набір запитань, який проганяють щомісяця, показує напрямок, а разовий тест - лише стан на сьогодні. Тривожний поріг - падіння точності більш ніж на 10 відсоткових пунктів відносно дня приймання.
Чим оцінка якості відрізняється від моніторингу ШІ-агента? Оцінка перевіряє, чи може агент працювати: ви проганяєте фіксований набір запитань із відомими правильними відповідями і рахуєте влучання. Моніторинг перевіряє, чи він працює просто зараз: живий трафік, виклики інструментів, ескалації, вартість і час відповіді. Оцінка ловить регрес після правки промпту чи зміни моделі, моніторинг - те, чого ніхто не передбачив під час написання тестів. Потрібні обидва: вони закривають різні типи помилок.
Які критерії приймання ШІ-агента прописати в договорі? Кожному критерію потрібні чотири частини: метрика, спосіб вимірювання, числовий поріг і конкретна людина, яка перевіряє. Мінімальний набір: точність відповідей на замороженому тестовому наборі, нуль вигаданих чисел і цін, збіг полів при записі в CRM, стовідсоткова передача людині в обумовлених сценаріях, медіана і p95 часу відповіді, вартість закритого звернення і розкриття ШІ в усіх каналах. Плюс доступ замовника до логів і пункт про те, що відбувається, якщо поріг не досягнуто.
Що таке shadow mode і скільки він має тривати? Shadow mode - це робота агента на реальному трафіку без показу його відповідей клієнтам: агент готує чернетку, людина все одно відповідає сама, а кожну чернетку оцінюють одним кліком. Стандарт - два тижні, за потоку менше ніж 20 звернень на день потрібно три-чотири, щоб вибірка була осмисленою. В останній тиждень конфігурацію не змінюють, бо це вимірювання, а не налаштування. Розумний поріг виходу до клієнтів - щонайменше 85% чернеток з оцінкою «надіслав би без правок».
Скільки коштує супровід ШІ-агента після запуску? Польські підрядники публікують 15-25% вартості впровадження на рік або абонементи 120-580 € (500-2 500 zł) на місяць, а витрати на модель і API, зазвичай 45-115 € (200-500 zł) на місяць, рахуються окремо. Англомовні студії називають 15-30% ціни розробки на рік. Абонемент виправданий, якщо включає щомісячний прогін тестового набору, доступ замовника до метрик, реакцію на зміну версії моделі і ліміт годин на правки.
Чому агент перестає працювати, хоча ніхто нічого не змінював? Бо змінюється оточення. Постачальник виводить версію моделі, і відповіді стають довшими та розпливчастішими; хтось перейменував поле форми, і заявки перестали записуватися; новий прайс залили в іншу папку, і бот називає старі ціни. Дослідження 143 корпоративних впроваджень RAG, опубліковане спільнотою MLOps у 2026 році, показало: 73% з них зловили критичний збій у першому кварталі на проді, а 41% цих збоїв не побачили стандартні набори тестів.
Чи потрібно купувати інструмент моніторингу агентів? За одного агента в невеликій компанії зазвичай ні. Чотири числа раз на тиждень - частка закритих без людини, ескалації за причинами, вартість задачі та медіана з p95 часу відповіді - вміщуються в таблицю, підключену до логів. Платні інструменти на кшталт LangSmith чи Arize Phoenix починають окуповуватися за кількох агентів і команди, якій треба бачити одну картину. Важливіше за інструмент те, щоб хтось щопонеділка читав десять випадкових діалогів.




