Питання «скільки коштує агент AI» звучить як запит про прайс-лист, але насправді це питання про архітектуру. Той самий бізнес-ефект можна забезпечити дешево та непередбачувано або трохи дорожче, але з вартістю, яку можна спланувати на рік наперед.
З чого складається вартість#
- Впровадження (CAPEX проєкту) — аналіз процесу, проєктування кроків агента, інтеграції з вашими системами (CRM, e-mail, бази даних), тестування та запуск.
- Змінна вартість моделей (OPEX) — або оплата за токени в хмарі, або амортизація власної інфраструктури. Тут вирішальне значення має вибір між API та суверенною інфраструктурою.
- Обслуговування — моніторинг якості, виправлення промптів і логіки, додавання нових навичок, коли процес змінюється.
Ми не наводимо однієї цифри, бо вона була б вигаданою — вартість зростає з кількістю інтеграцій та обсягом завдань. Нижче орієнтовні діапазони; реальну оцінку розраховуємо на вашому процесі.
| Складник | Характер | Що визначає діапазон |
|---|---|---|
| Впровадження | CAPEX (одноразово) | Простий агент для виконання завдань: від кількох тисяч злотих. Виробничий агент, інтегрований із системами: зазвичай порядку 30 000–80 000 злотих, залежно від кількості інтеграцій і правил; реальну оцінку розраховуємо на вашому процесі. |
| Змінна вартість моделей | OPEX (щомісячно) | Обсяг завдань × кількість викликів на завдання × вартість виклику в API, або амортизація власної інфраструктури. Підбір моделі під завдання змінює цю позицію в рази. |
| Обслуговування | OPEX (щомісячно) | Масштаб змін у процесі, кількість опрацьованих сценаріїв, потрібний рівень моніторингу якості. |
Що реально збільшує рахунок#
Найдорожчим є не сама модель — найдорожчі непередбачувані виклики. Агент, який для кожного кроку викликає найбільшу модель у хмарі, генерує рахунок, що зростає з навантаженням. Тому ми підключаємо моделі через router, який підбирає модель під завдання: маленьку й дешеву для класифікації, потужну — лише там, де дійсно потрібно. Це зазвичай найбільший окремий важіль для зниження витрат.
Як розраховувати вартість одиниці#
Замість того, щоб питати про ціну агента, порахуйте вартість виконання одного завдання: скільки коштує обробка одного ліда, класифікація одного документа, відповідь на один запит. Цей показник можна прямо порівняти з вартістю виконання тієї ж роботи людиною — і тільки він покаже, чи окупається агент.
Схема розрахунку (приклад, а не прайс-лист — реальні цифри рахуємо на ваших даних):
- Змінна вартість при API = кількість завдань на місяць × кількість викликів на завдання × вартість одного виклику (а вона залежить від кількості токенів входу й виходу та від того, наскільки велика модель опрацьовує дане завдання). У багатокроковому агенті одне завдання — це часто від кількох до десятка викликів (кожен крок циклу ReAct — це окремий виклик LLM), тож не припускайте, що 1 завдання = 1 виклик — це найпоширеніша помилка, яка занижує рахунок для агентів.
- Prompt caching — на боці входу найбільшим важелем для RAG-агента є кешування сталого системного промпту та заголовків контексту RAG: вони зазвичай становлять більшість токенів входу, а їх кешування знижує вартість входу на 20–40% без зміни логіки (як оптимізувати вартість токенів).
- Вартість одиниці при self-hosting = (амортизація обладнання + електроенергія + обслуговування) ÷ кількість завдань. Чим більший і стабільніший обсяг, тим нижча вартість на завдання.
- Точка окупності (break-even) — це обсяг, за якого ці дві цифри зрівнюються: нижче за нього дешевшим є API, вище — власна інфраструктура. Точка перетину зміщується з кожною зміною прайс-листа та поколінням обладнання, тому ми рахуємо її на реальному навантаженні, а не наперед.
Приклад порядку величини (тарифи з середини 2026, звіряйте з актуальним прайс-листом): для моделі середнього класу (бл. 0,30 USD за 1 млн токенів входу і бл. 1,20 USD за 1 млн виходу) завдання, що споживає ~1 тис. токенів входу і ~0,5 тис. виходу, коштує бл. 0,0009 USD за виклик — за 50 тис. завдань на місяць це порядок кількох десятків USD на модель. На боці self-hosting бокс із GPU, розкладений в амортизації, — це діапазон бл. 600–1200 USD/міс., тож точка break-even зазвичай лежить в околицях 0,5–2 млн викликів на місяць. Точний розподіл рахуємо на вашому обсязі; деталі порогу розкладаємо у вартість: локальна модель vs API.
Власні діапазони порахуєте в наших інструментах: калькулятор ROI показує, чи окупається завдання порівняно з ручною роботою, а калькулятор вартості інференсу оцінює змінну вартість на завдання. Поріг API-проти-власної-моделі розкладаємо в вартість: локальна модель vs API, а бік FinOps із поточним моніторингом рахунку — у моніторингу витрат на LLM. Коли ви хочете цифру, підібрану під ваш процес, а не оцінку з калькулятора — опишіть нам випадок, і ми розрахуємо кошторис.
Коли власна інфраструктура окупається швидше#
При малому обсязі API в хмарі дешевше (відсутність вхідних витрат). При постійному великому навантаженні власне обслуговування моделей і ембедінги BGE-M3 починають вигравати за вартістю та забезпечують передбачуваність. Точка перетину залежить від обсягу — тому ми підбираємо варіант під реальне навантаження, а не під максимальне залізо.
Спробуйте наживо#
Опишіть свій випадок, і модель оцінить розподіл витрат (впровадження, змінна вартість моделей, обслуговування) та вартість одиниці за завдання (playground: PII маскується, нульове зберігання):
FAQ#
Від чого залежить вартість агента AI?#
Від трьох речей: складності процесу (скільки кроків і інтеграцій), обсягу (скільки завдань на місяць) та вибору між API в хмарі та власною інфраструктурою. Найбільше на поточний рахунок впливає підбір моделі під завдання.
Що дешевше: використовувати готовий API чи власну модель?#
При малому обсязі — API. При постійному великому навантаженні власне обслуговування моделей забезпечує нижчу та передбачувану вартість одиниці. Межа залежить від кількості завдань на місяць.
Як не переплачувати за агента?#
Вимірюйте вартість виконання одного завдання, направляйте всі виклики через router, який підбирає модель під завдання, і починайте з одного вузько визначеного процесу, а не з «агента на всі випадки життя».
