Залежність від одного постачальника API — це прихований ризик: вартість зростає з трафіком, дані виходять назовні, а зміна постачальника означає переписування інтеграцій.
З чого складається суверенітет#
- Обслуговування LLM локально (vLLM, Ollama) — передбачувана затримка та вартість.
- Сервер ембедінгів (BGE-M3) як основа семантичного пошуку.
- RAG на корпоративних даних — відповіді з твоїх документів, з цитатами.
- Router / gateway для уніфікації входу та контролю вартості.
Проектуй на вихід, а не на lock-in#
Ключовий принцип: система має дозволяти змінювати постачальника — ніколи навпаки. Router дозволяє змішувати локальні моделі (для чутливих шляхів) з хмарними (там, де потрібна потужність), без переписування коду.
А що з GDPR#
Compliance проектуємо з самого початку (compliance-by-design): у варіанті on-prem шар генерації не залишає компанії, а коли router спрямовує вибрані, безпечні шляхи у хмару — маскуємо PII перед будь-яким виходом назовні. Безпека та GDPR важливіші за окрему функцію.
Не потрібен одразу кластер GPU — підбираємо варіант під реальне навантаження та бюджет. Важлива передбачувана вартість, а не максимальне залізо.
Скільки заліза справді потрібно#
Апаратний варіант залежить насамперед від розміру моделі та квантизації — тобто від того, скільки VRAM потрібно, щоб завантажити модель цілком у пам’ять карти. На практиці орієнтовні вимоги виглядають так:
- Модель 7B у квантизації Q4 — приблизно 4–5 ГБ VRAM. Вміщується на одній споживчій карті.
- Модель 13B — приблизно 8–10 ГБ VRAM. Достатньо однієї карти на 24 ГБ із запасом на контекст.
- Модель 70B — щонайменше 40–48 ГБ VRAM, тобто дві карти по 24 ГБ, з’єднані через NVLink, або одна професійна карта на 48 ГБ+.
Саме тому суверенність не означає одразу кластер. Реалістичний пілот зазвичай стартує з малої моделі Q4 — спершу на CPU для прототипу, а вже коли обсяг і вимоги до затримки це виправдають, переходить на GPU. Повне зведення карт, пропускної здатності та вартості обладнання описуємо в посібнику про локальні LLM і вибір GPU.
Коли self-hosting виграє в API#
Це фінансове рішення, а не лише технічне. За стабільного, високого обсягу запитів одноразова вартість обладнання (CAPEX) амортизується, а далі ти платиш переважно за електроенергію — тоді власна інфраструктура виходить дешевшою за рахунок за токен. За малого або нерегулярного трафіку зазвичай виграє хмара: ти не заморожуєш капітал в обладнанні, яке не використаєш. Повний розрахунок порогу окупності — з конкретними діапазонами та сценарієм break-even — знайдеш у порівнянні вартості локального LLM та API.
Чого суверенність вимагає натомість#
Суверенність — це не лише переваги, а й операційні зобов’язання, які треба чесно врахувати в рішенні:
- Обслуговування та чергування — власна інфраструктура потребує моніторингу та реагування на інциденти (on-call), а не лише разового впровадження.
- Оновлення моделей і драйверів — нові версії моделей, бібліотеки обслуговування та драйвери GPU треба оновлювати й тестувати.
- Резервування обладнання — один сервер — це одна точка відмови; висока доступність означає запасне обладнання або failover.
- Масштабування під час піків — хмара масштабується еластично під трафік; локально піки обслуговуєш у межах наявного обладнання (тут допомагає гібрид із router).
- Доступ до найновіших моделей — найновіші моделі бувають доступні в API раніше, ніж локально.
Саме тому ми підбираємо варіант під реальне навантаження, тримаємо високооб’ємні шляхи локально й додаємо хмару там, де потрібна еластичність. Повний операційний рахунок (моніторинг, оновлення, нагляд) розписуємо в посібнику про вартість утримання AI-агента.
Self-hosted vs API у хмарі#
| Self-hosted | API у хмарі | |
|---|---|---|
| Вартість | Передбачувана (CAPEX + електроенергія) | Змінна, зростає з трафіком |
| Приватність даних | Дані залишаються у тебе | Дані виходять до постачальника |
| Контроль | Повний (модель, версія, налаштування) | Обмежений до API |
| Залежність від постачальника | Відсутня (можна змінити) | Lock-in за ціною та функціоналом |
| Поріг входу | Вищий (обладнання, впровадження) | Низький (ключ API) |
| Обслуговування та масштабування | На твоєму боці (on-call, оновлення, резервування) | На боці постачальника (еластичне масштабування) |
Пов’язані шляхи#
Для глибшої реалізації прочитайте матеріал про self-hosted LLM і GDPR, порівняння вартості локального LLM та API, а також сторінку продукту BGE-M3 для семантичного пошуку. Власний поріг окупності порахуєш у калькуляторі вартості inference.
FAQ#
Що таке суверенна інфраструктура AI?#
Це моделі на твоєму обладнанні, з правом власності на код і дані — self-hosting замість залежності від одного постачальника. Проектуємо так, щоб ти міг змінити постачальника, ніколи навпаки.
Чи потрібні власні сервери або GPU?#
Не обов’язково. Підбираємо варіант під реальне навантаження та бюджет — від малих моделей до кластера. Важлива передбачувана вартість, а не максимальне залізо.
Як суверенна інфраструктура впливає на вартість?#
Передбачувана вартість замість рахунку-сюрпризу: замість платити за токен у хмарі, контролюєш продуктивність і вартість на власному залізі.
