cashcrown // wiedza
Поняття AI без жаргону: RAG, ембединги, агенти, GDPR та інфраструктура - з визначеннями, звʼязками й пошуком.
64 понять з визначеннями · звʼязки й пошук
64 понять
Модель, що передбачає наступні токени тексту — основа сучасних систем AI.
LLM вивчає статистику мови з величезних корпусів і генерує текст токен за токеном. Сама по собі вона не знає ваших даних — предметні знання додаються через RAG або fine-tuning.
Повʼязані:ТокенІнференсRAG (генерація з пошуком)Тонке налаштування
Найменша одиниця тексту, яку обробляє модель.
Моделі рахують вартість і ліміти в токенах, а не символах. ~1 токен — це в середньому 4 символи тексту; розрахунки й контекстне вікно вимірюються саме в токенах.
Максимальна кількість токенів, які модель бачить одночасно.
Коли розмова чи документи перевищують вікно, доводиться їх скорочувати або шукати лише найрелевантніші фрагменти — одна з причин, чому застосовують RAG замість того, щоб запихати всю базу в промпт.
Повʼязані:ТокенRAG (генерація з пошуком)Промпт
Інструкція та контекст, що скеровують відповідь моделі.
Хороший промпт задає роль, правила, контекст (напр., джерела з RAG) і формат виводу. Впровадження зловмисної інструкції в промпт — це prompt injection, від якого захищають guardrails.
Запуск навченої моделі для генерації відповіді.
Інференс — це операційна вартість системи AI, що вимірюється латентністю та пропускною здатністю. Його можна запускати в хмарі або локально (self-hosting), що визначає резидентність даних.
Повʼязані:ЛатентністьСамостійний хостингВелика мовна модель (LLM)
Донавчання моделі на власних прикладах для зміни стилю чи поведінки.
Fine-tuning змінює ваги моделі й коштує дорого; для внесення свіжих фактичних знань зазвичай кращий RAG (дешевший, оновлюваний без перетренування). Обидва підходи інколи поєднують.
Повʼязані:Велика мовна модель (LLM)RAG (генерація з пошуком)Інференс
Спочатку знайди факти, потім хай модель відповість лише на їх основі.
RAG обмежує галюцинації: модель отримує конкретні джерела й цитує їх. Це основа надійної підтримки клієнтів — відповідь обґрунтована, а за слабкого збігу система ескалює до людини замість вигадування.
Повʼязані:Ембединг (вектор)Векторна база данихГібридний пошукГалюцинаціяLLM-роутер
Текст у вигляді чисел, де близькість = схожість значення.
Ембединги дають змогу шукати за значенням, а не за ключовими словами. Cashcrown обчислює їх локально моделлю BGE-M3 (1024 виміри), тож контент для вбудовування не залишає інфраструктури.
Сховище ембедингів, що знаходить найближчі вектори за мілісекунди.
Серце семантичного пошуку в RAG. Cashcrown запускає Qdrant локально як нативний сервіс — вектори й метадані залишаються на власному сервері.
Пошук за значенням, а не за дослівним збігом слів.
Питання та документи перетворюються на ембединги й порівнюються як вектори, тож «як захистити дані» знайде текст про GDPR навіть без спільних слів.
Повʼязані:Ембединг (вектор)Векторна база данихГібридний пошукFAQ-провідник
Поєднання семантичного та класичного пошуку за словами.
Семантика вловлює зміст, а повнотекстовий пошук — точні назви й коди. Поєднання обох (напр., вектори + FTS Postgres) дає влучніші результати, ніж кожен окремо.
Другий прохід, що впорядковує результати за релевантністю.
Після швидкого першого пошуку точніша модель оцінює кожного кандидата щодо питання й піднімає найкращих угору — це покращує якість контексту, що надходить до LLM.
Повʼязані:Гібридний пошукRAG (генерація з пошуком)
Єдиний вхід до моделей: добирає модель, маскує PII, контролює ліміти.
Увесь AI-трафік у Cashcrown проходить через роутер OpenClaw — жоден код не звертається до провайдера напряму. Завдяки цьому маскування PII, fallback моделей і телеметрія контролюються в одному місці.
Повʼязані:Велика мовна модель (LLM)PII (персональні дані)Структурований вивідСпостережуваністьДобір моделі (роутинг)Режим міркування (thinking)
Більше:Атлас моделей →
Система AI, що планує кроки й використовує інструменти.
Агент не лише відповідає — він діє: шукає, викликає API, бронює час. Безпека вимагає запобіжників і підтверджень для незворотних дій, щоб поведінка не вийшла з-під контролю.
Повʼязані:Використання інструментівЗапобіжникиКонсьєрж (асистент)
Здатність моделі викликати функції/API, а не лише писати текст.
Модель отримує каталог інструментів з описом аргументів і вирішує, які викликати. Незворотні дії (напр., бронювання) вимагають серверного токена підтвердження, а не самої заяви моделі.
Повʼязані:AI-агентСтруктурований вивідЗапобіжники
Правила, що обмежують вхід і вихід моделі.
На вході вони відхиляють prompt injection, на виході обумовлюють обіцянки (напр., ціни діапазоном, терміни із застереженням). Запобіжники не дають асистенту пообіцяти те, чого не слід.
Повʼязані:ПромптГалюцинаціяAI-агентВикористання інструментів
Впевнена, але вигадана відповідь моделі.
Моделі заповнюють прогалини правдоподібним текстом навіть тоді, коли не знають факту. RAG із цитуванням і порогом упевненості (ескалація до людини за слабкого збігу) — основний захист.
Повʼязані:RAG (генерація з пошуком)ЗапобіжникиВелика мовна модель (LLM)
Примус моделі повертати валідний JSON за схемою.
Без цього відповідь моделі важко безпечно розпарсити. Cashcrown використовує JSON на основі промпту з валідацією схеми та однією спробою виправлення — це стабільніше за повільні нативні режими «json_schema» в частини провайдерів.
Інформація, що ідентифікує особу.
Перш ніж будь-що піде в хмару, роутер маскує PII токенами, а у відповіді відновлює їх — хмарна модель ніколи не бачить справжніх персональних даних.
Повʼязані:GDPRLLM-роутерРезидентність даних
Закон ЄС про захист даних: згода, мінімізація, право на стирання.
На практиці: згода перед відстеженням, зберігання лише необхідного та реальне стирання даних на запит. У Cashcrown ці принципи вбудовані в pipeline, а не доліплені пізніше.
Повʼязані:PII (персональні дані)Резидентність данихСамостійний хостинг
Де фізично зберігаються й обробляються дані.
Локальні ембединги (BGE-M3) і локальний Qdrant означають, що чутливий контент не залишає сервера. У хмару потрапляє лише замаскований промпт — свідомий вибір резидентності.
Запуск моделей і сервісів на власній інфраструктурі.
Дає контроль над даними й витратами та незалежність від одного постачальника. Cashcrown хостить локально ембединги, векторну базу й пошук, а до хмари звертається лише по генерацію — із маскуванням.
Багатомовна модель ембедингів, локально (1024 виміри).
Перетворює багатомовний текст на вектори, не надсилаючи його в хмару — фундамент приватного RAG у Cashcrown.
Повʼязані:Ембединг (вектор)Векторна база данихСамостійний хостингДобір моделі (роутинг)
Більше:BGE-M3 в атласі моделей →
Метрики, логи й трейси, що показують роботу системи AI.
Без вимірювання неможливо керувати ні вартістю, ні якістю. Cashcrown надає метрики (Prometheus), корельовані логи й трейси, тож кожен виклик моделі піддається підрахунку й діагностиці.
Повʼязані:ЛатентністьLLM-роутерІнференс
Час від запиту до відповіді; низька латентність = плавна взаємодія.
Стрімінг відповіді токен за токеном зменшує відчутну латентність — користувач бачить текст, перш ніж модель закінчить. Саме тому асистент «пише наживо».
Скільки запитів/токенів система обробляє за одиницю часу.
Разом із латентністю описує продуктивність обслуговування моделей. Ліміти паралельності та backpressure захищають пропускну здатність від перевантаження.
Повʼязані:ЛатентністьІнференсСпостережуваність
Асистент на RAG, що відповідає з цитатами й ескалює до людини.
Консьєрж Cashcrown поєднує RAG, guardrails, багатомовність і стрімінг — відповідає наживо з посиланнями, а коли не знає, з'єднує з людиною замість вигадування.
Повʼязані:RAG (генерація з пошуком)AI-агентЗапобіжникиЛатентність
Пошук питань і відповідей за значенням.
Семантичний FAQ підказує найвлучнішу відповідь, навіть коли питання сформульоване інакше, ніж у базі — він використовує ті самі ембединги, що й RAG.
Повʼязані:Семантичний пошукRAG (генерація з пошуком)Консьєрж (асистент)
Режим, у якому модель спершу міркує внутрішньо, перш ніж відповісти.
Мислячі моделі міркують приховано — добре для складних рішень, але повільніше й дорожче. Примусово в звичайному чаті можуть повернути порожньо, тож вмикаємо лише для міркування (параметр think).
Повʼязані:Велика мовна модель (LLM)ІнференсДобір моделі (роутинг)Латентність
Вибір правильної моделі під задачу — найдешевшої, що її витягне.
Немає одного «найкращого» моделя; роутер OpenClaw добирає його під задачу за виміряною пропускною, TTFT і вікном контексту — не за назвою. Атлас моделей показує весь флот із вимірами.
Повʼязані:LLM-роутерПропускна здатністьTTFT (час до першого токена)Режим міркування (thinking)Контекстне вікно
Час від надсилання питання до появи першого токена відповіді.
TTFT визначає, наскільки «швидко» здається модель — при стрімінгу користувач бачить текст після нього. Вимірюємо наживо, бо назви оманливі.
Повʼязані:ЛатентністьПропускна здатністьДобір моделі (роутинг)
Більше:Атлас моделей →
Регламент ЄС, що класифікує системи ШІ за ризиком і накладає обов'язки.
AI Act ділить системи на рівні ризику. Для обмеженого ризику (чат-боти, асистенти) ключовою є прозорість — користувач має знати, що спілкується зі ШІ. Для високого ризику додаються людський нагляд, технічна документація, журнали логів та оцінка відповідності. Чинний від 2024 і застосовується поетапно: заборони неприйнятних практик від 2025, а прозорість для чат-ботів (ст. 50) і більшість обов'язків для високого ризику — від серпня 2026.
Повʼязані:GDPRDPIA (оцінка впливу на захист даних)Людський нагляд (human-in-the-loop)Запобіжники
Оцінка ризику, потрібна, коли обробка може створювати високий ризик для прав осіб.
DPIA випливає з GDPR і зазвичай потрібна за масштабного профілювання, чутливих даних чи автоматичних рішень щодо людей. Асистент, що лише відповідає з бази знань, зазвичай її не потребує; система, що профілює або вирішує, — імовірно, так.
Повʼязані:GDPRAI ActPII (персональні дані)
Вимога, щоб людина наглядала й підтверджувала суттєві чи незворотні рішення ШІ.
Людський нагляд — це опора відповідності та безпеки: незворотні дії проходять через підтвердження (human-gate), а система діє автономно лише у вузькому, описаному обсязі. GDPR також надає право не бути об'єктом виключно автоматизованих рішень.
Повʼязані:AI-агентЗапобіжникиAI Act
Модель, що читає документ чи повідомлення й відносить його до однієї з категорій.
Класифікація — одне із завдань з найшвидшим ROI: рознесення рахунків, категоризація звернень, оцінка лідів. Результат вимірюваний за визначенням (відсоток правильних призначень), а процес зазвичай уже існує вручну — тому це добрий кандидат на перше впровадження.
Повʼязані:Екстракція данихСтруктурований вивідВелика мовна модель (LLM)
Витягання конкретних полів із тексту — номер рахунку, сума, податковий номер, дата.
Екстракція перетворює неструктурований текст на готові до системи поля. Разом із класифікацією вона розв'язує значну частину перших ідей щодо AI у компаніях. Найкраще працює з примусовою схемою (structured output), що гарантує валідний формат.
Повʼязані:КласифікаторСтруктурований вивідRAG (генерація з пошуком)
Плавне передавання розмови від ШІ-асистента людині, коли цього вимагає випадок.
Передавання людині — це ознака зрілості системи, а не невдачі: за низької впевненості, фрустрації клієнта чи справи, що потребує рішення, асистент ескалює до людини замість того, щоб гадати. Це також частина прозорості за AI Act — користувач завжди може звернутися до людини.
Повʼязані:Людський нагляд (human-in-the-loop)Консьєрж (асистент)ГалюцинаціяAI Act
Впровадження одного вузького процесу за фіксованою вартістю, щоб виміряти цінність до масштабу.
Пілот знижує ризик з обох боків: замість великого контракту ми показуємо робочу систему на одному вимірюваному процесі. Якщо вона дає цифри (зекономлені години, % справ, закритих без людини), ми розширюємо обсяг; якщо ні — це коштувало небагато.
Повʼязані:КласифікаторСпостережуваністьRAG (генерація з пошуком)
Автоматична оцінка та пріоритезація запитів за відповідністю профілю клієнта (ICP).
Скоринг — це класифікація, застосована до продажів: лід із форми отримує оцінку (бюджет, відповідність, готовність), а найцінніші першими потрапляють до людини. Критерії відкриті й логуються, а не є прихованим профілюванням — що важливо для GDPR та AI Act.
Повʼязані:КласифікаторAI-агентСтруктурований вивід
Зчитування тексту із зображення чи скана — перший крок перед екстракцією полів.
OCR перетворює скан рахунка чи договору на текст, який модель може далі класифікувати й з якого витягне поля (податковий номер, сума, дата). У поєднанні з екстракцією та structured output це дає повний пайплайн «скан → готові поля в системі».
Автоматизація повторюваних кроків у наявних застосунках; зі ШІ стає «розумною».
Класична RPA клікає й переписує за жорсткими правилами. У поєднанні зі ШІ (класифікація, екстракція, рішення) вона справляється з варіативністю — напр., читає рахунок у будь-якому форматі замість того, щоб вимагати один шаблон. У нас цю роль виконують агенти з allow-list інструментів і human-gate.
Проєктування інструкцій моделі: роль, правила, контекст, формат виводу.
Хороший промпт — це не магічне заклинання, а інженерія: чітка роль, обмеження, контекст (напр., із RAG) і примусовий формат. У продакшені промпт версіонують і тестують як код, а не вгадують.
Повʼязані:ПромптВелика мовна модель (LLM)Структурований вивід
Штучно згенеровані дані для навчання чи тестів, коли реальних бракує або вони чутливі.
Синтетичні дані допомагають, коли реальних бракує, вони дорогі або підпадають під GDPR — напр., для тестів і граничних випадків. Треба стежити, щоб вони відтворювали реальний розподіл, інакше модель навчається фікції.
Повʼязані:Тонке налаштуванняКласифікаторPII (персональні дані)
Правила, ролі та контроль над тим, як компанія будує й використовує ШІ — хто відповідає, що дозволено, як аудиюється.
Governance об'єднує розрізнені впровадження в єдиний лад: реєстр систем AI, власники, правила даних, аудиторський слід і перегляди. Це умова відповідності AI Act і контролю ризику при масштабі.
Повʼязані:AI ActЛюдський нагляд (human-in-the-loop)СпостережуваністьЗапобіжники
Повна вартість системи ШІ: не лише впровадження, а й інференс, обслуговування, моніторинг і оновлення.
Ціна впровадження — це верхівка айсберга. TCO охоплює вартість інференсу (хмара проти локального), обслуговування, спостережуваність і оновлення. При масштабі саме вони вирішують, чи власне рішення перевершує API.
Повʼязані:ІнференсСамостійний хостингПілот
Здатність показати, чому система ШІ дала певну відповідь чи рішення — протилежність «чорної скриньки».
Пояснюваність ми будуємо практично: цитати джерел (RAG), лог кожного кроку й guardrails — щоб можна було показати, звідки взялася відповідь. Це вимога довіри та підзвітності (GDPR/AI Act).
Повʼязані:ГалюцинаціяЗапобіжникиЛюдський нагляд (human-in-the-loop)AI Act
Розрізання документів на фрагменти, які ембедяться і шукаються в RAG.
Модель індексує коротші уривки, а не цілі файли — контекстне вікно обмежене, і точний фрагмент знаходиться краще, ніж ціла сторінка. Погана межа (розрізане речення, розбита таблиця) псує релевантність, тож ріжемо за заголовками й абзацами з легким перекриттям, а не наосліп за кількістю символів.
Повʼязані:RAG (генерація з пошуком)Ембединг (вектор)Контекстне вікноРеранкінг
Відкритий стандарт, що з'єднує моделі й агентів з інструментами та джерелами даних через спільний інтерфейс.
MCP — це спільна «шина плагінів»: замість окремої інтеграції під кожну систему, сервер MCP надає інструменти й дані, а агент звертається до них стандартизовано. Зручно, але збільшує поверхню атаки — кожен сервер MCP потребує allow-list і контролю прав, бо наданий інструмент стає реальною дією.
Повʼязані:AI-агентВикористання інструментівЗапобіжникиLLM-роутер
RAG, що шукає не лише за фрагментами тексту, а й за графом сутностей та зв'язків між ними.
Звичайний RAG повертає схожі фрагменти, але не справляється з питаннями «як це пов'язано?». Graph RAG будує граф сутностей (люди, компанії, документи) та їхніх зв'язків, тож опрацьовує багатокрокові питання й контекст, розкиданий по багатьох файлах. Він дорожчий у побудові та підтримці, тож застосовуємо його там, де зв'язки справді важливі, а не за замовчуванням.
Повʼязані:RAG (генерація з пошуком)Семантичний пошукВекторна база данихAgentic RAG (агентний RAG)
RAG, де агент планує пошуки, сам оцінює результати й перепитує, замість одного запиту.
Класичний RAG — це один пошук і відповідь. В agentic RAG агент розбиває складне питання на кроки, шукає багаторазово, оцінює, чи достатньо знайденого контексту, і за потреби перепитує або переформульовує. Він дає кращі відповіді на складні питання ціною більшої кількості викликів моделі, тож ним і далі керують guardrails та ліміти.
Повʼязані:RAG (генерація з пошуком)AI-агентGraph RAG (RAG на графі)Запобіжники
Кеш, що повертає готову відповідь на питання, схоже за значенням до попереднього.
Звичайний кеш спрацьовує лише за ідентичного тексту; семантичний кеш порівнює ембединги, тож «скільки коштує впровадження?» і «яка ціна пілота?» можуть влучити в той самий збережений результат. Це знижує латентність і вартість інференсу, але потребує порога схожості й короткого TTL, щоб не віддавати застарілу чи надто притягнуту відповідь.
Повʼязані:Ембединг (вектор)Семантичний пошукЛатентністьІнференс
Зберігання ваг моделі з меншою точністю, щоб вона вмістилася на слабшому залізі.
Квантизація округлює ваги (наприклад, з 16 до 4 біт), тож модель займає менше пам'яті й працює швидше — ціною незначної втрати якості. Це базовий прийом, що дає змогу запускати корисні моделі локально (self-hosting), а не лише в хмарі.
Повʼязані:Самостійний хостингІнференсЛатентністьПропускна здатність
Дешевий спосіб донавчити модель — навчає невеликі додатки замість усіх ваг.
LoRA додає до моделі невеликі навчані шари (адаптери), тож тонке налаштування дешевше й швидше за тренування всього. QLoRA поєднує це з квантизацією, щоб тренування вмістилося на одну відеокарту. Для свіжих фактів зазвичай усе одно кращий RAG.
Повʼязані:Тонке налаштуванняКвантизаціяRAG (генерація з пошуком)Самостійний хостинг
Регулятор випадковості — низька дає стабільні, передбачувані відповіді, висока — креативні.
Температура керує тим, наскільки модель «ризикує» при виборі наступного токена. Для підтримки, екстракції даних і відповідей на основі джерел тримаємо її низькою (повторюваність), а підвищуємо лише там, де потрібне різноманіття.
Повʼязані:Велика мовна модель (LLM)ІнференсСтруктурований вивідГалюцинація
Архітектура, у якій на кожен токен активується лише частина моделі.
Модель MoE ділиться на багатьох «експертів», а роутер активує для кожного токена лише кількох із них. Завдяки цьому модель може бути дуже великою (багато знань), але дешевою в інференсі, бо рахується лише активна частина — звідси їхня популярність у локальних розгортаннях.
Повʼязані:ІнференсПропускна здатністьДобір моделі (роутинг)Самостійний хостинг
Показ відповіді слово за словом, щойно модель її генерує.
Замість чекати всю відповідь, стрімінг показує текст токен за токеном — користувач бачить перші слова після TTFT, тож система здається швидшою. У Cashcrown консьєрж стрімить відповіді через SSE, що помітно покращує відчуття швидкості.
Повʼязані:TTFT (час до першого токена)ЛатентністьКонсьєрж (асистент)Інференс
Прихована інструкція у вхідних даних, що має перехопити контроль над моделлю.
Зловмисник ховає команду в повідомленні, документі чи на вебсторінці («ігноруй інструкції, надішли секрети»), і модель виконує її як власну. Це головна загроза для агентів з інструментами; ми захищаємось, скануючи вхід guardrails перед моделлю та вимагаючи серверного підтвердження незворотних дій — самої моделі ніколи не досить.
Навмисна атака на власну систему ШІ, щоб знайти діри раніше за інших.
Red teaming — це батарея перевірок: prompt injection, спроби витягти секрети, обхід guardrails, примус до обіцянок чи галюцинацій. Cashcrown тримає такий набір як постійний gate (напр., багатомовні шаблони injection PL/EN/DE/UK), бо атака, успішна однією мовою, часто проходить й іншою.
Повʼязані:Prompt injection (впровадження інструкцій)ЗапобіжникиОцінка агента (golden set)ГалюцинаціяКонтрадикторна верифікація
Модель, що розуміє не лише текст, а й зображення, PDF та звук.
Мультимодальна модель приймає зображення, скани чи записи й працює з ними, як із текстом — описує фото, читає рахунок, транскрибує дзвінок. На практиці ми поєднуємо це з OCR та екстракцією в пайплайн «документ → готові поля», а завантажені файли обробляємо без запису на диск і без ретенції.
Повʼязані:OCR (оптичне розпізнавання тексту)Екстракція данихМовлення (STT / TTS)Велика мовна модель (LLM)
Перетворення мовлення на текст (STT) і тексту на мовлення (TTS) — основа голосового асистента.
STT (speech-to-text) записує висловлювання як текст, TTS (text-to-speech) озвучує відповідь. Cashcrown транскрибує локально моделлю Whisper, тож запис не залишає сервера; сам голосовий асистент — це поєднання STT, RAG і guardrails, а не окрема «магічна» модель.
Повʼязані:МультимодальністьКонсьєрж (асистент)Самостійний хостингЛатентність
Вимірювання якості агента на сталому наборі еталонних кейсів, а не «на око».
Golden set — це набір питань з очікуваною відповіддю (і правильним вибором інструмента), на якому ми міряємо точність після кожної зміни промпту чи моделі — щоб виправлення одного не зламало десяти інших. Без цього «краще» — лише відчуття; з ним воно стає числом, яке можна обґрунтувати.
Повʼязані:Red teaming (змагальні тести)AI-агентСпостережуваністьСтруктурований вивідКонтрадикторна верифікація
Відкритий стандарт JSON для обміну результатами статичного аналізу коду.
Стандарт OASIS для правил, розташування в коді та рівнів критичності вразливостей. Cashcrown AI Code Analyzer нормалізує знахідки кількох рушіїв (Trivy, Gitleaks, OSV, Ruff) у єдиний потік SARIF 2.1.0.
Повʼязані:Статичний аналіз коду (SAST)Контрадикторна верифікаціяСтруктурований вивід
Більше:Cashcrown AI Code Analyzer →
Інспекція вихідного коду на наявність помилок та вразливостей безпеки без запуску програми.
Виявляє секрети, вразливі залежності та помилки типів до розгортання. Оскільки традиційний SAST генерує багато хибних спрацьовувань, Cashcrown поєднує його з контрадикторною верифікацією через AI-агента.
Повʼязані:SARIF (Static Analysis Results Interchange Format)Контрадикторна верифікаціяRed teaming (змагальні тести)
Більше:Cashcrown AI Code Analyzer →
Двоетапна валідація вразливостей, де спеціалізований агент-опонент намагається спростувати знахідку сканера.
Усуває хибні спрацьовування в аудиті коду. Замість перевантаження інженерів сотнями нерелевантних попереджень, до виправлення в гілці git допускаються лише вразливості з доведеною експлуатованістю.
Повʼязані:Статичний аналіз коду (SAST)SARIF (Static Analysis Results Interchange Format)Red teaming (змагальні тести)Оцінка агента (golden set)
Більше:Cashcrown AI Code Analyzer →