Oferuje trzy tryby (dense, sparse, hybrid), rerank i filtrowanie metadanych, a do tego obserwowalność jakości retrievalu. Model jest natywnie wielojęzyczny (m.in. polski) i radzi sobie z mieszanymi językami w jednym indeksie — pytanie po polsku znajduje odpowiedź niezależnie od języka źródła. Pojedyncze zapytanie (embedding + retrieval) zwykle schodzi poniżej ~50 ms na typowym indeksie — wartość mierzysz w dashboardzie obserwowalności retrievalu, a nie obiecujemy jej w oderwaniu od Twoich danych. Deploy self-host daje kontrolę nad kosztem i prywatnością. To silnik, na którym stawiamy Company GPT i wewnętrzne wyszukiwarki wiedzy. Pod spodem działa model BGE-M3 — parametry techniczne (1024-dim, embeddingi); to ten sam lokalny model, który napędza Concierge RAG tej strony.
