Bietet drei Modi (dense, sparse, hybrid), Reranking und Metadatenfilterung sowie Observability der Retrieval-Qualität. Das Modell ist nativ mehrsprachig (u. a. Polnisch) und kommt mit gemischten Sprachen in einem Index zurecht — eine Frage auf Polnisch findet die Antwort unabhängig von der Quellsprache. Eine einzelne Abfrage (Embedding + Retrieval) liegt auf einem typischen Index meist unter ~50 ms — diesen Wert misst Du im Observability-Dashboard des Retrievals, wir versprechen ihn nicht losgelöst von Deinen Daten. Self-Host-Deployment sorgt für Kontrolle über Kosten und Datenschutz. Das ist die Engine, auf der wir Company GPT und interne Wissenssuchsysteme aufbauen. Darunter läuft das BGE-M3-Modell — technische Daten (1024-dim, Embeddings); es ist dasselbe lokale Modell, das das Concierge-RAG dieser Seite antreibt.
