Ollama Cloud löst ein reales Problem: Die größten Modelle erfordern Hardware, die kleine oder mittelständische Unternehmen nicht anschaffen möchten. Doch „bequemer Leistungszugang“ wird zum Chaos, wenn jeder Service die Cloud auf eigene Faust ansteuert. Eine ausgereifte Nutzung hat ein einziges Gateway.
Warum ein Router statt direkter Aufrufe#
Direkte Aufrufe aus vielen Stellen bedeuten verteilte Schlüssel, keine gemeinsame Kostenkontrolle und das Risiko, dass personenbezogene Daten unmaskiert nach außen gelangen. Ein Router (OpenClaw) ist der einzige Zugang zu den Modellen: Hier wird entschieden, welches Modell die Aufgabe übernimmt, hier werden PII maskiert, hier werden Kosten erfasst und ein Fallback aktiviert, wenn das Modell eine leere Antwort liefert. Ein solcher LLM-Router ist für die gesamte Organisation eine einzige Kontrollschicht — unabhängig davon, wie viele Services ihn nutzen.
Modellauswahl für die Aufgabe#
Nicht jede Aufgabe benötigt das größte Modell. Der Router leitet Klassifizierungen und einfache Workflows an ein kleines, günstiges Modell weiter und reserviert die Leistung für Aufgaben, die sie wirklich brauchen (komplexe Schlussfolgerungen, lange Kontexte). Das ist gleichzeitig der wichtigste Hebel für Kosteneffizienz und Qualität.
In der Praxis lässt sich der größte Teil des Traffics mit einer kleineren Modellklasse abdecken, während die teuerste Leistung einem schmalen Ausschnitt an Aufgaben vorbehalten bleibt. Unten eine orientierende Zuordnung — die Kosten geben wir relativ an (Größenordnungen, nicht konkrete Tarife), da sich Preislisten ändern und von der Prompt-Länge abhängen:
| Aufgabentyp | Modellklasse | Relative Kosten | Wann wählen |
|---|---|---|---|
| Klassifizierung, Routing, Tagging, einfache Auswahl | klein | am niedrigsten | Kurze Eingabe, eindeutige Antwort, hohes Volumen |
| Datenextraktion, Zusammenfassung, Umformulierung | mittel | moderat | Struktur und Treue nötig, aber ohne mehrstufiges Schließen |
| Komplexes Schließen, langer Kontext, Dokumentenanalyse | groß | am höchsten | Die Aufgabe braucht eine Qualität, die sich erst beim größeren Modell zeigt |
Die Regel ist einfach: Beginne mit der kleinsten Klasse, die den Qualitätstest auf deinen Daten besteht, und hebe sie nur dort an, wo die Treffsicherheit real fehlt. Wie man ein Modell für eine konkrete Aufgabe auswählt, schlüsseln wir ausführlich im Artikel Wie man ein KI-Modell auswählt auf.
Cloud und DSGVO in einem Workflow#
Ollama Cloud bedeutet Verarbeitung außerhalb deiner Infrastruktur – daher behandeln wir es wie jeden Datenexport: PII-Maskierung vor dem Versand ist Pflicht, und sensible Pfade werden auf ein lokales Modell umgeleitet. Für Daten, die nicht nach außen dürfen, kombinieren wir die Cloud mit Self-Hosting in einem konsistenten Router. Sicherheit und DSGVO sind wichtiger als ein einzelnes Feature – wie man das Schritt für Schritt aufbaut, vertiefen wir im Artikel über Self-Hosting und DSGVO.
In der Praxis hat die Maskierung vor einem Cloud-Aufruf mehrere Schritte, die der Router jedes Mal ausführt:
- Entitäten erkennen — finde im Prompt personenbezogene und sensible Daten: Namen, E-Mails, Telefonnummern, nationale Ausweisnummern, Adressen, Kundenkennungen.
- Maskieren oder pseudonymisieren — ersetze sie durch stabile Platzhalter-Token (z. B.
KUNDE_1,EMAIL_1) und behalte die Zuordnung nur lokal. - Den maskierten Prompt senden an die Cloud — das Modell sieht die Struktur der Aufgabe, aber nicht die echten Daten.
- Die Werte in der Antwort wiederherstellen auf deiner Infrastruktur, anhand der lokalen Zuordnung.
Manche Daten maskieren wir nicht, sondern lassen sie gar nicht erst nach außen: Pfade, die Dokumente unter Verschwiegenheit, Daten besonderer Kategorien (z. B. Gesundheit) oder Inhalte mit zu hohem Offenlegungsrisiko berühren, leitet der Router vollständig auf das lokale Modell. Das ist eine bewusste Entscheidung an einer Stelle und nicht die Hoffnung, dass jeder Entwickler daran denkt.
Telemetrie: Sieh, wofür du zahlst#
Ein einziges Gateway liefert eine einzige Wahrheit über den Verbrauch: Welche Aufgaben verursachen Kosten, wie verteilt sich der Traffic auf die Modelle, wo lohnt es sich, die Last auf ein lokales Modell zu verlagern. Ohne diese Observability ist Kostenoptimierung nur Raten.
Damit „Sieh, wofür du zahlst“ konkret wird, protokolliert der Router bei jedem Aufruf einen Satz Felder:
- Modell und Klasse (Tier) — welches Modell die Aufgabe übernommen hat und aus welchem Regal (klein/mittel/groß).
- Eingabe- und Ausgabe-Token — denn sie schlagen sich in den Kosten nieder.
- Latenz — Antwortzeit, hilfreich bei der Wahl zwischen Modellen ähnlicher Qualität.
- geschätzte Kosten — berechnet aus der Token-Zahl und dem Tarif der jeweiligen Klasse.
- ob PII maskiert wurde — eine Spur, dass der Pfad die erforderliche Maskierung durchlaufen hat.
- ob ein Fallback oder eine Sperre ausgelöst wurde — ein Signal, dass das Modell eine leere Antwort lieferte oder die Aufgabe gestoppt wurde.
Aus solchen Feldern entsteht ein Bild, das Entscheidungen auf Basis von Zahlen statt Eindrücken erlaubt: wo die Modellklasse zu senken ist, welche Aufgaben lokal zu verlagern sind und wo die Kosten schneller wachsen als der Wert. Die vollständige Kostenaufschlüsselung eines ganzen Agenten — nicht nur der Modellaufrufe selbst — schlüsseln wir im Artikel Was ein KI-Agent kostet auf.
FAQ#
Wodurch unterscheidet sich Ollama Cloud vom Self-Hosting?#
Ollama Cloud bietet Leistung auf Abruf ohne eigene Hardware – niedrige Einstiegshürde, variable Kosten. Self-Hosting hat eine höhere Einstiegshürde, aber volle Kontrolle und vorhersehbare Kosten bei hohem Volumen. Oft ist eine Hybridlösung beider Ansätze optimal.
Kann ich Ollama Cloud DSGVO-konform nutzen?#
Ja, sofern du personenbezogene Daten vor dem Versand maskierst, den Umfang auf das Nötigste beschränkst und sensible Pfade auf ein lokales Modell umleitest. Der Router setzt diese Regeln an einer zentralen Stelle durch, statt auf die Disziplin jedes Entwicklers zu vertrauen.
Wozu ein Router, wenn ich das API direkt aufrufen kann?#
Direkte Aufrufe verteilen die Kontrolle: Kosten, Sicherheit und Modellauswahl laufen zwischen den Services auseinander. Der Router zentralisiert Entscheidungen, PII-Maskierung, Fallback und Telemetrie – das ist der Unterschied zwischen einem Experiment und einem produktiven System.
