Self-Hosted AI: OpenWebUI und Ollama als DSGVO-konforme ChatGPT-Alternative
ChatGPT ist praktisch, aber datenschutzrechtlich problematisch. Mit OpenWebUI und Ollama läuft ein vergleichbares System auf eigener Hardware.
Inhaltsverzeichnis
Warum Self-Hosted AI?
Wenn dein Team ChatGPT für Kundenmails nutzt, fließen Daten zu OpenAI in die USA. Seit Schrems II rechtlich heikel — insbesondere für Anwälte, Ärzte, Steuerberater.
Self-Hosted dreht das Bild: Modell läuft auf deinem Server, Daten verlassen dein Netzwerk nicht.
Deployment-Architektur
graph TB
U["👤 Browser"] -->|HTTPS| TP["Traefik
TLS"]
TP --> AUTH["Authentik
SSO"]
AUTH --> OW["OpenWebUI"]
OW <--> OL["Ollama"]
OW <--> DB[("PostgreSQL")]
OL -.lädt.-> MS["Modelle"]
OpenWebUI und Ollama
OpenWebUI: Weboberfläche wie ChatGPT — Chatverlauf, RAG, Multi-User, Rollen. Spricht mit Ollama oder Cloud-APIs.
Ollama: Engine, die das LLM ausführt. Ein Kommando: ollama run llama3.3. Lädt, quantisiert, stellt API bereit.
Praxistaugliche Modelle
- Llama 3.3 70B — Spitzenklasse, 48 GB VRAM oder 64 GB RAM
- Llama 3.3 8B — läuft auf Laptop/kleinem Server
- Mistral Small 3 — Preis-Leistung stark
- Qwen 2.5 72B — stark bei Code und Mehrsprachigkeit
- Phi-4 (14B) — beeindruckend für die Größe
Hardware
Ein-Personen-Nutzung 8B: Mac Mini M4 Pro oder PC mit RTX 4060 Ti 16 GB. Kleines Team, 70B: 2× RTX 4090 — 6.000–12.000 €.
Alternative: Hetzner/IONOS GPU-Server ab 300 €/Monat, DE-Rechenzentrum.
Grenzen
Offene Modelle 2026 nahe GPT-4o und Claude Sonnet — aber nicht auf Augenhöhe mit Claude Opus 4.7 oder GPT-5. Für komplexes Reasoning: API-Modelle.
Hybrid ist Standard
Alltag auf Self-Hosted, komplexe Einzelaufgaben über API mit anonymisiertem Input. OpenWebUI unterstützt beides.
Fazit
Für DE-KMUs mit IT-affinem Team 2026 produktionsreif. Setup: 2–4 Stunden für Docker-erfahrene.