PDFs in Markdown konvertieren mit Docling — für RAG-Systeme
Ein RAG-System ist nur so gut wie seine Datenaufbereitung. Docling konvertiert PDFs in saubere Markdown-Dokumente — ohne US-Cloud.
Inhaltsverzeichnis
Warum Markdown für RAG?
RAG zerlegt Dokumente in Chunks, erstellt Embeddings, findet passende Abschnitte. Je sauberer die Ausgangsdaten, desto besser der Retrieval.
Markdown ist Goldstandard: Überschriftenhierarchie erhalten, Tabellen maschinenlesbar, keine Vermischung von Fließtext und Listen.
Die komplette RAG-Pipeline
flowchart LR
A["📄 PDFs"] --> B["Docling"]
B --> C["📝 Markdown"]
C --> D["Chunking"]
D --> E["Embedding"]
E --> F[("Vector DB
pgvector")]
G["👤 Frage"] --> H["OpenWebUI"]
H --> I["Embedding"]
I --> F
F --> J["Top-k"]
J --> K["LLM"]
H --> K
K --> L["💬 Antwort"]
Was macht Docling?
IBM-Open-Source-Projekt (2024). Konvertiert PDFs, DOCX, HTML, PPTX in strukturiertes Markdown/JSON. Im Gegensatz zu pdftotext erkennt Layouts, Tabellen-Strukturen, Lesereihenfolge.
Wo glänzt Docling, wo nicht?
- Stark: Paper mit Formeln, Geschäftsberichte mit Tabellen, mehrspaltige PDFs
- Schwach: handschriftliche Notizen, verrauschte Scans ohne OCR
Deployment
Docker-Container oder Python-Library. REST-API-Endpunkt, angesprochen von n8n: PDF rein, Markdown raus.
Vergleich mit Alternativen
- Unstructured.io — Cloud-first
- LlamaParse — kostenpflichtig, US-basiert
- pdfplumber/PyPDF2 — scheitert bei Tabellen
- Docling — bester Open-Source-Stand 2026
Praxis-Setup
Docling-Server wandelt nachts neue Dokumente aus Nextcloud in Markdown, indexiert in pgvector, stellt OpenWebUI zur Verfügung. Agent zitiert Quellen mit Dokumentname und Seitenzahl.
Fazit
Für DSGVO-konforme RAG-Systeme die beste Open-Source-Wahl. Mit OpenWebUI und lokalem LLM entsteht eine vollständig selbstgehostete Wissensdatenbank mit ChatGPT-UX.