Die All-in-One Erweiterung für Paperless-ngx – weit mehr als nur Klassifizierung
Klassifizieren · Bereinigen · OCR · Chat · Cloud-Import · Duplikate finden – alles in einem Tool
⚠️ Betatest – Bitte vor der Nutzung IMMER ein vollständiges Paperless-ngx Backup erstellen! Aktive Entwicklung. Dokumente, Tags, Korrespondenten und Metadaten werden in Paperless-ngx verändert. Keine Garantie, keine Haftung. Nutzung auf eigenes Risiko.
Andere Tools wie Paperless-GPT oder Paperless-AI klassifizieren Dokumente beim Import. AI Paperless Organizer geht deutlich weiter – es ist eine vollständige Verwaltungs- und Optimierungssuite für Paperless-ngx:
| Feature | Kurz | |
|---|---|---|
| ✨ | KI-Klassifizierer | Titel, Tags, Korrespondent, Typ, Datum, Speicherpfad, Custom Fields – vollautomatisch oder manuell |
| 🧠 | Metadaten-Bereinigung | Doppelte Korrespondenten, Tags, Dokumententypen finden & zusammenführen |
| 🧹 | Tag Cleanup Wizard | 5-stufige systematische Tag-Bereinigung |
| 📷 | OCR (Ollama Vision) | Bessere Texterkennung mit lokalen KI-Modellen, Watchdog, Batch-Verarbeitung |
| 🏆 | Modell-Benchmark | Lokal vs. Cloud – bis zu 5 OCR-Modelle oder 4 LLM-Provider vergleichen |
| 💬 | Dokumenten-Chat (RAG) | Fragen an dein Archiv stellen – mit Quellenangabe und Hybrid-Search |
| ☁️ | Cloud Sync / Import | Google Drive, OneDrive, Dropbox, Nextcloud, lokale Ordner → automatisch in Paperless |
| 🔍 | Duplikate finden | Exakte Duplikate, ähnliche Dokumente (KI), doppelte Rechnungen erkennen |
| 🗑️ | Dokumente aufräumen | Junk-Dokumente (AGB, Impressum, etc.) finden und entfernen |
| 📊 | Dashboard & Statistiken | Fortschritt, Aktivitäten, gesparte Zeit |
💡 Kurz gesagt: Alles was Paperless-ngx fehlt – vollautomatisch wenn du willst, mit voller Kontrolle wenn du sie brauchst.
Es gibt andere Tools die Dokumente beim Import klassifizieren – aber sie lösen nicht das eigentliche Problem: Was ist mit den Tausenden Dokumenten die bereits in deinem System schlummern? Und was wenn die automatische Klassifizierung Fehler gemacht hat?
AI Paperless Organizer setzt den Fokus auf Flexibilität, Tiefe und Kontrolle:
- ⚡ Drei Modi: Vollautomatisch, Halb-automatisch oder Manuell – du stellst ein was du willst
- 📂 Speicherpfad-Profile – Personen-Profile mit Kontext, KI ordnet automatisch zu
- 🔧 Custom Fields – IBAN, Rechnungsnummer, Betrag, Kundennummer, ... aus dem Inhalt extrahieren
- 🚫 Feingranulare Ausschlüsse – Geschützte Tags, Ausschlusslisten, einzelne Felder deaktivieren
- ✏️ Prompts pro Feld – Individuelle KI-Anweisungen für Titel, Tags, Korrespondent, Typ, Datum
- 🏆 Benchmark – Bis zu 4 LLM-Provider gleichzeitig auf demselben Dokument testen
- 💬 Fragen stellen – RAG-Chat mit Hybrid-Search durchsucht dein gesamtes Archiv
- ☁️ Cloud-Import – Scans aus Google Drive, OneDrive oder Nextcloud automatisch importieren
- 🔍 Duplikate erkennen – Checksummen, KI-Embeddings und Rechnungsnummern-Vergleich
Deine Paperless-ngx Installation ist gewachsen und jetzt hast du:
- Hunderte doppelte Korrespondenten: "Telekom", "Deutsche Telekom", "Telekom GmbH", "DTAG"...
- Unsinnige Tags: Tippfehler, Test-Tags, Einträge von Paperless-AI oder Paperless-GPT
- Chaos bei Dokumententypen: "Rechnung", "Invoice", "Rechnungen", "rechnung"...
- Tausende unklassifizierte Dokumente: Fehlende Titel, Tags, Korrespondenten, falsche Speicherpfade
- Keine Volltextsuche mit KI: Du kannst nicht einfach fragen "Wann läuft mein Handyvertrag aus?"
- Kein Cloud-Import: Scans vom Handy (Google Drive) manuell hochladen
AI Paperless Organizer löst das alles – in einem Tool, mit voller Kontrolle.
Der Klassifizierer liest den Inhalt deiner Dokumente und befüllt automatisch alle Metadaten-Felder:
| Feld | Beschreibung |
|---|---|
| Titel | Präziser, inhaltsbasierter Titel (nicht "Dokument von Firma X") |
| Tags | Passende Tags aus deiner bestehenden Tag-Liste |
| Korrespondent | Absender/Aussteller – sucht in bestehenden Einträgen |
| Dokumententyp | Wählt aus deinen vorhandenen Typen |
| Speicherpfad | Intelligente Zuordnung zu Person/Ordner anhand von Profilen |
| Erstelldatum | Extrahiert das Dokumentdatum (Rechnungsdatum, Briefdatum, etc.) |
| Custom Fields | Beliebige Felder: IBAN, Rechnungsnummer, Betrag, Kundennummer, ... |
Mit OpenAI/Cloud-Modellen (Tool-Calling): Die KI ruft aktiv deine Paperless-Daten ab – sie sucht nach passenden Tags, Korrespondenten und Dokumententypen in Echtzeit, bevor sie entscheidet. Ergebnis: bessere Übereinstimmung mit bestehenden Einträgen.
Mit Ollama (lokale Modelle) ⭐ Empfohlen:
Mehrstufiger Prozess: Analyse → Tags → Dokumenttyp → Speicherpfad → Custom Fields → Verifikation. Alles lokal, keine Daten verlassen deinen Server. Für beste Ergebnisse: qwen3:4b oder qwen3:8b – Qwen3 nutzt intern Reasoning (Thinking-Modus) und liefert damit deutlich bessere Klassifizierungsqualität als ältere Modelle ohne Reasoning.
Alle KI-Vorschläge sind vor dem Speichern vollständig editierbar:
- Titel ändern
- Tags einzeln hinzufügen oder entfernen (mit Live-Suche)
- Korrespondent überschreiben
- Speicherpfad manuell wählen
- Custom Fields korrigieren
Mit "Anwenden & Weiter" arbeitest du Dokumente im Fließband-Modus durch.
- Felder ein-/ausschalten: Aktiviere nur was du brauchst (z.B. nur Titel + Datum)
- Tag-Verhalten: Bestehende Tags erhalten oder ersetzen
- Korrespondenten-Kurzname: Automatisch "Deutsche Telekom AG" → "Telekom" kürzen
- Rechtsform-Entfernung: GmbH, AG, KG, UG, OHG, Ltd. etc. automatisch abschneiden
- Geschützte Tags: Tags die nie entfernt werden (z.B.
inbox,runocr) - Ausschlusslisten: Dokumente mit bestimmten Tags/Korrespondenten überspringen
- Prompts anpassen: Individuelle Anweisungen pro Feld (Titel, Tags, Korrespondent, Typ, Datum)
Konfiguriere Personen-Profile für intelligente Pfad-Zuordnung:
- Beschreibe wer welche Dokumente bekommt (privat, geschäftlich, Kinder, Partner, etc.)
- Die KI liest den Kontext und entscheidet automatisch welcher Pfad passt
- Kurze Begründung wird immer mitgeliefert
Definiere beliebige Felder die aus Dokumenten extrahiert werden sollen:
- Rechnungsnummer – exakt wie im Dokument
- Gesamtbetrag – als Dezimalzahl (z.B. 1499.99)
- IBAN – vollständig ohne Leerzeichen
- Kundennummer, Vertragsnummer, Versicherungsnummer, ...
Behalte den Überblick über alle klassifizierten Dokumente:
- Vollständiger Verlauf mit vorher/nachher Vergleich
- Statistiken: Dokumente/Tag, Feldabdeckung, häufigste Korrespondenten
- Tag-Analyse: Welche Tags werden am häufigsten vergeben?
Weißt du nicht welches Modell für deine Dokumente am besten passt? Der integrierte Benchmark beantwortet das:
- Bis zu 4 Provider gleichzeitig auf demselben Dokument testen
- Lokal vs. Cloud direkt vergleichen: z.B.
Ollama llama3.1vs.GPT-4o-minivs.GPT-4o - Ergebnisse nebeneinander: Wer erkennt Titel, Tags, Korrespondent besser?
- Kostenabschätzung: Günstig genug für täglichen Einsatz oder doch lieber lokal?
- Qualitäts-Check auf einen Blick: Halluziniert ein Modell? Erfindet es Tags die nicht existieren?
Typische Erkenntnis aus dem Benchmark:
GPT-4o-miniliefert für 95% der Dokumente identische Qualität wieGPT-4o– zum Bruchteil des Preises.Ollamamitllama3.1:8breicht für einfache Dokumente und sendet keine Daten ins Internet.
⚠️ Datenschutz-Hinweis: Der Klassifizierer sendet den OCR-Text deiner Dokumente an das konfigurierte LLM zur Analyse. Bei Cloud-Modellen (OpenAI, etc.) verlassen die Dokumentinhalte deinen Server. Für maximalen Datenschutz: Ollama mit lokalen Modellen verwenden – dann bleibt alles auf deinem Server!
Die klassische Funktion: Finde und führe doppelte Metadaten zusammen.
Die KI analysiert nur die Namen deiner Metadaten (z.B. "Telekom", "Rechnung", "Steuer 2024") – niemals den Inhalt deiner Dokumente. Ergebnis: Vorschläge zum Zusammenführen mit Konfidenz-Werten.
KI-Analysen werden gespeichert und können kostenlos wieder geladen werden – du kannst die Vorschläge in Ruhe durchgehen, ohne jedes Mal neue KI-Kosten zu verursachen.
Unsicher ob zwei Einträge wirklich zusammengehören? Schau dir die zugehörigen Dokumente direkt an, bevor du zusammenführst.
5-stufiger Assistent zur systematischen Tag-Bereinigung:
- Leere Tags löschen – Tags ohne Dokumente entfernen
- Unsinnige Tags – KI identifiziert Tippfehler, Test-Tags, Fragmente
- Korrespondenten-Tags – Tags die eigentlich Firmen/Personen sind
- Dokumententyp-Tags – Tags die eigentlich Dokumententypen sind
- Ähnliche zusammenlegen – Duplikate und Varianten zusammenführen
Nicht zufrieden mit den KI-Vorschlägen? Passe die Prompts für jeden Bereich an:
- Metadaten-Bereinigung (Korrespondenten, Tags, Dokumententypen)
- Klassifizierer (Titel, Tags, Korrespondent, Typ, Datum – je ein Prompt)
- Systemweiter Kontext der KI
Dokumente automatisch aus Cloud-Speichern oder lokalen Ordnern in Paperless-ngx importieren – ohne manuelles Hochladen.
| Quelle | Verbindung | Auth nötig? |
|---|---|---|
| Google Drive | Automatischer OAuth-Flow im Browser | Nur einmalig anmelden |
| OneDrive | Automatischer OAuth-Flow im Browser | Nur einmalig anmelden |
| Dropbox | Automatischer OAuth-Flow im Browser | Nur einmalig anmelden |
| Nextcloud / WebDAV | URL + Benutzername/Passwort | Kein API-Key nötig |
| Lokaler Ordner | Docker-Volume-Pfad | Kein Setup nötig |
- Ordner-Browser: Ordner direkt durchsuchen und auswählen (Google Drive, OneDrive, WebDAV, lokal)
- Dateiname-Präfix: z.B.
SCAN-→ Datei wird alsSCAN-rechnung.pdfimportiert - Tags, Korrespondent, Dokumententyp: Automatisch beim Import in Paperless zuweisen
- Nach Import: Quelldatei behalten oder automatisch löschen
- Abruf-Intervall: Pro Quelle konfigurierbar (z.B. alle 5 Minuten)
- Sync-Daemon: Läuft im Hintergrund und prüft Quellen automatisch
- Import-Verlauf: Alle importierten Dateien mit Status einsehen
Google Drive, OneDrive und Dropbox benötigen Port 53682 für den OAuth-Callback:
# docker-compose.yml
backend:
ports:
- "8081:8000"
- "53682:53683" # rclone OAuth callbackDie Autorisierung erfolgt direkt im Browser – kein API-Key, kein Developer-Account, kein Terminal nötig.
Stelle Fragen an dein gesamtes Paperless-Archiv – die KI durchsucht alle Dokumente und antwortet mit Quellenangabe:
- Hybrid-Search: BM25 + ChromaDB Semantic Search + Cross-Encoder Reranking
- Streaming-Antworten mit Quellen-Attribution und Citation-Highlighting
- Query-Enrichment: Kurze Folgefragen werden automatisch angereichert
- Deutsche Optimierung: Cross-Encoder für deutsche Dokumente (mmarco-german)
- Fakten-Extraktion: Geburtsdaten, Adressen, Steuernummern aus Chunks
- Session-Management: Chats speichern und später fortsetzen
- Embedding: Ollama (mxbai-embed-large) oder OpenAI
Voraussetzung: RAG muss unter Einstellungen aktiviert und der Index aufgebaut werden. Die Indexierung läuft im Hintergrund.
Drei Erkennungsstufen unter Aufräumen → Duplikate finden:
| Stufe | Methode | Dauer (~5000 Docs) |
|---|---|---|
| Exakte Duplikate | Checksum-Vergleich (identische Dateien) | Sekunden |
| Ähnliche Dokumente | KI-Embedding-Vergleich (ChromaDB) | ~1-2 Minuten |
| Doppelte Rechnungen | LLM extrahiert Rechnungsnr. + Betrag | Stunden (Background-Job) |
- Ähnlichkeits-Schwelle konfigurierbar (80-100%)
- Ergebnisse als Gruppen mit Direktlinks zu Paperless-ngx
- Ignore-Liste für bestätigte Nicht-Duplikate
- Kein automatisches Löschen – du prüfst und entscheidest selbst
- Stop-Button für laufende Scans
Voraussetzung: Für "Ähnliche Dokumente" muss der RAG-Index aufgebaut sein. Exakte Duplikate funktionieren immer.
Dokumente mit besserer OCR-Erkennung neu verarbeiten – powered by Ollama Vision Models:
- Einzel-OCR: Dokument-ID eingeben, alten und neuen Text vergleichen, übernehmen
- Batch-OCR: Alle Dokumente oder nur getaggte in einem Durchlauf verarbeiten
- Multi-Server Failover: Mehrere Ollama-Server konfigurieren für Ausfallsicherheit
- Statistiken: Verarbeitete Seiten, Zeichen, Dauer pro Dokument im Überblick
- Watchdog: Automatische OCR-Verarbeitung neuer Dokumente im Hintergrund
- Tag-basierter Workflow:
runocrundocrfinishTags für flexible Steuerung - Ollama-Modelle automatisch erkennen: Dropdown in den Einstellungen statt manueller Eingabe
💡 Vorteil: Deine Dokumente verlassen nie den Server – Ollama läuft lokal!
Vergleiche verschiedene Ollama-Vision-Modelle direkt auf demselben Dokument – mit detaillierter KI-Qualitätsbewertung:
- Bis zu 5 Modelle gleichzeitig vergleichen (z.B. qwen3-vl:4b vs. 8b vs. glm-ocr vs. minicpm-v)
- Seite-für-Seite Ergebnisse nebeneinander mit Zeitangabe
- Modellspezifische Prompts: Jedes Modell bekommt den optimalen Prompt (qwen, glm-ocr, deepseek-ocr, gemma3, minicpm-v)
- Health-Check & Auto-Recovery: Prüft Ollama vor jedem Modell, wartet bei Absturz
Nach dem Vergleich kann ein Cloud-LLM (z.B. GPT-4o, o3, GPT-4.1) die OCR-Ergebnisse bewerten:
- 10 Bewertungskategorien: Namen, Datum, IBAN, Beträge, Adressen, Formularlogik, Vollständigkeit, Formatierung, Halluzinierung, Automatisierbarkeit
- Kritische Felder mit strenger Bewertung (IBAN-Fehler = sofort kritisch)
- Cross-Comparison: Wo stimmen alle Modelle überein, wo gibt es Widersprüche?
- Strukturierte Empfehlung: Bestes Modell für Qualität, Geschwindigkeit und Preis/Leistung
| Modell | Parameter | VRAM | Stärke |
|---|---|---|---|
qwen3-vl:4b-instruct |
4B | ~3 GB | Bester Allrounder, zuverlässig bei IBANs |
huihui_ai/qwen3-vl-abliterated:8b |
8B | ~6 GB | 8B ohne Safety-Filter (erkennt IBANs!) |
glm-ocr |
1.1B | ~2 GB | Ultra-schnell, gut bei Standard-Dokumenten |
minicpm-v |
8B | ~5.5 GB | Stark bei OCR-Benchmarks, Multi-Image |
qwen2.5vl:7b |
7B | ~6 GB | Bewährt, gute Qualität |
⚠️ Hinweis: Das Standard-Modellqwen3-vl:8b-instructhat Safety-Filter von Alibaba, die sensible Felder wie IBANs filtern. Für vollständige Transkription die abliterated-Variante oder4b-instructverwenden.
Mehr Details & Benchmark-Infos: docs/ocr-benchmark/
Junk-Dokumente wie AGB, Widerrufsbelehrungen und Datenschutzerklärungen automatisch finden und entfernen:
- Titel-basierte Suche: Findet nur Dokumente mit typischen Junk-Titeln (keine falschen Treffer bei normalen Dokumenten)
- Kartenansicht mit Vorschaubildern: Große Thumbnails für schnelle visuelle Prüfung
- Mehrfachauswahl: Einzeln oder alle auf einmal auswählen
- Bestätigungsdialog: Sicherheitsabfrage vor endgültiger Löschung
- Standard-Suchbegriffe: AGB, Widerruf, Datenschutzerklärung, Impressum, Nutzungsbedingungen u.v.m.
Getestet & stabil: OpenAI (GPT-4o, GPT-4o-mini, GPT-4.1), Ollama (qwen3-vl, llama3.1, etc.)
Andere LLM-Provider (Anthropic, Azure) sind implementiert, aber noch nicht ausführlich getestet. Bei Problemen gerne ein Issue erstellen – wir verbessern kontinuierlich!
An das LLM werden ausschließlich Metadaten-Namen übermittelt:
- Namen von Tags, Korrespondenten und Dokumententypen
- Anzahl der zugehörigen Dokumente
❌ Es werden KEINE Dokumenteninhalte, Texte oder Dateien gesendet!
Der Klassifizierer liest den OCR-Text des Dokuments um es zu klassifizieren:
- Bei Cloud-Modellen (OpenAI, etc.): OCR-Text wird an den Provider gesendet
- Bei Ollama (lokal): Alle Daten bleiben auf deinem Server
💡 Tipp: Für maximalen Datenschutz bei der Klassifizierung: Ollama mit lokalen Modellen nutzen – dann verlässt kein Dokumentinhalt deinen Server!
# docker-compose.yml
services:
backend:
image: webdienste/ai-paperless-organizer:backend-latest
ports:
- "8000:8000"
volumes:
- ./data:/app/data
environment:
- DATABASE_URL=sqlite+aiosqlite:///./data/organizer.db
frontend:
image: webdienste/ai-paperless-organizer:frontend-latest
ports:
- "3001:80"
depends_on:
- backenddocker-compose up -dgit clone https://github.com/syberx/AI-Paperless-Organizer.git
cd AI-Paperless-Organizer
docker-compose up -d --buildWebinterface: http://localhost:3001
- Gehe zu Einstellungen → Paperless-ngx
- URL eingeben (z.B.
https://paperless.example.com) - API Token aus Paperless: Admin → Auth Tokens → Neuer Token
- Verbindung testen
| Provider | API Key von | Empfohlenes Modell | Metadaten-Bereinigung | Klassifizierer |
|---|---|---|---|---|
| OpenAI | platform.openai.com | gpt-4o-mini / gpt-4o |
✅ Getestet | ✅ Getestet |
| Mistral | console.mistral.ai | mistral-small-latest |
🔄 Beta | ✅ Getestet |
| OpenRouter | openrouter.ai/keys | mistral/mistral-large-2411 |
❌ | ✅ Getestet |
| Ollama ⭐ | Kein Key nötig! | qwen3:4b / qwen3:8b |
🔄 Beta | ✅ Empfohlen |
| Anthropic | console.anthropic.com | claude-3-5-sonnet |
🔄 Beta | 🔄 Beta |
| Azure | Azure Portal | Dein Deployment | 🔄 Beta | 🔄 Beta |
💡 OpenRouter-Tipp: Über OpenRouter kannst du Mistral Large, Llama 3.3 70B, Gemini 2.0 Flash, Claude 3.5 Haiku und 300+ weitere Modelle mit einer einzigen API testen – ideal für den Benchmark ohne separate API-Keys.
💡 Empfehlung für lokale Klassifizierung: Ollama mit
qwen3:4boderqwen3:8bliefert aktuell die besten Ergebnisse bei lokal laufenden Modellen. Qwen3 verwendet intern eine Reasoning-Chain (Thinking-Modus) bevor es antwortet – das macht einen deutlichen Qualitätsunterschied bei der Auswahl von Tags, Dokumententypen und Speicherpfaden gegenüber klassischen Modellen wiemistral-nemo:12b. Wer mehr RAM hat, kann auchqwen3:14boderqwen3:32bausprobieren – mehr Parameter + Reasoning = bessere Ergebnisse.
Die LLM-Zuweisung erfolgt zentral unter Einstellungen – dort wird einmalig konfiguriert welcher Provider für welche Aufgabe (Klassifizierung, OCR, RAG-Chat) genutzt wird. Danach:
- Klassifizierer: Felder aktivieren, optional Speicherpfad-Profile und Custom Fields anlegen
- OCR: Modell wählen, Watchdog aktivieren
- RAG-Chat: Aktivieren und Index aufbauen lassen
1️⃣ Korrespondenten → 2️⃣ Dokumententypen → 3️⃣ Tags
- Leere entfernen – Ungenutzte Einträge (0 Dokumente) löschen
- Mit KI analysieren – Ähnliche Einträge finden lassen
- Vorschläge prüfen – Bei Bedarf Dokumente ansehen
- Zusammenführen oder Ignorieren – Du entscheidest!
1️⃣ OCR verbessern (optional) → 2️⃣ Klassifizieren → 3️⃣ Prüfen & Speichern
- Dokument-ID im Klassifizierer eingeben
- KI-Vorschläge prüfen und bei Bedarf anpassen
- Mit "Anwenden" oder "Anwenden & Weiter" speichern
- Beginne mit Korrespondenten – sie sind die wichtigste Basis
- Nutze den Tag Cleanup Wizard für systematische Tag-Bereinigung
- Gespeicherte Analysen sparen KI-Kosten beim erneuten Öffnen
- Konfiguriere Speicherpfad-Profile für vollautomatische Ordner-Zuordnung
- Nutze Ollama für den Klassifizierer wenn Datenschutz wichtig ist
┌──────────────────────────────────────────────────────────────────────┐
│ Docker Compose │
├───────────────────────────┬──────────────────────────────────────────┤
│ Frontend (React) │ Backend (FastAPI) │
│ Port: 3001 │ Port: 8000 │
│ │ │
│ • Dashboard │ • Paperless API Client │
│ • KI-Klassifizierer │ • LLM Provider (6 Anbieter) │
│ • Metadaten-Bereinigung │ • Classifier Service │
│ • Tag Cleanup Wizard │ • OCR Service (Ollama Vision) │
│ • OCR Manager │ • RAG Service (ChromaDB + BM25) │
│ • Dokumenten-Chat (RAG) │ • Cloud Import Service (rclone) │
│ • Cloud Sync / Import │ • Duplicate Detection Service │
│ • Duplikate finden │ • Cleanup Service │
│ • Aufräumen │ • SQLite + ChromaDB │
│ • Einstellungen │ • OllamaLock (Ressourcen-Management) │
└───────────────────────────┴──────────────────────────────────────────┘
│ │ │
▼ ▼ ▼
┌──────────────────┐ ┌─────────────┐ ┌─────────────┐
│ Cloud-Dienste │ │ Paperless │ │ Ollama │
│ Google Drive │ │ -ngx │ │ (lokal) │
│ OneDrive │ └─────────────┘ └─────────────┘
│ Dropbox │ │
│ Nextcloud │ ▼
└──────────────────┘ ┌─────────────────┐
│ Cloud LLMs │
│ (OpenAI, etc.) │
└─────────────────┘
| Bereich | Technologie |
|---|---|
| Backend | Python 3.11, FastAPI, SQLAlchemy (async), httpx |
| Frontend | React 18, TypeScript, Vite, TailwindCSS |
| Database | SQLite + ChromaDB (RAG-Vektoren) + BM25-Index |
| Container | Docker, Docker Compose |
| LLM | OpenAI, Mistral, Anthropic, Azure, OpenRouter, Ollama |
| OCR | Ollama Vision API (qwen3-vl, glm-ocr, minicpm-v, etc.) |
| RAG | ChromaDB + BM25 Hybrid Search, sentence-transformers Cross-Encoder |
| Cloud-Import | rclone (Google Drive, OneDrive, Dropbox), WebDAV, lokale Ordner |
Beiträge sind willkommen!
- Fork das Repository
- Erstelle einen Feature Branch (
git checkout -b feature/AmazingFeature) - Commit deine Änderungen (
git commit -m 'Add AmazingFeature') - Push zum Branch (
git push origin feature/AmazingFeature) - Öffne einen Pull Request
- 🐛 Bug Reports
- 💡 Feature Requests
- 🔌 Andere LLM Provider testen
Wenn dir dieses Projekt gefällt und Zeit spart, kannst du mich unterstützen:
ℹ️ Eigenwerbung – Der Autor dieses Projekts bietet professionelle Dienstleistungen rund um KI-Automatisierung an.
Wer dieses Tool nutzt, versteht bereits den Wert von KI-Automatisierung. Stell dir vor, was das für dein gesamtes Unternehmen bedeuten könnte.
Christian Wilms entwickelt maßgeschneiderte KI-Systemlösungen für Unternehmen – DSGVO-konform, lokal oder hybrid, ohne Cloud-Zwang:
| 🏢 KI-Systemlösungen für Unternehmen | Individuelle KI-Integration in bestehende Infrastruktur und Prozesse – abgestimmt auf die spezifischen Anforderungen deines Unternehmens, vollständig DSGVO-konform und On-Premise möglich |
| 📄 Paperless Organizer Setup & Anpassung | Professionelle Einrichtung dieses Tools für dein Unternehmen oder Büro – mit maßgeschneiderten Klassifizierungsregeln, Speicherpfad-Profilen, Custom Fields und automatisierten Workflows |
| 🔧 Individuelle KI-Automatisierung | Dokumentenverarbeitung, Prozessautomatisierung, LLM-Integration in vorhandene Systeme – entwickelt exakt für deine Abläufe, nicht von der Stange |
Dieses Projekt ist unter der MIT-Lizenz lizenziert – siehe LICENSE für Details.
Made with ❤️ for the Paperless-ngx Community
Endlich Ordnung in deinen Metadaten – und vollautomatische Klassifizierung!











