Paperless-ngx: So erstellen Sie Ihr eigenes durchsuchbares Dokumentenarchiv
Sie erinnern sich, dass in einem Vertrag ein wichtiger Betrag stand, doch die Datei heißt scan_2024_03_17.pdf und liegt zwischen Hunderten ähnlicher Dateien. Ein gewöhnlicher Dateimanager sucht nach dem Namen, während sich die benötigten Wörter im Scan befinden.
Paperless-ngx löst dieses Problem. Sie laden eine PDF-Datei, das Foto einer Quittung oder einen E-Mail-Anhang hoch. Der Dienst erkennt den Text, indexiert ihn und führt verstreute Dateien in einem einzigen Archiv zusammen. Danach können Sie ein Dokument anhand eines Nachnamens, einer Adresse, einer Kontonummer oder einer beliebigen Formulierung auf der Seite finden.
Was ist Paperless-ngx?
Paperless-ngx ist ein kostenloses Open-Source-System zur Dokumentenverwaltung. Es wird auf dem eigenen Server installiert, nimmt Dateien aus verschiedenen Quellen entgegen, führt OCR durch und ermöglicht die Suche nach Inhalten.
Anstelle einer einzigen starren Ordnerstruktur verwendet das System Korrespondenten, Dokumenttypen, Tags, Daten, benutzerdefinierte Felder und Ablageregeln. So lassen sich innerhalb weniger Sekunden Stromrechnungen aus dem Jahr 2026, Dokumente zu einer bestimmten Wohnung oder Garantien anzeigen, die bald ablaufen.
Warum Paperless-ngx besser ist als gewöhnliche Ordner
Ordner funktionieren, solange es nur wenige Dokumente gibt und Sie sich an Ihr eigenes Benennungssystem erinnern. Nach einigen Jahren entstehen Verzeichnisse wie Dokumente, Scans, Neu und Zu sortieren, und die richtige Datei ist nur noch schwer zu finden.
| Gewöhnlicher Ordner | Paperless-ngx |
|---|---|
| Suche nach Dateinamen | Suche nach Text innerhalb des Dokuments |
| Eine Datei, ein Ordner | Mehrere Tags und Eigenschaften |
| Manuelle Benennung und Sortierung | Automatische Zuweisung von Metadaten |
| Anhänge müssen manuell gespeichert werden | Import aus E-Mails |
| Ein Scan bleibt ein Bild | OCR macht den Text durchsuchbar |
Statt sich an das Verzeichnis erinnern zu müssen, genügt ein einziges Wort aus dem Dokument.
Wie Paperless-ngx eine Datei verarbeitet
Nach dem Hochladen führt der Dienst folgende Schritte aus:
- Er speichert die Originaldatei.
- Er extrahiert vorhandenen Text oder startet OCR.
- Bei Bedarf erstellt er eine archivierte PDF-Version und Vorschaubilder.
- Er fügt den Inhalt einem Volltextindex hinzu.
- Er wendet Regeln an und schlägt Korrespondent, Typ, Tags und Ablagepfad vor.
Sie können zunächst nur Upload und Suche verwenden und die Automatisierung später ergänzen.
Die nützlichsten Funktionen von Paperless-ngx
Suche innerhalb von Scans
Nach der OCR-Verarbeitung können Sie einen Vertrag über die Adresse, eine Rechnung über die Kundennummer und einen Beleg über das Gerätemodell finden. Eine Suche nach „vorzeitige Kündigung“ zeigt beispielsweise Dokumente mit dieser Formulierung an, selbst wenn die ursprüngliche PDF-Datei ausschließlich aus Bildern bestand.
Die Qualität hängt vom Scan ab: Eine gerade, kontrastreiche Seite wird besser erkannt als ein dunkles, schräg aufgenommenes Foto. Für ein russisch-englisches Archiv sollten beide OCR-Sprachen installiert werden.
Automatische Sortierung
Paperless-ngx kann neue Dokumente mit bereits sortierten Dokumenten abgleichen. Sie kennzeichnen mehrere Rechnungen desselben Anbieters manuell, und der Dienst lernt, für die nächsten Dateien denselben Korrespondenten, Typ und dieselben Tags vorzuschlagen.
Für eine strenge Logik stehen Regeln nach Text, Dateiname, Quelle oder Upload-Ordner zur Verfügung.
Import aus E-Mails
Der Dienst kann ein Postfach über IMAP prüfen und Nachrichten nach Regeln verarbeiten. Er kann beispielsweise nur PDF-Anhänge eines Lieferanten übernehmen, sie an das Archiv senden und die E-Mail anschließend als gelesen markieren oder in einen anderen Ordner verschieben.
Rechnungen sammeln sich nicht mehr im Posteingang an und können zusammen mit Scans durchsucht werden.
Workflows, Felder und gespeicherte Ansichten
Workflows führen Aktionen beim Hochladen, Hinzufügen oder Ändern eines Dokuments sowie nach Zeitplan aus. Sie können einen Eigentümer zuweisen, einen Tag hinzufügen, einen Typ auswählen und einen Ablagepfad festlegen.
Benutzerdefinierte Felder machen aus dem Archiv eine kleine Datenbank. Für einen Vertrag können Sie das Ablaufdatum speichern, für eine Rechnung den Betrag und die Zahlungsfrist und für ein Gerät die Seriennummer. Gespeicherte Ansichten zeigen dann beispielsweise „Zahlung erforderlich“ oder „Garantie läuft diesen Monat ab“.
Stapelscannen mit Barcodes
Paperless-ngx kann einen großen Scan mithilfe von Barcodes in mehrere Dokumente aufteilen. Zwischen den Papieren lassen sich Trennseiten einfügen, oder auf das erste Blatt kann ein ASN-Code geklebt werden.
ASN ist eine Archivseriennummer, die eine digitale Kopie mit dem Papieroriginal verknüpft. Das ist besonders praktisch, wenn große Papierstapel digitalisiert werden.
Versionen und optionale KI
In der Paperless-ngx-Reihe 3.x kamen Dokumentversionen, Linksammlungen für den gemeinsamen Zugriff und integrierte KI-Funktionen hinzu. Nach der Anbindung eines Modells kann der Dienst Metadaten vorschlagen und Fragen zu Dokumenten beantworten.
Für die Grundfunktionen ist keine KI erforderlich: OCR, Suche, Regeln, Tags und E-Mail-Import funktionieren auch ohne sie. Bei der Nutzung einer externen KI-API können Teile des Textes den Server verlassen, während ein lokales Modell mehr Ressourcen benötigt.
Für wen eignet sich Paperless-ngx?
Für ein persönliches oder familiäres Archiv: Verträge, Versicherungen, Kontoauszüge, Garantien, Quittungen, Unterlagen zur Wohnung und Anleitungen für Geräte.
Für Freiberufler und kleine Unternehmen: Rechnungen, Abnahmeprotokolle, Verträge, Ausgabenbelege und Korrespondenz mit Geschäftspartnern. Der E-Mail-Import reduziert manuelle Arbeit, während Zugriffsrechte die gemeinsame Nutzung von Dokumenten ermöglichen.
Für administrative Abläufe: schnelle Suche nach Belegen, Auswahl nach Lieferant und Zeitraum sowie eine Warteschlange für noch nicht bearbeitete Dateien.
Paperless-ngx ersetzt keine Buchhaltungssoftware, keine elektronische Signatur und kein unternehmensweites ECM-System.
Welchen Server benötigt Paperless-ngx?
Die Belastung hängt von der Anzahl der Seiten, der Scanqualität, der Upload-Häufigkeit und zusätzlichen Komponenten ab. Für den Einstieg können Sie sich an diesen praktischen Werten orientieren:
| Szenario | CPU | RAM | Speicher |
|---|---|---|---|
| Persönliches Archiv | 2 vCPU | 2 GB | ab 30–50 GB NVMe |
| Familie oder kleines Team | 2–4 vCPU | 4 GB | ab 60–100 GB NVMe |
| Große Stapel, Office-Dateien, lokale KI | ab 4 vCPU | ab 8 GB | Archivgröße mit zusätzlicher Reserve |
Auf einem schwachen Server kann die Oberfläche normal funktionieren, während die OCR-Verarbeitung großer Dokumente langsam ist. Tika und Gotenberg für Word-, Excel- und andere Office-Formate erhöhen ebenfalls den Speicherverbrauch.
Planen Sie beim Speicher ausreichend Reserve ein: Neben den Originalen können archivierte Versionen, Vorschaubilder, Index, Datenbank und temporäre Dateien gespeichert werden. Für Sicherungskopien wird ebenfalls separater Platz benötigt.
Paperless-ngx mit Docker auf einem VPS installieren
Die einfachste unterstützte Methode ist Docker Compose. Sie benötigen einen Linux-Server, Docker Engine und das Compose-Plug-in.
Das offizielle Projekt stellt einen interaktiven Installer bereit:
bash -c "$(curl -L https://raw.githubusercontent.com/paperless-ngx/paperless-ngx/main/install-paperless-ngx.sh)"Er fragt nach Verzeichnis, Datenbank, Port, OCR-Sprache, zusätzlichen Komponenten und Administratorkonto, erstellt anschließend die Compose-Konfiguration und startet die Container.
Auf einem Produktivserver ist es sicherer, das Skript zunächst herunterzuladen und zu prüfen:
curl -L https://raw.githubusercontent.com/paperless-ngx/paperless-ngx/main/install-paperless-ngx.sh \
-o install-paperless-ngx.sh
less install-paperless-ngx.sh
bash install-paperless-ngx.shIm Installationsverzeichnis können Sie den Start mit folgenden Befehlen prüfen:
docker compose ps
docker compose logs -f webserverFür russische und englische OCR wird üblicherweise rus+eng gesetzt. Zusätzlich werden in Docker die Sprachdaten rus eng installiert.
Veröffentlichen Sie den internen Port der Anwendung nicht direkt. Binden Sie eine Domain über einen Reverse Proxy an, aktivieren Sie HTTPS und schließen Sie nicht benötigte Ports. Für ein persönliches Archiv ist es noch sicherer, den Zugriff ausschließlich über ein VPN zu erlauben.
Paperless-ngx auf einem VPS von tropic.host
Für ein kleines Archiv eignet sich ein VPS mit 2 vCPU, 2–4 GB RAM und NVMe-Speicher. Bei tropic.host können Sie Ubuntu bereitstellen, Docker installieren und Paperless-ngx von Computer und Smartphone aus erreichbar machen, ohne zu Hause ein NAS betreiben zu müssen.
Ein VPS läuft rund um die Uhr, sodass der Dienst regelmäßig Anhänge aus E-Mails abrufen kann. Dokumente enthalten jedoch häufig personenbezogene Daten: Verwenden Sie HTTPS oder ein VPN, SSH-Schlüssel, eine restriktive Firewall und unabhängige Sicherungskopien.
Sicherheit und Sicherungskopien
Paperless-ngx bietet keine integrierte Ende-zu-Ende-Verschlüsselung für Dokumente. Ein Benutzer mit vollständigem Zugriff auf den Server, Docker-Volumes oder eine Sicherungskopie könnte das Archiv potenziell lesen.
Mindestmaßnahmen:
- den Dienst nur auf vertrauenswürdiger Infrastruktur betreiben;
- System und Container aktualisieren;
- den SSH-Zugriff auf Schlüssel beschränken;
- verschlüsselte Kopien außerhalb des Hauptservers speichern;
- die Wiederherstellung regelmäßig testen.
Für Umzug und Sicherung steht der integrierte document_exporter zur Verfügung:
docker compose exec webserver document_exporter ../exportKopieren Sie das Exportverzeichnis auf ein anderes Gerät oder in einen unabhängigen Speicher. Eine Kopie auf demselben VPS schützt nicht vor einem Festplattenschaden, versehentlichem Löschen oder dem Verlust des Zugriffs.
Lohnt sich die Installation von Paperless-ngx?
Paperless-ngx ist nützlich, wenn nicht mehr das Speichern, sondern das Finden von Dateien das Problem ist. Das System verwandelt Scans, Anhänge und PDFs mit unklaren Namen in ein Archiv, in dem Dokumente nach ihrem Inhalt gefunden und nach einheitlichen Regeln verarbeitet werden.
Für den Einstieg reicht es, den Dienst zu installieren, OCR-Sprachen einzurichten und die ersten Dateien hochzuladen. Tags, E-Mail-Import, Workflows, Barcodes und KI-Funktionen sollten Sie ergänzen, sobald ein klarer, wiederkehrender Ablauf entstanden ist.
FAQ
Kann Paperless-ngx kostenlos genutzt werden?
Ja. Es handelt sich um ein Open-Source-Projekt. Kosten entstehen nur für Hardware, VPS, Domain oder externe Dienste.
Erkennt Paperless-ngx russischen Text?
Ja. Für OCR wird das Tesseract-Sprachpaket rus verwendet. In einem gemischten Archiv wird üblicherweise rus+eng eingerichtet.
Wird die Originaldatei nach der OCR-Verarbeitung gelöscht?
Nein. Die Originaldatei bleibt erhalten. Abhängig von den Einstellungen kann daneben eine separate archivierte PDF-Version erstellt werden.
Können Dokumente vom Smartphone hochgeladen werden?
Ja. Dafür eignen sich die Weboberfläche, die API, eine kompatible mobile App oder die Weiterleitung des Dokuments an ein verbundenes E-Mail-Postfach.
Reicht eine VPS-Sicherung aus?
Ein VPS-Snapshot ist nützlich, sollte aber mit dem integrierten Exporter kombiniert und getrennt aufbewahrt werden. Wichtig ist nicht nur, ein Archiv zu erstellen, sondern auch die Wiederherstellung in einer sauberen Installation zu testen.
