Language: pl
Paperless-ngx: jak utworzyć własne archiwum dokumentów z wyszukiwaniem
Pamiętasz, że umowa zawierała ważną kwotę, ale plik nazywa się scan_2024_03_17.pdf i leży wśród setek podobnych dokumentów. Zwykły menedżer plików wyszukuje po nazwie, podczas gdy potrzebne słowa znajdują się wewnątrz skanu.
Paperless-ngx rozwiązuje ten problem. Przesyłasz plik PDF, zdjęcie rachunku albo załącznik e-mail, a usługa rozpoznaje tekst, indeksuje go i zamienia rozproszone pliki w jedno archiwum. Później możesz znaleźć dokument po nazwisku, adresie, numerze konta lub dowolnym wyrażeniu ze strony.
Czym jest Paperless-ngx?
Paperless-ngx to darmowy system zarządzania dokumentami o otwartym kodzie źródłowym. Działa na własnym serwerze, przyjmuje pliki z różnych źródeł, wykonuje OCR i pozwala wyszukiwać ich treść.
Zamiast jednej sztywnej struktury folderów używa kontrahentów, typów dokumentów, tagów, dat, pól niestandardowych i reguł przechowywania. Dzięki temu w kilka sekund wyświetlisz rachunki za prąd z 2026 roku, dokumenty dotyczące konkretnego mieszkania albo gwarancje, których termin wkrótce upływa.
Dlaczego Paperless-ngx jest lepszy od zwykłych folderów?
Foldery sprawdzają się, gdy masz niewiele dokumentów i wciąż pamiętasz swój system nazewnictwa. Po kilku latach pojawiają się katalogi takie jak Documents, Scans, New i To sort, a znalezienie właściwego pliku staje się trudne.
| Zwykły folder | Paperless-ngx |
|---|---|
| Wyszukiwanie po nazwie pliku | Wyszukiwanie tekstu wewnątrz dokumentu |
| Jeden plik, jeden folder | Wiele tagów i atrybutów |
| Ręczne nazywanie i sortowanie | Automatyczne przypisywanie metadanych |
| Załączniki trzeba zapisywać ręcznie | Import z e-maila |
| Skan pozostaje obrazem | OCR sprawia, że tekst można wyszukiwać |
Zamiast zapamiętywać katalog, wystarczy pamiętać jedno słowo z dokumentu.
Jak Paperless-ngx przetwarza plik?
Po przesłaniu dokumentu usługa:
- zapisuje oryginalny plik;
- wyodrębnia istniejący tekst albo uruchamia OCR;
- w razie potrzeby tworzy archiwalną wersję PDF i miniatury;
- dodaje treść do indeksu pełnotekstowego;
- stosuje reguły i sugeruje kontrahenta, typ, tagi oraz ścieżkę przechowywania.
Możesz zacząć od przesyłania i wyszukiwania, a automatyzację dodać później.
Najbardziej przydatne funkcje Paperless-ngx
Wyszukiwanie w skanach
Po OCR możesz znaleźć umowę po adresie, fakturę po numerze klienta, a rachunek po modelu urządzenia. Na przykład wyszukanie „early termination” pokaże dokumenty zawierające tę frazę, nawet gdy oryginalny PDF składał się wyłącznie z obrazów.
Jakość zależy od skanu: prosta strona o wysokim kontraście jest rozpoznawana lepiej niż ciemne zdjęcie wykonane pod kątem. W archiwum rosyjsko-angielskim ważne jest zainstalowanie obu języków OCR.
Automatyczne sortowanie
Paperless-ngx może dopasowywać nowe dokumenty do tych, które zostały już uporządkowane. Ręcznie oznaczasz kilka faktur od jednego dostawcy, a usługa uczy się sugerować tego samego kontrahenta, typ i tagi dla kolejnych plików.
W przypadku ścisłej logiki możesz utworzyć reguły na podstawie tekstu, nazwy pliku, źródła lub folderu przesyłania.
Import z e-maila
Usługa może sprawdzać skrzynkę przez IMAP i przetwarzać wiadomości zgodnie z regułami. Może na przykład pobierać tylko załączniki PDF od dostawcy, wysyłać je do archiwum, a następnie oznaczać wiadomość jako przeczytaną lub przenosić ją do innego folderu.
Faktury przestają gromadzić się w skrzynce i stają się dostępne w wyszukiwaniu razem ze skanami.
Workflow, pola i zapisane widoki
Workflow wykonuje działania po przesłaniu, dodaniu lub zmianie dokumentu albo zgodnie z harmonogramem. Może przypisać właściciela, dodać tag, wybrać typ i ustawić ścieżkę przechowywania.
Pola niestandardowe zamieniają archiwum w małą bazę danych. Dla umowy możesz zapisać datę wygaśnięcia, dla faktury kwotę i termin płatności, a dla sprzętu numer seryjny. Zapisane widoki mogą następnie pokazywać na przykład „wymagana płatność” albo „gwarancja wygasa w tym miesiącu”.
Skanowanie seryjne z kodami kreskowymi
Paperless-ngx potrafi podzielić jeden duży skan na kilka dokumentów za pomocą kodów kreskowych. Możesz umieszczać strony rozdzielające między dokumentami albo dołączyć kod ASN do pierwszej strony.
ASN to archiwalny numer seryjny, który łączy cyfrową kopię z papierowym oryginałem. Jest to wygodne przy digitalizacji dużych stosów dokumentów.
Wersje i opcjonalna sztuczna inteligencja
Seria Paperless-ngx 3.x wprowadziła wersje dokumentów, zestawy linków do wspólnego dostępu oraz wbudowane funkcje AI. Po podłączeniu modelu usługa może sugerować metadane i odpowiadać na pytania dotyczące dokumentów.
AI nie jest potrzebne do podstawowych funkcji: OCR, wyszukiwanie, reguły, tagi i import e-maili działają bez niego. Przy korzystaniu z zewnętrznego API AI część tekstu może opuścić serwer, a model lokalny wymaga większych zasobów.
Dla kogo przeznaczony jest Paperless-ngx?
Prywatne lub rodzinne archiwum: umowy, polisy, wyciągi, gwarancje, rachunki, dokumenty mieszkaniowe i instrukcje urządzeń.
Freelancerzy i małe firmy: faktury, protokoły odbioru, umowy, wydatki i korespondencja z kontrahentami. Import e-maili ogranicza ręczną pracę, a uprawnienia pozwalają udostępniać dokumenty.
Procesy administracyjne: szybkie wyszukiwanie w dokumentach źródłowych, filtrowanie po dostawcy i okresie oraz kolejka nieprzetworzonych plików.
Paperless-ngx nie zastępuje oprogramowania księgowego, podpisu elektronicznego ani firmowego systemu ECM.
Jakiego serwera potrzebuje Paperless-ngx?
Obciążenie zależy od liczby stron, jakości skanów, częstotliwości przesyłania i dodatkowych komponentów. Jako praktyczny punkt wyjścia możesz przyjąć:
| Scenariusz | CPU | RAM | Dysk |
|---|---|---|---|
| Prywatne archiwum | 2 vCPU | 2 GB | NVMe 30–50 GB lub więcej |
| Rodzina lub mały zespół | 2–4 vCPU | 4 GB | NVMe 60–100 GB lub więcej |
| Duże partie, pliki Office, lokalne AI | 4 vCPU lub więcej | 8 GB lub więcej | Rozmiar archiwum plus zapas |
Na słabym serwerze interfejs może działać normalnie, ale OCR dużych dokumentów będzie wolny. Tika i Gotenberg dla plików Word, Excel i innych formatów biurowych również zwiększają użycie pamięci.
Zaplanuj pojemność dysku z zapasem: oprócz oryginałów system może przechowywać wersje archiwalne, miniatury, indeks, bazę danych i pliki tymczasowe. Kopie zapasowe także wymagają osobnego miejsca.
Instalacja Paperless-ngx na VPS-ie za pomocą Dockera
Najprostszą obsługiwaną metodą jest Docker Compose. Potrzebujesz serwera Linux, Docker Engine i pluginu Compose.
Oficjalny projekt udostępnia interaktywny instalator:
bash -c "$(curl -L https://raw.githubusercontent.com/paperless-ngx/paperless-ngx/main/install-paperless-ngx.sh)"Instalator pyta o katalog, bazę danych, port, język OCR, dodatkowe komponenty i konto administratora, a następnie tworzy konfigurację Compose oraz uruchamia kontenery.
Na serwerze produkcyjnym bezpieczniej jest najpierw pobrać i sprawdzić skrypt:
curl -L https://raw.githubusercontent.com/paperless-ngx/paperless-ngx/main/install-paperless-ngx.sh \
-o install-paperless-ngx.sh
less install-paperless-ngx.sh
bash install-paperless-ngx.shW katalogu instalacji możesz sprawdzić uruchomienie za pomocą poleceń:
docker compose ps
docker compose logs -f webserverDla OCR rosyjskiego i angielskiego zwykle ustawia się rus+eng i instaluje dodatkowe dane językowe rus eng w Dockerze.
Nie wystawiaj bezpośrednio wewnętrznego portu aplikacji. Podłącz domenę przez reverse proxy, włącz HTTPS i zamknij niepotrzebne porty. W prywatnym archiwum jeszcze bezpieczniej jest zezwolić na dostęp wyłącznie przez VPN.
Paperless-ngx na VPS-ie w tropic.host
Do małego archiwum nadaje się VPS z 2 vCPU, 2–4 GB RAM-u i pamięcią NVMe. Na tropic.host możesz wdrożyć Ubuntu, zainstalować Dockera i zapewnić dostęp do Paperless-ngx z komputera oraz telefonu bez domowego NAS-a.
VPS działa przez całą dobę, więc usługa może regularnie pobierać załączniki e-mail. Dokumenty często zawierają jednak dane osobowe: używaj HTTPS lub VPN-u, kluczy SSH, restrykcyjnej zapory i niezależnych kopii zapasowych.
Bezpieczeństwo i kopie zapasowe
Paperless-ngx nie oferuje wbudowanego szyfrowania dokumentów end-to-end. Użytkownik z pełnym dostępem do serwera, wolumenów Dockera lub kopii zapasowej może potencjalnie odczytać archiwum.
Minimalne działania:
- hostuj usługę wyłącznie w zaufanej infrastrukturze;
- aktualizuj system i kontenery;
- ogranicz dostęp SSH do kluczy;
- przechowuj zaszyfrowane kopie poza głównym serwerem;
- okresowo testuj odzyskiwanie danych.
Do migracji i tworzenia kopii zapasowych służy wbudowany document_exporter:
docker compose exec webserver document_exporter ../exportSkopiuj katalog eksportu na inne urządzenie lub do niezależnego magazynu. Kopia na tym samym VPS-ie nie ochroni przed uszkodzeniem dysku, przypadkowym usunięciem ani utratą dostępu.
Czy warto instalować Paperless-ngx?
Paperless-ngx jest przydatny, gdy problemem nie jest już przechowywanie plików, lecz ich znajdowanie. Zamienia skany, załączniki i PDF-y o niejasnych nazwach w archiwum, w którym dokumenty wyszukuje się po treści i przetwarza według spójnych reguł.
Na początek wystarczy zainstalować usługę, skonfigurować języki OCR i przesłać pierwsze pliki. Tagi, import e-maili, workflow, kody kreskowe i funkcje AI warto dodawać, gdy masz jasny, powtarzalny proces.
FAQ
Czy Paperless-ngx można używać za darmo?
Tak. Jest to projekt open source. Koszty dotyczą wyłącznie sprzętu, VPS-a, domeny lub usług zewnętrznych.
Czy Paperless-ngx rozpoznaje tekst rosyjski?
Tak. OCR korzysta z pakietu językowego Tesseract rus. W przypadku mieszanego archiwum zwykle konfiguruje się rus+eng.
Czy oryginalny plik jest usuwany po OCR?
Nie. Oryginalny plik zostaje zachowany. Zależnie od ustawień obok niego może powstać osobna archiwalna wersja PDF.
Czy można przesyłać dokumenty z telefonu?
Tak. Możesz użyć interfejsu webowego, API, zgodnej aplikacji mobilnej lub przesłać dokument na podłączony adres e-mail.
Czy kopia zapasowa VPS-a wystarczy?
Migawka VPS-a jest przydatna, ale lepiej połączyć ją z wbudowanym eksporterem i przechowywać osobną kopię. Ważne jest nie tylko utworzenie archiwum, lecz także przetestowanie odzyskiwania na czystej instalacji.
