Paperless-ngx: come creare il tuo archivio di documenti consultabile
Ricordi che in un contratto era indicato un importo importante, ma il file si chiama scan_2024_03_17.pdf e si trova tra centinaia di file simili. Un normale file manager cerca per nome, mentre le parole che ti servono sono all’interno della scansione.
Paperless-ngx risolve questo problema. Carichi un PDF, la foto di una ricevuta o un allegato e-mail, e il servizio riconosce il testo, lo indicizza e riunisce i file sparsi in un unico archivio. In seguito puoi trovare un documento tramite un cognome, un indirizzo, un numero di conto o qualsiasi frase presente nella pagina.
Che cos’è Paperless-ngx
Paperless-ngx è un sistema gratuito e open source per la gestione dei documenti. Si installa sul proprio server, riceve file da fonti diverse, esegue l’OCR e permette di cercare nei contenuti.
Al posto di un’unica struttura rigida di cartelle utilizza corrispondenti, tipi di documento, tag, date, campi personalizzati e regole di archiviazione. In questo modo puoi visualizzare in pochi secondi le bollette elettriche del 2026, i documenti relativi a uno specifico appartamento o le garanzie prossime alla scadenza.
Perché Paperless-ngx è migliore delle normali cartelle
Le cartelle funzionano finché i documenti sono pochi e ricordi il tuo sistema di denominazione. Dopo alcuni anni compaiono directory come Documenti, Scansioni, Nuovi e Da ordinare, e trovare il file giusto diventa difficile.
| Cartella normale | Paperless-ngx |
|---|---|
| Ricerca per nome del file | Ricerca nel testo interno del documento |
| Un file, una cartella | Più tag e attributi |
| Nomi e ordinamento manuali | Assegnazione automatica dei metadati |
| Gli allegati devono essere salvati manualmente | Importazione dalla posta elettronica |
| La scansione rimane un’immagine | L’OCR rende il testo ricercabile |
Invece di cercare di ricordare la directory, basta ricordare una parola contenuta nel documento.
Come Paperless-ngx elabora un file
Dopo il caricamento, il servizio:
- salva il file originale;
- estrae il testo già presente oppure avvia l’OCR;
- crea, quando necessario, una versione PDF da archivio e le miniature;
- aggiunge il contenuto a un indice full-text;
- applica le regole e suggerisce il corrispondente, il tipo, i tag e il percorso di archiviazione.
Puoi iniziare con il caricamento e la ricerca, aggiungendo l’automazione in un secondo momento.
Le funzioni più utili di Paperless-ngx
Ricerca all’interno delle scansioni
Dopo l’OCR puoi trovare un contratto tramite l’indirizzo, una fattura tramite il numero cliente e una ricevuta tramite il modello del dispositivo. Per esempio, una ricerca di “recesso anticipato” mostrerà i documenti che contengono questa frase anche se il PDF originale era composto soltanto da immagini.
La qualità dipende dalla scansione: una pagina dritta e con buon contrasto viene riconosciuta meglio di una foto scura scattata in obliquo. Per un archivio in russo e inglese è importante installare entrambe le lingue OCR.
Ordinamento automatico
Paperless-ngx può confrontare i nuovi documenti con quelli già organizzati. Classifichi manualmente alcune fatture dello stesso fornitore e il servizio impara a suggerire lo stesso corrispondente, tipo e gli stessi tag per i file successivi.
Per una logica rigorosa sono disponibili regole basate sul testo, sul nome del file, sulla fonte o sulla cartella di caricamento.
Importazione dalla posta elettronica
Il servizio può controllare una casella tramite IMAP ed elaborare i messaggi secondo regole definite. Per esempio, può prelevare soltanto gli allegati PDF inviati da un fornitore, trasferirli nell’archivio e poi contrassegnare l’e-mail come letta o spostarla in un’altra cartella.
Le fatture smettono di accumularsi nella posta in arrivo e diventano ricercabili insieme alle scansioni.
Workflow, campi e viste salvate
I workflow eseguono azioni quando un documento viene caricato, aggiunto o modificato, oppure secondo una pianificazione. Possono assegnare un proprietario, aggiungere un tag, scegliere un tipo e impostare un percorso di archiviazione.
I campi personalizzati trasformano l’archivio in un piccolo database. Per un contratto puoi conservare la data di scadenza; per una fattura, l’importo e il termine di pagamento; per un dispositivo, il numero di serie. Le viste salvate possono quindi mostrare, per esempio, “pagamento richiesto” o “garanzia in scadenza questo mese”.
Scansione in blocco con codici a barre
Paperless-ngx può dividere una grande scansione in più documenti usando i codici a barre. Puoi inserire pagine separatrici tra i fogli oppure applicare un codice ASN sulla prima pagina.
ASN è un numero di serie dell’archivio che collega la copia digitale all’originale cartaceo. È una funzione comoda quando si digitalizzano grandi pile di documenti.
Versioni e IA opzionale
La serie Paperless-ngx 3.x ha introdotto le versioni dei documenti, raccolte di link per l’accesso condiviso e funzioni di IA integrate. Collegando un modello, il servizio può suggerire metadati e rispondere a domande sui documenti.
L’IA non è necessaria per le funzioni principali: OCR, ricerca, regole, tag e importazione e-mail funzionano anche senza. Utilizzando un’API di IA esterna, una parte del testo può lasciare il server, mentre un modello locale richiede più risorse.
A chi è adatto Paperless-ngx
Per un archivio personale o familiare: contratti, assicurazioni, estratti conto, garanzie, ricevute, documenti relativi all’abitazione e manuali dei dispositivi.
Per freelance e piccole imprese: fatture, verbali di accettazione, contratti, spese e corrispondenza con le controparti. L’importazione delle e-mail riduce il lavoro manuale, mentre i permessi di accesso consentono di condividere i documenti tra utenti.
Per i processi amministrativi: ricerca rapida dei documenti giustificativi, selezioni per fornitore e periodo e una coda di file non ancora elaborati.
Paperless-ngx non sostituisce un programma di contabilità, una firma elettronica o un sistema ECM aziendale.
Quale server serve per Paperless-ngx
Il carico dipende dal numero di pagine, dalla qualità delle scansioni, dalla frequenza dei caricamenti e dai componenti aggiuntivi. Per iniziare puoi usare questi riferimenti pratici:
| Scenario | CPU | RAM | Disco |
|---|---|---|---|
| Archivio personale | 2 vCPU | 2 GB | da 30–50 GB NVMe |
| Famiglia o piccolo team | 2–4 vCPU | 4 GB | da 60–100 GB NVMe |
| Grandi lotti, file Office, IA locale | da 4 vCPU | da 8 GB | dimensione dell’archivio con margine aggiuntivo |
Su un server poco potente l’interfaccia può funzionare normalmente, ma l’OCR di documenti grandi sarà lento. Tika e Gotenberg, usati per Word, Excel e altri formati da ufficio, aumentano inoltre il consumo di memoria.
Calcola lo spazio su disco con un certo margine: oltre agli originali, il sistema può conservare versioni da archivio, miniature, indice, database e file temporanei. Anche le copie di sicurezza richiedono spazio separato.
Installare Paperless-ngx su un VPS con Docker
Il metodo supportato più semplice è Docker Compose. Servono un server Linux, Docker Engine e il plug-in Compose.
Il progetto ufficiale mette a disposizione un programma di installazione interattivo:
bash -c "$(curl -L https://raw.githubusercontent.com/paperless-ngx/paperless-ngx/main/install-paperless-ngx.sh)"Richiede la directory, il database, la porta, la lingua OCR, i componenti aggiuntivi e l’account amministratore, quindi crea la configurazione Compose e avvia i container.
Su un server di produzione è più sicuro scaricare e controllare prima lo script:
curl -L https://raw.githubusercontent.com/paperless-ngx/paperless-ngx/main/install-paperless-ngx.sh \
-o install-paperless-ngx.sh
less install-paperless-ngx.sh
bash install-paperless-ngx.shDalla directory di installazione puoi verificare l’avvio con questi comandi:
docker compose ps
docker compose logs -f webserverPer l’OCR in russo e inglese si imposta normalmente rus+eng e si installano in Docker i dati linguistici aggiuntivi rus eng.
Non esporre direttamente la porta interna dell’applicazione. Collega un dominio tramite reverse proxy, attiva HTTPS e chiudi le porte non necessarie. Per un archivio personale è ancora più sicuro consentire l’accesso soltanto tramite VPN.
Paperless-ngx su un VPS tropic.host
Per un piccolo archivio è adatto un VPS con 2 vCPU, 2–4 GB di RAM e disco NVMe. Su tropic.host puoi distribuire Ubuntu, installare Docker e mantenere Paperless-ngx accessibile da computer e smartphone senza acquistare un NAS domestico.
Un VPS funziona 24 ore su 24, quindi il servizio può recuperare regolarmente gli allegati dalle e-mail. Tuttavia, i documenti contengono spesso dati personali: usa HTTPS o una VPN, chiavi SSH, un firewall restrittivo e copie di sicurezza indipendenti.
Sicurezza e copie di sicurezza
Paperless-ngx non offre una crittografia end-to-end integrata per i documenti. Un utente con accesso completo al server, ai volumi Docker o a una copia di sicurezza potrebbe potenzialmente leggere l’archivio.
Misure minime:
- ospitare il servizio soltanto su un’infrastruttura affidabile;
- aggiornare il sistema e i container;
- limitare l’accesso SSH alle chiavi;
- conservare copie crittografate fuori dal server principale;
- verificare periodicamente il ripristino.
Per la migrazione e le copie di sicurezza è disponibile il document_exporter integrato:
docker compose exec webserver document_exporter ../exportCopia la directory di esportazione su un altro dispositivo o in uno spazio di archiviazione indipendente. Una copia sullo stesso VPS non protegge da un guasto del disco, una cancellazione accidentale o la perdita dell’accesso.
Vale la pena installare Paperless-ngx?
Paperless-ngx è utile quando il problema non è più conservare i file, ma trovarli. Trasforma scansioni, allegati e PDF con nomi poco chiari in un archivio in cui i documenti vengono trovati tramite il contenuto ed elaborati secondo regole coerenti.
Per iniziare è sufficiente installare il servizio, configurare le lingue OCR e caricare i primi file. Tag, importazione e-mail, workflow, codici a barre e funzioni di IA possono essere aggiunti quando emerge un processo ripetitivo e ben definito.
FAQ
Paperless-ngx si può usare gratuitamente?
Sì. È un progetto open source. I costi riguardano soltanto l’hardware, il VPS, il dominio o i servizi esterni.
Paperless-ngx riconosce il testo in russo?
Sì. Per l’OCR viene utilizzato il pacchetto linguistico Tesseract rus. In un archivio con più lingue si configura normalmente rus+eng.
Il file originale viene eliminato dopo l’OCR?
No. Il file originale viene conservato. A seconda delle impostazioni, può essere creata accanto una versione PDF separata da archivio.
È possibile caricare documenti da uno smartphone?
Sì. Puoi usare l’interfaccia web, l’API, un’app mobile compatibile oppure inoltrare il documento a un indirizzo e-mail collegato.
È sufficiente una copia di sicurezza del VPS?
Uno snapshot del VPS è utile, ma è meglio abbinarlo all’esportatore integrato e conservare una copia separata. È importante non solo creare l’archivio, ma anche verificare il ripristino su un’installazione pulita.
