Tropic Host

Paperless-ngx: il tuo archivio di documenti con OCR su un VPS

7 min di lettura
Tropic
Paperless-ngx: il tuo archivio di documenti con OCR su un VPS

Paperless-ngx: come creare il tuo archivio di documenti consultabile

Ricordi che in un contratto era indicato un importo importante, ma il file si chiama scan_2024_03_17.pdf e si trova tra centinaia di file simili. Un normale file manager cerca per nome, mentre le parole che ti servono sono all’interno della scansione.

Paperless-ngx risolve questo problema. Carichi un PDF, la foto di una ricevuta o un allegato e-mail, e il servizio riconosce il testo, lo indicizza e riunisce i file sparsi in un unico archivio. In seguito puoi trovare un documento tramite un cognome, un indirizzo, un numero di conto o qualsiasi frase presente nella pagina.

Che cos’è Paperless-ngx

Paperless-ngx è un sistema gratuito e open source per la gestione dei documenti. Si installa sul proprio server, riceve file da fonti diverse, esegue l’OCR e permette di cercare nei contenuti.

Al posto di un’unica struttura rigida di cartelle utilizza corrispondenti, tipi di documento, tag, date, campi personalizzati e regole di archiviazione. In questo modo puoi visualizzare in pochi secondi le bollette elettriche del 2026, i documenti relativi a uno specifico appartamento o le garanzie prossime alla scadenza.

Perché Paperless-ngx è migliore delle normali cartelle

Le cartelle funzionano finché i documenti sono pochi e ricordi il tuo sistema di denominazione. Dopo alcuni anni compaiono directory come Documenti, Scansioni, Nuovi e Da ordinare, e trovare il file giusto diventa difficile.

Cartella normalePaperless-ngx
Ricerca per nome del fileRicerca nel testo interno del documento
Un file, una cartellaPiù tag e attributi
Nomi e ordinamento manualiAssegnazione automatica dei metadati
Gli allegati devono essere salvati manualmenteImportazione dalla posta elettronica
La scansione rimane un’immagineL’OCR rende il testo ricercabile

Invece di cercare di ricordare la directory, basta ricordare una parola contenuta nel documento.

Come Paperless-ngx elabora un file

Dopo il caricamento, il servizio:

  1. salva il file originale;
  2. estrae il testo già presente oppure avvia l’OCR;
  3. crea, quando necessario, una versione PDF da archivio e le miniature;
  4. aggiunge il contenuto a un indice full-text;
  5. applica le regole e suggerisce il corrispondente, il tipo, i tag e il percorso di archiviazione.

Puoi iniziare con il caricamento e la ricerca, aggiungendo l’automazione in un secondo momento.

Le funzioni più utili di Paperless-ngx

Ricerca all’interno delle scansioni

Dopo l’OCR puoi trovare un contratto tramite l’indirizzo, una fattura tramite il numero cliente e una ricevuta tramite il modello del dispositivo. Per esempio, una ricerca di “recesso anticipato” mostrerà i documenti che contengono questa frase anche se il PDF originale era composto soltanto da immagini.

La qualità dipende dalla scansione: una pagina dritta e con buon contrasto viene riconosciuta meglio di una foto scura scattata in obliquo. Per un archivio in russo e inglese è importante installare entrambe le lingue OCR.

Ordinamento automatico

Paperless-ngx può confrontare i nuovi documenti con quelli già organizzati. Classifichi manualmente alcune fatture dello stesso fornitore e il servizio impara a suggerire lo stesso corrispondente, tipo e gli stessi tag per i file successivi.

Per una logica rigorosa sono disponibili regole basate sul testo, sul nome del file, sulla fonte o sulla cartella di caricamento.

Importazione dalla posta elettronica

Il servizio può controllare una casella tramite IMAP ed elaborare i messaggi secondo regole definite. Per esempio, può prelevare soltanto gli allegati PDF inviati da un fornitore, trasferirli nell’archivio e poi contrassegnare l’e-mail come letta o spostarla in un’altra cartella.

Le fatture smettono di accumularsi nella posta in arrivo e diventano ricercabili insieme alle scansioni.

Workflow, campi e viste salvate

I workflow eseguono azioni quando un documento viene caricato, aggiunto o modificato, oppure secondo una pianificazione. Possono assegnare un proprietario, aggiungere un tag, scegliere un tipo e impostare un percorso di archiviazione.

I campi personalizzati trasformano l’archivio in un piccolo database. Per un contratto puoi conservare la data di scadenza; per una fattura, l’importo e il termine di pagamento; per un dispositivo, il numero di serie. Le viste salvate possono quindi mostrare, per esempio, “pagamento richiesto” o “garanzia in scadenza questo mese”.

Scansione in blocco con codici a barre

Paperless-ngx può dividere una grande scansione in più documenti usando i codici a barre. Puoi inserire pagine separatrici tra i fogli oppure applicare un codice ASN sulla prima pagina.

ASN è un numero di serie dell’archivio che collega la copia digitale all’originale cartaceo. È una funzione comoda quando si digitalizzano grandi pile di documenti.

Versioni e IA opzionale

La serie Paperless-ngx 3.x ha introdotto le versioni dei documenti, raccolte di link per l’accesso condiviso e funzioni di IA integrate. Collegando un modello, il servizio può suggerire metadati e rispondere a domande sui documenti.

L’IA non è necessaria per le funzioni principali: OCR, ricerca, regole, tag e importazione e-mail funzionano anche senza. Utilizzando un’API di IA esterna, una parte del testo può lasciare il server, mentre un modello locale richiede più risorse.

A chi è adatto Paperless-ngx

Per un archivio personale o familiare: contratti, assicurazioni, estratti conto, garanzie, ricevute, documenti relativi all’abitazione e manuali dei dispositivi.

Per freelance e piccole imprese: fatture, verbali di accettazione, contratti, spese e corrispondenza con le controparti. L’importazione delle e-mail riduce il lavoro manuale, mentre i permessi di accesso consentono di condividere i documenti tra utenti.

Per i processi amministrativi: ricerca rapida dei documenti giustificativi, selezioni per fornitore e periodo e una coda di file non ancora elaborati.

Paperless-ngx non sostituisce un programma di contabilità, una firma elettronica o un sistema ECM aziendale.

Quale server serve per Paperless-ngx

Il carico dipende dal numero di pagine, dalla qualità delle scansioni, dalla frequenza dei caricamenti e dai componenti aggiuntivi. Per iniziare puoi usare questi riferimenti pratici:

ScenarioCPURAMDisco
Archivio personale2 vCPU2 GBda 30–50 GB NVMe
Famiglia o piccolo team2–4 vCPU4 GBda 60–100 GB NVMe
Grandi lotti, file Office, IA localeda 4 vCPUda 8 GBdimensione dell’archivio con margine aggiuntivo

Su un server poco potente l’interfaccia può funzionare normalmente, ma l’OCR di documenti grandi sarà lento. Tika e Gotenberg, usati per Word, Excel e altri formati da ufficio, aumentano inoltre il consumo di memoria.

Calcola lo spazio su disco con un certo margine: oltre agli originali, il sistema può conservare versioni da archivio, miniature, indice, database e file temporanei. Anche le copie di sicurezza richiedono spazio separato.

Installare Paperless-ngx su un VPS con Docker

Il metodo supportato più semplice è Docker Compose. Servono un server Linux, Docker Engine e il plug-in Compose.

Il progetto ufficiale mette a disposizione un programma di installazione interattivo:

bash -c "$(curl -L https://raw.githubusercontent.com/paperless-ngx/paperless-ngx/main/install-paperless-ngx.sh)"

Richiede la directory, il database, la porta, la lingua OCR, i componenti aggiuntivi e l’account amministratore, quindi crea la configurazione Compose e avvia i container.

Su un server di produzione è più sicuro scaricare e controllare prima lo script:

curl -L https://raw.githubusercontent.com/paperless-ngx/paperless-ngx/main/install-paperless-ngx.sh \
  -o install-paperless-ngx.sh
less install-paperless-ngx.sh
bash install-paperless-ngx.sh

Dalla directory di installazione puoi verificare l’avvio con questi comandi:

docker compose ps
docker compose logs -f webserver

Per l’OCR in russo e inglese si imposta normalmente rus+eng e si installano in Docker i dati linguistici aggiuntivi rus eng.

Non esporre direttamente la porta interna dell’applicazione. Collega un dominio tramite reverse proxy, attiva HTTPS e chiudi le porte non necessarie. Per un archivio personale è ancora più sicuro consentire l’accesso soltanto tramite VPN.

Paperless-ngx su un VPS tropic.host

Per un piccolo archivio è adatto un VPS con 2 vCPU, 2–4 GB di RAM e disco NVMe. Su tropic.host puoi distribuire Ubuntu, installare Docker e mantenere Paperless-ngx accessibile da computer e smartphone senza acquistare un NAS domestico.

Un VPS funziona 24 ore su 24, quindi il servizio può recuperare regolarmente gli allegati dalle e-mail. Tuttavia, i documenti contengono spesso dati personali: usa HTTPS o una VPN, chiavi SSH, un firewall restrittivo e copie di sicurezza indipendenti.

Sicurezza e copie di sicurezza

Paperless-ngx non offre una crittografia end-to-end integrata per i documenti. Un utente con accesso completo al server, ai volumi Docker o a una copia di sicurezza potrebbe potenzialmente leggere l’archivio.

Misure minime:

  • ospitare il servizio soltanto su un’infrastruttura affidabile;
  • aggiornare il sistema e i container;
  • limitare l’accesso SSH alle chiavi;
  • conservare copie crittografate fuori dal server principale;
  • verificare periodicamente il ripristino.

Per la migrazione e le copie di sicurezza è disponibile il document_exporter integrato:

docker compose exec webserver document_exporter ../export

Copia la directory di esportazione su un altro dispositivo o in uno spazio di archiviazione indipendente. Una copia sullo stesso VPS non protegge da un guasto del disco, una cancellazione accidentale o la perdita dell’accesso.

Vale la pena installare Paperless-ngx?

Paperless-ngx è utile quando il problema non è più conservare i file, ma trovarli. Trasforma scansioni, allegati e PDF con nomi poco chiari in un archivio in cui i documenti vengono trovati tramite il contenuto ed elaborati secondo regole coerenti.

Per iniziare è sufficiente installare il servizio, configurare le lingue OCR e caricare i primi file. Tag, importazione e-mail, workflow, codici a barre e funzioni di IA possono essere aggiunti quando emerge un processo ripetitivo e ben definito.

FAQ

Paperless-ngx si può usare gratuitamente?

Sì. È un progetto open source. I costi riguardano soltanto l’hardware, il VPS, il dominio o i servizi esterni.

Paperless-ngx riconosce il testo in russo?

Sì. Per l’OCR viene utilizzato il pacchetto linguistico Tesseract rus. In un archivio con più lingue si configura normalmente rus+eng.

Il file originale viene eliminato dopo l’OCR?

No. Il file originale viene conservato. A seconda delle impostazioni, può essere creata accanto una versione PDF separata da archivio.

È possibile caricare documenti da uno smartphone?

Sì. Puoi usare l’interfaccia web, l’API, un’app mobile compatibile oppure inoltrare il documento a un indirizzo e-mail collegato.

È sufficiente una copia di sicurezza del VPS?

Uno snapshot del VPS è utile, ma è meglio abbinarlo all’esportatore integrato e conservare una copia separata. È importante non solo creare l’archivio, ma anche verificare il ripristino su un’installazione pulita.