Tropic Host

Paperless-ngx: tu propio archivo de documentos con OCR en un VPS

7 min de lectura
Tropic
Paperless-ngx: tu propio archivo de documentos con OCR en un VPS

Paperless-ngx: cómo crear tu propio archivo de documentos consultable

Recuerdas que en un contrato había una cantidad importante, pero el archivo se llama scan_2024_03_17.pdf y está entre cientos de archivos parecidos. Un gestor de archivos normal busca por el nombre, mientras que las palabras que necesitas están dentro del escaneo.

Paperless-ngx resuelve este problema. Subes un PDF, la foto de un recibo o un archivo adjunto de correo, y el servicio reconoce el texto, lo indexa y reúne los archivos dispersos en un único archivo documental. Después puedes encontrar un documento por un apellido, una dirección, un número de cuenta o cualquier frase que aparezca en la página.

Qué es Paperless-ngx

Paperless-ngx es un sistema de gestión documental gratuito y de código abierto. Se instala en tu propio servidor, recibe archivos de distintas fuentes, realiza OCR y permite buscar por el contenido.

En lugar de una estructura de carpetas única y rígida, utiliza remitentes, tipos de documento, etiquetas, fechas, campos personalizados y reglas de almacenamiento. Así puedes mostrar en pocos segundos las facturas de electricidad de 2026, los documentos relacionados con un apartamento concreto o las garantías que están a punto de vencer.

Por qué Paperless-ngx es mejor que las carpetas normales

Las carpetas funcionan mientras hay pocos documentos y recuerdas tu propio sistema de nombres. Después de unos años aparecen directorios como Documentos, Escaneos, Nuevos y Por ordenar, y encontrar el archivo correcto se vuelve difícil.

Carpeta normalPaperless-ngx
Búsqueda por nombre de archivoBúsqueda en el texto del documento
Un archivo, una carpetaVarias etiquetas y propiedades
Nombres y clasificación manualesAsignación automática de metadatos
Los adjuntos deben guardarse manualmenteImportación desde el correo electrónico
El escaneo sigue siendo una imagenEl OCR hace que el texto se pueda buscar

En lugar de intentar recordar el directorio, basta con recordar una palabra del documento.

Cómo procesa Paperless-ngx un archivo

Después de subirlo, el servicio:

  1. guarda el archivo original;
  2. extrae el texto existente o inicia el OCR;
  3. crea, cuando es necesario, una versión PDF para archivo y miniaturas;
  4. añade el contenido a un índice de texto completo;
  5. aplica reglas y sugiere un remitente, un tipo, etiquetas y una ruta de almacenamiento.

Puedes empezar solo con la carga y la búsqueda, y añadir la automatización más adelante.

Las funciones más útiles de Paperless-ngx

Búsqueda dentro de los escaneos

Después del OCR, puedes encontrar un contrato por la dirección, una factura por el número de cliente y un recibo por el modelo del dispositivo. Por ejemplo, una búsqueda de «cancelación anticipada» mostrará los documentos que contienen esa frase, aunque el PDF original estuviera formado únicamente por imágenes.

La calidad depende del escaneo: una página recta y con buen contraste se reconoce mejor que una foto oscura tomada en ángulo. Para un archivo en ruso e inglés, es importante instalar ambos idiomas de OCR.

Clasificación automática

Paperless-ngx puede comparar los documentos nuevos con los que ya has organizado. Clasificas manualmente varias facturas del mismo proveedor y el servicio aprende a sugerir el mismo remitente, tipo y etiquetas para los archivos siguientes.

Para aplicar una lógica estricta, puedes crear reglas basadas en el texto, el nombre del archivo, la fuente o la carpeta de carga.

Importación desde el correo electrónico

El servicio puede revisar un buzón mediante IMAP y procesar los mensajes según reglas. Por ejemplo, puede recoger únicamente los adjuntos PDF de un proveedor, enviarlos al archivo y después marcar el mensaje como leído o moverlo a otra carpeta.

Las facturas dejan de acumularse en la bandeja de entrada y se pueden buscar junto con los escaneos.

Flujos de trabajo, campos y vistas guardadas

Los flujos de trabajo ejecutan acciones cuando un documento se sube, se añade o se modifica, o según una programación. Pueden asignar un propietario, añadir una etiqueta, seleccionar un tipo y establecer una ruta de almacenamiento.

Los campos personalizados convierten el archivo en una pequeña base de datos. Para un contrato puedes guardar la fecha de vencimiento; para una factura, el importe y el plazo de pago; y para un equipo, el número de serie. Las vistas guardadas pueden mostrar, por ejemplo, «pago pendiente» o «la garantía vence este mes».

Escaneo por lotes con códigos de barras

Paperless-ngx puede dividir un escaneo grande en varios documentos mediante códigos de barras. Puedes insertar páginas separadoras entre los papeles o pegar un código ASN en la primera hoja.

ASN es un número de serie de archivo que vincula la copia digital con el original en papel. Resulta práctico al digitalizar grandes pilas de documentos.

Versiones e IA opcional

La serie Paperless-ngx 3.x incorporó versiones de documentos, conjuntos de enlaces para el acceso compartido y funciones de IA integradas. Al conectar un modelo, el servicio puede sugerir metadatos y responder preguntas sobre los documentos.

La IA no es necesaria para las funciones principales: el OCR, la búsqueda, las reglas, las etiquetas y la importación de correo funcionan sin ella. Al utilizar una API de IA externa, parte del texto puede salir del servidor, mientras que un modelo local requiere más recursos.

Para quién es adecuado Paperless-ngx

Para un archivo personal o familiar: contratos, seguros, extractos, garantías, recibos, documentos de vivienda y manuales de equipos.

Para autónomos y pequeñas empresas: facturas, actas de aceptación, contratos, gastos y correspondencia con socios. La importación de correo reduce el trabajo manual, mientras que los permisos de acceso permiten compartir documentos entre usuarios.

Para procesos administrativos: búsqueda rápida de justificantes, selecciones por proveedor y periodo, y una cola de archivos aún no procesados.

Paperless-ngx no sustituye un programa de contabilidad, una firma electrónica ni un sistema ECM corporativo.

Qué servidor necesita Paperless-ngx

La carga depende de la cantidad de páginas, la calidad de los escaneos, la frecuencia de las cargas y los componentes adicionales. Para empezar, puedes usar estas referencias prácticas:

EscenarioCPURAMDisco
Archivo personal2 vCPU2 GBdesde 30–50 GB NVMe
Familia o equipo pequeño2–4 vCPU4 GBdesde 60–100 GB NVMe
Lotes grandes, archivos Office, IA localdesde 4 vCPUdesde 8 GBtamaño del archivo con margen adicional

En un servidor poco potente, la interfaz puede funcionar con normalidad, pero el OCR de documentos grandes será lento. Tika y Gotenberg, utilizados para Word, Excel y otros formatos de oficina, también aumentan el consumo de memoria.

Calcula el espacio de disco con margen: además de los originales, el sistema puede guardar versiones de archivo, miniaturas, un índice, una base de datos y archivos temporales. Las copias de seguridad también necesitan espacio independiente.

Instalación de Paperless-ngx en un VPS con Docker

El método compatible más sencillo es Docker Compose. Necesitarás un servidor Linux, Docker Engine y el complemento Compose.

El proyecto oficial ofrece un instalador interactivo:

bash -c "$(curl -L https://raw.githubusercontent.com/paperless-ngx/paperless-ngx/main/install-paperless-ngx.sh)"

Te pedirá el directorio, la base de datos, el puerto, el idioma de OCR, los componentes adicionales y la cuenta de administrador. Después creará la configuración de Compose e iniciará los contenedores.

En un servidor de producción es más seguro descargar y revisar primero el script:

curl -L https://raw.githubusercontent.com/paperless-ngx/paperless-ngx/main/install-paperless-ngx.sh \
  -o install-paperless-ngx.sh
less install-paperless-ngx.sh
bash install-paperless-ngx.sh

Desde el directorio de instalación puedes comprobar el inicio con estos comandos:

docker compose ps
docker compose logs -f webserver

Para OCR en ruso e inglés, normalmente se configura rus+eng y se instalan en Docker los datos de idioma adicionales rus eng.

No expongas directamente el puerto interno de la aplicación. Conecta un dominio mediante un proxy inverso, activa HTTPS y cierra los puertos innecesarios. Para un archivo personal es todavía más seguro permitir el acceso solo mediante una VPN.

Paperless-ngx en un VPS de tropic.host

Para un archivo pequeño es adecuado un VPS con 2 vCPU, 2–4 GB de RAM y almacenamiento NVMe. En tropic.host puedes desplegar Ubuntu, instalar Docker y mantener Paperless-ngx accesible desde un ordenador y un teléfono sin comprar un NAS doméstico.

Un VPS funciona las 24 horas, por lo que el servicio puede recoger periódicamente los adjuntos del correo. Sin embargo, los documentos suelen contener datos personales: utiliza HTTPS o una VPN, claves SSH, un cortafuegos restrictivo y copias de seguridad independientes.

Seguridad y copias de seguridad

Paperless-ngx no ofrece cifrado de extremo a extremo integrado para los documentos. Un usuario con acceso completo al servidor, a los volúmenes de Docker o a una copia de seguridad podría leer el archivo.

Medidas mínimas:

  • alojar el servicio únicamente en una infraestructura de confianza;
  • actualizar el sistema y los contenedores;
  • restringir el acceso SSH a claves;
  • guardar copias cifradas fuera del servidor principal;
  • comprobar periódicamente la restauración.

Para la migración y las copias de seguridad existe un document_exporter integrado:

docker compose exec webserver document_exporter ../export

Copia el directorio de exportación a otro dispositivo o a un almacenamiento independiente. Una copia en el mismo VPS no protege frente a daños en el disco, un borrado accidental o la pérdida de acceso.

¿Merece la pena instalar Paperless-ngx?

Paperless-ngx resulta útil cuando el problema ya no es guardar los archivos, sino encontrarlos. Convierte escaneos, adjuntos y PDF con nombres poco claros en un archivo donde los documentos se encuentran por su contenido y se procesan según reglas coherentes.

Para empezar basta con instalar el servicio, configurar los idiomas de OCR y subir los primeros archivos. Las etiquetas, la importación de correo, los flujos de trabajo, los códigos de barras y las funciones de IA conviene añadirlos cuando exista un proceso repetitivo y bien definido.

FAQ

¿Se puede utilizar Paperless-ngx gratis?

Sí. Es un proyecto de código abierto. Los costes corresponden únicamente al equipo, el VPS, el dominio o los servicios externos.

¿Paperless-ngx reconoce texto en ruso?

Sí. El OCR utiliza el paquete de idioma rus de Tesseract. En un archivo con varios idiomas normalmente se configura rus+eng.

¿Se elimina el archivo original después del OCR?

No. El archivo original se conserva. Según la configuración, puede crearse junto a él una versión PDF independiente para archivo.

¿Se pueden subir documentos desde un teléfono?

Sí. Puedes utilizar la interfaz web, la API, una aplicación móvil compatible o reenviar el documento a una dirección de correo conectada.

¿Es suficiente una copia de seguridad del VPS?

Una instantánea del VPS es útil, pero es mejor combinarla con el exportador integrado y guardar una copia por separado. No solo es importante crear el archivo, sino también probar la restauración en una instalación limpia.