Language: hi
Paperless-ngx: अपना खोजने योग्य दस्तावेज़ आर्काइव कैसे बनाएँ
आपको याद है कि किसी अनुबंध में एक महत्वपूर्ण राशि लिखी थी, लेकिन फ़ाइल का नाम scan_2024_03_17.pdf है और वह सैकड़ों समान फ़ाइलों के बीच पड़ी है। सामान्य फ़ाइल मैनेजर नाम से खोजता है, जबकि आपको जिस शब्द की आवश्यकता है वह स्कैन के भीतर मौजूद है।
Paperless-ngx इस समस्या को हल करता है। आप PDF, रसीद की फोटो या ईमेल अटैचमेंट अपलोड करते हैं, और सेवा टेक्स्ट पहचानकर उसे इंडेक्स करती है तथा बिखरी हुई फ़ाइलों को एक आर्काइव में बदल देती है। इसके बाद आप दस्तावेज़ को उपनाम, पते, अकाउंट नंबर या पेज पर मौजूद किसी भी वाक्यांश से खोज सकते हैं।
Paperless-ngx क्या है?
Paperless-ngx एक निःशुल्क, ओपन-सोर्स दस्तावेज़ प्रबंधन प्रणाली है। यह आपके अपने सर्वर पर चलती है, अलग-अलग स्रोतों से फ़ाइलें स्वीकार करती है, OCR करती है और उनकी सामग्री खोजने देती है।
एक कठोर फ़ोल्डर संरचना के बजाय यह correspondents, document types, tags, dates, custom fields और storage rules का उपयोग करती है। इससे आप कुछ ही सेकंड में 2026 के बिजली बिल, किसी खास अपार्टमेंट के दस्तावेज़ या जल्द समाप्त होने वाली वारंटी दिखा सकते हैं।
Paperless-ngx सामान्य फ़ोल्डरों से बेहतर क्यों है?
जब दस्तावेज़ कम हों और आपको अपनी naming system याद हो, तब फ़ोल्डर काम करते हैं। कुछ वर्षों बाद Documents, Scans, New और To sort जैसे डायरेक्टरी बनने लगते हैं और सही फ़ाइल ढूँढना कठिन हो जाता है।
| सामान्य फ़ोल्डर | Paperless-ngx |
|---|---|
| फ़ाइल नाम से खोज | दस्तावेज़ के भीतर टेक्स्ट से खोज |
| एक फ़ाइल, एक फ़ोल्डर | कई टैग और विशेषताएँ |
| मैन्युअल नामकरण और छँटाई | मेटाडेटा का स्वचालित असाइनमेंट |
| अटैचमेंट मैन्युअली सेव करने पड़ते हैं | ईमेल से इम्पोर्ट |
| स्कैन एक इमेज बना रहता है | OCR टेक्स्ट को खोजने योग्य बनाता है |
डायरेक्टरी याद रखने के बजाय आपको दस्तावेज़ का केवल एक शब्द याद रखना होगा।
Paperless-ngx किसी फ़ाइल को कैसे प्रोसेस करता है?
अपलोड के बाद सेवा:
- मूल फ़ाइल सेव करती है;
- मौजूदा टेक्स्ट निकालती है या OCR शुरू करती है;
- आवश्यकता होने पर आर्काइवल PDF वर्ज़न और थंबनेल बनाती है;
- सामग्री को full-text index में जोड़ती है;
- नियम लागू करती है और correspondent, type, tags तथा storage path सुझाती है।
आप अपलोड और खोज से शुरुआत कर सकते हैं और बाद में ऑटोमेशन जोड़ सकते हैं।
Paperless-ngx के सबसे उपयोगी फीचर्स
स्कैन के भीतर खोज
OCR के बाद आप अनुबंध को पते से, इनवॉइस को ग्राहक नंबर से और रसीद को डिवाइस मॉडल से खोज सकते हैं। उदाहरण के लिए, “early termination” खोजने पर ऐसे दस्तावेज़ दिखेंगे जिनमें यह वाक्यांश है, भले ही मूल PDF केवल इमेज से बना हो।
गुणवत्ता स्कैन पर निर्भर करती है: सीधा और उच्च-कॉन्ट्रास्ट वाला पेज, कोण पर खींची गई अँधेरी फोटो की तुलना में बेहतर पहचाना जाता है। रूसी-अंग्रेज़ी आर्काइव के लिए दोनों OCR भाषाएँ इंस्टॉल करना महत्वपूर्ण है।
स्वचालित छँटाई
Paperless-ngx नए दस्तावेज़ों का मिलान पहले से व्यवस्थित दस्तावेज़ों से कर सकता है। आप किसी एक प्रदाता के कई इनवॉइस को मैन्युअली लेबल करते हैं और सेवा अगली फ़ाइलों के लिए उसी correspondent, type और tags का सुझाव देना सीखती है।
सख्त लॉजिक के लिए आप टेक्स्ट, फ़ाइल नाम, स्रोत या अपलोड फ़ोल्डर पर आधारित नियम बना सकते हैं।
ईमेल से इम्पोर्ट
सेवा IMAP के माध्यम से मेलबॉक्स जाँच सकती है और नियमों के अनुसार संदेश प्रोसेस कर सकती है। उदाहरण के लिए, यह किसी सप्लायर के केवल PDF अटैचमेंट ले सकती है, उन्हें आर्काइव में भेज सकती है और फिर ईमेल को पढ़ा हुआ चिह्नित या दूसरे फ़ोल्डर में स्थानांतरित कर सकती है।
इनवॉइस इनबॉक्स में जमा होने के बजाय स्कैन के साथ खोजने योग्य बन जाते हैं।
वर्कफ़्लो, फ़ील्ड और सेव्ड व्यू
वर्कफ़्लो दस्तावेज़ अपलोड, जोड़ने या बदलने पर अथवा तय शेड्यूल के अनुसार कार्रवाई करते हैं। वे owner असाइन कर सकते हैं, tag जोड़ सकते हैं, type चुन सकते हैं और storage path सेट कर सकते हैं।
Custom fields आर्काइव को एक छोटे डेटाबेस में बदल देते हैं। अनुबंध के लिए आप expiration date, इनवॉइस के लिए amount और payment deadline, तथा उपकरण के लिए serial number सेव कर सकते हैं। इसके बाद saved views “payment required” या “warranty expires this month” जैसे दस्तावेज़ दिखा सकते हैं।
बारकोड के साथ बैच स्कैनिंग
Paperless-ngx बारकोड का उपयोग करके एक बड़े स्कैन को कई दस्तावेज़ों में बाँट सकता है। आप कागज़ों के बीच separator pages रख सकते हैं या पहले पेज पर ASN code लगा सकते हैं।
ASN archive serial number है, जो डिजिटल कॉपी को कागज़ी मूल दस्तावेज़ से जोड़ता है। बड़े ढेर को डिजिटाइज़ करते समय यह सुविधाजनक होता है।
वर्ज़न और वैकल्पिक AI
Paperless-ngx 3.x सीरीज़ में document versions, साझा एक्सेस के लिए link sets और built-in AI फीचर्स जोड़े गए। किसी मॉडल से कनेक्ट करने पर सेवा मेटाडेटा सुझा सकती है और दस्तावेज़ों के बारे में सवालों के जवाब दे सकती है।
मुख्य फीचर्स के लिए AI आवश्यक नहीं है: OCR, खोज, नियम, टैग और ईमेल इम्पोर्ट इसके बिना काम करते हैं। बाहरी AI API इस्तेमाल करने पर कुछ टेक्स्ट सर्वर से बाहर जा सकता है, जबकि लोकल मॉडल को अधिक संसाधनों की आवश्यकता होती है।
Paperless-ngx किसके लिए उपयुक्त है?
व्यक्तिगत या पारिवारिक आर्काइव: अनुबंध, बीमा पॉलिसी, स्टेटमेंट, वारंटी, रसीदें, आवास संबंधी दस्तावेज़ और उपकरणों के मैनुअल।
फ्रीलांसर और छोटे व्यवसाय: इनवॉइस, स्वीकृति प्रमाणपत्र, अनुबंध, खर्च और व्यावसायिक साझेदारों के साथ पत्राचार। ईमेल इम्पोर्ट मैन्युअल काम घटाता है, जबकि एक्सेस परमिशन से उपयोगकर्ता दस्तावेज़ साझा कर सकते हैं।
प्रशासनिक प्रक्रियाएँ: स्रोत दस्तावेज़ों में तेज़ खोज, सप्लायर और अवधि के अनुसार चयन तथा प्रोसेस न हुई फ़ाइलों की कतार।
Paperless-ngx अकाउंटिंग सॉफ़्टवेयर, इलेक्ट्रॉनिक सिग्नेचर या कॉर्पोरेट ECM सिस्टम का विकल्प नहीं है।
Paperless-ngx को किस तरह के सर्वर की आवश्यकता है?
लोड पेजों की संख्या, स्कैन गुणवत्ता, अपलोड की आवृत्ति और अतिरिक्त कंपोनेंट पर निर्भर करता है। शुरुआती अनुमान के लिए इन व्यावहारिक कॉन्फ़िगरेशन का उपयोग कर सकते हैं:
| स्थिति | CPU | RAM | डिस्क |
|---|---|---|---|
| व्यक्तिगत आर्काइव | 2 vCPU | 2 GB | 30–50 GB NVMe या अधिक |
| परिवार या छोटी टीम | 2–4 vCPU | 4 GB | 60–100 GB NVMe या अधिक |
| बड़े बैच, Office फ़ाइलें, लोकल AI | 4 vCPU या अधिक | 8 GB या अधिक | आर्काइव का आकार और अतिरिक्त जगह |
कमज़ोर सर्वर पर इंटरफ़ेस सामान्य रूप से काम कर सकता है, लेकिन बड़े दस्तावेज़ों का OCR धीमा होगा। Word, Excel और अन्य Office फ़ॉर्मेट के लिए Tika और Gotenberg भी मेमोरी उपयोग बढ़ाते हैं।
डिस्क क्षमता में पर्याप्त जगह रखें: मूल फ़ाइलों के अलावा सिस्टम आर्काइवल वर्ज़न, थंबनेल, इंडेक्स, डेटाबेस और अस्थायी फ़ाइलें भी रख सकता है। बैकअप के लिए भी अलग जगह चाहिए।
Docker के साथ VPS पर Paperless-ngx इंस्टॉल करना
सबसे सरल समर्थित तरीका Docker Compose है। आपको Linux सर्वर, Docker Engine और Compose plugin चाहिए।
आधिकारिक प्रोजेक्ट एक इंटरैक्टिव इंस्टॉलर देता है:
bash -c "$(curl -L https://raw.githubusercontent.com/paperless-ngx/paperless-ngx/main/install-paperless-ngx.sh)"यह डायरेक्टरी, डेटाबेस, पोर्ट, OCR भाषा, अतिरिक्त कंपोनेंट और एडमिनिस्ट्रेटर अकाउंट के बारे में पूछता है, फिर Compose कॉन्फ़िगरेशन बनाकर कंटेनर शुरू करता है।
प्रोडक्शन सर्वर पर स्क्रिप्ट को पहले डाउनलोड करके जाँचना अधिक सुरक्षित है:
curl -L https://raw.githubusercontent.com/paperless-ngx/paperless-ngx/main/install-paperless-ngx.sh \
-o install-paperless-ngx.sh
less install-paperless-ngx.sh
bash install-paperless-ngx.shइंस्टॉलेशन डायरेक्टरी से आप इन कमांड से स्टार्टअप जाँच सकते हैं:
docker compose ps
docker compose logs -f webserverरूसी और अंग्रेज़ी OCR के लिए सामान्यतः rus+eng सेट करें और Docker में अतिरिक्त rus eng भाषा डेटा इंस्टॉल करें।
एप्लिकेशन का आंतरिक पोर्ट सीधे एक्सपोज़ न करें। रिवर्स प्रॉक्सी के माध्यम से डोमेन कनेक्ट करें, HTTPS सक्षम करें और अनावश्यक पोर्ट बंद रखें। व्यक्तिगत आर्काइव के लिए केवल VPN से एक्सेस की अनुमति देना और भी सुरक्षित है।
tropic.host VPS पर Paperless-ngx
छोटे आर्काइव के लिए 2 vCPU, 2–4 GB RAM और NVMe स्टोरेज वाला VPS उपयुक्त है। tropic.host पर आप Ubuntu डिप्लॉय कर सकते हैं, Docker इंस्टॉल कर सकते हैं और घर के NAS के बिना कंप्यूटर तथा फोन से Paperless-ngx उपलब्ध रख सकते हैं।
VPS चौबीसों घंटे चलता है, इसलिए सेवा नियमित रूप से ईमेल अटैचमेंट ले सकती है। हालाँकि दस्तावेज़ों में अक्सर व्यक्तिगत डेटा होता है: HTTPS या VPN, SSH keys, प्रतिबंधित फ़ायरवॉल और स्वतंत्र बैकअप का उपयोग करें।
सुरक्षा और बैकअप
Paperless-ngx दस्तावेज़ों के लिए built-in end-to-end encryption नहीं देता। सर्वर, Docker volumes या बैकअप तक पूर्ण पहुँच रखने वाला उपयोगकर्ता आर्काइव पढ़ सकता है।
न्यूनतम उपाय:
- सेवा को केवल विश्वसनीय इन्फ्रास्ट्रक्चर पर होस्ट करें;
- सिस्टम और कंटेनर अपडेट करें;
- SSH एक्सेस को keys तक सीमित रखें;
- मुख्य सर्वर के बाहर encrypted copies रखें;
- समय-समय पर रिकवरी का परीक्षण करें।
माइग्रेशन और बैकअप के लिए built-in document_exporter उपलब्ध है:
docker compose exec webserver document_exporter ../exportएक्सपोर्ट डायरेक्टरी को किसी दूसरे डिवाइस या स्वतंत्र स्टोरेज पर कॉपी करें। उसी VPS पर रखी कॉपी डिस्क क्षति, गलती से डिलीट होने या एक्सेस खोने से सुरक्षा नहीं देगी।
क्या Paperless-ngx इंस्टॉल करना उचित है?
Paperless-ngx तब उपयोगी है जब समस्या फ़ाइलें सेव करना नहीं, बल्कि उन्हें ढूँढना हो। यह अस्पष्ट नाम वाले स्कैन, अटैचमेंट और PDF को ऐसे आर्काइव में बदल देता है जहाँ दस्तावेज़ सामग्री से मिलते हैं और एकसमान नियमों के अनुसार प्रोसेस होते हैं।
शुरुआत के लिए सेवा इंस्टॉल करना, OCR भाषाएँ कॉन्फ़िगर करना और पहली फ़ाइलें अपलोड करना पर्याप्त है। टैग, ईमेल इम्पोर्ट, वर्कफ़्लो, बारकोड और AI फीचर्स तब जोड़ें जब आपके पास स्पष्ट, दोहराई जाने वाली प्रक्रिया हो।
FAQ
क्या Paperless-ngx निःशुल्क इस्तेमाल किया जा सकता है?
हाँ। यह एक ओपन-सोर्स प्रोजेक्ट है। खर्च केवल हार्डवेयर, VPS, डोमेन या बाहरी सेवाओं पर होता है।
क्या Paperless-ngx रूसी टेक्स्ट पहचान सकता है?
हाँ। OCR Tesseract के rus भाषा पैकेज का उपयोग करता है। मिश्रित आर्काइव के लिए सामान्यतः rus+eng कॉन्फ़िगर किया जाता है।
क्या OCR के बाद मूल फ़ाइल डिलीट हो जाती है?
नहीं। मूल फ़ाइल सुरक्षित रहती है। सेटिंग्स के आधार पर उसके साथ अलग आर्काइवल PDF वर्ज़न बनाया जा सकता है।
क्या फोन से दस्तावेज़ अपलोड किए जा सकते हैं?
हाँ। आप वेब इंटरफ़ेस, API, किसी संगत मोबाइल ऐप या कनेक्टेड ईमेल पते पर दस्तावेज़ फ़ॉरवर्ड करने का उपयोग कर सकते हैं।
क्या VPS बैकअप पर्याप्त है?
VPS snapshot उपयोगी है, लेकिन इसे built-in exporter के साथ मिलाकर अलग कॉपी रखना बेहतर है। केवल आर्काइव बनाना ही नहीं, बल्कि साफ़ इंस्टॉलेशन पर रिकवरी का परीक्षण करना भी महत्वपूर्ण है।
