Paperless-ngx: สร้างคลังเอกสารที่ค้นหาได้ของคุณเอง
คุณจำได้ว่าสัญญาฉบับหนึ่งมีจำนวนเงินสำคัญ แต่ไฟล์ชื่อ scan_2024_03_17.pdf และอยู่ท่ามกลางไฟล์ที่คล้ายกันอีกหลายร้อยไฟล์ โปรแกรมจัดการไฟล์ทั่วไปค้นหาจากชื่อไฟล์ ขณะที่คำที่คุณต้องการอยู่ภายในเอกสารสแกน
Paperless-ngx แก้ปัญหานี้ได้ คุณอัปโหลด PDF รูปใบเสร็จ หรือไฟล์แนบอีเมล แล้วบริการจะรู้จำข้อความ จัดทำดัชนี และเปลี่ยนไฟล์ที่กระจัดกระจายให้เป็นคลังเดียว หลังจากนั้นคุณจะค้นหาเอกสารด้วยนามสกุล ที่อยู่ เลขบัญชี หรือวลีใด ๆ บนหน้าเอกสารก็ได้
Paperless-ngx คืออะไร
Paperless-ngx คือระบบจัดการเอกสารแบบฟรีและโอเพนซอร์ส ทำงานบนเซิร์ฟเวอร์ของคุณเอง รับไฟล์จากหลายแหล่ง ทำ OCR และให้ค้นหาเนื้อหาภายในเอกสารได้
แทนที่จะใช้โครงสร้างโฟลเดอร์แบบตายตัวเพียงอย่างเดียว ระบบใช้ผู้ติดต่อ ประเภทเอกสาร แท็ก วันที่ ฟิลด์กำหนดเอง และกฎการจัดเก็บ คุณจึงสามารถแสดงบิลค่าไฟปี 2026 เอกสารสำหรับอพาร์ตเมนต์แห่งใดแห่งหนึ่ง หรือใบรับประกันที่กำลังจะหมดอายุได้ในไม่กี่วินาที
ทำไม Paperless-ngx จึงดีกว่าโฟลเดอร์ทั่วไป
โฟลเดอร์ยังใช้งานได้ตราบใดที่มีเอกสารไม่มากและคุณยังจำระบบการตั้งชื่อได้ แต่หลังจากผ่านไปไม่กี่ปี จะมีไดเรกทอรีอย่าง Documents, Scans, New และ To sort เกิดขึ้น และการหาไฟล์ที่ต้องการก็ทำได้ยาก
| โฟลเดอร์ทั่วไป | Paperless-ngx |
|---|---|
| ค้นหาจากชื่อไฟล์ | ค้นหาข้อความภายในเอกสาร |
| หนึ่งไฟล์อยู่ในหนึ่งโฟลเดอร์ | ใช้แท็กและแอตทริบิวต์ได้หลายรายการ |
| ตั้งชื่อและจัดเรียงด้วยตนเอง | กำหนดเมทาดาทาโดยอัตโนมัติ |
| ต้องบันทึกไฟล์แนบด้วยตนเอง | นำเข้าจากอีเมล |
| เอกสารสแกนยังเป็นเพียงรูปภาพ | OCR ทำให้ค้นหาข้อความได้ |
แทนที่จะพยายามจำไดเรกทอรี คุณเพียงจำคำหนึ่งคำจากเอกสารก็พอ
Paperless-ngx ประมวลผลไฟล์อย่างไร
หลังจากอัปโหลด บริการจะ:
- บันทึกไฟล์ต้นฉบับ
- ดึงข้อความที่มีอยู่หรือเริ่มทำ OCR
- สร้างเอกสาร PDF สำหรับเก็บถาวรและภาพขนาดย่อเมื่อจำเป็น
- เพิ่มเนื้อหาไปยังดัชนีการค้นหาแบบเต็มข้อความ
- ใช้กฎและแนะนำผู้ติดต่อ ประเภท แท็ก และเส้นทางการจัดเก็บ
คุณเริ่มจากการอัปโหลดและค้นหาได้ก่อน แล้วค่อยเพิ่มระบบอัตโนมัติภายหลัง
ฟีเจอร์ Paperless-ngx ที่มีประโยชน์ที่สุด
ค้นหาภายในเอกสารสแกน
หลังทำ OCR แล้ว คุณสามารถค้นหาสัญญาด้วยที่อยู่ ใบแจ้งหนี้ด้วยเลขลูกค้า และใบเสร็จด้วยรุ่นอุปกรณ์ได้ ตัวอย่างเช่น การค้นหา “early termination” จะแสดงเอกสารที่มีวลีดังกล่าว แม้ว่า PDF ต้นฉบับจะประกอบด้วยรูปภาพเท่านั้น
คุณภาพขึ้นอยู่กับเอกสารสแกน: หน้าที่ตรงและมีคอนทราสต์สูงจะรู้จำได้ดีกว่ารูปมืดที่ถ่ายเอียง สำหรับคลังเอกสารภาษารัสเซียและอังกฤษ การติดตั้งภาษา OCR ทั้งสองภาษามีความสำคัญ
การจัดเรียงอัตโนมัติ
Paperless-ngx สามารถจับคู่เอกสารใหม่กับเอกสารที่คุณจัดระเบียบไว้แล้ว คุณติดป้ายใบแจ้งหนี้หลายฉบับจากผู้ให้บริการรายหนึ่งด้วยตนเอง แล้วบริการจะเรียนรู้เพื่อแนะนำผู้ติดต่อ ประเภท และแท็กแบบเดียวกันให้กับไฟล์ถัดไป
สำหรับตรรกะที่เข้มงวด คุณสามารถสร้างกฎตามข้อความ ชื่อไฟล์ แหล่งที่มา หรือโฟลเดอร์อัปโหลดได้
นำเข้าจากอีเมล
บริการสามารถตรวจสอบกล่องจดหมายผ่าน IMAP และประมวลผลข้อความตามกฎ ตัวอย่างเช่น ดึงเฉพาะไฟล์แนบ PDF จากผู้จัดจำหน่ายรายหนึ่ง ส่งเข้าไปในคลัง แล้วทำเครื่องหมายอีเมลว่าอ่านแล้วหรือย้ายไปยังโฟลเดอร์อื่น
ใบแจ้งหนี้จะไม่กองอยู่ในกล่องจดหมายอีกต่อไป แต่ค้นหาได้ร่วมกับเอกสารสแกน
เวิร์กโฟลว์ ฟิลด์ และมุมมองที่บันทึกไว้
เวิร์กโฟลว์จะทำงานเมื่ออัปโหลด เพิ่ม หรือเปลี่ยนแปลงเอกสาร หรือทำงานตามกำหนดเวลา โดยสามารถกำหนดเจ้าของ เพิ่มแท็ก เลือกประเภท และตั้งเส้นทางจัดเก็บได้
ฟิลด์กำหนดเองเปลี่ยนคลังเอกสารให้เป็นฐานข้อมูลขนาดเล็ก สำหรับสัญญา คุณอาจเก็บวันหมดอายุ; สำหรับใบแจ้งหนี้ เก็บจำนวนเงินและกำหนดชำระ; และสำหรับอุปกรณ์ เก็บหมายเลขซีเรียล จากนั้นมุมมองที่บันทึกไว้จะแสดงรายการอย่าง “ต้องชำระเงิน” หรือ “การรับประกันหมดอายุเดือนนี้” ได้
สแกนเป็นชุดด้วยบาร์โค้ด
Paperless-ngx สามารถแบ่งการสแกนขนาดใหญ่ออกเป็นเอกสารหลายฉบับด้วยบาร์โค้ด คุณวางหน้าคั่นระหว่างเอกสาร หรือแนบรหัส ASN ไว้กับแผ่นแรกได้
ASN คือหมายเลขซีเรียลของเอกสารเก็บถาวร ซึ่งเชื่อมสำเนาดิจิทัลกับต้นฉบับกระดาษ วิธีนี้สะดวกเมื่อแปลงเอกสารกองใหญ่เป็นดิจิทัล
เวอร์ชันและ AI ที่เป็นตัวเลือก
ซีรีส์ Paperless-ngx 3.x เพิ่มเวอร์ชันเอกสาร ชุดลิงก์สำหรับการเข้าถึงร่วมกัน และฟีเจอร์ AI ในตัว เมื่อเชื่อมต่อโมเดลแล้ว บริการสามารถแนะนำเมทาดาทาและตอบคำถามเกี่ยวกับเอกสารได้
AI ไม่จำเป็นสำหรับฟีเจอร์หลัก: OCR การค้นหา กฎ แท็ก และการนำเข้าอีเมลทำงานได้โดยไม่ต้องใช้ AI เมื่อใช้ API AI ภายนอก ข้อความบางส่วนอาจออกจากเซิร์ฟเวอร์ ขณะที่โมเดลภายในเครื่องต้องใช้ทรัพยากรมากกว่า
Paperless-ngx เหมาะกับใคร
สำหรับคลังส่วนตัวหรือครอบครัว: สัญญา กรมธรรม์ ประวัติรายการ ใบรับประกัน ใบเสร็จ เอกสารที่อยู่อาศัย และคู่มืออุปกรณ์
สำหรับฟรีแลนซ์และธุรกิจขนาดเล็ก: ใบแจ้งหนี้ ใบรับรองการส่งมอบ สัญญา ค่าใช้จ่าย และการติดต่อกับคู่สัญญา การนำเข้าอีเมลช่วยลดงานด้วยตนเอง ส่วนสิทธิ์การเข้าถึงช่วยให้ผู้ใช้แชร์เอกสารได้
สำหรับกระบวนการงานธุรการ: ค้นหาเอกสารต้นทางได้รวดเร็ว เลือกตามผู้จัดจำหน่ายและช่วงเวลา และจัดการคิวไฟล์ที่ยังไม่ได้ประมวลผล
Paperless-ngx ไม่ได้มาแทนที่ซอฟต์แวร์บัญชี ลายเซ็นอิเล็กทรอนิกส์ หรือระบบ ECM ขององค์กร
Paperless-ngx ต้องการเซิร์ฟเวอร์แบบใด
ภาระงานขึ้นอยู่กับจำนวนหน้า คุณภาพการสแกน ความถี่ในการอัปโหลด และส่วนประกอบเพิ่มเติม คุณสามารถใช้จุดเริ่มต้นเชิงปฏิบัติเหล่านี้ได้:
| สถานการณ์ | CPU | RAM | ดิสก์ |
|---|---|---|---|
| คลังส่วนตัว | 2 vCPU | 2 GB | 30–50 GB NVMe ขึ้นไป |
| ครอบครัวหรือทีมขนาดเล็ก | 2–4 vCPU | 4 GB | 60–100 GB NVMe ขึ้นไป |
| งานชุดใหญ่ ไฟล์ Office และ AI ภายในเครื่อง | 4 vCPU ขึ้นไป | 8 GB ขึ้นไป | ขนาดคลังบวกพื้นที่สำรอง |
บนเซิร์ฟเวอร์ที่ช้า อินเทอร์เฟซอาจทำงานเป็นปกติ แต่ OCR สำหรับเอกสารขนาดใหญ่จะใช้เวลานาน Tika และ Gotenberg สำหรับ Word, Excel และรูปแบบไฟล์สำนักงานอื่น ๆ ก็เพิ่มการใช้หน่วยความจำเช่นกัน
วางแผนความจุดิสก์โดยเผื่อพื้นที่ไว้: นอกจากต้นฉบับแล้ว ระบบอาจเก็บเวอร์ชันสำหรับเก็บถาวร ภาพขนาดย่อ ดัชนี ฐานข้อมูล และไฟล์ชั่วคราว การสำรองข้อมูลก็ต้องใช้พื้นที่แยกต่างหากเช่นกัน
ติดตั้ง Paperless-ngx บน VPS ด้วย Docker
วิธีที่รองรับและง่ายที่สุดคือ Docker Compose คุณต้องมีเซิร์ฟเวอร์ Linux, Docker Engine และปลั๊กอิน Compose
โครงการอย่างเป็นทางการมีตัวติดตั้งแบบโต้ตอบ:
bash -c "$(curl -L https://raw.githubusercontent.com/paperless-ngx/paperless-ngx/main/install-paperless-ngx.sh)"ตัวติดตั้งจะถามไดเรกทอรี ฐานข้อมูล พอร์ต ภาษา OCR ส่วนประกอบเพิ่มเติม และบัญชีผู้ดูแล จากนั้นสร้างการตั้งค่า Compose และเริ่มคอนเทนเนอร์
บนเซิร์ฟเวอร์ production ควรดาวน์โหลดและตรวจสอบสคริปต์ก่อน:
curl -L https://raw.githubusercontent.com/paperless-ngx/paperless-ngx/main/install-paperless-ngx.sh \
-o install-paperless-ngx.sh
less install-paperless-ngx.sh
bash install-paperless-ngx.shจากไดเรกทอรีติดตั้ง คุณตรวจสอบการเริ่มทำงานด้วยคำสั่งเหล่านี้ได้:
docker compose ps
docker compose logs -f webserverสำหรับ OCR ภาษารัสเซียและอังกฤษ โดยทั่วไปให้ตั้งค่า rus+eng และติดตั้งข้อมูลภาษา rus eng เพิ่มเติมใน Docker
อย่าเปิดพอร์ตภายในของแอปพลิเคชันโดยตรง ใช้ reverse proxy เชื่อมต่อกับโดเมน เปิดใช้ HTTPS และปิดพอร์ตที่ไม่จำเป็น สำหรับคลังส่วนตัว การอนุญาตให้เข้าถึงผ่าน VPN เท่านั้นจะปลอดภัยยิ่งขึ้น
Paperless-ngx บน VPS ของ tropic.host
สำหรับคลังขนาดเล็ก VPS ที่มี 2 vCPU, RAM 2–4 GB และพื้นที่จัดเก็บ NVMe ก็เพียงพอ บน tropic.host คุณสามารถติดตั้ง Ubuntu, ลง Docker และให้ Paperless-ngx เข้าถึงได้จากคอมพิวเตอร์และโทรศัพท์โดยไม่ต้องมี NAS ที่บ้าน
VPS ทำงานตลอดเวลา จึงสามารถรวบรวมไฟล์แนบอีเมลได้เป็นประจำ อย่างไรก็ตาม เอกสารมักมีข้อมูลส่วนบุคคล: ใช้ HTTPS หรือ VPN, คีย์ SSH, ไฟร์วอลล์ที่จำกัดสิทธิ์ และข้อมูลสำรองอิสระ
ความปลอดภัยและข้อมูลสำรอง
Paperless-ngx ไม่มีการเข้ารหัสเอกสารแบบ end-to-end ในตัว ผู้ใช้ที่มีสิทธิ์เต็มบนเซิร์ฟเวอร์ volume Docker หรือข้อมูลสำรองอาจอ่านคลังเอกสารได้
มาตรการขั้นต่ำ:
- โฮสต์บริการบนโครงสร้างพื้นฐานที่เชื่อถือได้เท่านั้น
- อัปเดตระบบและคอนเทนเนอร์
- จำกัดการเข้าถึง SSH ให้ใช้คีย์
- เก็บสำเนาที่เข้ารหัสไว้นอกเซิร์ฟเวอร์หลัก
- ทดสอบการกู้คืนเป็นระยะ
สำหรับการย้ายระบบและการสำรองข้อมูล มี document_exporter ในตัว:
docker compose exec webserver document_exporter ../exportคัดลอกไดเรกทอรี export ไปยังอุปกรณ์อื่นหรือพื้นที่จัดเก็บอิสระ สำเนาที่อยู่บน VPS เดียวกันจะไม่ป้องกันความเสียหายของดิสก์ การลบโดยไม่ตั้งใจ หรือการสูญเสียสิทธิ์เข้าถึง
Paperless-ngx คุ้มค่าที่จะติดตั้งหรือไม่?
Paperless-ngx มีประโยชน์เมื่อปัญหาไม่ได้อยู่ที่การเก็บไฟล์อีกต่อไป แต่อยู่ที่การค้นหา มันเปลี่ยนเอกสารสแกน ไฟล์แนบ และ PDF ที่มีชื่อไม่ชัดเจนให้เป็นคลังที่ค้นหาจากเนื้อหาและประมวลผลตามกฎที่สม่ำเสมอได้
ในการเริ่มต้น เพียงติดตั้งบริการ กำหนดค่าภาษา OCR และอัปโหลดไฟล์แรก จากนั้นจึงเพิ่มแท็ก การนำเข้าอีเมล เวิร์กโฟลว์ บาร์โค้ด และฟีเจอร์ AI เมื่อมีกระบวนการที่ชัดเจนและทำซ้ำเป็นประจำ
FAQ
ใช้ Paperless-ngx ฟรีได้หรือไม่?
ได้ โครงการนี้เป็นโอเพนซอร์ส ค่าใช้จ่ายมีเฉพาะฮาร์ดแวร์ VPS โดเมน หรือบริการภายนอก
Paperless-ngx รู้จำข้อความภาษารัสเซียได้หรือไม่?
ได้ OCR ใช้แพ็กเกจภาษา Tesseract rus สำหรับคลังหลายภาษา โดยทั่วไปจะตั้งค่า rus+eng
ไฟล์ต้นฉบับจะถูกลบหลังทำ OCR หรือไม่?
ไม่ ไฟล์ต้นฉบับจะถูกเก็บไว้ ขึ้นอยู่กับการตั้งค่า ระบบอาจสร้าง PDF สำหรับเก็บถาวรแยกไว้อีกไฟล์หนึ่ง
อัปโหลดเอกสารจากโทรศัพท์ได้หรือไม่?
ได้ คุณใช้เว็บอินเทอร์เฟซ API แอปมือถือที่เข้ากันได้ หรือส่งต่อเอกสารไปยังที่อยู่อีเมลที่เชื่อมต่อไว้ได้
ข้อมูลสำรองของ VPS เพียงพอหรือไม่?
snapshot ของ VPS มีประโยชน์ แต่ควรใช้ร่วมกับ exporter ในตัวและเก็บสำเนาแยกต่างหาก สิ่งสำคัญไม่ใช่แค่การสร้างคลังข้อมูล แต่ต้องทดสอบการกู้คืนบนการติดตั้งใหม่ที่สะอาดด้วย
