Paperless-ngx: คลังเอกสาร OCR ของคุณเองบน VPS

1 อ่านขั้นต่ำแล้ว
Tropic
Paperless-ngx: คลังเอกสาร OCR ของคุณเองบน VPS

Paperless-ngx: สร้างคลังเอกสารที่ค้นหาได้ของคุณเอง

คุณจำได้ว่าสัญญาฉบับหนึ่งมีจำนวนเงินสำคัญ แต่ไฟล์ชื่อ scan_2024_03_17.pdf และอยู่ท่ามกลางไฟล์ที่คล้ายกันอีกหลายร้อยไฟล์ โปรแกรมจัดการไฟล์ทั่วไปค้นหาจากชื่อไฟล์ ขณะที่คำที่คุณต้องการอยู่ภายในเอกสารสแกน

Paperless-ngx แก้ปัญหานี้ได้ คุณอัปโหลด PDF รูปใบเสร็จ หรือไฟล์แนบอีเมล แล้วบริการจะรู้จำข้อความ จัดทำดัชนี และเปลี่ยนไฟล์ที่กระจัดกระจายให้เป็นคลังเดียว หลังจากนั้นคุณจะค้นหาเอกสารด้วยนามสกุล ที่อยู่ เลขบัญชี หรือวลีใด ๆ บนหน้าเอกสารก็ได้

Paperless-ngx คืออะไร

Paperless-ngx คือระบบจัดการเอกสารแบบฟรีและโอเพนซอร์ส ทำงานบนเซิร์ฟเวอร์ของคุณเอง รับไฟล์จากหลายแหล่ง ทำ OCR และให้ค้นหาเนื้อหาภายในเอกสารได้

แทนที่จะใช้โครงสร้างโฟลเดอร์แบบตายตัวเพียงอย่างเดียว ระบบใช้ผู้ติดต่อ ประเภทเอกสาร แท็ก วันที่ ฟิลด์กำหนดเอง และกฎการจัดเก็บ คุณจึงสามารถแสดงบิลค่าไฟปี 2026 เอกสารสำหรับอพาร์ตเมนต์แห่งใดแห่งหนึ่ง หรือใบรับประกันที่กำลังจะหมดอายุได้ในไม่กี่วินาที

ทำไม Paperless-ngx จึงดีกว่าโฟลเดอร์ทั่วไป

โฟลเดอร์ยังใช้งานได้ตราบใดที่มีเอกสารไม่มากและคุณยังจำระบบการตั้งชื่อได้ แต่หลังจากผ่านไปไม่กี่ปี จะมีไดเรกทอรีอย่าง Documents, Scans, New และ To sort เกิดขึ้น และการหาไฟล์ที่ต้องการก็ทำได้ยาก

โฟลเดอร์ทั่วไปPaperless-ngx
ค้นหาจากชื่อไฟล์ค้นหาข้อความภายในเอกสาร
หนึ่งไฟล์อยู่ในหนึ่งโฟลเดอร์ใช้แท็กและแอตทริบิวต์ได้หลายรายการ
ตั้งชื่อและจัดเรียงด้วยตนเองกำหนดเมทาดาทาโดยอัตโนมัติ
ต้องบันทึกไฟล์แนบด้วยตนเองนำเข้าจากอีเมล
เอกสารสแกนยังเป็นเพียงรูปภาพOCR ทำให้ค้นหาข้อความได้

แทนที่จะพยายามจำไดเรกทอรี คุณเพียงจำคำหนึ่งคำจากเอกสารก็พอ

Paperless-ngx ประมวลผลไฟล์อย่างไร

หลังจากอัปโหลด บริการจะ:

  1. บันทึกไฟล์ต้นฉบับ
  2. ดึงข้อความที่มีอยู่หรือเริ่มทำ OCR
  3. สร้างเอกสาร PDF สำหรับเก็บถาวรและภาพขนาดย่อเมื่อจำเป็น
  4. เพิ่มเนื้อหาไปยังดัชนีการค้นหาแบบเต็มข้อความ
  5. ใช้กฎและแนะนำผู้ติดต่อ ประเภท แท็ก และเส้นทางการจัดเก็บ

คุณเริ่มจากการอัปโหลดและค้นหาได้ก่อน แล้วค่อยเพิ่มระบบอัตโนมัติภายหลัง

ฟีเจอร์ Paperless-ngx ที่มีประโยชน์ที่สุด

ค้นหาภายในเอกสารสแกน

หลังทำ OCR แล้ว คุณสามารถค้นหาสัญญาด้วยที่อยู่ ใบแจ้งหนี้ด้วยเลขลูกค้า และใบเสร็จด้วยรุ่นอุปกรณ์ได้ ตัวอย่างเช่น การค้นหา “early termination” จะแสดงเอกสารที่มีวลีดังกล่าว แม้ว่า PDF ต้นฉบับจะประกอบด้วยรูปภาพเท่านั้น

คุณภาพขึ้นอยู่กับเอกสารสแกน: หน้าที่ตรงและมีคอนทราสต์สูงจะรู้จำได้ดีกว่ารูปมืดที่ถ่ายเอียง สำหรับคลังเอกสารภาษารัสเซียและอังกฤษ การติดตั้งภาษา OCR ทั้งสองภาษามีความสำคัญ

การจัดเรียงอัตโนมัติ

Paperless-ngx สามารถจับคู่เอกสารใหม่กับเอกสารที่คุณจัดระเบียบไว้แล้ว คุณติดป้ายใบแจ้งหนี้หลายฉบับจากผู้ให้บริการรายหนึ่งด้วยตนเอง แล้วบริการจะเรียนรู้เพื่อแนะนำผู้ติดต่อ ประเภท และแท็กแบบเดียวกันให้กับไฟล์ถัดไป

สำหรับตรรกะที่เข้มงวด คุณสามารถสร้างกฎตามข้อความ ชื่อไฟล์ แหล่งที่มา หรือโฟลเดอร์อัปโหลดได้

นำเข้าจากอีเมล

บริการสามารถตรวจสอบกล่องจดหมายผ่าน IMAP และประมวลผลข้อความตามกฎ ตัวอย่างเช่น ดึงเฉพาะไฟล์แนบ PDF จากผู้จัดจำหน่ายรายหนึ่ง ส่งเข้าไปในคลัง แล้วทำเครื่องหมายอีเมลว่าอ่านแล้วหรือย้ายไปยังโฟลเดอร์อื่น

ใบแจ้งหนี้จะไม่กองอยู่ในกล่องจดหมายอีกต่อไป แต่ค้นหาได้ร่วมกับเอกสารสแกน

เวิร์กโฟลว์ ฟิลด์ และมุมมองที่บันทึกไว้

เวิร์กโฟลว์จะทำงานเมื่ออัปโหลด เพิ่ม หรือเปลี่ยนแปลงเอกสาร หรือทำงานตามกำหนดเวลา โดยสามารถกำหนดเจ้าของ เพิ่มแท็ก เลือกประเภท และตั้งเส้นทางจัดเก็บได้

ฟิลด์กำหนดเองเปลี่ยนคลังเอกสารให้เป็นฐานข้อมูลขนาดเล็ก สำหรับสัญญา คุณอาจเก็บวันหมดอายุ; สำหรับใบแจ้งหนี้ เก็บจำนวนเงินและกำหนดชำระ; และสำหรับอุปกรณ์ เก็บหมายเลขซีเรียล จากนั้นมุมมองที่บันทึกไว้จะแสดงรายการอย่าง “ต้องชำระเงิน” หรือ “การรับประกันหมดอายุเดือนนี้” ได้

สแกนเป็นชุดด้วยบาร์โค้ด

Paperless-ngx สามารถแบ่งการสแกนขนาดใหญ่ออกเป็นเอกสารหลายฉบับด้วยบาร์โค้ด คุณวางหน้าคั่นระหว่างเอกสาร หรือแนบรหัส ASN ไว้กับแผ่นแรกได้

ASN คือหมายเลขซีเรียลของเอกสารเก็บถาวร ซึ่งเชื่อมสำเนาดิจิทัลกับต้นฉบับกระดาษ วิธีนี้สะดวกเมื่อแปลงเอกสารกองใหญ่เป็นดิจิทัล

เวอร์ชันและ AI ที่เป็นตัวเลือก

ซีรีส์ Paperless-ngx 3.x เพิ่มเวอร์ชันเอกสาร ชุดลิงก์สำหรับการเข้าถึงร่วมกัน และฟีเจอร์ AI ในตัว เมื่อเชื่อมต่อโมเดลแล้ว บริการสามารถแนะนำเมทาดาทาและตอบคำถามเกี่ยวกับเอกสารได้

AI ไม่จำเป็นสำหรับฟีเจอร์หลัก: OCR การค้นหา กฎ แท็ก และการนำเข้าอีเมลทำงานได้โดยไม่ต้องใช้ AI เมื่อใช้ API AI ภายนอก ข้อความบางส่วนอาจออกจากเซิร์ฟเวอร์ ขณะที่โมเดลภายในเครื่องต้องใช้ทรัพยากรมากกว่า

Paperless-ngx เหมาะกับใคร

สำหรับคลังส่วนตัวหรือครอบครัว: สัญญา กรมธรรม์ ประวัติรายการ ใบรับประกัน ใบเสร็จ เอกสารที่อยู่อาศัย และคู่มืออุปกรณ์

สำหรับฟรีแลนซ์และธุรกิจขนาดเล็ก: ใบแจ้งหนี้ ใบรับรองการส่งมอบ สัญญา ค่าใช้จ่าย และการติดต่อกับคู่สัญญา การนำเข้าอีเมลช่วยลดงานด้วยตนเอง ส่วนสิทธิ์การเข้าถึงช่วยให้ผู้ใช้แชร์เอกสารได้

สำหรับกระบวนการงานธุรการ: ค้นหาเอกสารต้นทางได้รวดเร็ว เลือกตามผู้จัดจำหน่ายและช่วงเวลา และจัดการคิวไฟล์ที่ยังไม่ได้ประมวลผล

Paperless-ngx ไม่ได้มาแทนที่ซอฟต์แวร์บัญชี ลายเซ็นอิเล็กทรอนิกส์ หรือระบบ ECM ขององค์กร

Paperless-ngx ต้องการเซิร์ฟเวอร์แบบใด

ภาระงานขึ้นอยู่กับจำนวนหน้า คุณภาพการสแกน ความถี่ในการอัปโหลด และส่วนประกอบเพิ่มเติม คุณสามารถใช้จุดเริ่มต้นเชิงปฏิบัติเหล่านี้ได้:

สถานการณ์CPURAMดิสก์
คลังส่วนตัว2 vCPU2 GB30–50 GB NVMe ขึ้นไป
ครอบครัวหรือทีมขนาดเล็ก2–4 vCPU4 GB60–100 GB NVMe ขึ้นไป
งานชุดใหญ่ ไฟล์ Office และ AI ภายในเครื่อง4 vCPU ขึ้นไป8 GB ขึ้นไปขนาดคลังบวกพื้นที่สำรอง

บนเซิร์ฟเวอร์ที่ช้า อินเทอร์เฟซอาจทำงานเป็นปกติ แต่ OCR สำหรับเอกสารขนาดใหญ่จะใช้เวลานาน Tika และ Gotenberg สำหรับ Word, Excel และรูปแบบไฟล์สำนักงานอื่น ๆ ก็เพิ่มการใช้หน่วยความจำเช่นกัน

วางแผนความจุดิสก์โดยเผื่อพื้นที่ไว้: นอกจากต้นฉบับแล้ว ระบบอาจเก็บเวอร์ชันสำหรับเก็บถาวร ภาพขนาดย่อ ดัชนี ฐานข้อมูล และไฟล์ชั่วคราว การสำรองข้อมูลก็ต้องใช้พื้นที่แยกต่างหากเช่นกัน

ติดตั้ง Paperless-ngx บน VPS ด้วย Docker

วิธีที่รองรับและง่ายที่สุดคือ Docker Compose คุณต้องมีเซิร์ฟเวอร์ Linux, Docker Engine และปลั๊กอิน Compose

โครงการอย่างเป็นทางการมีตัวติดตั้งแบบโต้ตอบ:

bash -c "$(curl -L https://raw.githubusercontent.com/paperless-ngx/paperless-ngx/main/install-paperless-ngx.sh)"

ตัวติดตั้งจะถามไดเรกทอรี ฐานข้อมูล พอร์ต ภาษา OCR ส่วนประกอบเพิ่มเติม และบัญชีผู้ดูแล จากนั้นสร้างการตั้งค่า Compose และเริ่มคอนเทนเนอร์

บนเซิร์ฟเวอร์ production ควรดาวน์โหลดและตรวจสอบสคริปต์ก่อน:

curl -L https://raw.githubusercontent.com/paperless-ngx/paperless-ngx/main/install-paperless-ngx.sh \
  -o install-paperless-ngx.sh
less install-paperless-ngx.sh
bash install-paperless-ngx.sh

จากไดเรกทอรีติดตั้ง คุณตรวจสอบการเริ่มทำงานด้วยคำสั่งเหล่านี้ได้:

docker compose ps
docker compose logs -f webserver

สำหรับ OCR ภาษารัสเซียและอังกฤษ โดยทั่วไปให้ตั้งค่า rus+eng และติดตั้งข้อมูลภาษา rus eng เพิ่มเติมใน Docker

อย่าเปิดพอร์ตภายในของแอปพลิเคชันโดยตรง ใช้ reverse proxy เชื่อมต่อกับโดเมน เปิดใช้ HTTPS และปิดพอร์ตที่ไม่จำเป็น สำหรับคลังส่วนตัว การอนุญาตให้เข้าถึงผ่าน VPN เท่านั้นจะปลอดภัยยิ่งขึ้น

Paperless-ngx บน VPS ของ tropic.host

สำหรับคลังขนาดเล็ก VPS ที่มี 2 vCPU, RAM 2–4 GB และพื้นที่จัดเก็บ NVMe ก็เพียงพอ บน tropic.host คุณสามารถติดตั้ง Ubuntu, ลง Docker และให้ Paperless-ngx เข้าถึงได้จากคอมพิวเตอร์และโทรศัพท์โดยไม่ต้องมี NAS ที่บ้าน

VPS ทำงานตลอดเวลา จึงสามารถรวบรวมไฟล์แนบอีเมลได้เป็นประจำ อย่างไรก็ตาม เอกสารมักมีข้อมูลส่วนบุคคล: ใช้ HTTPS หรือ VPN, คีย์ SSH, ไฟร์วอลล์ที่จำกัดสิทธิ์ และข้อมูลสำรองอิสระ

ความปลอดภัยและข้อมูลสำรอง

Paperless-ngx ไม่มีการเข้ารหัสเอกสารแบบ end-to-end ในตัว ผู้ใช้ที่มีสิทธิ์เต็มบนเซิร์ฟเวอร์ volume Docker หรือข้อมูลสำรองอาจอ่านคลังเอกสารได้

มาตรการขั้นต่ำ:

  • โฮสต์บริการบนโครงสร้างพื้นฐานที่เชื่อถือได้เท่านั้น
  • อัปเดตระบบและคอนเทนเนอร์
  • จำกัดการเข้าถึง SSH ให้ใช้คีย์
  • เก็บสำเนาที่เข้ารหัสไว้นอกเซิร์ฟเวอร์หลัก
  • ทดสอบการกู้คืนเป็นระยะ

สำหรับการย้ายระบบและการสำรองข้อมูล มี document_exporter ในตัว:

docker compose exec webserver document_exporter ../export

คัดลอกไดเรกทอรี export ไปยังอุปกรณ์อื่นหรือพื้นที่จัดเก็บอิสระ สำเนาที่อยู่บน VPS เดียวกันจะไม่ป้องกันความเสียหายของดิสก์ การลบโดยไม่ตั้งใจ หรือการสูญเสียสิทธิ์เข้าถึง

Paperless-ngx คุ้มค่าที่จะติดตั้งหรือไม่?

Paperless-ngx มีประโยชน์เมื่อปัญหาไม่ได้อยู่ที่การเก็บไฟล์อีกต่อไป แต่อยู่ที่การค้นหา มันเปลี่ยนเอกสารสแกน ไฟล์แนบ และ PDF ที่มีชื่อไม่ชัดเจนให้เป็นคลังที่ค้นหาจากเนื้อหาและประมวลผลตามกฎที่สม่ำเสมอได้

ในการเริ่มต้น เพียงติดตั้งบริการ กำหนดค่าภาษา OCR และอัปโหลดไฟล์แรก จากนั้นจึงเพิ่มแท็ก การนำเข้าอีเมล เวิร์กโฟลว์ บาร์โค้ด และฟีเจอร์ AI เมื่อมีกระบวนการที่ชัดเจนและทำซ้ำเป็นประจำ

FAQ

ใช้ Paperless-ngx ฟรีได้หรือไม่?

ได้ โครงการนี้เป็นโอเพนซอร์ส ค่าใช้จ่ายมีเฉพาะฮาร์ดแวร์ VPS โดเมน หรือบริการภายนอก

Paperless-ngx รู้จำข้อความภาษารัสเซียได้หรือไม่?

ได้ OCR ใช้แพ็กเกจภาษา Tesseract rus สำหรับคลังหลายภาษา โดยทั่วไปจะตั้งค่า rus+eng

ไฟล์ต้นฉบับจะถูกลบหลังทำ OCR หรือไม่?

ไม่ ไฟล์ต้นฉบับจะถูกเก็บไว้ ขึ้นอยู่กับการตั้งค่า ระบบอาจสร้าง PDF สำหรับเก็บถาวรแยกไว้อีกไฟล์หนึ่ง

อัปโหลดเอกสารจากโทรศัพท์ได้หรือไม่?

ได้ คุณใช้เว็บอินเทอร์เฟซ API แอปมือถือที่เข้ากันได้ หรือส่งต่อเอกสารไปยังที่อยู่อีเมลที่เชื่อมต่อไว้ได้

ข้อมูลสำรองของ VPS เพียงพอหรือไม่?

snapshot ของ VPS มีประโยชน์ แต่ควรใช้ร่วมกับ exporter ในตัวและเก็บสำเนาแยกต่างหาก สิ่งสำคัญไม่ใช่แค่การสร้างคลังข้อมูล แต่ต้องทดสอบการกู้คืนบนการติดตั้งใหม่ที่สะอาดด้วย