Language: he
Paperless-ngx: איך ליצור ארכיון מסמכים אישי שניתן לחפש בו
אתם זוכרים שחוזה כלל סכום חשוב, אבל שם הקובץ הוא scan_2024_03_17.pdf והוא נמצא בין מאות קבצים דומים. מנהל קבצים רגיל מחפש בשם הקובץ, בזמן שהמילים הדרושות נמצאות בתוך הסריקה.
Paperless-ngx פותר את הבעיה הזו. אתם מעלים PDF, תמונה של קבלה או קובץ מצורף לאימייל, והשירות מזהה את הטקסט, מוסיף אותו לאינדקס והופך קבצים מפוזרים לארכיון אחד. לאחר מכן אפשר למצוא מסמך לפי שם משפחה, כתובת, מספר חשבון או כל ביטוי שמופיע בעמוד.
מהו Paperless-ngx
Paperless-ngx הוא מערכת חינמית לניהול מסמכים בקוד פתוח. הוא פועל בשרת שלכם, מקבל קבצים ממקורות שונים, מבצע OCR ומאפשר לחפש בתוך התוכן שלהם.
במקום מבנה תיקיות קשיח, הוא משתמש באנשי קשר, סוגי מסמכים, תגיות, תאריכים, שדות מותאמים אישית וכללי אחסון. כך אפשר להציג בתוך שניות חשבונות חשמל מ-2026, מסמכים לדירה מסוימת או אחריות שעומדת לפוג.
למה Paperless-ngx עדיף על תיקיות רגילות
תיקיות מתאימות כשיש מעט מסמכים ועדיין זוכרים את שיטת השמות. אחרי כמה שנים מופיעות תיקיות כמו Documents, Scans, New ו-To sort, ומציאת הקובץ הנכון נעשית קשה.
| תיקייה רגילה | Paperless-ngx |
|---|---|
| חיפוש לפי שם הקובץ | חיפוש בטקסט שבתוך המסמך |
| קובץ אחד, תיקייה אחת | תגיות ותכונות רבות |
| מתן שמות ומיון ידניים | הקצאת מטא-נתונים אוטומטית |
| יש לשמור קבצים מצורפים ידנית | ייבוא מאימייל |
| סריקה נשארת תמונה | OCR הופך את הטקסט לחיפושável |
במקום לנסות לזכור תיקייה, מספיק לזכור מילה אחת מתוך המסמך.
איך Paperless-ngx מעבד קובץ
לאחר העלאה, השירות:
- שומר את הקובץ המקורי;
- מחלץ טקסט קיים או מתחיל OCR;
- יוצר גרסת PDF ארכיונית ותמונות ממוזערות לפי הצורך;
- מוסיף את התוכן לאינדקס חיפוש מלא;
- מפעיל כללים ומציע איש קשר, סוג, תגיות ונתיב אחסון.
אפשר להתחיל בהעלאה ובחיפוש ולהוסיף אוטומציה בהמשך.
היכולות השימושיות ביותר של Paperless-ngx
חיפוש בתוך סריקות
לאחר OCR אפשר למצוא חוזה לפי כתובת, חשבונית לפי מספר לקוח וקבלה לפי דגם המכשיר. לדוגמה, חיפוש של «early termination» יציג מסמכים שמכילים את הביטוי גם כשה-PDF המקורי כלל תמונות בלבד.
האיכות תלויה בסריקה: עמוד ישר עם ניגודיות גבוהה מזוהה טוב יותר מתמונה כהה שצולמה בזווית. בארכיון רוסי-אנגלי חשוב להתקין את שתי שפות ה-OCR.
מיון אוטומטי
Paperless-ngx יכול להתאים מסמכים חדשים לאלה שכבר ארגנתם. אתם מתייגים ידנית כמה חשבוניות מספק אחד, והשירות לומד להציע את אותו איש קשר, סוג ותגיות לקבצים הבאים.
לוגיקה מדויקת יותר אפשר ליצור באמצעות כללים המבוססים על טקסט, שם קובץ, מקור או תיקיית העלאה.
ייבוא מאימייל
השירות יכול לבדוק תיבת דואר באמצעות IMAP ולעבד הודעות לפי כללים. לדוגמה, הוא יכול לקבל רק קבצי PDF מצורפים מספק, לשלוח אותם לארכיון ואז לסמן את האימייל כנקרא או להעביר אותו לתיקייה אחרת.
חשבוניות מפסיקות להצטבר בתיבת הדואר הנכנס והופכות לחיפושables לצד הסריקות.
תהליכי עבודה, שדות ותצוגות שמורות
תהליכי עבודה מבצעים פעולות כשמסמך מועלה, נוסף, משתנה או לפי לוח זמנים. הם יכולים להקצות בעלים, להוסיף תגית, לבחור סוג ולהגדיר נתיב אחסון.
שדות מותאמים אישית הופכים את הארכיון למסד נתונים קטן. בחוזה אפשר לשמור תאריך תפוגה; בחשבונית סכום ומועד תשלום; ולציוד מספר סידורי. תצוגות שמורות יכולות להציג, למשל, «נדרש תשלום» או «האחריות פגה החודש».
סריקה באצווה עם ברקודים
Paperless-ngx יכול לפצל סריקה גדולה למסמכים אחדים באמצעות ברקודים. אפשר להציב דפי הפרדה בין הניירות או להדביק קוד ASN על הגיליון הראשון.
ASN הוא מספר סידורי ארכיוני המקשר עותק דיגיטלי למקור הנייר. הדבר נוח בעת דיגיטציה של ערימות גדולות.
גרסאות ו-AI אופציונלי
סדרת Paperless-ngx 3.x הוסיפה גרסאות מסמכים, קבוצות קישורים לגישה משותפת ויכולות AI מובנות. כשמחברים מודל, השירות יכול להציע מטא-נתונים ולענות על שאלות בנוגע למסמכים.
AI אינו נדרש ליכולות הליבה: OCR, חיפוש, כללים, תגיות וייבוא מאימייל פועלים גם בלעדיו. בשימוש ב-API חיצוני של AI, חלק מהטקסט עשוי לעזוב את השרת, בעוד שמודל מקומי דורש יותר משאבים.
למי Paperless-ngx מתאים
לארכיון אישי או משפחתי: חוזים, פוליסות ביטוח, דפי חשבון, אחריות, קבלות, מסמכי דיור ומדריכי ציוד.
לעצמאים ולעסקים קטנים: חשבוניות, אישורי מסירה, חוזים, הוצאות והתכתבויות עם צדדים נגדיים. ייבוא מאימייל מפחית עבודה ידנית, והרשאות גישה מאפשרות לשתף מסמכים.
לתהליכים מנהליים: חיפוש מהיר במסמכי מקור, בחירה לפי ספק ותקופה ותור של קבצים שלא עובדו.
Paperless-ngx אינו מחליף תוכנת הנהלת חשבונות, חתימה אלקטרונית או מערכת ECM ארגונית.
איזה שרת Paperless-ngx צריך
העומס תלוי במספר העמודים, באיכות הסריקה, בתדירות ההעלאה וברכיבים נוספים. אפשר להשתמש בנקודות הפתיחה המעשיות הבאות:
| תרחיש | CPU | RAM | דיסק |
|---|---|---|---|
| ארכיון אישי | 2 vCPU | 2 GB | 30–50 GB NVMe או יותר |
| משפחה או צוות קטן | 2–4 vCPU | 4 GB | 60–100 GB NVMe או יותר |
| אצוות גדולות, קובצי Office, AI מקומי | 4 vCPU או יותר | 8 GB או יותר | גודל הארכיון בתוספת קיבולת פנויה |
בשרת חלש הממשק עשוי לעבוד כרגיל, אבל OCR של מסמכים גדולים יהיה איטי. Tika ו-Gotenberg עבור Word, Excel ופורמטים אחרים של Office גם מגבירים את צריכת הזיכרון.
תכננו את נפח הדיסק עם מרווח: מלבד המקור, המערכת עשויה לשמור גרסאות ארכיוניות, תמונות ממוזערות, אינדקס, מסד נתונים וקבצים זמניים. גם לגיבויים דרוש מקום נפרד.
התקנת Paperless-ngx ב-VPS עם Docker
השיטה הנתמכת והפשוטה ביותר היא Docker Compose. דרושים שרת Linux, Docker Engine ותוסף Compose.
הפרויקט הרשמי מספק מתקין אינטראקטיבי:
bash -c "$(curl -L https://raw.githubusercontent.com/paperless-ngx/paperless-ngx/main/install-paperless-ngx.sh)"הוא שואל על התיקייה, מסד הנתונים, הפורט, שפת ה-OCR, רכיבים נוספים וחשבון המנהל, ואז יוצר תצורת Compose ומפעיל את הקונטיינרים.
בשרת ייצור בטוח יותר להוריד את הסקריפט ולבדוק אותו קודם:
curl -L https://raw.githubusercontent.com/paperless-ngx/paperless-ngx/main/install-paperless-ngx.sh \
-o install-paperless-ngx.sh
less install-paperless-ngx.sh
bash install-paperless-ngx.shמתיקיית ההתקנה אפשר לבדוק את ההפעלה באמצעות הפקודות האלה:
docker compose ps
docker compose logs -f webserverעבור OCR ברוסית ובאנגלית מגדירים בדרך כלל rus+eng ומתקינים את נתוני השפות הנוספות rus eng בתוך Docker.
אל תחשפו ישירות את הפורט הפנימי של האפליקציה. חברו דומיין דרך reverse proxy, הפעילו HTTPS וסגרו פורטים מיותרים. בארכיון אישי בטוח עוד יותר לאפשר גישה רק דרך VPN.
Paperless-ngx ב-VPS של tropic.host
לארכיון קטן מתאים VPS עם 2 vCPU, זיכרון RAM בנפח 2–4 GB ואחסון NVMe. ב-tropic.host תוכלו לפרוס Ubuntu, להתקין Docker ולשמור על Paperless-ngx נגיש ממחשב ומטלפון ללא NAS ביתי.
VPS פועל מסביב לשעון, ולכן השירות יכול לאסוף בקביעות קבצים מצורפים לאימייל. עם זאת, מסמכים כוללים לעיתים קרובות מידע אישי: השתמשו ב-HTTPS או VPN, במפתחות SSH, בחומת אש מגבילה ובגיבויים עצמאיים.
אבטחה וגיבויים
Paperless-ngx אינו מספק הצפנה מובנית מקצה לקצה למסמכים. משתמש עם גישה מלאה לשרת, ל-volume של Docker או לגיבוי עלול לקרוא את הארכיון.
אמצעים בסיסיים:
- אירחו את השירות רק בתשתית מהימנה;
- עדכנו את המערכת ואת הקונטיינרים;
- הגבילו גישת SSH למפתחות;
- שמרו עותקים מוצפנים מחוץ לשרת הראשי;
- בדקו את השחזור מעת לעת.
להעברה ולגיבויים יש document_exporter מובנה:
docker compose exec webserver document_exporter ../exportהעתיקו את תיקיית הייצוא למכשיר אחר או לאחסון עצמאי. עותק באותו VPS לא יגן מפני נזק לדיסק, מחיקה בשוגג או אובדן גישה.
האם כדאי להתקין Paperless-ngx?
Paperless-ngx שימושי כשהבעיה כבר אינה שמירת קבצים אלא מציאתם. הוא הופך סריקות, קבצים מצורפים ו-PDF בעלי שמות לא ברורים לארכיון שבו אפשר למצוא מסמכים לפי התוכן ולעבד אותם לפי כללים עקביים.
כדי להתחיל מספיק להתקין את השירות, להגדיר שפות OCR ולהעלות את הקבצים הראשונים. כדאי להוסיף תגיות, ייבוא מאימייל, תהליכי עבודה, ברקודים ויכולות AI כשיש לכם תהליך ברור וחוזר על עצמו.
שאלות נפוצות
האם אפשר להשתמש ב-Paperless-ngx בחינם?
כן. זהו פרויקט בקוד פתוח. העלויות היחידות הן עבור חומרה, VPS, דומיין או שירותים חיצוניים.
האם Paperless-ngx מזהה טקסט רוסי?
כן. ה-OCR משתמש בחבילת השפה rus של Tesseract. בארכיון מעורב בדרך כלל מגדירים rus+eng.
האם הקובץ המקורי נמחק אחרי OCR?
לא. הקובץ המקורי נשמר. בהתאם להגדרות, לידו עשויה להיווצר גרסת PDF ארכיונית נפרדת.
האם אפשר להעלות מסמכים מטלפון?
כן. אפשר להשתמש בממשק האינטרנט, ב-API, באפליקציה סלולרית תואמת או להעביר את המסמך לכתובת אימייל מחוברת.
האם גיבוי של VPS מספיק?
Snapshot של VPS שימושי, אך עדיף לשלב אותו עם ה-exporter המובנה ולשמור עותק נפרד. חשוב לא רק ליצור ארכיון, אלא גם לבדוק שחזור בהתקנה נקייה.
