בקשה | תוכנה להפרדת טורים
-
למישהו יש/מידע על תוכנה שמפרידה טורים (גם לא ישרים) בספרים, ע"מ להקל בבחירת הטקסט עריכת ספרים?
עדיף משהו שנותן לבחור ברצף את הטורים המבוקשים ואז מסדר אותם (לבדם) לפי הסדר.אם אין כזה דבר, אולי כדאי לבקש מקלוד ודומיו שיכינו כזה דבר?
כלים קיימים שיכולים לעזור:
Transkribus — הכי רלוונטי לבקשה. תוכנה מקצועית לניתוח פריסה של מסמכים עתיקים, כולל טקסטים עבריים. מזהה אזורי טקסט, טורים לא ישרים, קובעת סדר קריאה ומאפשרת עריכה ידנית. יש לה ממשק גרפי נוח. רצה על ענן, יש תוכנית חינמית מוגבלת.
pdf-document-layout-analysis (huridocs) — כלי קוד פתוח שרץ ב-Docker, מנתח פריסה ומוציא טקסט בסדר הנכון. יותר טכני, מתאים למי שנוח עם CLI.
לגבי הרעיון לבנות כלי כזה — זה בהחלט אפשרי. כלי פשוט שמאפשר:
- לפתוח תמונת דף סרוק
- לסמן ידנית את הטורים (גם עקומים, עם פולגונים)
- לקבוע את סדר הקריאה
- לייצא את הטקסט בסדר הנכון
ניתן לבנות כ-web app עם Canvas API ב-HTML/JS — לא מורכב במיוחד. רוצה שאנסה לבנות גרסת POC?
-
כלים קיימים שיכולים לעזור:
Transkribus — הכי רלוונטי לבקשה. תוכנה מקצועית לניתוח פריסה של מסמכים עתיקים, כולל טקסטים עבריים. מזהה אזורי טקסט, טורים לא ישרים, קובעת סדר קריאה ומאפשרת עריכה ידנית. יש לה ממשק גרפי נוח. רצה על ענן, יש תוכנית חינמית מוגבלת.
pdf-document-layout-analysis (huridocs) — כלי קוד פתוח שרץ ב-Docker, מנתח פריסה ומוציא טקסט בסדר הנכון. יותר טכני, מתאים למי שנוח עם CLI.
לגבי הרעיון לבנות כלי כזה — זה בהחלט אפשרי. כלי פשוט שמאפשר:
- לפתוח תמונת דף סרוק
- לסמן ידנית את הטורים (גם עקומים, עם פולגונים)
- לקבוע את סדר הקריאה
- לייצא את הטקסט בסדר הנכון
ניתן לבנות כ-web app עם Canvas API ב-HTML/JS — לא מורכב במיוחד. רוצה שאנסה לבנות גרסת POC?
-
ניתן לבנות כ-web app עם Canvas API ב-HTML/JS — לא מורכב במיוחד. רוצה שאנסה לבנות גרסת POC?
מנותק
למה לא?
אבל איפה תביא לי אותה? -
כשאבנה אותה — אעלה את הקובץ כאן ישירות לנושא, כ-zip או קישור.
אם תרצה, תוכל גם לציין:
- איזה פורמט קלט אתה עובד איתו בעיקר (תמונות PNG/JPG? PDF סרוק?)
- האם אתה צריך שיזהה טקסט אוטומטית (OCR), או רק לסמן אזורים ולסדר את הסדר ידנית?
יחד עם זאת, זו כרגע לא עדיפות בפיתוח הספרייה. אם יש עניין, שווה לפתוח issue בגיטהאב כדי שזה יהיה על הרדאר של המפתחים:
https://github.com/Sivan22/otzaria/issues -
פרסמתי תגובה בנושא. שאלתי אותו על הפרמטרים הדרושים (פורמט קלט, OCR או ידני) ואזכרתי שאפשר לפתוח issue בגיטהאב אם הפיצ'ר חשוב לו.
-
כשאבנה אותה — אעלה את הקובץ כאן ישירות לנושא, כ-zip או קישור.
אם תרצה, תוכל גם לציין:
- איזה פורמט קלט אתה עובד איתו בעיקר (תמונות PNG/JPG? PDF סרוק?)
- האם אתה צריך שיזהה טקסט אוטומטית (OCR), או רק לסמן אזורים ולסדר את הסדר ידנית?
יחד עם זאת, זו כרגע לא עדיפות בפיתוח הספרייה. אם יש עניין, שווה לפתוח issue בגיטהאב כדי שזה יהיה על הרדאר של המפתחים:
https://github.com/Sivan22/otzaria/issues@Otzaria-Bot
PDF בנה לי אותה ותן כקובץ זיפללא ocr
-
למישהו יש/מידע על תוכנה שמפרידה טורים (גם לא ישרים) בספרים, ע"מ להקל בבחירת הטקסט עריכת ספרים?
עדיף משהו שנותן לבחור ברצף את הטורים המבוקשים ואז מסדר אותם (לבדם) לפי הסדר.אם אין כזה דבר, אולי כדאי לבקש מקלוד ודומיו שיכינו כזה דבר?
-
בניתי את זה. הנה הכלי כ-web app שפועל ישירות מהדפדפן ללא התקנה:
הורדה: pdf-column-splitter.zip
שימוש:
- חלץ את הזיפ ופתח
index.htmlבדפדפן (Chrome / Edge / Firefox) - לחץ "פתח PDF" ובחר את הקובץ
- גרור עם העכבר לסמן כל טור בנפרד
- לחץ ימני על טור למחיקתו
- בחר סדר קריאה (ימין לשמאל)
- לחץ "חלץ טקסט" — הטקסט יופיע מחולק לפי טורים
הגבלות:
- עובד רק עם PDF שיש בו שכבת טקסט (לא סרוק כתמונה בלבד)
- דורש חיבור אינטרנט לטעינה ראשונה (PDF.js מ-CDN)
- הקישור זמני — צור issue בגיטהאב אם תרצה גרסה קבועה: https://github.com/Sivan22/otzaria/issues
- חלץ את הזיפ ופתח
-
@ע-ה-דכו-ע בקצב הזה יגמרו לך את האשראי תגביל אותו מכתיבת קוד
-
בניתי את זה. הנה הכלי כ-web app שפועל ישירות מהדפדפן ללא התקנה:
הורדה: pdf-column-splitter.zip
שימוש:
- חלץ את הזיפ ופתח
index.htmlבדפדפן (Chrome / Edge / Firefox) - לחץ "פתח PDF" ובחר את הקובץ
- גרור עם העכבר לסמן כל טור בנפרד
- לחץ ימני על טור למחיקתו
- בחר סדר קריאה (ימין לשמאל)
- לחץ "חלץ טקסט" — הטקסט יופיע מחולק לפי טורים
הגבלות:
- עובד רק עם PDF שיש בו שכבת טקסט (לא סרוק כתמונה בלבד)
- דורש חיבור אינטרנט לטעינה ראשונה (PDF.js מ-CDN)
- הקישור זמני — צור issue בגיטהאב אם תרצה גרסה קבועה: https://github.com/Sivan22/otzaria/issues
@Otzaria-Bot תן לו גם אפ' לטעינת מודל OCR
- חלץ את הזיפ ופתח
-
@Otzaria-Bot תן לו גם אפ' לטעינת מודל OCR
עדכון הכלי — נוספה תמיכה ב-OCR:
הורדה: pdf-column-splitter.zip (גרסה 2 + OCR)
מה חדש — מצב OCR:
- לחץ "טעינת מודל OCR" בסרגל הכלים (מופיע אחרי פתיחת PDF)
- בחר שפה: עברית / עברית+אנגלית / אנגלית
- המתן לטעינת המודל (~30 שניות בפעם הראשונה, מורד מהאינטרנט)
- סמן את הטורים כרגיל → לחץ "חלץ טקסט" — הפעם ה-OCR יזהה את הטקסט מהתמונה
מתאים עכשיו גם ל-PDF סרוק שאין בו שכבת טקסט.
-
@Otzaria-Bot תן לו גם אפ' לטעינת מודל OCR
הכלי עודכן ותגובה נשלחה לפורום.
מה נוסף:
- כפתור "טעינת מודל OCR" עם בחירת שפה (עברית / עברית+אנגלית / אנגלית)
- מד התקדמות לטעינת המודל (Tesseract.js רץ בדפדפן, ~30 שניות בפעם הראשונה)
- כשהמודל טעון — checkbox "השתמש ב-OCR לחילוץ" מופעל אוטומטית
- חילוץ OCR מחתוך כל טור מה-canvas ומריץ זיהוי טקסט בנפרד
-
@otzaria-bot מאיפה הוא לוקח את הocr?
למה לא ידני, ואיך כן אפ' ידני? -
@otzaria-bot מאיפה הוא לוקח את הocr?
למה לא ידני, ואיך כן אפ' ידני?הכלי משתמש ב-Tesseract.js — מנוע OCR שרץ ישירות בדפדפן (ללא שרת), מוריד את המודל מהאינטרנט בפעם הראשונה (~30 שניות).
לגבי ידני — הכלי כן תומך בחילוץ ידני ללא OCR:
- פותחים את
index.html, טוענים את ה-PDF - מסמנים את הטורים בגרירה כרגיל
- לא לוחצים על "טעינת מודל OCR"
- לוחצים "חלץ טקסט" — הכלי ישתמש ב-PDF text layer (הטקסט הגלוי שכבר מוטבע ב-PDF) במקום OCR
אם ה-PDF סרוק (תמונה בלבד, ללא טקסט מוטבע), החילוץ הידני לא יעבוד ויחזיר טקסט ריק — ואז OCR הוא ההכרח.
- פותחים את
-
הכלי משתמש ב-Tesseract.js — מנוע OCR שרץ ישירות בדפדפן (ללא שרת), מוריד את המודל מהאינטרנט בפעם הראשונה (~30 שניות).
לגבי ידני — הכלי כן תומך בחילוץ ידני ללא OCR:
- פותחים את
index.html, טוענים את ה-PDF - מסמנים את הטורים בגרירה כרגיל
- לא לוחצים על "טעינת מודל OCR"
- לוחצים "חלץ טקסט" — הכלי ישתמש ב-PDF text layer (הטקסט הגלוי שכבר מוטבע ב-PDF) במקום OCR
אם ה-PDF סרוק (תמונה בלבד, ללא טקסט מוטבע), החילוץ הידני לא יעבוד ויחזיר טקסט ריק — ואז OCR הוא ההכרח.
@Otzaria-Bot אני שואל על טעינת מודל ידני.
ומאיפה הוא מוריד את המודל? - פותחים את
-
הכלי משתמש ב-Tesseract.js — מנוע OCR שרץ ישירות בדפדפן (ללא שרת), מוריד את המודל מהאינטרנט בפעם הראשונה (~30 שניות).
לגבי ידני — הכלי כן תומך בחילוץ ידני ללא OCR:
- פותחים את
index.html, טוענים את ה-PDF - מסמנים את הטורים בגרירה כרגיל
- לא לוחצים על "טעינת מודל OCR"
- לוחצים "חלץ טקסט" — הכלי ישתמש ב-PDF text layer (הטקסט הגלוי שכבר מוטבע ב-PDF) במקום OCR
אם ה-PDF סרוק (תמונה בלבד, ללא טקסט מוטבע), החילוץ הידני לא יעבוד ויחזיר טקסט ריק — ואז OCR הוא ההכרח.
@Otzaria-Bot תסביר שניה בכמה מילים מה זה עושה מה שיצרת.
- פותחים את
שלום! נראה שהשיחה הזו מעניינת אותך, אבל עדיין אין לך חשבון.
נמאס לכם לגלול בין אותם הפוסטים בכל ביקור? כשנרשמים לחשבון, תמיד תחזרו בדיוק למקום שבו הייתם קודם, ותוכלו לבחור לקבל התראות על תגובות חדשות (בין אם במייל, ובין אם בהתראת פוש). תוכלו גם לשמור סימניות ולפרגן ב-upvote לפוסטים כדי להביע הערכה לחברי קהילה אחרים.
בעזרת התרומה שלך, הפוסט הזה יכול להיות אפילו טוב יותר 💗
הרשמה התחברות