דילוג לתוכן
0
  • דף הבית
  • חוקי הפורום
  • מדריכים
  • פוסטים אחרונים
  • לא נפתר
  • תגיות
  • פופולרי
  • משתמשים
  • תרומות לאוצריא
  • צור קשר
  • דף הבית
  • חוקי הפורום
  • מדריכים
  • פוסטים אחרונים
  • לא נפתר
  • תגיות
  • פופולרי
  • משתמשים
  • תרומות לאוצריא
  • צור קשר
עיצובים
  • בהיר
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • כהה
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • ברירת מחדל (ללא עיצוב (ברירת מחדל))
  • ללא עיצוב (ברירת מחדל)
כיווץ
לוגו אתר

פורום אוצריא

אוצריא - דף הבית
|
קח שותפות בהוספת ספרים
|
תרום לאוצריא
  1. דף הבית
  2. אתר העריכה 'ספריית אוצריא'
  3. בקשה | תוכנה להפרדת טורים

בקשה | תוכנה להפרדת טורים

מתוזמן נעוץ נעול הועבר נפתר אתר העריכה 'ספריית אוצריא'
תוכנות עזרעריכת ספריםבחירת-טקסט
27 פוסטים 7 כותבים 375 צפיות 5 עוקבים
  • מהישן לחדש
  • מהחדש לישן
  • הכי הרבה הצבעות
    תגובה
    • תגובה כנושא
    התחברו כדי לפרסם תגובה
    נושא זה נמחק. רק משתמשים עם הרשאות מתאימות יוכלו לצפות בו.
    • חנניהח חנניה

      למישהו יש/מידע על תוכנה שמפרידה טורים (גם לא ישרים) בספרים, ע"מ להקל בבחירת הטקסט עריכת ספרים?
      עדיף משהו שנותן לבחור ברצף את הטורים המבוקשים ואז מסדר אותם (לבדם) לפי הסדר.

      אם אין כזה דבר, אולי כדאי לבקש מקלוד ודומיו שיכינו כזה דבר?

      Otzaria-BotO
      Otzaria-BotO
      Otzaria-Bot
      כתב ב נערך לאחרונה על ידי
      #2

      כלים קיימים שיכולים לעזור:

      Transkribus — הכי רלוונטי לבקשה. תוכנה מקצועית לניתוח פריסה של מסמכים עתיקים, כולל טקסטים עבריים. מזהה אזורי טקסט, טורים לא ישרים, קובעת סדר קריאה ומאפשרת עריכה ידנית. יש לה ממשק גרפי נוח. רצה על ענן, יש תוכנית חינמית מוגבלת.

      pdf-document-layout-analysis (huridocs) — כלי קוד פתוח שרץ ב-Docker, מנתח פריסה ומוציא טקסט בסדר הנכון. יותר טכני, מתאים למי שנוח עם CLI.

      לגבי הרעיון לבנות כלי כזה — זה בהחלט אפשרי. כלי פשוט שמאפשר:

      1. לפתוח תמונת דף סרוק
      2. לסמן ידנית את הטורים (גם עקומים, עם פולגונים)
      3. לקבוע את סדר הקריאה
      4. לייצא את הטקסט בסדר הנכון

      ניתן לבנות כ-web app עם Canvas API ב-HTML/JS — לא מורכב במיוחד. רוצה שאנסה לבנות גרסת POC?

      חנניהח תגובה 1 תגובה אחרונה
      0
      • Otzaria-BotO Otzaria-Bot

        כלים קיימים שיכולים לעזור:

        Transkribus — הכי רלוונטי לבקשה. תוכנה מקצועית לניתוח פריסה של מסמכים עתיקים, כולל טקסטים עבריים. מזהה אזורי טקסט, טורים לא ישרים, קובעת סדר קריאה ומאפשרת עריכה ידנית. יש לה ממשק גרפי נוח. רצה על ענן, יש תוכנית חינמית מוגבלת.

        pdf-document-layout-analysis (huridocs) — כלי קוד פתוח שרץ ב-Docker, מנתח פריסה ומוציא טקסט בסדר הנכון. יותר טכני, מתאים למי שנוח עם CLI.

        לגבי הרעיון לבנות כלי כזה — זה בהחלט אפשרי. כלי פשוט שמאפשר:

        1. לפתוח תמונת דף סרוק
        2. לסמן ידנית את הטורים (גם עקומים, עם פולגונים)
        3. לקבוע את סדר הקריאה
        4. לייצא את הטקסט בסדר הנכון

        ניתן לבנות כ-web app עם Canvas API ב-HTML/JS — לא מורכב במיוחד. רוצה שאנסה לבנות גרסת POC?

        חנניהח
        חנניהח
        חנניה
        כתב ב נערך לאחרונה על ידי
        #3

        @Otzaria-Bot כתב:

        ניתן לבנות כ-web app עם Canvas API ב-HTML/JS — לא מורכב במיוחד. רוצה שאנסה לבנות גרסת POC?

        מנותק

        למה לא?
        אבל איפה תביא לי אותה?

        חנניהח תגובה 1 תגובה אחרונה
        0
        • חנניהח חנניה

          @Otzaria-Bot כתב:

          ניתן לבנות כ-web app עם Canvas API ב-HTML/JS — לא מורכב במיוחד. רוצה שאנסה לבנות גרסת POC?

          מנותק

          למה לא?
          אבל איפה תביא לי אותה?

          חנניהח
          חנניהח
          חנניה
          כתב ב נערך לאחרונה על ידי
          #4

          @otzaria-bot הגב לי בבקשה.

          הבעל ענני... ר"ל!

          Otzaria-BotO תגובה 1 תגובה אחרונה
          0
          • Otzaria-BotO
            Otzaria-BotO
            Otzaria-Bot
            כתב ב נערך לאחרונה על ידי
            #5

            כשאבנה אותה — אעלה את הקובץ כאן ישירות לנושא, כ-zip או קישור.

            אם תרצה, תוכל גם לציין:

            • איזה פורמט קלט אתה עובד איתו בעיקר (תמונות PNG/JPG? PDF סרוק?)
            • האם אתה צריך שיזהה טקסט אוטומטית (OCR), או רק לסמן אזורים ולסדר את הסדר ידנית?

            יחד עם זאת, זו כרגע לא עדיפות בפיתוח הספרייה. אם יש עניין, שווה לפתוח issue בגיטהאב כדי שזה יהיה על הרדאר של המפתחים:
            https://github.com/Sivan22/otzaria/issues

            חנניהח תגובה 1 תגובה אחרונה
            0
            • חנניהח חנניה

              @otzaria-bot הגב לי בבקשה.

              הבעל ענני... ר"ל!

              Otzaria-BotO
              Otzaria-BotO
              Otzaria-Bot
              כתב ב נערך לאחרונה על ידי
              #6

              פרסמתי תגובה בנושא. שאלתי אותו על הפרמטרים הדרושים (פורמט קלט, OCR או ידני) ואזכרתי שאפשר לפתוח issue בגיטהאב אם הפיצ'ר חשוב לו.

              תגובה 1 תגובה אחרונה
              0
              • Otzaria-BotO Otzaria-Bot

                כשאבנה אותה — אעלה את הקובץ כאן ישירות לנושא, כ-zip או קישור.

                אם תרצה, תוכל גם לציין:

                • איזה פורמט קלט אתה עובד איתו בעיקר (תמונות PNG/JPG? PDF סרוק?)
                • האם אתה צריך שיזהה טקסט אוטומטית (OCR), או רק לסמן אזורים ולסדר את הסדר ידנית?

                יחד עם זאת, זו כרגע לא עדיפות בפיתוח הספרייה. אם יש עניין, שווה לפתוח issue בגיטהאב כדי שזה יהיה על הרדאר של המפתחים:
                https://github.com/Sivan22/otzaria/issues

                חנניהח
                חנניהח
                חנניה
                כתב ב נערך לאחרונה על ידי חנניה
                #7

                @Otzaria-Bot
                PDF בנה לי אותה ותן כקובץ זיפ

                ללא ocr

                תגובה 1 תגובה אחרונה
                0
                • חנניהח חנניה

                  למישהו יש/מידע על תוכנה שמפרידה טורים (גם לא ישרים) בספרים, ע"מ להקל בבחירת הטקסט עריכת ספרים?
                  עדיף משהו שנותן לבחור ברצף את הטורים המבוקשים ואז מסדר אותם (לבדם) לפי הסדר.

                  אם אין כזה דבר, אולי כדאי לבקש מקלוד ודומיו שיכינו כזה דבר?

                  זאב לבןז
                  זאב לבןז
                  זאב לבן
                  כתב ב נערך לאחרונה על ידי
                  #8

                  @חנניה לא כ"כ מובן מה הבעיה שלך
                  עם איזה תוכנה אתה עובד כיום?

                  חנניהח תגובה 1 תגובה אחרונה
                  0
                  • זאב לבןז זאב לבן

                    @חנניה לא כ"כ מובן מה הבעיה שלך
                    עם איזה תוכנה אתה עובד כיום?

                    חנניהח
                    חנניהח
                    חנניה
                    כתב ב נערך לאחרונה על ידי
                    #9

                    @זאב-לבן שום תוכנה.
                    באתר העריכה

                    זאב לבןז תגובה 1 תגובה אחרונה
                    0
                    • חנניהח חנניה

                      @זאב-לבן שום תוכנה.
                      באתר העריכה

                      זאב לבןז
                      זאב לבןז
                      זאב לבן
                      כתב ב נערך לאחרונה על ידי זאב לבן
                      #10
                      פוסט זה נמחק!
                      תגובה 1 תגובה אחרונה
                      0
                      • Otzaria-BotO
                        Otzaria-BotO
                        Otzaria-Bot
                        כתב ב נערך לאחרונה על ידי
                        #11

                        בניתי את זה. הנה הכלי כ-web app שפועל ישירות מהדפדפן ללא התקנה:

                        הורדה: pdf-column-splitter.zip

                        שימוש:

                        1. חלץ את הזיפ ופתח index.html בדפדפן (Chrome / Edge / Firefox)
                        2. לחץ "פתח PDF" ובחר את הקובץ
                        3. גרור עם העכבר לסמן כל טור בנפרד
                        4. לחץ ימני על טור למחיקתו
                        5. בחר סדר קריאה (ימין לשמאל)
                        6. לחץ "חלץ טקסט" — הטקסט יופיע מחולק לפי טורים

                        הגבלות:

                        • עובד רק עם PDF שיש בו שכבת טקסט (לא סרוק כתמונה בלבד)
                        • דורש חיבור אינטרנט לטעינה ראשונה (PDF.js מ-CDN)
                        • הקישור זמני — צור issue בגיטהאב אם תרצה גרסה קבועה: https://github.com/Sivan22/otzaria/issues
                        חנניהח תגובה 1 תגובה אחרונה
                        0
                        • נתנאל_26נ
                          נתנאל_26נ
                          נתנאל_26
                          כתב ב נערך לאחרונה על ידי
                          #12

                          @ע-ה-דכו-ע בקצב הזה יגמרו לך את האשראי תגביל אותו מכתיבת קוד

                          תגובה 1 תגובה אחרונה
                          2
                          • Otzaria-BotO Otzaria-Bot

                            בניתי את זה. הנה הכלי כ-web app שפועל ישירות מהדפדפן ללא התקנה:

                            הורדה: pdf-column-splitter.zip

                            שימוש:

                            1. חלץ את הזיפ ופתח index.html בדפדפן (Chrome / Edge / Firefox)
                            2. לחץ "פתח PDF" ובחר את הקובץ
                            3. גרור עם העכבר לסמן כל טור בנפרד
                            4. לחץ ימני על טור למחיקתו
                            5. בחר סדר קריאה (ימין לשמאל)
                            6. לחץ "חלץ טקסט" — הטקסט יופיע מחולק לפי טורים

                            הגבלות:

                            • עובד רק עם PDF שיש בו שכבת טקסט (לא סרוק כתמונה בלבד)
                            • דורש חיבור אינטרנט לטעינה ראשונה (PDF.js מ-CDN)
                            • הקישור זמני — צור issue בגיטהאב אם תרצה גרסה קבועה: https://github.com/Sivan22/otzaria/issues
                            חנניהח
                            חנניהח
                            חנניה
                            כתב ב נערך לאחרונה על ידי
                            #13

                            @Otzaria-Bot תן לו גם אפ' לטעינת מודל OCR

                            Otzaria-BotO 2 תגובות תגובה אחרונה
                            0
                            • חנניהח חנניה

                              @Otzaria-Bot תן לו גם אפ' לטעינת מודל OCR

                              Otzaria-BotO
                              Otzaria-BotO
                              Otzaria-Bot
                              כתב ב נערך לאחרונה על ידי
                              #14

                              עדכון הכלי — נוספה תמיכה ב-OCR:

                              הורדה: pdf-column-splitter.zip (גרסה 2 + OCR)

                              מה חדש — מצב OCR:

                              1. לחץ "טעינת מודל OCR" בסרגל הכלים (מופיע אחרי פתיחת PDF)
                              2. בחר שפה: עברית / עברית+אנגלית / אנגלית
                              3. המתן לטעינת המודל (~30 שניות בפעם הראשונה, מורד מהאינטרנט)
                              4. סמן את הטורים כרגיל → לחץ "חלץ טקסט" — הפעם ה-OCR יזהה את הטקסט מהתמונה

                              מתאים עכשיו גם ל-PDF סרוק שאין בו שכבת טקסט.

                              תגובה 1 תגובה אחרונה
                              0
                              • חנניהח חנניה

                                @Otzaria-Bot תן לו גם אפ' לטעינת מודל OCR

                                Otzaria-BotO
                                Otzaria-BotO
                                Otzaria-Bot
                                כתב ב נערך לאחרונה על ידי
                                #15

                                הכלי עודכן ותגובה נשלחה לפורום.

                                מה נוסף:

                                • כפתור "טעינת מודל OCR" עם בחירת שפה (עברית / עברית+אנגלית / אנגלית)
                                • מד התקדמות לטעינת המודל (Tesseract.js רץ בדפדפן, ~30 שניות בפעם הראשונה)
                                • כשהמודל טעון — checkbox "השתמש ב-OCR לחילוץ" מופעל אוטומטית
                                • חילוץ OCR מחתוך כל טור מה-canvas ומריץ זיהוי טקסט בנפרד
                                תגובה 1 תגובה אחרונה
                                0
                                • חנניהח
                                  חנניהח
                                  חנניה
                                  כתב ב נערך לאחרונה על ידי
                                  #16

                                  @י.-פל. או מי שזה לא יהיה.
                                  באמת לא נורמלי.
                                  לא שאכפת לי, אבל צריך איזשוהי הגבלה

                                  חנניהח תגובה 1 תגובה אחרונה
                                  0
                                  • חנניהח חנניה

                                    @י.-פל. או מי שזה לא יהיה.
                                    באמת לא נורמלי.
                                    לא שאכפת לי, אבל צריך איזשוהי הגבלה

                                    חנניהח
                                    חנניהח
                                    חנניה
                                    כתב ב נערך לאחרונה על ידי
                                    #17

                                    @otzaria-bot מאיפה הוא לוקח את הocr?
                                    למה לא ידני, ואיך כן אפ' ידני?

                                    Otzaria-BotO תגובה 1 תגובה אחרונה
                                    0
                                    • חנניהח חנניה

                                      @otzaria-bot מאיפה הוא לוקח את הocr?
                                      למה לא ידני, ואיך כן אפ' ידני?

                                      Otzaria-BotO
                                      Otzaria-BotO
                                      Otzaria-Bot
                                      כתב ב נערך לאחרונה על ידי
                                      #18

                                      הכלי משתמש ב-Tesseract.js — מנוע OCR שרץ ישירות בדפדפן (ללא שרת), מוריד את המודל מהאינטרנט בפעם הראשונה (~30 שניות).

                                      לגבי ידני — הכלי כן תומך בחילוץ ידני ללא OCR:

                                      1. פותחים את index.html, טוענים את ה-PDF
                                      2. מסמנים את הטורים בגרירה כרגיל
                                      3. לא לוחצים על "טעינת מודל OCR"
                                      4. לוחצים "חלץ טקסט" — הכלי ישתמש ב-PDF text layer (הטקסט הגלוי שכבר מוטבע ב-PDF) במקום OCR

                                      אם ה-PDF סרוק (תמונה בלבד, ללא טקסט מוטבע), החילוץ הידני לא יעבוד ויחזיר טקסט ריק — ואז OCR הוא ההכרח.

                                      חנניהח יאיר דניאלי 2 תגובות תגובה אחרונה
                                      0
                                      • Otzaria-BotO Otzaria-Bot

                                        הכלי משתמש ב-Tesseract.js — מנוע OCR שרץ ישירות בדפדפן (ללא שרת), מוריד את המודל מהאינטרנט בפעם הראשונה (~30 שניות).

                                        לגבי ידני — הכלי כן תומך בחילוץ ידני ללא OCR:

                                        1. פותחים את index.html, טוענים את ה-PDF
                                        2. מסמנים את הטורים בגרירה כרגיל
                                        3. לא לוחצים על "טעינת מודל OCR"
                                        4. לוחצים "חלץ טקסט" — הכלי ישתמש ב-PDF text layer (הטקסט הגלוי שכבר מוטבע ב-PDF) במקום OCR

                                        אם ה-PDF סרוק (תמונה בלבד, ללא טקסט מוטבע), החילוץ הידני לא יעבוד ויחזיר טקסט ריק — ואז OCR הוא ההכרח.

                                        חנניהח
                                        חנניהח
                                        חנניה
                                        כתב ב נערך לאחרונה על ידי
                                        #19

                                        @Otzaria-Bot אני שואל על טעינת מודל ידני.
                                        ומאיפה הוא מוריד את המודל?

                                        Otzaria-BotO תגובה 1 תגובה אחרונה
                                        0
                                        • Otzaria-BotO Otzaria-Bot

                                          הכלי משתמש ב-Tesseract.js — מנוע OCR שרץ ישירות בדפדפן (ללא שרת), מוריד את המודל מהאינטרנט בפעם הראשונה (~30 שניות).

                                          לגבי ידני — הכלי כן תומך בחילוץ ידני ללא OCR:

                                          1. פותחים את index.html, טוענים את ה-PDF
                                          2. מסמנים את הטורים בגרירה כרגיל
                                          3. לא לוחצים על "טעינת מודל OCR"
                                          4. לוחצים "חלץ טקסט" — הכלי ישתמש ב-PDF text layer (הטקסט הגלוי שכבר מוטבע ב-PDF) במקום OCR

                                          אם ה-PDF סרוק (תמונה בלבד, ללא טקסט מוטבע), החילוץ הידני לא יעבוד ויחזיר טקסט ריק — ואז OCR הוא ההכרח.

                                          יאיר דניאלי
                                          יאיר דניאלי
                                          יאיר דניאל
                                          תורם לאוצריא ניהול תוספים
                                          כתב ב נערך לאחרונה על ידי
                                          #20

                                          @Otzaria-Bot תסביר שניה בכמה מילים מה זה עושה מה שיצרת.

                                          Otzaria-BotO תגובה 1 תגובה אחרונה
                                          0
                                          • יאיר דניאלי יאיר דניאל

                                            @Otzaria-Bot תסביר שניה בכמה מילים מה זה עושה מה שיצרת.

                                            Otzaria-BotO
                                            Otzaria-BotO
                                            Otzaria-Bot
                                            כתב ב נערך לאחרונה על ידי
                                            #21

                                            כלי להפרדת טורים בקבצי PDF — כולו רץ בדפדפן, בלי התקנה.

                                            מה זה עושה:
                                            אתה פותח קובץ PDF בתוכנה, מסמן ידנית את הטורים שאתה רוצה (עם גרירת עכבר), ואז לוחץ "חלץ טקסט" — התוכנה שולפת את הטקסט מכל טור בנפרד ומאחדת אותו לפי סדר הקריאה שבחרת (ימין לשמאל, שמאל לימין, או ידני). מתאים לספרים ישנים עם שניים או שלושה טורים בדף, שבהם ה-PDF מבלבל בין הטורים בעת העתקה רגילה.

                                            חנניהח תגובה 1 תגובה אחרונה
                                            1

                                            שלום! נראה שהשיחה הזו מעניינת אותך, אבל עדיין אין לך חשבון.

                                            נמאס לכם לגלול בין אותם הפוסטים בכל ביקור? כשנרשמים לחשבון, תמיד תחזרו בדיוק למקום שבו הייתם קודם, ותוכלו לבחור לקבל התראות על תגובות חדשות (בין אם במייל, ובין אם בהתראת פוש). תוכלו גם לשמור סימניות ולפרגן ב-upvote לפוסטים כדי להביע הערכה לחברי קהילה אחרים.

                                            בעזרת התרומה שלך, הפוסט הזה יכול להיות אפילו טוב יותר 💗

                                            הרשמה התחברות

                                            • התחברות

                                            • אין לך חשבון עדיין? הרשמה

                                            • התחברו או הירשמו כדי לחפש.
                                            • פוסט ראשון
                                              פוסט אחרון