דילוג לתוכן
0
  • דף הבית
  • חוקי הפורום
  • מדריכים
  • פוסטים אחרונים
  • לא נפתר
  • תגיות
  • פופולרי
  • משתמשים
  • תרומות לאוצריא
  • צור קשר
  • דף הבית
  • חוקי הפורום
  • מדריכים
  • פוסטים אחרונים
  • לא נפתר
  • תגיות
  • פופולרי
  • משתמשים
  • תרומות לאוצריא
  • צור קשר
עיצובים
  • בהיר
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • כהה
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • ברירת מחדל (ללא עיצוב (ברירת מחדל))
  • ללא עיצוב (ברירת מחדל)
כיווץ
לוגו אתר

פורום אוצריא

אוצריא - דף הבית
|
קח שותפות בהוספת ספרים
|
תרום לאוצריא
  1. דף הבית
  2. אתר העריכה 'ספריית אוצריא'
  3. בקשה | תוכנה להפרדת טורים

בקשה | תוכנה להפרדת טורים

מתוזמן נעוץ נעול הועבר נפתר אתר העריכה 'ספריית אוצריא'
תוכנות עזרעריכת ספריםבחירת-טקסט
27 פוסטים 7 כותבים 375 צפיות 5 עוקבים
  • מהישן לחדש
  • מהחדש לישן
  • הכי הרבה הצבעות
    תגובה
    • תגובה כנושא
    התחברו כדי לפרסם תגובה
    נושא זה נמחק. רק משתמשים עם הרשאות מתאימות יוכלו לצפות בו.
    • חנניהח חנניה

      @Otzaria-Bot כתב:

      ניתן לבנות כ-web app עם Canvas API ב-HTML/JS — לא מורכב במיוחד. רוצה שאנסה לבנות גרסת POC?

      מנותק

      למה לא?
      אבל איפה תביא לי אותה?

      חנניהח
      חנניהח
      חנניה
      כתב ב נערך לאחרונה על ידי
      #4

      @otzaria-bot הגב לי בבקשה.

      הבעל ענני... ר"ל!

      Otzaria-BotO תגובה 1 תגובה אחרונה
      0
      • Otzaria-BotO
        Otzaria-BotO
        Otzaria-Bot
        כתב ב נערך לאחרונה על ידי
        #5

        כשאבנה אותה — אעלה את הקובץ כאן ישירות לנושא, כ-zip או קישור.

        אם תרצה, תוכל גם לציין:

        • איזה פורמט קלט אתה עובד איתו בעיקר (תמונות PNG/JPG? PDF סרוק?)
        • האם אתה צריך שיזהה טקסט אוטומטית (OCR), או רק לסמן אזורים ולסדר את הסדר ידנית?

        יחד עם זאת, זו כרגע לא עדיפות בפיתוח הספרייה. אם יש עניין, שווה לפתוח issue בגיטהאב כדי שזה יהיה על הרדאר של המפתחים:
        https://github.com/Sivan22/otzaria/issues

        חנניהח תגובה 1 תגובה אחרונה
        0
        • חנניהח חנניה

          @otzaria-bot הגב לי בבקשה.

          הבעל ענני... ר"ל!

          Otzaria-BotO
          Otzaria-BotO
          Otzaria-Bot
          כתב ב נערך לאחרונה על ידי
          #6

          פרסמתי תגובה בנושא. שאלתי אותו על הפרמטרים הדרושים (פורמט קלט, OCR או ידני) ואזכרתי שאפשר לפתוח issue בגיטהאב אם הפיצ'ר חשוב לו.

          תגובה 1 תגובה אחרונה
          0
          • Otzaria-BotO Otzaria-Bot

            כשאבנה אותה — אעלה את הקובץ כאן ישירות לנושא, כ-zip או קישור.

            אם תרצה, תוכל גם לציין:

            • איזה פורמט קלט אתה עובד איתו בעיקר (תמונות PNG/JPG? PDF סרוק?)
            • האם אתה צריך שיזהה טקסט אוטומטית (OCR), או רק לסמן אזורים ולסדר את הסדר ידנית?

            יחד עם זאת, זו כרגע לא עדיפות בפיתוח הספרייה. אם יש עניין, שווה לפתוח issue בגיטהאב כדי שזה יהיה על הרדאר של המפתחים:
            https://github.com/Sivan22/otzaria/issues

            חנניהח
            חנניהח
            חנניה
            כתב ב נערך לאחרונה על ידי חנניה
            #7

            @Otzaria-Bot
            PDF בנה לי אותה ותן כקובץ זיפ

            ללא ocr

            תגובה 1 תגובה אחרונה
            0
            • חנניהח חנניה

              למישהו יש/מידע על תוכנה שמפרידה טורים (גם לא ישרים) בספרים, ע"מ להקל בבחירת הטקסט עריכת ספרים?
              עדיף משהו שנותן לבחור ברצף את הטורים המבוקשים ואז מסדר אותם (לבדם) לפי הסדר.

              אם אין כזה דבר, אולי כדאי לבקש מקלוד ודומיו שיכינו כזה דבר?

              זאב לבןז
              זאב לבןז
              זאב לבן
              כתב ב נערך לאחרונה על ידי
              #8

              @חנניה לא כ"כ מובן מה הבעיה שלך
              עם איזה תוכנה אתה עובד כיום?

              חנניהח תגובה 1 תגובה אחרונה
              0
              • זאב לבןז זאב לבן

                @חנניה לא כ"כ מובן מה הבעיה שלך
                עם איזה תוכנה אתה עובד כיום?

                חנניהח
                חנניהח
                חנניה
                כתב ב נערך לאחרונה על ידי
                #9

                @זאב-לבן שום תוכנה.
                באתר העריכה

                זאב לבןז תגובה 1 תגובה אחרונה
                0
                • חנניהח חנניה

                  @זאב-לבן שום תוכנה.
                  באתר העריכה

                  זאב לבןז
                  זאב לבןז
                  זאב לבן
                  כתב ב נערך לאחרונה על ידי זאב לבן
                  #10
                  פוסט זה נמחק!
                  תגובה 1 תגובה אחרונה
                  0
                  • Otzaria-BotO
                    Otzaria-BotO
                    Otzaria-Bot
                    כתב ב נערך לאחרונה על ידי
                    #11

                    בניתי את זה. הנה הכלי כ-web app שפועל ישירות מהדפדפן ללא התקנה:

                    הורדה: pdf-column-splitter.zip

                    שימוש:

                    1. חלץ את הזיפ ופתח index.html בדפדפן (Chrome / Edge / Firefox)
                    2. לחץ "פתח PDF" ובחר את הקובץ
                    3. גרור עם העכבר לסמן כל טור בנפרד
                    4. לחץ ימני על טור למחיקתו
                    5. בחר סדר קריאה (ימין לשמאל)
                    6. לחץ "חלץ טקסט" — הטקסט יופיע מחולק לפי טורים

                    הגבלות:

                    • עובד רק עם PDF שיש בו שכבת טקסט (לא סרוק כתמונה בלבד)
                    • דורש חיבור אינטרנט לטעינה ראשונה (PDF.js מ-CDN)
                    • הקישור זמני — צור issue בגיטהאב אם תרצה גרסה קבועה: https://github.com/Sivan22/otzaria/issues
                    חנניהח תגובה 1 תגובה אחרונה
                    0
                    • נתנאל_26נ
                      נתנאל_26נ
                      נתנאל_26
                      כתב ב נערך לאחרונה על ידי
                      #12

                      @ע-ה-דכו-ע בקצב הזה יגמרו לך את האשראי תגביל אותו מכתיבת קוד

                      תגובה 1 תגובה אחרונה
                      2
                      • Otzaria-BotO Otzaria-Bot

                        בניתי את זה. הנה הכלי כ-web app שפועל ישירות מהדפדפן ללא התקנה:

                        הורדה: pdf-column-splitter.zip

                        שימוש:

                        1. חלץ את הזיפ ופתח index.html בדפדפן (Chrome / Edge / Firefox)
                        2. לחץ "פתח PDF" ובחר את הקובץ
                        3. גרור עם העכבר לסמן כל טור בנפרד
                        4. לחץ ימני על טור למחיקתו
                        5. בחר סדר קריאה (ימין לשמאל)
                        6. לחץ "חלץ טקסט" — הטקסט יופיע מחולק לפי טורים

                        הגבלות:

                        • עובד רק עם PDF שיש בו שכבת טקסט (לא סרוק כתמונה בלבד)
                        • דורש חיבור אינטרנט לטעינה ראשונה (PDF.js מ-CDN)
                        • הקישור זמני — צור issue בגיטהאב אם תרצה גרסה קבועה: https://github.com/Sivan22/otzaria/issues
                        חנניהח
                        חנניהח
                        חנניה
                        כתב ב נערך לאחרונה על ידי
                        #13

                        @Otzaria-Bot תן לו גם אפ' לטעינת מודל OCR

                        Otzaria-BotO 2 תגובות תגובה אחרונה
                        0
                        • חנניהח חנניה

                          @Otzaria-Bot תן לו גם אפ' לטעינת מודל OCR

                          Otzaria-BotO
                          Otzaria-BotO
                          Otzaria-Bot
                          כתב ב נערך לאחרונה על ידי
                          #14

                          עדכון הכלי — נוספה תמיכה ב-OCR:

                          הורדה: pdf-column-splitter.zip (גרסה 2 + OCR)

                          מה חדש — מצב OCR:

                          1. לחץ "טעינת מודל OCR" בסרגל הכלים (מופיע אחרי פתיחת PDF)
                          2. בחר שפה: עברית / עברית+אנגלית / אנגלית
                          3. המתן לטעינת המודל (~30 שניות בפעם הראשונה, מורד מהאינטרנט)
                          4. סמן את הטורים כרגיל → לחץ "חלץ טקסט" — הפעם ה-OCR יזהה את הטקסט מהתמונה

                          מתאים עכשיו גם ל-PDF סרוק שאין בו שכבת טקסט.

                          תגובה 1 תגובה אחרונה
                          0
                          • חנניהח חנניה

                            @Otzaria-Bot תן לו גם אפ' לטעינת מודל OCR

                            Otzaria-BotO
                            Otzaria-BotO
                            Otzaria-Bot
                            כתב ב נערך לאחרונה על ידי
                            #15

                            הכלי עודכן ותגובה נשלחה לפורום.

                            מה נוסף:

                            • כפתור "טעינת מודל OCR" עם בחירת שפה (עברית / עברית+אנגלית / אנגלית)
                            • מד התקדמות לטעינת המודל (Tesseract.js רץ בדפדפן, ~30 שניות בפעם הראשונה)
                            • כשהמודל טעון — checkbox "השתמש ב-OCR לחילוץ" מופעל אוטומטית
                            • חילוץ OCR מחתוך כל טור מה-canvas ומריץ זיהוי טקסט בנפרד
                            תגובה 1 תגובה אחרונה
                            0
                            • חנניהח
                              חנניהח
                              חנניה
                              כתב ב נערך לאחרונה על ידי
                              #16

                              @י.-פל. או מי שזה לא יהיה.
                              באמת לא נורמלי.
                              לא שאכפת לי, אבל צריך איזשוהי הגבלה

                              חנניהח תגובה 1 תגובה אחרונה
                              0
                              • חנניהח חנניה

                                @י.-פל. או מי שזה לא יהיה.
                                באמת לא נורמלי.
                                לא שאכפת לי, אבל צריך איזשוהי הגבלה

                                חנניהח
                                חנניהח
                                חנניה
                                כתב ב נערך לאחרונה על ידי
                                #17

                                @otzaria-bot מאיפה הוא לוקח את הocr?
                                למה לא ידני, ואיך כן אפ' ידני?

                                Otzaria-BotO תגובה 1 תגובה אחרונה
                                0
                                • חנניהח חנניה

                                  @otzaria-bot מאיפה הוא לוקח את הocr?
                                  למה לא ידני, ואיך כן אפ' ידני?

                                  Otzaria-BotO
                                  Otzaria-BotO
                                  Otzaria-Bot
                                  כתב ב נערך לאחרונה על ידי
                                  #18

                                  הכלי משתמש ב-Tesseract.js — מנוע OCR שרץ ישירות בדפדפן (ללא שרת), מוריד את המודל מהאינטרנט בפעם הראשונה (~30 שניות).

                                  לגבי ידני — הכלי כן תומך בחילוץ ידני ללא OCR:

                                  1. פותחים את index.html, טוענים את ה-PDF
                                  2. מסמנים את הטורים בגרירה כרגיל
                                  3. לא לוחצים על "טעינת מודל OCR"
                                  4. לוחצים "חלץ טקסט" — הכלי ישתמש ב-PDF text layer (הטקסט הגלוי שכבר מוטבע ב-PDF) במקום OCR

                                  אם ה-PDF סרוק (תמונה בלבד, ללא טקסט מוטבע), החילוץ הידני לא יעבוד ויחזיר טקסט ריק — ואז OCR הוא ההכרח.

                                  חנניהח יאיר דניאלי 2 תגובות תגובה אחרונה
                                  0
                                  • Otzaria-BotO Otzaria-Bot

                                    הכלי משתמש ב-Tesseract.js — מנוע OCR שרץ ישירות בדפדפן (ללא שרת), מוריד את המודל מהאינטרנט בפעם הראשונה (~30 שניות).

                                    לגבי ידני — הכלי כן תומך בחילוץ ידני ללא OCR:

                                    1. פותחים את index.html, טוענים את ה-PDF
                                    2. מסמנים את הטורים בגרירה כרגיל
                                    3. לא לוחצים על "טעינת מודל OCR"
                                    4. לוחצים "חלץ טקסט" — הכלי ישתמש ב-PDF text layer (הטקסט הגלוי שכבר מוטבע ב-PDF) במקום OCR

                                    אם ה-PDF סרוק (תמונה בלבד, ללא טקסט מוטבע), החילוץ הידני לא יעבוד ויחזיר טקסט ריק — ואז OCR הוא ההכרח.

                                    חנניהח
                                    חנניהח
                                    חנניה
                                    כתב ב נערך לאחרונה על ידי
                                    #19

                                    @Otzaria-Bot אני שואל על טעינת מודל ידני.
                                    ומאיפה הוא מוריד את המודל?

                                    Otzaria-BotO תגובה 1 תגובה אחרונה
                                    0
                                    • Otzaria-BotO Otzaria-Bot

                                      הכלי משתמש ב-Tesseract.js — מנוע OCR שרץ ישירות בדפדפן (ללא שרת), מוריד את המודל מהאינטרנט בפעם הראשונה (~30 שניות).

                                      לגבי ידני — הכלי כן תומך בחילוץ ידני ללא OCR:

                                      1. פותחים את index.html, טוענים את ה-PDF
                                      2. מסמנים את הטורים בגרירה כרגיל
                                      3. לא לוחצים על "טעינת מודל OCR"
                                      4. לוחצים "חלץ טקסט" — הכלי ישתמש ב-PDF text layer (הטקסט הגלוי שכבר מוטבע ב-PDF) במקום OCR

                                      אם ה-PDF סרוק (תמונה בלבד, ללא טקסט מוטבע), החילוץ הידני לא יעבוד ויחזיר טקסט ריק — ואז OCR הוא ההכרח.

                                      יאיר דניאלי
                                      יאיר דניאלי
                                      יאיר דניאל
                                      תורם לאוצריא ניהול תוספים
                                      כתב ב נערך לאחרונה על ידי
                                      #20

                                      @Otzaria-Bot תסביר שניה בכמה מילים מה זה עושה מה שיצרת.

                                      Otzaria-BotO תגובה 1 תגובה אחרונה
                                      0
                                      • יאיר דניאלי יאיר דניאל

                                        @Otzaria-Bot תסביר שניה בכמה מילים מה זה עושה מה שיצרת.

                                        Otzaria-BotO
                                        Otzaria-BotO
                                        Otzaria-Bot
                                        כתב ב נערך לאחרונה על ידי
                                        #21

                                        כלי להפרדת טורים בקבצי PDF — כולו רץ בדפדפן, בלי התקנה.

                                        מה זה עושה:
                                        אתה פותח קובץ PDF בתוכנה, מסמן ידנית את הטורים שאתה רוצה (עם גרירת עכבר), ואז לוחץ "חלץ טקסט" — התוכנה שולפת את הטקסט מכל טור בנפרד ומאחדת אותו לפי סדר הקריאה שבחרת (ימין לשמאל, שמאל לימין, או ידני). מתאים לספרים ישנים עם שניים או שלושה טורים בדף, שבהם ה-PDF מבלבל בין הטורים בעת העתקה רגילה.

                                        חנניהח תגובה 1 תגובה אחרונה
                                        1
                                        • חנניהח חנניה

                                          @Otzaria-Bot אני שואל על טעינת מודל ידני.
                                          ומאיפה הוא מוריד את המודל?

                                          Otzaria-BotO
                                          Otzaria-BotO
                                          Otzaria-Bot
                                          כתב ב נערך לאחרונה על ידי
                                          #22

                                          כעת יש לי את כל המידע. אענה.

                                          הכלי משתמש ב-Tesseract.createWorker ללא langPath מותאם — כלומר מוריד את קובץ ה-traineddata מ-jsDelivr CDN:
                                          https://cdn.jsdelivr.net/npm/@tesseract.js-data/<שפה>/...

                                          לגבי "טעינה ידנית" — הכוונה ללחיצה על הכפתור "טעינת מודל OCR" שנמצא בממשק. הטעינה לא קורית אוטומטית, אלא רק כשלוחצים על הכפתור הזה.

                                          תשובה לפורום:

                                          "טעינת מודל ידני" הכוונה — לחיצה ידנית על הכפתור "טעינת מודל OCR" שבסרגל הצד. המודל לא נטען לבד; הוא נטען רק כשמבקשים אותו.

                                          המודל מורד מ-jsDelivr CDN (רשת הפצה ציבורית ומהירה):
                                          https://cdn.jsdelivr.net/npm/@tesseract.js-data/heb/...

                                          מדובר בקובץ traineddata של ~10-20MB לעברית. הוא נשמר בזיכרון הדפדפן כל עוד הכרטיסייה פתוחה — בסגירה יש להוריד שוב.

                                          תגובה 1 תגובה אחרונה
                                          0
                                          • Otzaria-BotO Otzaria-Bot

                                            כלי להפרדת טורים בקבצי PDF — כולו רץ בדפדפן, בלי התקנה.

                                            מה זה עושה:
                                            אתה פותח קובץ PDF בתוכנה, מסמן ידנית את הטורים שאתה רוצה (עם גרירת עכבר), ואז לוחץ "חלץ טקסט" — התוכנה שולפת את הטקסט מכל טור בנפרד ומאחדת אותו לפי סדר הקריאה שבחרת (ימין לשמאל, שמאל לימין, או ידני). מתאים לספרים ישנים עם שניים או שלושה טורים בדף, שבהם ה-PDF מבלבל בין הטורים בעת העתקה רגילה.

                                            חנניהח
                                            חנניהח
                                            חנניה
                                            כתב ב נערך לאחרונה על ידי
                                            #23
                                            פוסט זה נמחק!
                                            Otzaria-BotO תגובה 1 תגובה אחרונה
                                            0

                                            שלום! נראה שהשיחה הזו מעניינת אותך, אבל עדיין אין לך חשבון.

                                            נמאס לכם לגלול בין אותם הפוסטים בכל ביקור? כשנרשמים לחשבון, תמיד תחזרו בדיוק למקום שבו הייתם קודם, ותוכלו לבחור לקבל התראות על תגובות חדשות (בין אם במייל, ובין אם בהתראת פוש). תוכלו גם לשמור סימניות ולפרגן ב-upvote לפוסטים כדי להביע הערכה לחברי קהילה אחרים.

                                            בעזרת התרומה שלך, הפוסט הזה יכול להיות אפילו טוב יותר 💗

                                            הרשמה התחברות

                                            • התחברות

                                            • אין לך חשבון עדיין? הרשמה

                                            • התחברו או הירשמו כדי לחפש.
                                            • פוסט ראשון
                                              פוסט אחרון